1. Windows 11 下 vLLM 0.16 源码编译实战(CUDA 12.6 / PyTorch 2.7.1 完全匹配方案)
最近在 Windows 11 上折腾 vLLM 的源码编译,发现官方文档对 Windows 平台的支持并不完善。经过多次尝试,终于成功用 CUDA 12.6 编译出了与 PyTorch 2.7.1+cu126 完全匹配的 vLLM 0.16 版本。相比之前用 CUDA 12.8 编译的方案,这次确保了运行时环境的一致性,避免了潜在的兼容性问题。下面就把完整的踩坑过程和解决方案分享给大家。
1.1 为什么选择 CUDA 12.6 重新编译?
之前我用 CUDA 12.8 成功编译过 vLLM,但后来发现虚拟环境中安装的 PyTorch 是 2.7.1+cu126 版本。虽然 CUDA 12.8 编译的 wheel 在大多数情况下能向前兼容运行,但为了彻底避免潜在的版本不匹配问题,还是决定用与 PyTorch 完全一致的 CUDA 12.6 重新编译。
验证当前环境的 PyTorch CUDA 版本很简单:
bash复制python -c "import torch; print(torch.__version__, '| CUDA:', torch.version.cuda)"
# 输出:2.7.1+cu126 | CUDA: 12.6
如果你也遇到类似情况,建议检查 PyTorch 的 CUDA 版本,确保编译环境与之匹配。这样可以避免运行时出现莫名其妙的错误。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与关键配置
2.1 硬件与软件环境
我的编译环境配置如下:
| 项目 | 版本 |
|---|---|
| 操作系统 | Windows 11 专业版 23H2 |
| GPU | NVIDIA GeForce RTX 3090 (sm_86) |
| 显卡驱动 | 595.02 |
| CUDA Toolkit | 12.6 |
| Python | 3.12.11 |
| PyTorch | 2.7.1+cu126 |
| Visual Studio | 2022 Professional v17.12.17 |
| vLLM 分支 | SystemPanic/vllm-windows ( |
