1. 项目概述
最近在Windows WSL环境下部署vLLM推理服务时,遇到了显存占用过高的问题。经过反复测试和优化,最终成功在MiniCPM系列模型上实现了稳定运行。本文将分享从模型下载到服务部署的全过程,包括关键参数调优和常见问题解决方案。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 环境准备与模型下载
2.1 基础环境配置
推荐使用WSL2 + Ubuntu 22.04环境,确保已安装NVIDIA驱动和CUDA工具包。以下是关键组件版本要求:
- CUDA 11.8或更高
- Python 3.9+
- vLLM 0.3.0+
- PyTorch 2.1.0+
创建专用Python环境:
bash复制python -m venv vllm-env
source vllm-env/bin/activate
pip install vllm==0.3.0 torch==2.1.0
2.2 模型下载与验证
使用ModelScope下载量化版模型可显著降低显存需求。以下是推荐的模型组合:
python复制from modelscope import snapshot_download
# 语言模型(4bit量化版)
llm_model = "OpenBMB/MiniCPM4-0.5B-QAT-Int4-GPTQ-format"
# 视觉语言模型(可选非量化版)
vlm_model = "OpenBMB/MiniCPM-V-2_6-int4"
snapshot_download(llm_model, local_dir="./models/llm")
snapshot_download(vlm_model, local_dir="./models/vlm")
注意:模型下载后检查文件完整性,确保包含config.json、model.safetensors等关键文件。
3. vLLM服务部署
3.1 服务启动脚本
创建服务管理脚本server_manager.py,包含以下核心功能:
- 模型路径安全处理
- 进程监控与清理
- 双服务并行管理
python复制import os
import subprocess
import signal
from modelscope impor
