国家高新技术企业AI 时代系统集成商

用 vLLM 本地部署 Qwen 与 DeepSeek 蒸馏模型

本文给出在 NVIDIA 卡上用 vLLM 启动开源大模型、并以 OpenAI 兼容接口对外提供服务的通用步骤,以及接入知识库、内网安全和上线前检查要点。适合有基本 Linux 运维能力的技术人员。

重要说明:推理框架与模型版本更新很快,下列命令是通用示例,参数名称和可用选项以 vLLM 与模型官方文档的当期版本为准,实际部署前请在您的环境中验证。本文不替代针对您具体硬件的实测。模型权重请从官方渠道获取,并留意各模型的许可条款是否允许您的使用方式。

一、部署前先算显存

先估算模型权重和并发缓存是否放得下,见 显存配置速查。举例:32B 级模型 4bit 量化权重约 21 GB,一张 48 GB 卡可以起步;不量化的 FP16 约 64 GB,需要多卡。

二、环境准备

  • Linux 服务器,安装与显卡匹配的 NVIDIA 驱动和 CUDA 运行环境(版本需与所用 vLLM 版本要求一致)。
  • Python 虚拟环境,或使用官方提供的容器镜像,便于隔离与复现。
  • 确认磁盘空间:模型权重文件较大,且需要在内网环境预先下载或通过镜像导入。
# 创建独立环境并安装(示例)
python -m venv vllm-env
source vllm-env/bin/activate
pip install vllm

在完全离线的内网中,需要在有网络的机器上下载好权重和依赖,再拷贝到内网服务器。

三、启动一个模型服务

以 Qwen 系列 32B 为例(模型名称以官方发布为准):

vllm serve Qwen/Qwen3-32B \
  --served-model-name qwen3-32b \
  --tensor-parallel-size 2 \
  --max-model-len 16384 \
  --gpu-memory-utilization 0.90 \
  --api-key YOUR_INTERNAL_KEY \
  --host 127.0.0.1 --port 8000

常用参数说明:

  • --tensor-parallel-size:用几张卡做张量并行,应与可用显卡数及显存需求匹配。
  • --max-model-len:最大上下文长度。设得越大,单路缓存越多、能支持的并发越少,应按业务实际需要设置,而不是越大越好。
  • --gpu-memory-utilization:允许使用显存的比例,需给激活与碎片留余量。
  • --api-key:接口认证密钥,必须设置并妥善保管。
  • --host:监听地址。默认只监听本机,由网关对外转发,避免直接暴露。

若使用 4bit 量化版权重(如 AWQ 格式的发布版本),显存占用会明显下降,但需要用您的评估集验证精度损失是否可接受。

DeepSeek-R1 蒸馏版(如基于 Qwen 的 32B 版本)的启动方式类似,把模型路径换成对应权重即可。这类“深度思考”模型会输出推理过程,部分 vLLM 版本提供推理内容解析选项,可把思考内容与最终答案分开返回,具体选项名随版本变化,请查阅当期文档。671B 满血版需要多卡多机配置,部署复杂度和硬件要求都高得多,多数场景不必使用。

四、验证服务与调用

vLLM 提供 OpenAI 兼容接口,可以用 curl 做最基本的验证:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_INTERNAL_KEY" \
  -d '{
    "model": "qwen3-32b",
    "messages": [{"role": "user", "content": "用一句话介绍你自己"}],
    "max_tokens": 100
  }'

正常返回后,再用压测工具在预期并发与上下文长度下测首字延迟和生成速度,这些数字才是配置是否够用的依据。

五、接入知识库

知识库应用只需把模型地址配置为这个 OpenAI 兼容接口。完整的知识库还需要嵌入模型和重排序模型,它们占用显存不大,通常可与主模型共卡或放在另一张卡上。检索、权限、引用与拒答的设计,见 企业知识库搭建流程。

六、安全与上线检查清单

  • 推理端口只在内网可达,由网关做认证、限流与审计,不直接暴露公网。
  • 设置 API Key,并通过防火墙限制来源 IP。
  • 日志中避免记录完整的敏感提问内容,或对日志做访问控制。
  • 用 systemd 或容器编排管理服务,配置自动重启与健康检查。
  • 监控显存、GPU 利用率、请求延迟与错误率,设定告警。
  • 固定模型与框架版本,升级前用评估集回归。
  • 记录模型来源、版本与许可条款,便于合规审查。
  • 做压测与故障演练,确认在峰值并发下的表现。

七、国产算力卡怎么办

国产卡需要使用对应厂商提供的推理框架和适配镜像,启动命令、可用量化方式和支持的模型列表各不相同,请以厂商官方文档为准。选型时的注意事项见 国产算力卡与 NVIDIA 选型指南。如果需要我们代为部署与调优,可预约部署评估。

常见问题

国产算力卡也能用这套步骤吗?
思路相同,但推理引擎、驱动与启动命令不同,需要使用对应厂商提供的推理框架和镜像,并以其官方文档为准。我们的应用层通过统一接口调用模型,因此更换底层卡不需要改上层应用。
部署后可以直接对公网开放吗?
不建议。推理服务应只在内网访问,通过网关做认证、限流和审计;至少设置 API Key 并用防火墙限制来源。直接把推理端口暴露到公网存在被滥用和数据泄露的风险。

想结合您的实际情况算一遍?

文章里的数字是通用参考。是否需要本地硬件、选哪一档、预算怎么构成,需要结合您的使用规模和数据要求评估。

  • 用配置计算器先估算硬件量级
  • 比较云端、专属云与本地部署的成本
  • 给出硬件、软件、实施、培训与服务的分项估算
电话:13716687203 邮箱:info@zzxytech.com
预约部署评估 配置计算器
北京中泽信业科技发展有限公司方案咨询:13716687203 info@zzxytech.com