VLLM部署Qwen模型

发布时间:2026/8/18 15:47:10

VLLM部署Qwen模型
一、Qwen2.5-14B1. 环境准备# 创建并激活虚拟环境推荐 python -m venv qwen_env source qwen_env/bin/activate # 安装依赖库确保Python≥3.8 pip install vllm transformers torch2. 下载模型pip install modelscope modelscope download --model Qwen/Qwen2.5-14B-Instruct --local_dir path/to/dir如果下载模型的时候提示没有权限export MODELSCOPE_CACHE/tmp/modelscope_cache modelscope download --model Qwen/Qwen2.5-7B-Instruct3. 启动服务# 指定4张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1,2,3 # 设置模型路径和服务名称 MODEL_PATH./Qwen2.5-14B-Instruct SERVED_MODEL_NAMEQwen2.5_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 4 \ # 使用4张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文4. 验证服务发送测试请求新终端curl http://localhost:8000/v1/models预期输出{object:list,data:[{id:qwen2.5_14B,object:model}]}5. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)6. 远程调用API示例首先本地获取IP地址ifconfig然后远程使用例如import openai client openai.OpenAI(base_urlhttp://10.233.23.133:8000/v1, api_keynone) response client.chat.completions.create( modelqwen2.5_14B, messages[{role: user, content: 你好}] ) print(response.choices[0].message.content)二、Qwen3-14B部署方式类似但需要cuda版本12.4可以nvidia-smi查看transformers版本4.51.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.10 conda create -n vllm python3.102切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopepip install -U vllm \ --pre \ --extra-index-url https://wheels.vllm.ai/nightly pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3-14B SERVED_MODEL_NAMEQwen3_14B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh3. 调用API示例​​import openai client openai.OpenAI(base_urlhttp://localhost:8000/v1, api_keynone) response client.chat.completions.create( modelqwen3-14B, messages[{role: user, content: /no_think 你好}] ) print(response.choices[0].message.content)三、关于虚拟环境在notebook使用conda install ipykernel python -m ipykernel install --user --name vllm四、Qwen3.5-27B部署方式类似但需要cuda版本13.0可以nvidia-smi查看Python 3.12。然后vLLM 0.27.1 transformers 5.15.0。1. 安装VLLM1创建 conda 环境# 创建 conda 虚拟环境环境名称为 vllmpython 的版本为 3.12 conda create -n vllm python3.122切换 vllm 环境conda activate vllm这里有可能切换失败可以尝试两种方案conda init或者source ~/.bashrc3安装 vllm 和 modelscopeuv pip install vllm0.27.1 --torch-backendcu130 pip install modelscope2. 启动服务创建run.sh文件# 指定2张GPU根据实际GPU数量调整 export CUDA_VISIBLE_DEVICES0,1 # 设置模型路径和服务名称 MODEL_PATH./Qwen3.5-27B SERVED_MODEL_NAMEQwen3.5_27B # 启动服务关键参数说明见注释 python -m vllm.entrypoints.openai.api_server \ --model $MODEL_PATH \ --served-model-name $SERVED_MODEL_NAME \ --tensor-parallel-size 2 \ # 使用2张GPU并行 --gpu-memory-utilization 0.95 \ # GPU显存利用率 --port 8000 \ --max-num-seqs 256 \ # 提高并发处理能力 --max-model-len 8192 # 支持更长上下文然后命令行运行sh run.sh

相关新闻

如何把 OpenCV 塞进 ESP32?3 个台阶带你入门轻量级计算机视觉

如何把 OpenCV 塞进 ESP32?3 个台阶带你入门轻量级计算机视觉

2026/8/18 15:37:10

如何把 OpenCV 塞进 ESP32?3 个台阶带你入门轻量级计算机视觉 【免费下载链接】esp32-opencv Shrinked OpenCV for ESP32 项目地址: https://gitcode.com/gh_mirrors/es/esp32-opencv 很多嵌入式开发者都遇到过这样的场景:好不容易给摄像头模组通…

像专家一样交互式分析:vim-startuptime 中 K 键与 gf 键的 6 种妙用

像专家一样交互式分析:vim-startuptime 中 K 键与 gf 键的 6 种妙用

2026/8/18 15:37:10

像专家一样交互式分析:vim-startuptime 中 K 键与 gf 键的 6 种妙用 【免费下载链接】vim-startuptime A plugin for viewing Vim and Neovim startup event timing information. 项目地址: https://gitcode.com/gh_mirrors/vim/vim-startuptime 想知道 Vim …

云托管部署 cloudbase-extension-cms 完整指南:腾讯云与微信小程序双环境实战

云托管部署 cloudbase-extension-cms 完整指南:腾讯云与微信小程序双环境实战

2026/8/18 15:37:10

云托管部署 cloudbase-extension-cms 完整指南:腾讯云与微信小程序双环境实战 【免费下载链接】cloudbase-extension-cms 🚀 一站式云端内容管理系统 - An open source Node.js headless cms based on CloudBase 项目地址: https://gitcode.com/gh_mir…

老旧Mac升级macOS完整指南:用OpenCore Legacy Patcher让老Mac免费跑上最新系统

老旧Mac升级macOS完整指南:用OpenCore Legacy Patcher让老Mac免费跑上最新系统

2026/8/18 16:47:12

老旧Mac升级macOS完整指南:用OpenCore Legacy Patcher让老Mac免费跑上最新系统 【免费下载链接】OpenCore-Legacy-Patcher Experience macOS just like before 项目地址: https://gitcode.com/GitHub_Trending/op/OpenCore-Legacy-Patcher 我的MacBook Pro&a…

VisionProTeleop 架构全解析:gRPC、WebRTC 与 RealityKit 如何协同工作?

VisionProTeleop 架构全解析:gRPC、WebRTC 与 RealityKit 如何协同工作?

2026/8/18 16:47:12

VisionProTeleop 架构全解析:gRPC、WebRTC 与 RealityKit 如何协同工作? 【免费下载链接】VisionProTeleop VisionOS App Python Library to stream hand tracking data from Vision Pro, video/audio stream to Vision Pro. 项目地址: https://gitco…

Palworld存档转换实战指南:3分钟看懂SAV转JSON与无损回写

Palworld存档转换实战指南:3分钟看懂SAV转JSON与无损回写

2026/8/18 16:47:12

Palworld存档转换实战指南:3分钟看懂SAV转JSON与无损回写 【免费下载链接】palworld-save-tools Tools for converting Palworld .sav files to JSON and back 项目地址: https://gitcode.com/gh_mirrors/pa/palworld-save-tools 帕鲁玩家的存档是一串谁也读…

逆向工具升级前容易漏掉的兼容性项

逆向工具升级前容易漏掉的兼容性项

2026/8/18 16:47:12

逆向工具升级前容易漏掉的兼容性项 讨论面向新版本的升级风险评估,关键不是罗列工具,而是回答一个更实际的问题:在 逆向工程:IDA / Ghidra 静态分析与动态调试实战 的当前边界内,什么证据足以支持下一步动作。可用的观…

安全协作中的接口与责任边界

安全协作中的接口与责任边界

2026/8/18 16:47:12

安全协作中的接口与责任边界 漏洞利用与缓解绕过:栈/堆溢出、ASLR/DEP 绕过技术剖析的工作很少卡在“缺少一个工具”。更常见的是,跨团队协作中的 API 与责任边界没有落到可执行的约束上。先确认授权测试范围、缓解配置、补丁状态和行为证据各自的责任人…

从 Windows 到 UOS 与 macOS:Notepad-- 跨平台文本编辑器一步步上手指南

从 Windows 到 UOS 与 macOS:Notepad-- 跨平台文本编辑器一步步上手指南

2026/8/18 16:37:12

从 Windows 到 UOS 与 macOS:Notepad-- 跨平台文本编辑器一步步上手指南 【免费下载链接】notepad-- 一个支持windows/linux/mac的文本编辑器,目标是做中国人自己的编辑器,来自中国。 项目地址: https://gitcode.com/GitHub_Trending/no/no…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/17 1:28:42

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/18 1:03:22

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/17 8:40:51

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

多智能体大模型辩论中的立场收敛:从伪共识到理性说服的评估方法

多智能体大模型辩论中的立场收敛:从伪共识到理性说服的评估方法

2026/8/18 0:06:29

1. 从一场“假辩论”说起:为什么大模型辩论会走向“伪共识”?最近在折腾多智能体大语言模型(Multi-Agent LLM)的辩论实验,发现一个挺有意思的现象。我让几个基于GPT-4的智能体就一个争议性话题(比如“远程办…

Frida动态代码插桩框架:从原理到实战的移动安全与逆向工程指南

Frida动态代码插桩框架:从原理到实战的移动安全与逆向工程指南

2026/8/18 0:06:29

1. 从“黑盒”到“白盒”:为什么我们需要Frida在移动安全、逆向工程甚至是一些自动化测试的场景里,我们经常会遇到一个让人头疼的问题:面对一个编译好的、没有源代码的应用程序,我们如何知道它在运行时内部发生了什么?…

ECharts饼图中心文字配置指南:从label与title区别到动态交互实现

ECharts饼图中心文字配置指南:从label与title区别到动态交互实现

2026/8/18 0:06:29

1. 从“空心”到“有魂”:为什么要在饼图中间加文字?如果你用过ECharts画饼图,大概率会注意到一个现象:默认生成的饼图中间是空心的。这个设计本身没问题,它清晰地展示了各个扇区的占比关系。但在很多实际的业务场景里…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…