Ubuntu24.04 Docker+vLLM+qianwen2.5-coder-32B部署文档

发布时间:2026/8/6 22:32:11

Ubuntu24.04 Docker+vLLM+qianwen2.5-coder-32B部署文档
硬件配置宿主机工作目录~/proj_dir/code_dir/llm_work宿主机模型存放路径~/proj_dir/code_dir/llm_work/models容器内挂载路径/models硬件前置提醒标准 RTX 4090 单卡 24GB双卡总显存 48GB无法运行 FP16 全精度 32B 模型权重约 64GB必须使用 AWQ 4bit 量化版如果你的显卡是单卡 48GB 专业卡总 96GB可使用 FP16 完整版。下面两套方案分别给出。一、前置环境校验必做先确认 Docker 与 GPU 直通环境正常避免后续踩坑。# 1. 确认 Docker 版本 docker --version # 2. 验证 NVIDIA 容器工具包、GPU 直通正常 docker run --rm --gpus all nvidia/cuda:12.1.0-base-ubuntu22.04 nvidia-smi能正常输出显卡型号、显存信息代表环境就绪。二、创建指定工作目录# 递归创建工作目录和模型目录 mkdir -p ~/proj_dir/code_dir/llm_work/models # 进入工作目录后续操作均在此目录下执行 cd ~/proj_dir/code_dir/llm_work三、下载模型文件宿主机下载后续挂载进容器使用 ModelScope 国内镜像高速下载避免容器内下载慢、丢包问题。先安装下载工具pip install modelscope双 48GB 及以上显存显卡使用模型大小约 65GB全精度无损失代码能力最强。modelscope download --model Qwen/Qwen2.5-Coder-32B-Instruct \ --local_dir /home/gyy/proj_dir/code_dir/llm_work/models/qwen2.5-coder-32b-instruct下载完成校验ls -lh /home/gyy/proj_dir/code_dir/llm_work/models/四、Docker 启动 vLLM 推理服务手动启动模式无自动重启完全由你按需启停。docker run -d \ --name vllm-qwen32b-coder \ --gpus all \ --ipchost \ -p 8000:8000 \ -v /home/gyy/proj_dir/code_dir/llm_work/models:/models \ vllm/vllm-openai:v0.6.3 \ --model /models/qwen2.5-coder-32b-instruct \ --served-model-name qwen2.5-coder \ --tensor-parallel-size 2 \ --trust-remote-code \ --max-model-len 32768 \ --gpu-memory-utilization 0.85 \ --host 0.0.0.0 \ --port 8000核心路径参数说明-v /home/gyy/proj_dir/code_dir/llm_work/models:/models将宿主机的模型目录映射到容器内的/models容器直接读取宿主机文件不额外占用磁盘--model /models/xxx容器内的模型路径必须和挂载后的容器内路径完全一致无--restart always服务器重启、容器退出后不会自动拉起完全手动控制五、服务启动验证1. 查看实时加载日志bashdocker logs -f vllm-qwen32b-coder等待日志中出现Uvicorn running on http://0.0.0.0:8000代表模型加载完成、服务就绪。 按Ctrl C可退出日志查看容器继续后台运行。2. 健康状态检查bashcurl -v http://127.0.0.1:8000/health返回 HTTP/1.1 200 OK 即为服务正常。六、服务调用示例vLLM 提供标准 OpenAI 兼容接口所有支持 OpenAI 协议的工具、插件均可直接对接。6.1 curl 命令调用curl http://127.0.0.1:8000/v1/chat/completions \ -H Content-Type: application/json \ -d { model: qwen2.5-coder, messages: [ {role: system, content: 你是专业的编程助手擅长代码生成、调试与架构设计。}, {role: user, content: 用 Python 写一个线程安全的单例模式附带详细注释} ], temperature: 0.2, max_tokens: 1024, stream: false }6.2 Python SDK 调用先安装依赖bashpip install openai新建测试脚本test_qwen_coder.pypython运行from openai import OpenAI # 对接本地 vLLM 服务 client OpenAI( base_urlhttp://127.0.0.1:8000/v1, api_keydummy_key # 本地部署无鉴权时随意填写即可 ) response client.chat.completions.create( modelqwen2.5-coder, messages[ {role: user, content: 解释 C 中 unique_ptr 和 shared_ptr 的区别与适用场景} ], temperature0.2, max_tokens1024 ) print(模型回复) print(response.choices[0].message.content)执行脚本bashpython test_qwen_coder.py七、日常手动运维命令重要docker run仅在首次创建容器时执行 1 次后续启停一律使用docker start/stop不要重复执行 run 命令否则会报容器名冲突。# 查看所有容器状态 docker ps -a # 手动启动服务需要使用模型时执行 docker start vllm-qwen32b-coder # 手动停止服务用完释放显存必做 docker stop vllm-qwen32b-coder # 查看实时运行日志 docker logs -f vllm-qwen32b-coder # 查看最近 50 行日志 docker logs --tail 50 vllm-qwen32b-coder # 删除容器仅重建时使用不会删除宿主机模型文件 docker rm vllm-qwen32b-coder八、关键避坑说明显存匹配双 24GB 4090 严禁直接跑 FP16 原版 32B会直接 OOM 崩溃共享内存--ipchost是 vLLM 必加参数缺失会报共享内存不足、推理异常模型路径--model填的是容器内的路径不是宿主机路径必须和挂载目录对应数据安全模型文件存在宿主机删除 / 重建容器完全不会丢失模型放心调试端口访问局域网其他机器访问时使用宿主机IP:8000确保服务器防火墙开放 8000 端口官方参考文档Qwen2.5-Coder 官方仓库https://github.com/QwenLM/Qwen2.5-CodervLLM Docker 部署官方指南https://docs.vllm.ai/en/latest/serving/deploying_with_docker.htmlvLLM OpenAI 兼容接口文档https://docs.vllm.ai/en/latest/serving/openai_compatible_server.htmlModelScope 模型主页https://modelscope.cn/models/qwen/Qwen2.5-Coder-32B-Instruct-AWQ

相关新闻

解密nguyenvulebinh/wav2vec2-base-vi-vlsp2020的语言模型:5-gram LM如何将WER降至6.53%?

解密nguyenvulebinh/wav2vec2-base-vi-vlsp2020的语言模型:5-gram LM如何将WER降至6.53%?

2026/8/6 22:32:11

解密nguyenvulebinh/wav2vec2-base-vi-vlsp2020的语言模型:5-gram LM如何将WER降至6.53%? 【免费下载链接】wav2vec2-base-vi-vlsp2020 项目地址: https://ai.gitcode.com/hf_mirrors/nguyenvulebinh/wav2vec2-base-vi-vlsp2020 nguyenvulebinh/…

一场关于“源头”的反思:当AI让数据治理回归业务本质

一场关于“源头”的反思:当AI让数据治理回归业务本质

2026/8/6 22:32:11

上礼拜,被朋友拉去听了场山东CIO联盟的线上闭门会,主题叫“AI赋能的源端数据质量改造”。坦白讲,刚开始我是带着“又是老调重弹”的心态进去的——毕竟“数据治理”这四个字,在圈里都快被念成紧箍咒了。主数据平台上了&#xff0c…

FastHX实战案例:构建实时聊天应用(lipsum-chat)全解析

FastHX实战案例:构建实时聊天应用(lipsum-chat)全解析

2026/8/6 22:22:11

FastHX实战案例:构建实时聊天应用(lipsum-chat)全解析 【免费下载链接】fasthx Declarative Python server-side rendering utility for FastAPI with built-in HTMX support. 项目地址: https://gitcode.com/gh_mirrors/fa/fasthx FastHX是一个为FastAPI设计…

香辛料色选的误剔怎么排查:从成像对比到喷阀延迟的调试记录

香辛料色选的误剔怎么排查:从成像对比到喷阀延迟的调试记录

2026/8/6 23:32:14

香辛料色选出现误剔或漏选时,常见的判断是“颜色阈值没有调好”,但实际问题往往发生在成像、料层和执行环节之间。以孜然为例,霉变粒、暗色粒、碎壳、草梗和轻杂会同时出现;有些碎壳与合格粒颜色接近,有些粉尘会降低背…

flipperzero-mayhem进阶技巧:自定义WiFi脚本实现复杂攻击流程

flipperzero-mayhem进阶技巧:自定义WiFi脚本实现复杂攻击流程

2026/8/6 23:32:14

flipperzero-mayhem进阶技巧:自定义WiFi脚本实现复杂攻击流程 【免费下载链接】flipperzero-mayhem Perfect companion for your Flipper Zero. ESP32 with WiFi, BT/BLE, micro-SD, cameraPSRAM, flashlight and extras: NRF24/CC1101, 3V/5V sensors 项目地址: …

如何快速激活Windows和Office系统:KMS智能激活脚本终极指南

如何快速激活Windows和Office系统:KMS智能激活脚本终极指南

2026/8/6 23:32:14

如何快速激活Windows和Office系统:KMS智能激活脚本终极指南 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 还在为Windows和Office的激活问题烦恼吗?KMS_VL_ALL_AIO是一款…

如何高效使用ComfyUI-WanVideoWrapper:专业AI视频生成完整解决方案

如何高效使用ComfyUI-WanVideoWrapper:专业AI视频生成完整解决方案

2026/8/6 23:32:14

如何高效使用ComfyUI-WanVideoWrapper:专业AI视频生成完整解决方案 【免费下载链接】ComfyUI-WanVideoWrapper 项目地址: https://gitcode.com/GitHub_Trending/co/ComfyUI-WanVideoWrapper ComfyUI-WanVideoWrapper是ComfyUI生态中最全面的AI视频生成插件&…

Claude Desktop 中文补丁终极指南:3分钟实现AI助手全界面汉化

Claude Desktop 中文补丁终极指南:3分钟实现AI助手全界面汉化

2026/8/6 23:32:14

Claude Desktop 中文补丁终极指南:3分钟实现AI助手全界面汉化 【免费下载链接】claude-desktop-zh-cn Claude Desktop Chinese Patch (macOS & Windows) 项目地址: https://gitcode.com/gh_mirrors/cl/claude-desktop-zh-cn 你是否厌倦了在英文界面中摸索…

Handshake全节点HSD:5分钟掌握去中心化域名系统部署

Handshake全节点HSD:5分钟掌握去中心化域名系统部署

2026/8/6 23:22:14

Handshake全节点HSD:5分钟掌握去中心化域名系统部署 【免费下载链接】hsd Handshake Daemon & Full Node 项目地址: https://gitcode.com/gh_mirrors/hs/hsd Handshake Daemon (HSD) 是Handshake协议的核心实现,为去中心化域名系统提供完整节…

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

2026/8/6 19:19:00

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案 【免费下载链接】ncmdumpGUI C#版本网易云音乐ncm文件格式转换,Windows图形界面版本 项目地址: https://gitcode.com/gh_mirrors/nc/ncmdumpGUI 你是否曾经从网易云音乐下载了心爱的歌曲&am…

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

2026/8/5 6:02:27

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比工程导读:本文深入讨论 分布式配置中心选型实战:Nacos与Consul在创业场景下的对比 在生产工程实践中的核心落地方案。基于 分布式架构与微服务设计 视角,剖析实际痛点、架…

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

2026/8/5 8:19:55

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案 【免费下载链接】MoneyPrinterPlus AI一键批量生成各类短视频,自动批量混剪短视频,自动把视频发布到抖音,快手,小红书,视频号上,赚钱从来没有这么容易过! 支持本地语音模型chatTTS,fasterwhisper,…

Unity相机抖动插件Camera-Shake集成与应用实战指南

Unity相机抖动插件Camera-Shake集成与应用实战指南

2026/8/6 0:00:51

1. 项目概述与核心价值最近在做一个动作游戏,需要给主角的重击和爆炸场景加点料,让打击感更足。我第一时间就想到了给相机加个抖动效果,毕竟这是提升玩家沉浸感最简单直接的手段之一。自己手写一个也不是不行,但时间成本高&#x…

Cocos Creator 3.7微信小游戏开发:从架构设计到提审上线的全流程实战指南

Cocos Creator 3.7微信小游戏开发:从架构设计到提审上线的全流程实战指南

2026/8/6 0:00:51

1. 项目概述:为什么需要一份3.7版本的专属适配指南?如果你是一位使用Cocos Creator开发微信小游戏的开发者,并且项目正运行在3.7版本上,那么你很可能已经感受到了那份“甜蜜的烦恼”。一方面,Cocos Creator 3.7是一个功…

AI编程实战:从Prompt工程到工具链集成,打造高效开发工作流

AI编程实战:从Prompt工程到工具链集成,打造高效开发工作流

2026/8/6 0:00:51

1. 项目概述:一次开源AI编程课程的深度重构 最近,我把自己的开源AI编程课程《Claude Code》做了一次从里到外的大更新。如果你对利用Claude、Codex这类大模型来辅助编程感兴趣,或者正在寻找一个能跟上最新AI编码工具迭代节奏的学习路径&#…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/6 5:43:30

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/4 14:25:14

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/4 15:11:03

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…