【96G显卡本地部署DeepSeek-V4-Flash-0731的Q2量化版】实现推理速度90+词元秒

发布时间:2026/8/10 8:46:56

【96G显卡本地部署DeepSeek-V4-Flash-0731的Q2量化版】实现推理速度90+词元秒
【本地部署DeepSeek-V4-Flash-0731-Q2实现推理速度90词元秒】结论运行环境介绍硬件软件不同量化版本的运行脚本和速度情况主角登场加入DFlash可以提速50%以上后话结论在本地单机部署个人使用可以达到80~90 tokens/s使用Q2量化版。启动参数如下PSD:\llama_cppcat.\huihuiaiDS.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 1 ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^--kv-unified ^--port 12340 pausePSD:\llama_cpp.\huihuiaiDS.bat下面是详细的运行报告和不同版本的测速报告运行环境介绍硬件软件内存128G的 DDR5 4800 MT/S 32G * 4 )显卡96G显存的RTX Pro 6000 型号的显卡硬盘NVME硬盘 2TCPUIntel i9-13900KF系统Windows 11驱动版本NVIDIA-SMI 595.71CUDA Version13.2LLAMA CPP 版本#b10295 版llama-b10295-bin-win-cuda-13.3-x64 CUDA 13.3 DLL不同量化版本的运行脚本和速度情况1: unsloth / DeepSeek-V4-Flash-0731-GGUF / UD-IQ3_XXS 的速度约20 token/s运行脚本如下PSD:\llama_cppcat.\deepseekServer.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf^--aliasDeepSeek-V4-Flash-0731-IQ3_XXS^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 2 ^--top-k 40 ^--kv-unified ^-ngl 40 ^--no-mmap ^--port 12340 pause2: 尝试加入DFlash技术看看能否实现加速结论是草稿接受度0.40的情况下速度下降到了10-13 ts左右。脚本如下PSD:\llama_cppcat.\deepseekServer_DSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\UD-IQ3_XXS\DeepSeek-V4-Flash-0731-UD-IQ3_XXS-00001-of-00004.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasDeepSeek-V4-Flash-0731-IQ3_XXS^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 2 ^--top-k 40 ^--kv-unified ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^-ngl 36 ^--no-mmap ^--port 12340 pause3 以下测试LMStudio community发布的 DeepSeek-V4-Flash-0731-mxfp4 模型的速度此量化模型的准确率最高(几乎达到99%准确率)模型大约 156 GB。先看如果加入DSpark的草稿模型时速度如何结论 2 tsPSD:\llama_cppcat.\runServer_DSMXFP4_DSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf^-mdF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\dspark-DeepSeek-V4-Flash-0731-MXFP4.gguf^--aliasDeepSeek-V4-Flash-0731-MXFP4^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^-c 196608 ^-t 24 ^-b 2048 ^-ub 512 ^-np 1 ^--top-k 40 ^--kv-unified ^--no-mmap ^--port 12340 pause请看运行时的资源情况其实可以看到内存被大量占用。由于超过了128G很多时间都消耗在了内存交换上因此推理速度很慢。现在尝试取消DFlash的功能不加载DSpark草稿模型: 先说结论17-18 tsPSD:\llama_cppcat.\runServer_DSMXFP4_NoDSpark.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf^--aliasDeepSeek-V4-Flash-0731-MXFP4^-c 196608 ^-t 24 ^-b 2048 ^-ub 512 ^-np 1 ^--top-k 40 ^--kv-unified ^--no-mmap ^--port 12340 pausePSD:\llama_cpp.\runServer_DSMXFP4_NoDSpark.bat 0.00.159.607 W DEPRECATED:--mmap and--no-mmap are deprecated.use--load-mode mmap instead 0.00.159.768 I cmn common_param: common_params_print_info: verbosity 3(adjust with the -lv NCLIarg)0.00.231.029 W srv llama_server:-----------------0.00.231.038 W srv llama_server: CORS issetto allow all origins(*)and no API key isset0.00.231.040 W srv llama_server: this can be a security risk(cross-origin attacks)0.00.231.041 W srv llama_server: more info: https://github.com/ggml-org/llama.cpp/pull/25655 0.00.231.041 W srv llama_server:-----------------0.00.235.399 I srv load_model: loading modelF:\.lmstudio\lmstudio-community\DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-0731-MXFP4-00001-of-00004.gguf1.48.853.251 I srv load_model: initializing,n_slots 1,n_ctx_slot 196608,kv_unified true1.48.877.992 I srv init: chat template supports preserving reasoning,consider enabling it via--reasoning-preserve 1.48.878.857 I srv llama_server: model loaded 1.48.878.868 I srv llama_server: listening on http://127.0.0.1:12340启动之后我们运行一下我们没有指定GPU运行的层数和CPU运行的层数LLAMA CPP 自动处理了。我们自己可以尝试通过-ngl 36 或者 48 来设置。这里我就不尝试了。尝试过了速度还是没有超过50 ts的可能个人认为低于40-50 ts的推理速度聊天可以但是用来做代理任务和写代码等任务还是太慢了。主角登场很多社区的大型实验室给出了很多版本的DS的量化版本根据LMStudio的推荐我选用了huihui-AI 的版本他给出的Q2量化版文件大小为 87 GB这对96G现存的显卡来说非常友好。虽然Q2的准确率下降到了70%左右但是如果速度能够达到90 ts的话比qwen-3.6-27B还是要强上许多毕竟200B的参数量在这里。加入DFlash可以提速50%以上本文开头已经给出运行脚本加上了DSpark我这里给出如果不加草稿模型的运行速度作为参考 50 t/sechooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-abliterated-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 32768 ^-t 12 ^-b 2048 ^-ub 512 ^-np 1 ^--kv-unified ^--port 12340 pause如图从显存资源图也可以看到运行时显存没有完全占用所以非常适合将剩余的显存来运行草稿模型DSpark于是有了开头的脚本可以实现90 t/s的速度。这里我们再次把启动脚本放出来PSD:\llama_cppcat.\huihuiaiDS.bat echooff D: cd/D D:\llama_cpp llama-server ^-mF:\.lmstudio\huihui-ai\Huihui-DeepSeek-V4-Flash-0731-GGUF\DeepSeek-V4-Flash-Q2-0731.gguf^-mdF:\modelscope\DeepSeek-V4-Flash-0731-GGUF\dspark\dspark-DeepSeek-V4-Flash-0731-BF16.gguf^--aliasdeepseek-v4-flash-0731-abli-Q2^-c 196608 ^-t 16 ^-b 2048 ^-ub 512 ^-np 1 ^--spec-typedraft-dspark ^--spec-draft-n-max 3 ^--kv-unified ^--port 12340 pausePSD:\llama_cpp.\huihuiaiDS.bat后话就在我前天还是使用LLAMA_CPP 的版本还是b10297的时候现在就发布了b10329版本了。更新好快。这个发布应该是AI做的。现在技术迭代实在是太快了。Deepseek V4 Flash 正式版也就是 0731 版本作为能在本地部署的话可以说比qwen 3.6系列要强一些的期待社区继续用强化qwen 3.6的方法继续挖掘DSv4F的更多能力又或者等待Qwen 3.8系列推出开源版本。视频开源模型 MiniMax H3 现在很热闹让视频生成领域非常火爆。希望编程领域也能继续发光发热大家加油如果本文章对你有帮助或者让你更加了解如何在本地部署 DeepSeek 大语言模型请你为我点赞吧~~感谢

相关新闻

Python贪吃蛇游戏开发全解析:从Pygame入门到项目实战

Python贪吃蛇游戏开发全解析:从Pygame入门到项目实战

2026/8/10 8:36:56

1. 项目概述与核心价值 最近在整理自己的代码仓库,翻出了几年前刚学Python时写的贪吃蛇游戏。这个项目虽然不大,但麻雀虽小五脏俱全,它几乎涵盖了从零开始构建一个图形化小游戏所需的所有核心概念:事件循环、图形渲染、碰撞检测、…

应收账款周转率只看总数行不行?如何深入剖析应收账款周转率背后的结构?

应收账款周转率只看总数行不行?如何深入剖析应收账款周转率背后的结构?

2026/8/10 8:36:56

每到月底或者年底,财务办公室里总是最忙的时候。大家盯着电脑屏幕,从ERP系统里导出一堆密密麻麻的明细,再打开Excel,用无数个VLOOKUP和透视表,花个三五天时间拼凑出一份财务分析报告。当老板在会上皱着眉头问一句&…

微信小程序商城开发实战:从零到一构建仿小米商城

微信小程序商城开发实战:从零到一构建仿小米商城

2026/8/10 8:36:56

大家好,我是专注于Web前端与小程序开发的博主。在电商业务快速发展的今天,将成熟的Web商城项目迁移到微信小程序平台,实现多端触达用户,已成为许多开发者的核心需求。然而,从零开始搭建一个功能完整、体验流畅的微信小…

QwenCode智能代码助手:从核心原理到开发实战的深度指南

QwenCode智能代码助手:从核心原理到开发实战的深度指南

2026/8/10 10:06:59

1. 项目概述:初识QwenCode 最近在开发者圈子里,一个名为“QwenCode”的工具讨论度悄然升温。作为一个常年混迹在代码与工具链中的老手,我对这类宣称能提升编码效率的新玩意儿总是抱有三分好奇和七分审视。简单来说,QwenCode是一个…

微信小程序在线教育系统源码解析:从部署到二次开发全指南

微信小程序在线教育系统源码解析:从部署到二次开发全指南

2026/8/10 10:06:59

这次我们来看一个基于微信小程序的在线视频教育系统,重点是它自带作品集展示功能,并且源码是免费提供的。对于想快速搭建一个教育类小程序,或者需要学习小程序前后端完整开发流程的开发者来说,这是一个非常直接的参考项目。它不涉…

Steam创意工坊免费下载终极指南:5分钟上手WorkshopDL跨平台模组工具

Steam创意工坊免费下载终极指南:5分钟上手WorkshopDL跨平台模组工具

2026/8/10 10:06:59

Steam创意工坊免费下载终极指南:5分钟上手WorkshopDL跨平台模组工具 【免费下载链接】WorkshopDL WorkshopDL - The Best Steam Workshop Downloader 项目地址: https://gitcode.com/gh_mirrors/wo/WorkshopDL 还在为跨平台游戏无法使用Steam创意工坊模组而烦…

解决UE5 C++开发中Visual Studio 2022中文乱码:UTF-8编码配置指南

解决UE5 C++开发中Visual Studio 2022中文乱码:UTF-8编码配置指南

2026/8/10 10:06:59

1. 项目概述:一个被忽视的编码细节引发的开发困境 如果你在用 Visual Studio 2022 写 Unreal Engine 5 的 C 代码,大概率遇到过这个让人头疼的场景:在 VS 里写好的代码,注释清晰,逻辑分明,但一回到 UE5 的编…

OpenAI黑帽大会复盘HF安全事件:AI供应链攻击链与防御实践

OpenAI黑帽大会复盘HF安全事件:AI供应链攻击链与防御实践

2026/8/10 10:06:59

这次我们来看一个关于AI安全领域的重要事件复盘。项目标题“OpenAI黑帽大会详述HF事件时间线”指向的并非一个可部署的软件工具,而是一份由OpenAI在顶级安全会议“黑帽大会”上披露的、针对Hugging Face平台安全事件的详细技术分析报告。对于开发者、安全研究员以及…

基于TVA-World的具身智能终身学习与记忆重放原理

基于TVA-World的具身智能终身学习与记忆重放原理

2026/8/10 9:56:59

前沿技术探索:TVA智能体(简称TVA)TVA智能体(亦称“AI智能体视觉”或“TVA视觉智能体”)是依托Transformer架构与“因式智能体”理论构建的通用视觉技术框架。它融合深度强化学习(DRL)、卷积神经…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/10 5:58:32

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/10 7:54:12

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/10 7:19:21

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

Prometheus 监控体系深度部署:选型别只看功能清单

Prometheus 监控体系深度部署:选型别只看功能清单

2026/8/10 0:06:33

Prometheus 监控体系深度部署:选型别只看功能清单 选型场景:小规模集群直接部署 Thanos 的代价 如果为解决 15 天本地存储限制,直接部署 Thanos Sidecar、Store Gateway、Querier、Compactor、Ruler、Bucket Web 并接入 S3,就需…

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节

2026/8/10 0:06:33

ELK 日志分析平台与全链路追踪:代码评审该盯住哪些细节 场景示例:一条 2MB 日志影响 Elasticsearch 写入 一个上传接口若执行 log.Info("Request dumped: ", r.Body),会将 2MB 的二进制 Body 写入日志。高并发下,这类超…

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节

2026/8/10 0:06:33

从零到一构建开源项目的完整历程:代码评审该盯住哪些细节 项目进入稳定版本后,外部 Pull Request(PR)会带来新的协作成本。大范围改动混入风格重构,或修复局部问题时修改公共函数签名,都可能扩大评审和兼容…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…