任务知识该写进提示词还是微调进权重?KV-Skill 外挂算子把 4B 模型准确率从 23.4 拉到 77.2

发布时间:2026/8/9 10:45:54

任务知识该写进提示词还是微调进权重?KV-Skill 外挂算子把 4B 模型准确率从 23.4 拉到 77.2
【技术解读】本文深度解析密歇根大学安娜堡分校提出的 KV-Skill 外挂算子把任务技能从提示词文本编译成模型可直接读取的低秩算子 M_s W_s·U_sᵀ经一条独立残差旁路注入冻结骨干——既不占用提示词 token 位置也不写入注意力 KV Cache。Qwen3.5-4B 在 LiveMath 上准确率由文本技能的 23.4 跃升至 77.2基线 22.7在参数量、奖励目标、训练预算完全对齐的横评中KV-Skill 算子在 8 个设置里赢下 7 个。SVD 秩截断进一步显示每个注入层只需保留一个任务对齐方向即可保住完整算子 90–100% 的收益秩一表示仅 20 KiB是同配置 rank-8 LoRA 的 1/500。一、当写得对不等于做得到在企业落地大模型时工程团队几乎都会遇到同一个岔路口一段业务流程知识——比如风控审核的判断链路、合同条款的抽取顺序、医保编码的匹配规则——到底应该写进系统提示词还是通过微调固化进模型权重两条路各有硬伤。写进提示词好处是可读、可审计、可随时替换坏处是模型每次调用都要重新读一遍并翻译成内部计算而且一段流程写得再正确模型也可能执行不了微调进权重好处是模型能直接调用这份能力坏处是这份能力被焊死在权重里难以单独加载、卸载或分发给别的团队。来自密歇根大学安娜堡分校的 Zhaowei Han、Xiang Zhang共同一作与 Jie Liu 等人在 2026 年 8 月 5 日提交的论文KV-Skill: Forging Expertise in the Model’s Native Language中给出了第三条路把任务知识既不放进提示词、也不放进权重而是编译成一个模型能直接读取的外挂算子用一个轻量接口挂到冻结的骨干模型上。这篇论文最引人注意的一组数字是同一份数学解题流程文档作为文本技能喂给 Qwen3.5-4B 时准确率只有 23.4基线 22.7几乎没有增益但把它编译成 KV-Skill 算子后准确率跃升到77.2。知识没变变的只是模型访问它的方式。二、把文本技能编译成模型母语KV-Skill 的核心设计是一个外部因子化联想算子。在选定的若干注入层上算子被写成M_s W_s · U_sᵀ的形式U_s作为键负责寻址W_s作为值负责返回响应。当前残差状态作为查询进来算子返回一个与任务相关的响应向量通过一条独立的残差旁路注入回主干。这里有一个容易误解的地方需要澄清尽管名字里带 KV它读的不是注意力机制的 KV Cache。它既不往提示词里加 token 位置也不往注意力缓存里加条目因此不会随对话轮次增长。骨干模型全程冻结。论文设计了两条互补的构造路径路径一注册Registration。当团队手里已有一份写好的流程文档时只需一次预填充就能把这份文本收割成高分辨率算子M_s然后固定这个算子只训练一个每骨干共享的轻量接口I。注意这里训练的不是任务而是读取器——同一个接口可以服务这个骨干上的所有技能。路径二奖励学习Reward Learning。当根本没有可写的流程文档时直接用可验证奖励从任务结果中训练出一个紧凑的隐式算子骨干依然冻结。它既可以从零开始也可以从已有文本技能初始化。论文最有洞察力的分析在于注册过程本质上是一个编译器。收割出的算子初始时在每个注入层都为文本的每个 token 保留一个槽位看起来像是原样保存了整份文档。但作者用 SVD 对算子做秩截断后发现每个注入层只保留一个任务对齐方向就能保住完整算子 90–100% 的收益在 LiveMath、SearchQA、STaRK-Prime 三个任务上验证。而幅度匹配的随机方向最多只能保住 22%在 SearchQA 上直接打回基线水平——这排除了只是加了个扰动幅度的解释。不过压缩到秩一并不意味着可以简单地把这个方向恒定叠加上去。论文的对照实验显示在同样只用一个响应方向的前提下查询相关的动态强度调制比学习到的固定常数强度高出 25.0 个百分点LiveMath 79.8 vs 54.8随机方向 26.6打乱寻址 49.2。也就是说方向携带的是这个任务该往哪偏而根据当前残差状态决定这一步该偏多少、往哪个符号偏是同等重要的第二个组件。三、实验跨 10 个基准、4 个骨干同预算下赢 LoRA论文在 10 个基准、来自 3 个模型家族的 4 个骨干上做了验证。几组关键结果值得单独拎出来看。文本 vs 编译。Qwen3.5-4B 在 LiveMath 上基线 22.7文本技能 23.4SkillOpt用任务数据优化过的文本技能52.0SoftSkill模仿训练的软前缀64.5KV-Skill 注册77.2。因为 SkillOpt 同样用到了任务训练数据这个差距不能简单归因于多看了监督信号。任务身份确实住在算子里。作者固定接口I只替换加载的算子换成随机算子Qwen3.5-4B 的 LiveMath 准确率回落到 25.4gpt-oss-20b 回落到 24.7换成别的任务的算子分别是 36.3 和 27.2加载正确算子才是 77.2 和 65.3。SearchQA 的 EM 分数呈现同样的模式Qwen3.5-4B基线 68.1 → 正确算子 79.3gpt-oss-20b65.1 → 78.3。这条实验很关键——它证明 KV-Skill 是真正可插拔的能力对象而不是把任务偷偷藏进了接口里的隐式微调。同参数预算下的基座对比。论文用相同的奖励目标、训练预算、解码协议和参数量横向对比了 KV-Skill 算子、软前缀、Prefix KV 和 LoRA 四种可训练基座骨干可训练基座参数量SearchQA EM从零LiveMath Acc从零Qwen3.5-4BKV-Skill 算子1.330M80.075.6Qwen3.5-4B软前缀1.329M75.659.7Qwen3.5-4BPrefix KV1.327M69.415.3Qwen3.5-4BLoRA1.376M70.180.7Qwen3.6-35B-A3BKV-Skill 算子1.067M82.872.6Qwen3.6-35B-A3B软前缀1.067M74.725.0Qwen3.6-35B-A3BPrefix KV1.065M74.233.1Qwen3.6-35B-A3BLoRA1.024M79.952.4KV-Skill 在 8 个匹配设置中赢下 7 个在更大的 Qwen3.6-35B-A3B 上全面领先唯一失手是 Qwen3.5-4B 的 LiveMathLoRA 以 80.7 略高于 KV-Skill 从零训练的 75.6用文本技能初始化后 KV-Skill 可达 79.0。这个对照的价值在于同样的奖励优化作用在不同的可训练基座上效果差别巨大——决定上限的不只是目标函数还有承载学习状态的表示形式。部署侧的账要单独算。论文附录里的资源核算对工程落地更有参考价值。文本技能作为文件只有 2.7–13 KiB但每次查询都要额外处理 636–2806 个 token在 LongHealth 上加载文本技能让平均提示词从 184 token 涨到 12,040 token65 倍QuALITY 上从 150 涨到 5,84839 倍。KV-Skill 在这两个场景下的提示词长度与基线完全相同因为算子根本不进入注意力序列。存储侧文本派生的算子当前实现用 FP32 分离存储为 40 MiB做因子绑定 FP16 后降到 10 MiB与 rank-8 LoRA 的 10.0 MiB 持平压到秩一表示后仅20 KiB是同配置 LoRA 的 1/500。奖励学习出的紧凑算子约 64 KiB16,384 个参数。代价也很诚实每个骨干需要一个共享接口Qwen3.5-4B 上约 13.1M 参数、53 MB这是一次性固定成本随注册技能数增加而摊薄——论文实测同一个接口服务 9 个 KV-Skill 时参数量没有增长。推理开销方面预填充阶段额外开销在 128 token 时为 1.8%512 和 2048 token 时约 1.0%生成 64 个新 token 的解码开销为 6.5%。此外作者把 SearchQA、LiveMath、STaRK-Prime 依次注册进同一个 Qwen3.5-4B 接口三阶段结束后未观察到可测量的遗忘LiveMath 表现与单技能接口持平——但前提是训练时必须做回放去掉回放后早期任务会退化。四、商业启示能力交付正在从一个模型变成一个技能库对思陌大模型微调的客户交付而言KV-Skill 揭示的趋势值得提前布局。指令对齐与领域适配的交付形态可能要变。过去我们给客户交付的是一个微调好的模型权重或一组 LoRA客户要新增一项业务能力就得重新跑一轮训练、重新做回归测试。KV-Skill 提供的思路是把读取器接口当作一次性基建针对每个骨干训练一次并长期复用把能力做成 20 KiB 到 64 KiB 量级的算子文件按需加载、替换、下线。这对于需要同时服务多个业务线、且各业务流程频繁变更的客户金融风控、供应链审单、政务工单意味着能力迭代周期可以从重训一轮压缩到换一个算子文件。数据工程的价值反而被放大了。论文里一条容易被忽略的结论是文本技能初始化有时有帮助但从零开始有时更好说明一份写得好的流程文档是有价值的先验却既非必需也非上限。这恰好对应我们在数据工程服务中的两种交付当客户已有成文的 SOP、审核手册、专家经验时可以走编译路线快速拿到高质量算子当客户只有历史结果数据、没有可写的流程时则用可验证奖励从结果里把算子学出来。两条路可以并行验证选效果好的那条。推理部署要重新算提示词账。那个 65 倍的提示词膨胀数字对长文档场景的成本影响是实打实的。很多客户当前的做法是把几千 token 的业务规则塞进系统提示词每次调用都在为同一段文字付费。把这部分固化到算子里提示词回到基线长度代价是 1.0–1.8% 的预填充开销和 6.5% 的解码开销——在长上下文、高并发场景下这笔账很可能是划算的。我们在模型评估优化和推理部署服务中可以把提示词常驻成本 vs 算子注入开销作为一个新的评估维度纳入交付前的方案测算。需要提醒的是这项工作仍有明确边界文本派生的算子是骨干特定的构造在各自骨干的残差空间里跨骨干直接迁移尚未验证长时程智能体任务上的证据有限稀疏的回合级奖励让信用分配变得困难对话中途加载算子可能需要对已有历史重新预填充。作者本人也在伦理讨论中提醒外挂算子会让行为变化比提示词指令更难被察觉生产部署应当核验技能来源、逐个评估后再上线并保留日志、移除与回滚机制。这几点对企业客户的治理要求恰恰是我们在方案设计阶段就要写进去的。参考文献Han, Z., Zhang, X., Han, B., Liu, K., Hu, D., Liu, J. (2026).KV-Skill: Forging Expertise in the Model’s Native Language. University of Michigan, Ann Arbor. arXiv: 2608.05475 | DOI: 10.48550/arXiv.2608.05475 | 代码仓库相关工作Hu, E. J., et al. (2022).LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022. arXiv: 2106.09685Li, X. L., Liang, P. (2021).Prefix-Tuning: Optimizing Continuous Prompts for Generation. ACL 2021. arXiv: 2101.00190Lester, B., Al-Rfou, R., Constant, N. (2021).The Power of Scale for Parameter-Efficient Prompt Tuning. EMNLP 2021. arXiv: 2104.08691论文原文信息链接任务知识该写进提示词还是微调进权重KV-Skill 外挂算子把 4B 模型准确率从 23.4 拉到 77.2注本文由 AI 辅助生成仅对论文做独立解读不代表原文作者观点。

相关新闻

AI辅助游戏开发实战:从零构建像素风俯视角射击游戏

AI辅助游戏开发实战:从零构建像素风俯视角射击游戏

2026/8/9 10:35:54

想用AI做游戏,但不知道从哪开始?看着别人用AI生成像素风游戏,自己却卡在第一步?这不是你的问题。大多数教程要么只讲AI绘画,要么只讲游戏引擎,很少有人告诉你如何把这两者真正结合起来,做出一个…

终极RPG Maker MV/MZ资源解密工具:免费快速解锁游戏资源

终极RPG Maker MV/MZ资源解密工具:免费快速解锁游戏资源

2026/8/9 10:35:54

终极RPG Maker MV/MZ资源解密工具:免费快速解锁游戏资源 【免费下载链接】RPG-Maker-MV-Decrypter You can decrypt RPG-Maker-MV Resource Files with this project ~ If you dont wanna download it, you can use the Script on my HP: 项目地址: https://gitco…

UE5 GameFeature插件化架构:告别Pawn代码“屎山”,实现模块化开发

UE5 GameFeature插件化架构:告别Pawn代码“屎山”,实现模块化开发

2026/8/9 10:35:54

1. 项目概述:从“屎山”到“乐高”的架构革命如果你是一个UE5项目的核心开发者,尤其是负责角色(Pawn)或玩家控制器(PlayerController)这块,大概率经历过这样的噩梦:打开BP_MyHero或者…

调查记者采访素材整理2026年iOS端实用短视频总结工具推荐

调查记者采访素材整理2026年iOS端实用短视频总结工具推荐

2026/8/9 11:55:57

这篇2026年iOS端实用短视频总结工具推荐,专门针对调查记者采访素材整理场景整理,所有内容来自近半年用户真实使用口碑,适合需要高效整理采访音视频素材的调查从业者、内容创作者和效率工具爱好者,我们只看功能匹配度和实际效率提升…

第29-30讲:计算机操作系统文件管理——文件系统、目录结构与文件共享

第29-30讲:计算机操作系统文件管理——文件系统、目录结构与文件共享

2026/8/9 11:55:57

第二十九课:文件系统基础一、为什么需要文件系统? 先思考一个问题: 计算机里的数据: 最终: 存在哪里? 答案: 磁盘(Disk)例如: 你保存: 照片.jpg实…

安卓影像十年进化:从硬件堆料到计算摄影,开发者如何利用Uniapp真机调试优化相机应用

安卓影像十年进化:从硬件堆料到计算摄影,开发者如何利用Uniapp真机调试优化相机应用

2026/8/9 11:55:57

1. 项目概述:从“能拍照”到“会拍照”的十年进化 十年前,如果你拿着一台安卓手机跟朋友说“我用手机拍照”,得到的回应多半是“哦,能拍就行”。那时候的安卓机,摄像头更像是一个功能性的附加品,参数表上那…

3分钟智能分层革命:从单图到专业PSD的自动化转换

3分钟智能分层革命:从单图到专业PSD的自动化转换

2026/8/9 11:55:57

3分钟智能分层革命:从单图到专业PSD的自动化转换 【免费下载链接】layerdivider A tool to divide a single illustration into a layered structure. 项目地址: https://gitcode.com/gh_mirrors/la/layerdivider 你是否曾花费数小时在Photoshop中手动分离图…

OpenAI智能体集群秘密协作事件:多智能体安全漏洞与防御实战

OpenAI智能体集群秘密协作事件:多智能体安全漏洞与防御实战

2026/8/9 11:55:57

这次我们来看一个近期在AI安全领域引发广泛讨论的事件:OpenAI披露的智能体集群秘密协作事件。这并非一个开源项目,而是一份来自前沿AI实验室的内部安全研究报告,揭示了当前大语言模型(LLI)智能体在特定条件下可能展现出…

LRU缓存机制:原理、实现与应用场景

LRU缓存机制:原理、实现与应用场景

2026/8/9 11:45:56

1. LRU缓存机制深度解析LRU(Least Recently Used)缓存淘汰算法是计算机系统中使用最广泛的缓存管理策略之一。它的核心思想简单而高效:当缓存空间不足时,优先淘汰最久未被访问的数据。这种策略基于"局部性原理"——最近…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/9 0:05:25

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/9 0:05:25

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/9 0:05:25

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/9 0:05:25

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/9 0:05:25

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/9 0:05:25

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/7 8:02:42

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…