【论文自读】AgentSlimming: 面向高效与成本感知的多智能体系统

发布时间:2026/8/11 16:18:39

【论文自读】AgentSlimming: 面向高效与成本感知的多智能体系统
发表年份2026年7月2日至7日会议ACL 2026 Long PaperCCF-A作者单位上海交通大学、南京大学、悉尼大学、南京航空航天大学、上海人工智能实验室等摘要基于大语言模型的多智能体系统MAS在复杂任务中展现出了卓越的能力。然而手动设计最优的通信拓扑结构耗时费力而自动化扩展方法则常导致结构臃肿、包含大量冗余智能体进而造成过高的令牌消耗。为解决该问题我们提出了AgentSlimming——一种面向图结构多智能体工作流的即插即用型压缩框架。受神经网络中剪枝与量化技术的启发AgentSlimming通过以下步骤压缩工作流首先采用混合机制估算每个智能体的重要性分数然后移除冗余智能体或用低成本智能体进行替换其中每次操作均通过基于基线锚定的接受规则进行验证以防止性能崩塌。实验表明AgentSlimming在性能损失可忽略的前提下平均令牌成本最高可降低78.9%且有时甚至能提升准确率在成本与质量之间实现了强劲的帕累托最优权衡。我们的代码已公开于GitHub - CitrusYL/AgentSlimming: A research framework for optimizing graph-structured LLM agent workflows. · GitHubAgentSlimming示意图为识别冗余AgentSlimming对每个智能体节点计算四种不同的排名指标度中心性、介数中心性、成本比较和近似沙普利值。剪枝和量化均基于计算得到的重要性分数选择候选节点按重要性从低到高排序优先优化排名最低的候选节点。每次操作后执行重新评估。若得分降至可接受阈值以下则触发回滚机制以撤销当前操作并立即终止该阶段从而保持优越的性能。问题定义作者将多智能体系统的优化问题表述为在有向图上的离散结构搜索问题明确权衡任务性能和执行成本。核心思想把每个智能体当作图上的节点通过多维指标反复评估每个节点对团队是否‘不可或缺’然后大胆删掉‘闲人’或把‘高薪低效’的人换成‘实习生’每动一步就检查一下团队业绩准确率一旦业绩下滑就立刻撤销操作。最终得到一个精简、省钱且依然能干活的智能体团队。具体实现第一步先得到一个性能很强、但比较“臃肿”的初始 Workflow。具体而言在本文的主实验中作者先用AFlow构建了一个initial high-performance workflow graph初始的高性能工作流图把它定义为Gbase。第二步用Dprobe和Dval这两个集合来优化这个高性能Workflow​。具体而言有三个数据集。Dval是就是每个 benchmark 自己划出来的验证集。针对哪个 benchmark 优化 workflow就用哪个 benchmark 自己的Dval。Dprobe是Dval的一个子集它用来快速估计每个 Agent 节点的重要性和成本贡献。作者进一步在 HotpotQA 上测试了 10、50 和 100 三种 probe size。其中 50 个样本时取得了最高准确率且作者指出 30–60 个 probe samples 通常已能产生较稳定的节点重要性排序。因此可以把 50 理解为一个较具代表性的 probe size但论文并未明确说明所有主实验统一固定为 50。表7HotpotQA上探针数据集大小的敏感性分析。我们改变了用于节点重要性评估的探针大小并报告了由此产生的任务准确率和每个问题的平均推理成本。小结Dval和Dprobe的用处Dprobe​告诉你“改谁”。Dval​告诉你“改完之后这个方案能不能要”。Dtest​最后评估这个优化后的 Workflow 到底有多好。Dval​ 是每个 benchmark 自己划分出的验证集Dprobe​ 则是从该验证集 Dval​ 中进一步抽取出来的一个更小的数据子集。若假设取 50 个样本那么 Dprobe​ 就可以看作是从 Dval​ 中抽出的 50 个样本组成的小数据集。有了初始高性能工作流 Gbase​以及 Dprobe​、Dval​ 和 Dtest​ 三类数据后就可以开始理解 AgentSlimming 的具体优化流程。Stage 1 AgentPruner 裁剪阶段第一步先判断每个 Agent 节点有多重要我们在Dprobe这个数据集上对Gbase里面的每个节点去计算四个信号值①Degree Centrality度中心性定义衡量一个节点在图中连接了多少个邻居。也就是看这个节点和多少个其他智能体有直接信息往来。计算方式入度 出度或有向图中边的总数。论文中的使用逻辑连接越少的节点越容易被剪枝。因为它在拓扑结构上处于边缘位置删掉它对整体信息流通影响最小。【平白的理解就是说那些没什么连接的结点相对于其他连接比较多的节点信息量相对较少所以去除它带来的影响比较少。】② Betweenness Centrality介数中心性定义衡量一个节点在图中充当信息桥梁中间人的程度。如果很多其他节点之间的最短路径都要经过它那它的介数中心性就高。计算方式【在从 A 到 B 的所有最短路径中经过 该节点 的比例是多少累加】论文中的使用逻辑介数越低的节点越容易被剪枝。因为它在信息流通中不是关键枢纽删掉它不会阻断重要的信息传递。③Approximate Shapley Value近似沙普利值定义从功能贡献的角度来衡量一个节点。它来自合作博弈论用来评估“如果把某个玩家节点从团队中拿掉团队的整体收益准确率掉了多少”。掉的越少说明这个节点越不重要。计算方式留一法 LOO论文中的使用逻辑沙普利值越小的节点越容易被剪枝或量化。因为它对最终答案的准确率贡献最小。④Delta-Cost增量成本信号定义衡量删除或替换这个节点能省多少钱。这是从经济/成本维度来评估节点的重要性。计算方式使用逻辑增量成本越高的节点越优先被剪枝或量化。因为剪掉它能带来最大的经济收益。第二步把四个指标融合成一个 RRF 排名所有指标都会转换成排名然后通过 RRF 统一融合最终融合分数越低节点越该被优化掉。第三步真的把最不重要的 Agent 删除比如现在RRF判断AgentB是最终不重要的那就把B删掉。然后作者做了一个Graph SurgeryA-B-C删除B之后自动补一条:A-C也就是把被删除节点的 predecessor 和 successor 重新连接起来确保 workflow 仍然可执行。论文对此给出了明确规则对于 s∈In(v) 和 t∈Out(v)删除 v 后补上 s→t。第四步这时候 Dval​ 就开始发挥作用了Dprobe​ 刚才只是告诉我们Agent B 看起来最值得删但是它不能最终决定真的删还要检查SGp是否够好。即其中Tp 0.95。也就是说假设Gbase是80%那么最低接收线就是0.95*80%76%。如果删掉Agent B后SGp79%7976就接受就把agent B删掉如果不是那就rollback。AgentPruner 整个阶段一句话总结就是Dprobe 找“谁可以删” →删掉→Dval 检查“能不能接受” →接受/回滚→重新计算→继续下一轮​第二阶段 Agent Quant核心思想考虑哪些剩余 Agent 可以从 GPT-4.1-mini 换成 GPT-4.1-nano。第一步重新评估哪些节点最适合“降级模型”AgentQuant 仍然使用第一阶段的RRF 排序机制区别在于第一阶段的 Shapley 是把 Agent v 删掉以后性能掉多少。而第二阶段不是删除v而不是把v的大模型换成了更便宜的模型再观察性能变化。比如说在Dprobe上面测试将C节点换成了更便宜的模型nano性能只掉了0.2%那就说明这个节点没必要用那么贵的模型。反之如果性能掉了很多那就不能换。经过前两个阶段以后我们得到新的Gp。第三阶段是AgentTunerAdaptive MCTS Fine-tuning前两阶段是在“逐节点”做贪心优化而第三阶段开始把整个 workflow 当成一个搜索对象做离线的局部结构搜索。具体而言就是从这个 Gq​ 出发进一步搜索有没有更好的完整 workflowAgentTuner 从压缩后的 Gq​ 出发把完整 workflow 当成搜索节点借鉴 AFlow 的 MCTS 思路通过修改 prompt、连接关系和 operator 组合产生候选 workflow并在 Dval​ 上比较 score 和 cost进一步寻找更优的成本–性能折中。三个阶段都是迭代的。AgentPruner反复删节点它不是只删一个节点。直到 Top-k 候选节点都不能继续安全删除或者 pruning budget 用完才停止。AgentQuant也反复量化多个节点第二阶段同样不是只把一个节点换成便宜模型。每一轮重新排名→选择候选节点→尝试替换模型→Dval​验证→接受/拒绝然后继续下一轮。评估数据集 benchmark1标准基准测试Standard Benchmarks我们使用了完整的AFlowZhang等2025c套件包括GSM8KCobbe等2021MBPPAustin等2021完整集合HotpotQAYang等2018和DROPDua等2019随机采样的1,000个实例子集对于MATHHendrycks等2021我们遵循其特定子集即涵盖四个类别的617个Level-5问题。这些数据集采用1:4 的验证/测试划分即验证集占20%测试集占80%。注AFlow 套件AFlow suite不是一个数据集也不是一个软件包。AgentSlimming 为了和 AFlow 公平比较直接沿用了 AFlow 的那套 benchmark。你可以把它理解成2高难度基准测试High-difficulty Benchmarks为评估在复杂推理和编码任务上的性能我们纳入了AIME美国数学协会Art of Problem SolvingMuSiQueAnsTrivedi等2022LiveCodeJain等2025这些数据集采用3:7 的验证/测试划分即验证集占30%测试集占70%。跨这两个类别我们的评估套件共同覆盖了三种核心能力数学推理Mathematical Reasoning、编码Coding和问答Question Answering确保了对智能体系统性能的全面评估。注各benchmark的简单介绍基线方法我们将AgentSlimming与一系列多样化的基线方法进行比较I人工提示策略Manual Prompting Strategies标准思维链CoTWei等2022自一致性思维链SC-CoTWang等2023自我精炼Self-RefineMadaan等2023LLM-DebateDu等2023II自动化工作流优化Automated Workflow OptimizationADASHu等2025AFlowZhang等2025cIII成本感知型AFlowCost-Aware AFlow我们实现了一个修改版的AFlow变体该变体在搜索阶段将成本比较明确地集成到其选择机制中直接在成本效率上进行竞争。注Cost-Aware AFlow 并非本文方法而是作者基于原始 AFlow 实现的成本感知版本用作强对比基线。它在 AFlow 的搜索阶段显式加入成本比较机制以验证 AgentSlimming 的优势并非仅来自“考虑了成本”而是来自其基于节点重要性评估的剪枝与语义量化机制。实验结果(1) Standard BenchmarksAFlow自带的那些数据集表1标准基准测试上的性能和推理成本比较。成本表示平均API费用美元/问题。加粗表示基于工作流的方法不包括简单提示词基线中的最佳结果。绿色百分比表示与AFlow相比的相对成本降低突显了在保持有竞争力的准确率的同时节省了多少推理预算。(2) High-difficulty Benchmarks文章新加的数据集表2高难度基准测试上的性能和推理成本比较。成本表示平均API费用美元/问题。加粗表示基于工作流的方法不包括简单提示词基线中的最佳结果。绿色百分比表示与AFlow相比的相对成本降低。消融实验①第一组消融Prune 和 Quantize 的顺序重要吗表3反转流程顺序的消融实验。我们在MATH、MBPP和LiveCode上比较了基线、反转顺序流程先量化后剪枝以及最终的先剪枝后量化结果这三个数据集分别代表数学推理、程序合成和面向执行的代码生成。实验表明反转顺序产生了大致相似的最终成本-准确率权衡仅在贪心回滚机制下因搜索轨迹略有不同而产生微小差异。尽管如此我们在框架中仍采用“剪枝→量化”的设计因为先剪枝可以提前移除冗余节点缩小搜索空间从而使后续的量化阶段更加高效并降低框架的整体搜索成本。作者真正想说明的是两种顺序最后都能得到比较好的 cost–accuracy trade-off最终效果主要来自 Pruning 和 Quantization 的联合效果而不是依赖一个特殊的执行顺序。注Baseline不进行压缩直接使用原始的高性能 workflowQuantization → Pruning先对 Agent 进行低成本模型替换量化再删除冗余 Agent 节点Pruning → QuantizationOriginal Method先删除冗余 Agent 节点再对剩余节点进行低成本模型替换这是AgentSlimming 默认采用的原始流程。②第二组消融为什么一定要 RRF 多指标融合表4重要性排序策略的消融研究。我们比较了基于拓扑的信号仅度中心性、仅介数中心性、基于功能的信号仅沙普利值以及它们通过倒数排名融合RRF进行融合后的效果。评估涵盖四个代表性基准测试DROP阅读理解和离散数值推理、MATH和AIME数学与符号推理其中AIME进一步针对竞赛级别的问题求解、以及MBPP程序合成。我们报告了任务准确率Acc.和每个问题的平均推理成本$/问题。RRF行中的百分比表示与基线相比在每个基准测试上的相对变化。注意Baseline不压缩原始的高性能 workflowBetweenness-only只用介数中心性决定优先压缩谁Degree-only只用度中心性Shapley-only只用 ShapleyRRF (ours)把多种指标融合后再决定优先压缩谁。另外论文没有单独报告 Delta-Cost-only 这一行。虽然完整 RRF 方法包含成本信号但 Table 4 的单指标消融只报告了 Degree、Betweenness 和 Shapley 三种。

相关新闻

系统api-管道和FIFO

系统api-管道和FIFO

2026/8/11 16:18:39

管道 没有名字标识,决定了只能用于父子进程间的IPC.半双工模式 int pipe(int fd[2]);fd[0]用于读取,fd[1]用于写入.上图为父子进程通过两个管道对象实现全双工通信的例子 FIFO 有名字标识,文件系统路径名,半…

成都燃气灶维修全域覆盖 欧米到家同城上门深度检修承诺不返工|打不着火|松手熄火|黄火冒黑烟|漏气|各类故障一站式解决

成都燃气灶维修全域覆盖 欧米到家同城上门深度检修承诺不返工|打不着火|松手熄火|黄火冒黑烟|漏气|各类故障一站式解决

2026/8/11 16:18:39

导读成都燃气灶出现打不着火、点火后松手熄火、火焰发黄、冒黑烟、燃烧不均、旋钮失灵或疑似漏气等问题,可联系欧米到家统一报修热线400-996-9791。平台根据所在区域安排同城维修师傅上门,先检测故障原因,再说明维修方案和费用,确…

Epic 转让 ArtStation 和 Sketchfab,优先发展虚幻引擎 6 等业务

Epic 转让 ArtStation 和 Sketchfab,优先发展虚幻引擎 6 等业务

2026/8/11 16:18:39

Epic 转让 ArtStation 和 Sketchfab 背后的业务调整 2021 年,Epic 收购了艺术家作品集网站 ArtStation 和 Sketchfab。如今,Epic 宣布将这两个平台交由为游戏销售 3D 资产的 Kitbash 接手。 Epic 战略调整:聚焦核心业务发展 Epic 表示&#x…

自动驾驶中的视觉-语言-动作模型:综述

自动驾驶中的视觉-语言-动作模型:综述

2026/8/11 18:28:47

25年6月来自 MacGill 大学、清华、小米、Wisconsin 大学和 Minnesota 大学的论文“A Survey on Vision-Language-Action Models for Autonomous Driving”。 多模态大语言模型 (MLLM) 的快速发展为视觉-语言-动作 (VLA) 范式铺平了道路,该范式将视觉感知、自然语言理…

本地部署 OpenClaw AI 智能体,安装路径与安全软件避坑指南(含安装包)

本地部署 OpenClaw AI 智能体,安装路径与安全软件避坑指南(含安装包)

2026/8/11 18:28:47

Windows 部署 OpenClaw 本地 AI 自动化智能体🦞零基础图形化搭建指南 核心亮点💡 可视化图形界面、零代码操作、自动补齐运行依赖、全套组件内置、28 万 Tokens 可用额度,避开繁琐环境调试,新手也能快速搭建桌面 AI 自动化助手。…

新手零基础搭建本地 AI 数字员工 OpenClaw 完整安装操作指南(含安装包)

新手零基础搭建本地 AI 数字员工 OpenClaw 完整安装操作指南(含安装包)

2026/8/11 18:28:47

Windows 本地部署 OpenClaw 实操指南|快速搭建 AI 自动化智能体,规避复杂环境配置 核心亮点:零代码操作|图形可视化界面|自动补齐运行环境|内置全套依赖组件|搭载 28 万 Tokens 额度 资源获取…

Visual-Regression-Tracker未来路线图:即将发布的令人期待的新特性

Visual-Regression-Tracker未来路线图:即将发布的令人期待的新特性

2026/8/11 18:28:47

Visual-Regression-Tracker未来路线图:即将发布的令人期待的新特性 【免费下载链接】Visual-Regression-Tracker Backend and Frontend application for tracking differences via image comparison 项目地址: https://gitcode.com/gh_mirrors/vi/Visual-Regressi…

MusicBee-NeteaseLyrics技术解析:构建网易云音乐歌词服务的深度集成方案

MusicBee-NeteaseLyrics技术解析:构建网易云音乐歌词服务的深度集成方案

2026/8/11 18:28:47

MusicBee-NeteaseLyrics技术解析:构建网易云音乐歌词服务的深度集成方案 【免费下载链接】MusicBee-NeteaseLyrics A plugin to retrieve lyrics from Netease Cloud Music for MusicBee. 项目地址: https://gitcode.com/gh_mirrors/mu/MusicBee-NeteaseLyrics …

电力模块采购:2026年主流品牌技术路线深度解析与选型参考

电力模块采购:2026年主流品牌技术路线深度解析与选型参考

2026/8/11 18:18:46

当单机柜功率从8kW向50kW乃至更高水平攀升,传统分散式供配电架构在占地、交付周期和全链路效率上的结构性短板已无法回避。将变压器、中低压配电、UPS、母线及监控系统进行工厂预制与系统集成的高集成电力模块,正从曾经的"可选方案"加速演变为…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/10 5:58:32

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/11 8:44:43

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/11 15:57:54

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

Unity新手入门:从零搭建开发环境与核心概念解析

Unity新手入门:从零搭建开发环境与核心概念解析

2026/8/11 0:07:41

1. 项目概述:为什么Unity是游戏开发者的首选起点如果你对游戏开发感兴趣,或者想进入这个充满创造力的行业,那么“Unity”这个名字你肯定不陌生。它几乎是所有新手开发者、独立游戏团队,甚至是一些3A大厂在特定项目上的首选引擎。为…

Agency-Agents 智能体系统从零搭建实战指南

Agency-Agents 智能体系统从零搭建实战指南

2026/8/11 0:07:41

在开发复杂应用时,我们常常遇到单一模型难以兼顾全局规划与细节执行的困境。有时候,模型擅长创意生成却在逻辑推理上稍显吃力,或者精于代码编写却缺乏对业务上下文的深刻理解。为了解决这个问题,多智能体协作架构应运而生&#xf…

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

MiniMax 权益码 Token Plan 套餐 9 折优惠,Token Plan 共建邀请计划 至2026.8.31

2026/8/11 0:07:41

🚀 MiniMax Token Plan MiniMax 推出全新 Token 计划,新增语音、音乐、视频和图片生成权益。 用户邀请好友可享双重福利 订阅一份套餐,解锁最新模型 —— 前沿 Coding 能力、1M 超长上下文、原生多模态,图文音视频共用套餐额度。 …

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…