[论文学习]让Agent击败Agent:基于LLM的Agent中汙点型漏洞的自动检测(AgentFuzz / AutoMalTool)

发布时间:2026/8/25 13:35:10

[论文学习]让Agent击败Agent:基于LLM的Agent中汙点型漏洞的自动检测(AgentFuzz / AutoMalTool)
Make Agent Defeat Agent: Automatic Detection of Taint-Style Vulnerabilities in LLM-based Agents (AgentFuzz, USENIX Security 2025)论文重点本文提出了AutoMalTool首个针对LLM-based Agent的自动化红队测试框架通过多智能体协作自动生成可规避现有检测机制的恶意MCP工具系统性地揭示了MCPModel Context Protocol生态下的供应链投毒风险。实验表明该框架能以约85%的生成成功率制造出可操控主流Agent行为的恶意工具而现有检测工具的检出率分别仅为11.1%MCP-Scan和23.4%A.I.G。核心研究内容问题定义随着LLM能力的爆发式增长LLM-based Agent已被广泛应用于金融、软件开发、科学研究等关键领域。为了标准化Agent与外部环境的交互Anthropic提出了Model Context ProtocolMCP并迅速成为事实标准。然而MCP的广泛采用引入了全新的攻击面——工具投毒攻击Tool Poisoning Attack。在这种攻击中攻击者通过提示注入Prompt Injection的方式将恶意指令注入MCP工具的描述description等元数据中然后将伪造的恶意MCP包上传至PyPI、npm等开源仓库或MCP.so、Smithery等MCP市场。Agent开发者可能在不知情的情况下安装这些恶意包从而引发开源软件供应链投毒攻击。尽管已有研究指出了这一风险但其红队测试手段大多停留在概念验证PoC阶段高度依赖人工构造且仅覆盖极少数场景如天气查询工具。面对MCP工具功能的高度多样性如何实现自动化、系统化的红队测试成为一个亟待解决的关键问题。创新方法AutoMalTool的核心创新在于设计了一个多智能体协作系统通过四个专用Agent的协同工作自动将良性的MCP工具转化为可操控Agent行为的恶意工具Initial Generator初始生成器首先识别良性MCP工具的典型用户任务场景然后基于该场景从两类预定义恶意行为错误参数调用Incorrect Parameter Invocation 和输出结果误解读Output Results Misinterpretation中选择一类生成对应的恶意工具描述。Oracle判定器评估生成的恶意工具是否能被现有检测机制识别。若检测到恶意行为则向Tool Optimizer提供反馈以便改进。Effectiveness Evaluator有效性评估器在模拟环境中验证恶意工具能否成功实施预期的攻击行为。若失败则分析失败原因并提供改进建议。Tool Optimizer工具优化器根据Oracle或Effectiveness Evaluator的反馈迭代优化恶意工具描述——当被检测到时优化规避性当攻击失败时优化有效性。值得特别指出的是AutoMalTool只修改MCP工具的元数据名称、描述、输入模式并通过静态代码分析来更新原始包确保生成的恶意工具保留原有代码功能。这使其区别于传统的提示注入攻击——后者只需修改输入而前者必须保证程序语法正确且功能完整。研究成果AutoMalTool在两个主流LLM-based AgentClaude Desktop和Cline上进行了评估使用了三个不同领域的流行良性MCP包共计53个MCP工具指标结果平均生成成功率约85.0%有效攻击成功率35.3%单工具生成成本约$0.03API费用单工具生成时间平均200秒MCP-Scan检出率11.1%A.I.G检出率23.4%实验还发现LLM-based Agent对错误参数调用攻击更为敏感而对输出结果误解读攻击的抵抗能力相对更强后者由于涉及更复杂的输出操控而难度更高。此外AutoMalTool生成的恶意描述中包含的特殊token如\u2022已被证明能显著增强攻击效果。实际落地应用的可能性AutoMalTool的实用价值体现在多个层面安全审计Agent开发者可利用该框架对自身系统进行红队测试在攻击者利用之前发现潜在漏洞。检测工具评估安全厂商可用AutoMalTool生成的恶意样本作为基准测试和提升MCP-Scan、A.I.G等检测工具的能力。安全研究为学术界和工业界研究MCP生态安全提供系统化的测试工具和数据生成能力。考虑到其低成本每工具$0.03和高效率200秒/工具该框架具备良好的规模化应用前景。技术细节攻击模型AutoMalTool假设攻击者对目标Agent的内部细节如系统架构、底层LLM一无所知属于黑盒场景。攻击者的目标是构造一个恶意MCP工具包并上传至公开仓库诱使Agent开发者安装使用。攻击针对Agent工具调用的两个阶段参数接地阶段Parameter Grounding——通过错误参数调用攻击诱导Agent传入错误参数。例如操控交易Agent购买特定股票。结果解读阶段Result Interpretation——通过输出结果误解读攻击诱导Agent错误理解工具输出。例如让交易Agent从市场数据中得出错误结论。核心算法流程AutoMalTool的生成流程可概括为以下步骤输入: 良性MCP包 x, 恶意行为类型描述 T, 最大优化迭代数 N 输出: 恶意MCP包 x 1. 从x中提取目标工具信息: 名称n, 描述d, 输入模式s 2. 生成潜在用户任务场景 T 3. 基于T、T、n、d、s生成恶意行为场景及对应的恶意工具描述d 4. 初始化迭代计数 l0 5. while l N: a. Oracle评估d的规避性 b. 若可规避检测: - Effectiveness Evaluator在模拟环境中验证攻击效果 - 若攻击成功: 打包输出终止 - 若攻击失败: 获取失败原因Tool Optimizer优化d c. 若不可规避检测: - Tool Optimizer优化d以提升规避性 d. l 1规避检测的核心策略当Oracle检测到恶意行为时Tool Optimizer采用基于语义的重述semantic-based rephrasing策略来规避检测将恶意行为描述为工具的预期合法功能声称被错误标记为误报false positive。结合Oracle提供的检测原因指导重述过程。应用四种增强策略提供场景特定使用建议、详述边缘情况处理、提供多上下文结果解读提示、提供有效结果呈现指导。这一设计的巧妙之处在于由于LLM的安全对齐机制safety alignment直接要求LLM修改描述以规避检测可能被拒绝而通过重述合法功能的方式则绕过了这一限制。有效性评估机制Effectiveness Evaluator采用LLM作为评判者LLM-as-a-judge的方法从三个维度评估攻击是否成功比较使用良性工具和恶意工具时Agent响应的行为差异判断这些差异是否与预期的恶意行为一致分析恶意行为的影响是否足够显著以构成成功攻击若攻击失败则调用失败推理器Failure Reasoner分析恶意工具描述中的弱点并提出可操作的改进建议。研究设定实验配置目标AgentClaude Desktop、Cline后端LLM多种主流LLM论文未具体列出全部型号但涉及多个主流选项良性MCP包3个不同领域的流行包共53个MCP工具恶意行为类型错误参数调用、输出结果误解读检测工具MCP-ScanMCP安全扫描工具A.I.G另一安全检测机制模拟环境Effectiveness Evaluator使用模拟Agent提示Simulated Agent Prompt来复现真实Agent的工具调用流程理解用户任务选择可用工具接地工具参数解读工具结果并生成最终输出通过对比模拟Agent在良性工具和恶意工具下的响应差异判断攻击是否成功。综合分析学术贡献AutoMalTool的贡献可以从三个维度来理解第一填补了自动化红队测试的空白。此前对MCP工具投毒攻击的研究停留在手工构造PoC的阶段仅能覆盖极少数场景。AutoMalTool首次实现了端到端的自动化生成能够适配不同领域、不同功能的MCP工具使大规模安全评估成为可能。第二提出了多智能体协作的自动化攻击生成范式。Initial Generator、Oracle、Effectiveness Evaluator和Tool Optimizer四个Agent各司其职、迭代协作的设计在有效性确保攻击成功和规避性确保不被检测之间形成了巧妙的平衡。这种生成-评估-优化的闭环机制实际上是自动化对抗生成思想在LLM Agent安全领域的成功应用。第三揭示了现有防御手段的严重不足。MCP-Scan和A.I.G分别仅有11.1%和23.4%的检出率意味着当前主流的MCP安全检测工具在面对精心构造的投毒攻击时几乎形同虚设。这一发现对整个MCP生态的安全建设具有警示意义。局限性与未来方向从技术角度看AutoMalTool存在一些值得关注的局限攻击面覆盖目前仅覆盖两种恶意行为类型错误参数调用和输出结果误解读而实际攻击场景可能更加多样。检测工具的时效性随着AutoMalTool的公开检测工具开发者可能会针对其生成模式进行针对性改进导致其规避性下降。防御机制的缺失论文侧重于攻击生成而非防御如何有效检测和防御此类攻击仍是开放问题。对产业界的启示从产业视角看这项研究提出了几个亟需关注的问题MCP生态的信任危机当任何人都可以将恶意MCP包上传至PyPI或MCP市场时Agent开发者的信任决策变得极其困难。检测工具的军备竞赛攻击生成工具的自动化意味着攻击者可以大规模、低成本地生成变种这对检测工具提出了持续进化的要求。供应链安全的新战场MCP工具投毒本质上是开源软件供应链攻击在AI Agent领域的新变种传统的供应链安全实践需要延伸至MCP生态。实践应用对Agent开发者的建议主动红队测试将AutoMalTool或其类似框架纳入CI/CD流程在部署前对集成的MCP工具进行自动化安全评估。来源验证仅从可信来源安装MCP包对包的内容进行完整性校验和静态分析。最小权限原则限制Agent可调用的MCP工具范围避免不必要的权限暴露。对安全工具厂商的建议检测能力升级鉴于现有检测工具对AutoMalTool生成样本的低检出率亟需开发针对语义重述、特殊token等规避手段的检测技术。动态测试除静态扫描外应考虑在沙箱环境中动态执行MCP工具观察其实际行为。对研究者的建议扩展攻击类型探索更多类型的恶意行为如工具选择阶段的攻击丰富自动化生成的能力边界。防御机制研究基于AutoMalTool生成的样本开发和评估有效的防御方案。多模态扩展随着MCP协议向多模态方向发展研究图像、音频等模态下的投毒攻击风险。参考资料来源原始论文: Make Agent Defeat Agent: Automatic Detection of Taint-Style Vulnerabilities in LLM-based Agents (AgentFuzz / AutoMalTool), arXiv:2509.21011

相关新闻

HarmonyOS 7.0 / API 26 FaceAR 低光环境兜底:识别点丢失后如何保持预览稳定

HarmonyOS 7.0 / API 26 FaceAR 低光环境兜底:识别点丢失后如何保持预览稳定

2026/8/25 13:35:10

HarmonyOS 7.0 / API 26 FaceAR 低光环境兜底:识别点丢失后如何保持预览稳定 这篇只讲一个点:FaceAR 低光环境兜底。版本边界先说清楚:下面的写法面向 HarmonyOS 7.0 / API 26。老版本工程不要直接照搬,先确认 SDK、DevEco Studio…

HarmonyOS 7.0 / API 26 BodyAR 训练动作分段:长动作为什么要拆成可恢复步骤

HarmonyOS 7.0 / API 26 BodyAR 训练动作分段:长动作为什么要拆成可恢复步骤

2026/8/25 13:35:10

HarmonyOS 7.0 / API 26 BodyAR 训练动作分段:长动作为什么要拆成可恢复步骤 这篇只讲一个点:BodyAR 训练动作分段。版本边界先说清楚:下面的写法面向 HarmonyOS 7.0 / API 26。老版本工程不要直接照搬,先确认 SDK、DevEco Studio…

免费使用阿里云服务器快速搭建自己的个人网站

免费使用阿里云服务器快速搭建自己的个人网站

2026/8/25 13:25:10

开通阿里云服务器(部署服务器) 推荐:阿里云登录 - 欢迎登录阿里云,安全稳定的云计算服务平台 选择【2核(vCPU) 2GiB | 经济型 e | ESSD Entry 40GiB】,几乎能用2-3个月 试用地域(中国香港 / 北京 / 杭州…

Spring Boot + 微信小程序高校食堂自助点餐系统70381----从个性化推荐到订单运营的完整实现

Spring Boot + 微信小程序高校食堂自助点餐系统70381----从个性化推荐到订单运营的完整实现

2026/8/25 14:55:20

摘要该系统面向高校食堂高峰期排队时间长、点餐效率低以及运营数据分散等问题,采用“用户移动点餐 管理端运营”的双端模式。用户端围绕菜单推荐、菜品浏览、加购下单、订单管理、资讯与反馈形成连续体验;管理端负责销售统计、用户管理、内容维护、反馈…

[通信与计算]通信原理02:源编码与熵的考虑

[通信与计算]通信原理02:源编码与熵的考虑

2026/8/25 14:55:20

源编码与熵的考虑本文从通信与信息论角度,系统介绍源编码与熵相关的基本概念和工程实践。首先定义离散无记忆信源的熵,解释其作为理论最优平均码长下界的意义,随后讨论前缀码、哈夫曼编码、算术编码和Lempel-Ziv通用编码等典型方法&#xff0…

模型幻觉检测与抑制技术-金融医疗双案例实战

模型幻觉检测与抑制技术-金融医疗双案例实战

2026/8/25 14:55:20

模型幻觉的检测与抑制技术:金融客服与医疗转录双案例实战声明:本文案例为工程模拟场景,数据指标为演示效果,仅供工程思路参考,不代表真实业务结果。背景:幻觉是"检测"出来的,还是&quo…

Python办公11:定时自动同步重要文件夹至移动硬盘或云端

Python办公11:定时自动同步重要文件夹至移动硬盘或云端

2026/8/25 14:55:20

11:备份专家——定时自动同步重要文件夹至移动硬盘或云端第二阶段:文件管理与系统自动化(9-15)场景引入 你的工作资料只存在电脑本地?一旦硬盘损坏、电脑丢失或中勒索病毒,几年的心血瞬间归零。 专业的做法…

离职电脑隐私清理完整指南——临走前别忘把“自己“带走

离职电脑隐私清理完整指南——临走前别忘把“自己“带走

2026/8/25 14:55:20

背景:最近在试用期,想着万一下一步要走,公司电脑上的个人隐私得清理干净。微信聊天记录、浏览器密码、自己装的软件……哪些该删?怎么删才彻底?整理了一份超全的清理清单,按优先级和类别分好,离…

Windows系统文件WalletProxy.dll丢失找不到问题解决

Windows系统文件WalletProxy.dll丢失找不到问题解决

2026/8/25 14:45:20

在使用电脑系统时经常会出现丢失找不到某些文件的情况,由于很多常用软件都是采用 Microsoft Visual Studio 编写的,所以这类软件的运行需要依赖微软Visual C运行库,比如像 QQ、迅雷、Adobe 软件等等,如果没有安装VC运行库或者安装…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/24 19:53:32

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/24 19:56:07

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/24 21:16:09

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南

2026/8/25 0:04:34

三步把QQ空间历史说说导出到本地:GetQzonehistory 极简指南 【免费下载链接】GetQzonehistory 获取QQ空间发布的历史说说 项目地址: https://gitcode.com/GitHub_Trending/ge/GetQzonehistory Meta Description:GetQzonehistory 是一个QQ空间历史说…

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

洛谷 P7912:[CSP-J 2021 T4] 小熊的果篮 ← 双向链表

2026/8/25 0:04:35

【题目来源】 https://www.luogu.com.cn/problem/P7912 【题目描述】 小熊的水果店里摆放着一排 n 个水果。每个水果只可能是苹果或桔子,从左到右依次用正整数 1,2,…,n 编号。连续排在一起的同一种水果称为一个“块”。小熊要把这一排水果挑到若干个果篮里&#x…

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG

2026/8/25 0:04:35

Transformers.js 网页端图像抠图实战:零后端 3 行代码返回透明 PNG 【免费下载链接】transformers.js State-of-the-art Machine Learning for the web. Run 🤗 Transformers directly in your browser, with no need for a server! 项目地址: https:/…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/22 2:02:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/22 4:13:47

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/22 1:32:34

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…