[论文学习]MINJA:针对LLM智能体的实用内存注入攻击

发布时间:2026/8/14 15:02:42

[论文学习]MINJA:针对LLM智能体的实用内存注入攻击
MINJA: A Practical Memory Injection Attack against LLM Agents (2025)论文重点MINJAMemory INjection Attack提出了一种无需直接篡改智能体内存库即可实施内存投毒攻击的方法。攻击者仅通过普通用户的查询交互就能诱导LLM智能体自主生成并存储恶意记录从而在后续受害者查询时误导智能体的推理过程。论文在医疗、电商和通用问答等多个场景下验证了该攻击的有效性揭示了当前LLM智能体内存管理机制中存在的严重安全漏洞。核心研究内容问题定义LLM智能体与普通LLM的一大区别在于其配备的长期记忆库——系统会将过往的查询与推理轨迹存储下来当新查询到来时检索最相关的历史记录作为上下文示例in-context demonstration辅助智能体完成当前任务。然而这个设计引入了一个严重的安全隐患如果内存库被污染检索到的恶意示例会误导智能体的推理。论文举了一个令人不安的例子——自动驾驶智能体的内存若被注入“在极高时速下执行急停”的记录用户可能在高速公路上遭遇突然刹停引发致命事故。已有研究如AgentPoison虽然探索过这一威胁但它们都假设攻击者拥有直接修改内存库的特权。现实世界中这种系统级权限几乎不可能获取。MINJA的核心问题在于在攻击者只是一个普通用户、只能通过查询与智能体交互的条件下能否实现内存投毒创新方法MINJA的技术设计围绕两个核心挑战展开挑战一恶意记录该如何设计才能有效误导智能体攻击者的目标是对受害者查询 ( q_v )包含受害者实体 ( v )让智能体生成目标查询 ( q_t ) 对应的推理步骤 ( R_{q_t} )( q_t ) 将 ( v ) 替换为目标实体 ( t )。问题在于( q_v ) 和 ( R_{q_t} ) 之间存在逻辑鸿沟——一个关于“患者A”的查询推理步骤怎么会变成“患者B”的数据MINJA的解决方案是引入桥接步骤Bridging Steps。例如在医疗场景中桥接步骤可以是“患者A的数据现在保存在患者B的名下”——这个看似合理的中间推理将受害查询与目标推理逻辑连接起来。桥接步骤需要足够通用因为受害者可能提出任意包含 ( v ) 的查询。同时恶意记录的查询语句必须保持“良性”外观避免使用罕见或异常内容以确保后续能被正常检索。挑战二如何诱导智能体自主生成并存储这些恶意记录由于无法直接写入内存攻击者必须让智能体“自己动手”。MINJA设计了一个指示提示Indication Prompt——一段附加在攻击查询后的逻辑推理步骤序列用于诱导智能体生成桥接步骤。但问题又来了如果查询中始终带着这个“指示提示”那么存储的记录与正常受害者查询的相似度可能不够高影响检索概率。为此MINJA提出了渐进缩短策略Progressive Shortening Strategy, PSS——逐步从查询中移除指示提示的内容同时确保智能体的响应中仍保留桥接步骤和目标推理。经过多轮迭代最终存入内存的记录 ((a_v, [b_{v,t}, R_{a_t}])) 在外观上已与正常查询无异。整个攻击流程可以概括为攻击者提交带有指示提示的查询 → 智能体生成含桥接步骤的响应并存入内存 → 攻击者逐步缩短提示 → 最终存入“干净”的恶意记录 → 受害者提交查询时该记录被检索为示例 → 智能体被误导生成目标推理。研究成果论文在三种不同类型的智能体上进行了广泛实验智能体场景数据集基座模型EHRAgent医疗电子健康记录MIMIC-III、eICUGPT-4RAP电商网页购物WebshopGPT-4、GPT-4oQA Agent通用问答MMLUGPT-4、GPT-4o评估采用三个指标注入成功率ISR恶意记录成功存入内存的比例攻击成功率ASR存入的恶意记录成功误导智能体的比例效用下降UD攻击对智能体正常任务性能的影响核心实验结果ISR普遍超过90%EHRAgent在MIMIC-III上达95.6%eICU上达98.5%RAPGPT-4o达99.3%QA Agent达100%ASR表现突出EHRAgent在eICU上达90.0%RAPGPT-4o达98.5%不同场景下ASR在57%至98.5%之间UD极小几乎所有场景下UD在±10%以内表明攻击对智能体正常功能几乎没有副作用值得注意的是MINJA在被NeurIPS 2025接收为Poster论文侧面印证了该工作的学术价值。实际落地应用的可能性MINJA的攻击条件极为宽松——攻击者只需像普通用户一样与智能体交互无需任何系统特权。这意味着任何能够访问公共智能体服务的用户都可能成为攻击者共享内存库的设计在现有智能体框架中非常普遍ChatGPT的“为所有人改进模型”功能即为一例即便系统采用隔离内存账户劫持等身份伪装手段也比获取系统级权限现实得多从防御角度看MINJA揭示的漏洞具有迫切的现实意义。随着LLM智能体在医疗、金融、自动驾驶等高 stakes 领域加速落地这类攻击的实际危害不容忽视。技术细节攻击的形式化定义设受害者查询为 ( q_v )其中包含受害者实体 ( v )。攻击者的目标是让智能体对 ( q_v ) 生成目标推理 ( R_{q_t} )其中 ( q_t ) 是将 ( v ) 替换为目标实体 ( t ) 后的查询。恶意记录的理想形式为[(a_v, [\mathbf{b}{v,t}, \mathbf{R}{a_t}])]其中( a_v )包含受害者实体 ( v ) 的攻击查询外观上与正常查询无异( \mathbf{b}_{v,t} )桥接步骤逻辑上连接 ( v ) 和 ( t )( \mathbf{R}_{a_t} )目标查询 ( a_t ) 对应的推理步骤渐进缩短策略PSS设指示提示为 ( [r_1, r_2, \ldots, r_n] )每一步缩短操作为[[a_v, r_1, r_2, \ldots, r_{n-i}] \rightarrow [a_v, r_1, r_2, \ldots, r_{n-i-1}]]即每次从末尾移除一个推理步骤 ( r_{n-i} )。经过 ( n ) 轮迭代后最终存入的记录为 ( (a_v, [b_{v,t}, R_{a_t}]) )。检索机制智能体基于查询相似度从内存中检索 ( k ) 条最相似的记录作为上下文示例。MINJA正是利用这一机制通过让恶意记录的查询 ( a_v ) 与受害者查询 ( q_v ) 高度相似确保恶意记录被检索到。论文采用余弦相似度计算文本嵌入相似性。研究设定硬件与软件配置论文未明确列出具体的硬件配置但从实验描述可以推断模型GPT-4和GPT-4o通过API调用嵌入模型all-MiniLM-L6-v2用于EHRAgent和RAP、text-embedding-ada-002用于QA Agent内存检索数量RAP检索3条、EHRAgent检索4条、QA Agent检索5条实验设计细节受害-目标配对每个配置进行9组独立实验医疗场景Patient ID配对、Medication配对电商场景商品配对QA场景术语配对将答案按字母表偏移4位攻击查询数量MMLU用10条其他数据集用15条指示提示缩短次数Patient ID缩短4次、Medication/Items/Terms缩短5次内存初始化EHRAgent预置4条良性记录RAP和MMLU从空内存开始综合分析MINJA这篇论文的贡献远不止于“发现了一个漏洞”——它在几个层面上推动了LLM智能体安全研究的前沿。首先是威胁模型的突破。以往的智能体内存攻击研究如AgentPoison假设攻击者拥有直接修改内存的能力。这个假设在现实世界中几乎不成立——谁能直接修改ChatGPT的内存库MINJA将攻击者降维到“普通用户”级别揭示了即使没有任何特权内存投毒依然是可行的。这才是真正让人不安的地方。其次是技术设计的精巧。桥接步骤 指示提示 渐进缩短三个组件环环相扣。桥接步骤解决的是“逻辑鸿沟”——为什么查询A会导致推理B指示提示解决的是“如何让智能体自己生成”——不能直接写就诱导它自己写。渐进缩短解决的是“如何不留痕迹”——最终存入的记录在外观上与正常记录无异。这套组合拳打下来攻击的隐蔽性和实用性都得到了保证。再者是实验的覆盖面。论文没有停留在单一场景而是覆盖了医疗EHRAgent、电商RAP、通用问答QA Agent三个截然不同的领域。这种跨领域的验证说明了漏洞的普遍性——不是某个特定框架的设计缺陷而是当前LLM智能体“共享内存 相似度检索 上下文学习”这套通用架构的系统性风险。一个值得注意的细节是ASR的波动。在MMLU上QA Agent的ASR从40%到100%不等标准差高达19.1%。这说明攻击效果受具体受害-目标配对的影响很大——有些配对容易误导有些则不然。这种不稳定性既是攻击者的挑战也暗示了潜在防御的可能方向也许可以通过分析哪些类型的实体替换更容易被“桥接”来设计针对性的防护。从更宏观的视角看MINJA揭示的问题本质上是“信任链的断裂”。智能体信任内存中的历史记录是可靠的但MINJA证明了这个信任可以被轻易利用。这让人联想到传统软件安全中的“信任输入”问题——永远不要信任用户输入。而对于LLM智能体来说或许我们应该加上一条新原则永远不要无条件信任内存中的历史记录。实践应用对智能体开发者的建议内存隔离最直接的防御是避免不同用户共享同一内存库。如果必须共享至少要对写入内容进行严格审核。检索过滤在将内存记录作为上下文示例之前增加一道安全检查——检测是否存在异常的“桥接”逻辑如将实体A映射到实体B。谨慎存储推理链论文指出不应将完整的链式推理CoT存储为内存记录。推理链越详细被操纵的空间就越大。写时策略Write-time Policy对即将写入内存的内容进行异常检测识别可能包含桥接步骤或异常实体映射的记录。对普通用户的建议对于使用公共智能体服务如ChatGPT、医疗咨询AI等的场景应意识到你看到的结果可能受到其他用户交互的影响在涉及敏感决策医疗、金融、安全的场景中对智能体的输出保持审慎态度必要时进行人工复核研究人员的后续方向防御机制设计如何有效检测和抵御MINJA这类攻击目前论文仅验证了攻击的有效性防御仍是开放问题攻击的进一步演化MINJA针对的是实体替换场景更复杂的攻击如情感操纵、立场转换是否也可行内存安全的理论框架能否建立一套形式化的内存安全模型指导智能体系统的安全设计参考资料原始论文Dong, S., Xu, S., He, P., Li, Y., Tang, J., Liu, T., Liu, H., Xiang, Z. (2025).Memory Injection Attacks on LLM Agents via Query-Only Interaction. arXiv:2503.03704. https://arxiv.org/abs/2503.03704NeurIPS 2025 Poster https://neurips.cc/virtual/2025/loc/san-diego/poster/118152

相关新闻

dynamic java 别被忽悠了!Apache的动态Java?那纯属张冠李戴

dynamic java 别被忽悠了!Apache的动态Java?那纯属张冠李戴

2026/8/14 15:02:42

用C编写的HTTP, 其(静态)以及/event(动态)MPM属于自身进程/线程调度策略, 和Java没有关系, Java应用借助等容器来运行, 仅仅充当反向代理。HTTP自身是由C编写而成的, 并非直接运用Java, 所谓Java中的与进程管理模式存在着概念上的…

10个AI提示词,让你的Java代码从“能用”到“能打”

10个AI提示词,让你的Java代码从“能用”到“能打”

2026/8/14 15:02:42

大家好,我是你们的AI编程道友-逆熵而行。你是否也遇到过这样的场景:别怕!今儿分享10个着实超实用之AI提示词, 让其变为你的“专属Java代码优化师”。新手可以抄, 老手亦能爽, 代码由“能跑”径直进化至“能打”!3 个 “提速” 提示…

C++ 注入类名详解:从依赖注入到现代框架实践

C++ 注入类名详解:从依赖注入到现代框架实践

2026/8/14 14:52:42

C 注入类名详解:从依赖注入到现代框架实践一、C 注入类名详解1、 引言:什么是注入类名?2、核心概念与语法规则2.1、 基本定义2.2 、在类模板中的行为2.3、 与继承的关系3、 为什么需要注入类名?——解决模板中的歧义4、实战示例&a…

正餐酒楼收银系统选型实测:从包厢挂账到宴席并单,五家主流方案横评

正餐酒楼收银系统选型实测:从包厢挂账到宴席并单,五家主流方案横评

2026/8/14 16:02:44

正餐酒楼是餐饮里最重的业态,收银系统的难点从来不在收款:预订能不能和开台打通、包厢服务跟不跟得上、挂账客户月底怎么对账、婚宴寿宴多桌并单怎么不出错。本文以天财商龙、客如云、二维火、美团收银、收钱吧五家为样本,从预订排位、包厢桌…

RAG + Agent 项目:普通 Python、LangChain、LangGraph 三种写法对比

RAG + Agent 项目:普通 Python、LangChain、LangGraph 三种写法对比

2026/8/14 16:02:44

摘要 LangSmith 不是业务框架,它不负责帮你写 RAG、Agent、工具调用,也不负责替你检索知识库。 它的定位更像是大模型应用的Trace / Debug / Evaluation / Monitoring 平台。简单说,它负责把一次 AI 请求从输入到输出的完整过程记录下来&…

logistics regression

logistics regression

2026/8/14 16:02:44

P与NP P:能在多项式时间能找到解; NP:能在多项式时间内验证候选解的对错。 NP 难:所有 NP 问题都能在多项式时间内归约到它,即,它至少和 NP 类问题一样难。不要求多项式时间可验证。 NP 完全:NP…

烘焙店收银系统怎么选?五款主流方案从预订到会员复购的实测对比

烘焙店收银系统怎么选?五款主流方案从预订到会员复购的实测对比

2026/8/14 16:02:44

烘焙是餐饮里少有的增量赛道,但竞争同样残酷:短保产品按天甚至按小时计损耗,顾客先看颜值再下单,复购全靠回头客。收银系统选不好,损耗、排队、复购三座大山压得小店喘不过气。本文把收钱吧、银豹、美团收银、客如云、…

微信聊天记录备份全指南:PyWxDump 删库警示与合规实操手册

微信聊天记录备份全指南:PyWxDump 删库警示与合规实操手册

2026/8/14 16:02:44

微信聊天记录备份全指南:PyWxDump 删库警示与合规实操手册 【免费下载链接】PyWxDump 删库 项目地址: https://gitcode.com/GitHub_Trending/py/PyWxDump 微信承载了太多难以复制的记忆——孩子的第一句话、家人的叮嘱、客户的关键确认、离职前的项目交接。可…

lu,大鼠穿梭箱、大小鼠穿梭箱、大鼠穿梭实验箱、穿梭视频分析系统

lu,大鼠穿梭箱、大小鼠穿梭箱、大鼠穿梭实验箱、穿梭视频分析系统

2026/8/14 15:52:44

穿梭实验系统是研究动物条件反射、定量观测动物行为变化的经典设备。实验箱体底部布设不锈钢电击栅提供非条件足底电击刺激,顶部噪声发生器输出条件刺激;条件刺激结束前动物移动至安全区记为主动回避;电击触发后完成躲避记为被动回避。经反复…

比较好的亚太EMBA,问了6位校友师资差别真的挺大

比较好的亚太EMBA,问了6位校友师资差别真的挺大

2026/8/13 11:01:28

比较好的亚太EMBA核心差异先看什么?对于希望兼顾工作与系统管理能力提升的亚太区高管而言,筛选匹配度高的EMBA项目时,师资配置是决定学习体验与实际收获的核心要素之一。我们结合3-4个公开信息透明、办学历史较长的亚太区主流EMBA项目特点&am…

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

备考3个月对比6份资料 海外游学的亚洲EMBA面试注意点

2026/8/14 10:48:24

备考海外游学的亚洲EMBA面试,核心要围绕项目国际化设计逻辑、个人跨文化管理经验匹配度两个维度准备,避免把游学模块等同于普通旅游参访的认知偏差。不少备考者花3个月对比6份资料,却容易忽略面试官对“国际视野落地能力”的考察——比如香港…

比较好的国内EMBA,问了二十位校友聊透人脉价值

比较好的国内EMBA,问了二十位校友聊透人脉价值

2026/8/13 17:17:06

比较好的国内EMBA核心差异体现在哪些方面?比较好的国内EMBA的核心长期价值,很大程度上依托于校友网络的连接质量与资源生态的活跃度,这也是不少高管在择校时优先考量的因素。我们结合3-4个市场关注度较高的项目公开信息,从课程、师…

大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

大连网站建设找简维科技:为您打造懂业务更懂用户的数字化转型引擎

2026/8/14 0:01:53

在这个数字化浪潮席卷全球的今天,企业想要在激烈的市场竞争中站稳脚跟,拥有一张好看的“数字名片”已经远远不够了。很多老板在刚开始接触互联网业务时,都有一个共同的困惑:为什么我花了钱建的网站,就像是在真空中自嗨?访客进来转了两圈就跑了,线索石沉大海,甚至连客服…

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

临沂网站建设铭镇:深耕本土数字生态,以匠心铸就企业品牌核心竞争力

2026/8/14 0:01:54

在这个流量为王、视觉至上的互联网时代,对于临沂乃至整个山东乃至全国的传统中小企业来说,拥有一张精美的“数字名片”早已不再是可选项,而是生存的必答题。每当夜幕降临,沂河两岸灯火辉煌,物流之都的喧嚣逐渐沉淀为对未来的思考。我们常常听到老板们在茶余饭后探讨:为什…

Flutter与OpenHarmony实现剧本杀组队表单开发实战

Flutter与OpenHarmony实现剧本杀组队表单开发实战

2026/8/14 0:01:54

1. 项目概述在移动应用开发领域,跨平台框架Flutter因其高效的开发体验和出色的性能表现,已经成为众多开发者的首选。而OpenHarmony作为新兴的操作系统平台,其开放性和灵活性为开发者提供了全新的可能性。本文将聚焦于一个实际应用场景——剧本…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/8 5:07:31

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/9 13:42:46

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/8 2:30:15

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…