PAST-Bench:面向个人智能体递归自提升能力评测基准

发布时间:2026/8/5 23:30:49

PAST-Bench:面向个人智能体递归自提升能力评测基准
PAST-Bench面向个人智能体递归自提升能力评测基准论文arXiv编号2608.04003v1 | 发布时间2026-08-03论文HTML原文https://arxiv.org/html/2608.04003v1论文PDFhttps://arxiv.org/pdf/2608.04003v1项目开源仓库https://github.com/Gen-Verse/PAST-Bench摘要递归自提升Recursive Self-Improvement, RSI要求AI智能体利用历史交互经验优化后续任务表现。个人AI智能体天然具备跨会话存储偏好、任务流程、工具脚本、交互历史的持久化能力但现有评测方案无法区分“性能提升是否真正来源于复用历史留存经验”。本文提出PAST-Bench评测基准采用持久化开关对照实验方案同一任务序列分别开启/关闭持久存储构建26个任务家族、总计204段交互样本覆盖四大核心自提升能力记忆留存、流程复用、信息检索、内容更新。现有评测仅输出任务正确率无法定位性能增益的真实来源PAST-Bench同时提供任务得分与机制证据分(\text{Mech})分离底座模型、智能体运行时、历史经验三类因素对结果的影响。基于基准诊断出原有Hermes智能体五大核心缺陷针对性提出**Hermes**改进框架新增五大独立可消融运行时机制规划校验E1、结构化记忆渲染E3、技能路由E3、检索门控E4、会话收尾刷新E5。在7款主流底座大模型、4套开源智能体框架上完成全量实验Hermes相较原生Hermes整体自提升差距Δ从0.13提升至0.15机制证据分从0.64提升至0.73其中内容更新类任务增益最显著Δ0.24。消融实验证明五大机制具备互补叠加效应可独立开关用于模块归因分析。PAST-Bench为持久化智能体自提升领域提供可复现、可归因标准化评测与诊断工具。1 引言研究背景个人智能体可跨会话持久存储记忆、标准化操作流程SOP、用户配置、历史交互记录理论上能够复用过往经验实现自主进化。但现有智能体评测存在致命缺陷单次快照式打分仅评估单轮孤立任务不跟踪多会话时序经验复用效果增益无法归因任务正确率提升无法区分是底座模型原生能力、上下文短期记忆还是持久化存储带来的真实收益缺少污染对照组无法排除模型内置参数记忆、提示词短期上下文带来的分数干扰。现有长记忆、技能评测数据集仅单独测试某一类持久化能力无法构建开关对照闭环实验无法量化“关闭持久存储后性能衰减幅度”也就无法证明智能体真的学会复用历史经验。核心定义在线自演化Online Self-Evolution无需微调模型、无需优化提示词智能体通过跨会话持久存储、检索、修正经验自主提升后续任务表现。这是完整递归自提升的底层基础也是本文研究核心。本文四大核心贡献PAST-Bench评测基准26个任务家族、204段交互四大自提升能力全覆盖采用持久化开启/关闭匹配对照实现性能增益归因双维度量化指标任务得分衡量最终效果机制证据分(\text{Mech})验证性能提升是否来自规范的“存储-检索-复用”完整链路Hermes改进智能体框架基于基准诊断出原生Hermes五大短板设计5个独立可消融运行时机制模块可单独开关用于消融实验完整归因实验体系单机制消融、机制交互诊断、跨模型泛化、多智能体横向对比配套完整复现脚本、评测流水线。2 相关工作现有智能评测分为三类均无法实现持久化经验的精准归因单任务交互式基准GAIA、AgentBench等仅打分单次任务无跨会话时序序列无法衡量经验复用独立记忆/技能数据集LongMemEval、SkillsBench单独评测单一持久化模块缺少同任务“开/关存储”对照增益混杂上下文短期记忆智能架构消融研究仅对比整体框架无法拆解“经验存储、检索、更新”单环节缺陷。PAST-Bench创新点以任务家族时序序列为评测单元同一套任务固定模型、提示词、工具仅切换持久存储开关同时采集完整执行轨迹用于机制链路校验。基准对比表评测基准跨会话经验评估模型横向对比智能体框架对比轨迹机制归因GAIA××××AgentBench×✓××VisualWebArena×✓××LongMemEval✓✓××SkillsBench局部近似✓局部近似×PAST-Bench✓✓✓✓3 PAST-Bench评测基准整体设计3.1 基准构造四大核心能力分类全部204段交互样本分为四大任务家族覆盖在线自演化完整链路记忆留存Memory41个样本测试用户偏好、约束、历史案例跨会话持久检索子场景偏好采纳、约束留存、弱触发历史调取、异常清单查询流程复用Procedural Reuse64个样本测试多步骤标准化SOP跨会话存储、复用子场景SOP自动生成、隐式规则归纳、故障流程沉淀信息检索Information Gathering48个样本测试历史存档信息主动调取拒绝凭空猜测子场景上线复盘、值班交接、变更冻结审计等内容更新Update51个样本测试过期信息覆盖、旧记录隔离子场景事实修正、规则迁移、临时异常过期、SOP补丁更新。样本总量分布饼图说明总样本204段26个子家族流程复用占比30.8%、更新26.9%、信息搜集23.1%、记忆留存19.2%。3.2 评测流水线核心规则1会话隔离机制每一轮评估均全新空会话上下文不继承上一轮对话历史仅开启持久化模式时智能体可读取前序学习阶段写入的记忆、技能文件。关闭持久化对照组完全屏蔽所有跨会话存储保证分数差值仅来源于历史经验复用。任务序列固定三段式结构学习轮Learn智能体执行任务并写入持久化经验评估轮Eval全新会话测试是否复用学习轮留存内容对照轮Control关闭持久存储同任务重新执行作为分数基线。2两大核心量化指标指标1任务得分ses_ese​单episodeseσe×(0.80×ce0.20×re)s_e \sigma_e \times (0.80 \times c_e 0.20 \times r_e)se​σe​×(0.80×ce​0.20×re​)σe\sigma_eσe​安全二元标识出现违规操作直接置0cec_ece​任务完成度输出内容匹配标准答案0~1rer_ere​工具调用故障恢复率。家族层面自提升差距ΔfSw/−Sw/o\Delta_f S_{\text{w/}} - S_{\text{w/o}}Δf​Sw/​−Sw/o​即开启/关闭持久化平均分差值Δ0\Delta0Δ0代表复用经验带来提升。指标2机制证据分Mech\text{\(\text{Mech}\)}Mech不单纯看正确率校验智能体是否走完写入→检索→正确复用完整标准链路五维加权计算取值0~1Mechf15(wpraucrh(1−pr))\text{\(\text{Mech}\)}_f\frac{1}{5}(\text{wp}\text{ra}\text{uc}\text{rh}(1-\text{pr}))Mechf​51​(wpraucrh(1−pr))wp学习阶段正确写入有效经验ra评估轮精准检索对应留存内容uc更新场景隔离过期旧数据rh远距离任务经验不衰减pr无效冗余存储污染占比越低分越高。(\text{Mech})分数越高代表性能提升确由规范持久化链路带来而非模型内置记忆、短期上下文投机。3评测执行脚本仓库完整bash脚本片段# 全模型对比运行脚本scripts/run_model_comparison.sh\--compare-no-persistence\--judge-model MiniMax-M2.7\--trace-dirtraces/main/model_run/${MODEL}/${RUN_ID}# Hermes单机制消融脚本scripts/run_hermes_plus_mechanisms_full.sh\--trace-root traces/ablations\--agent-profile minimax\--judge-model MiniMax-M2.7\--mechanismmemory# 可指定E1/E2/E3/E4/E5单一模块运行输出文件sequence_results.json每段任务原始得分sequence_summary.json家族级均值sequence_comparison.json持久化开关差值Δ、(\text{Mech})分数汇总。4 Hermes基于基准诊断的改进智能体框架4.1 原生Hermes五大核心缺陷PAST-Bench诊断得出规划无前置检索E1缺陷生成行动方案前不读取历史存储凭空制定流程记忆无结构化隔离E2缺陷新旧事实混杂过期记录与有效内容同时暴露流程不持久化为可检索技能E3缺陷多步骤SOP仅留在对话上下文无法跨会话调取检索后置E4缺陷未查询存档就直接生成答案凭空猜测会话无同步刷新E5缺陷更新后的新规则不会覆盖旧存档新旧信息共存。4.2 Hermes五大独立可消融机制一一对应缺陷E1 规划前置校验Plan生成任何不可逆操作前强制检索匹配持久化记忆/技能基于历史经验制定方案独立开关不依赖其他模块。E2 结构化记忆渲染Render写入记忆时附加实体、作用域、过期时间元数据读取时自动屏蔽已作废旧记录仅展示当前有效条目。E3 技能路由Route完整多步骤流程自动打包为可检索技能标注适用场景后续任务可按关键词匹配调取支持流程微调补丁。E4 检索门控Gate任务依赖历史存档时拦截草稿输出强制先执行记忆/技能检索禁止无依据作答。E5 会话收尾同步刷新Close每段任务结束同步覆盖更新后的规则、事实新会话仅读取修正后权威记录隔离过期数据。五大模块完全解耦可单独开启/关闭用于消融实验不改动Hermes基础循环架构。5 完整实验设置与结果5.1 实验基线底座大模型GLM-5.1、Kimi K2.6、DeepSeek-V4-Pro、MiniMax-M2.7、GPT-5.4、Claude Sonnet 4.6、Claude Opus 4.6对比智能体框架原生Hermes、nanobot、ZeroClaw、Agent-Zero评测裁判固定MiniMax-M2.7温度0最大输出8192token硬件与环境Python3.11uvDocker容器化调度API多线程并发。5.2 主实验固定Hermes、更换底座模型模型整体Δ机制分(\text{Mech})四大能力增益分布GPT-5.40.240.80记忆38%、更新35%双核心增益Claude Sonnet 4.60.200.76记忆40%、更新36%DeepSeek-V4-Pro0.170.71记忆48%为主Kimi K2.60.170.72记忆49%占最高GLM-5.10.200.70更新46%收益最大MiniMax-M2.70.130.64均衡分布Claude Opus 4.60.190.70更新38%核心结论所有底座模型开启持久化后均有正向自提升但增益集中能力差异极大不存在通用最优模型。5.3 固定MiniMax-M2.7横向对比四大智能体智能体框架整体Δ(\text{Mech})分数核心短板Agent-Zero-0.080.39多数场景复用经验后性能下降ZeroClaw0.120.55记忆增益高、流程复用失效nanobot0.130.57仅更新类任务有效记忆几乎无提升原生Hermes0.130.64均衡但链路不完整Hermes本文0.150.73更新任务增益大幅提升关键现象nanobot与原生Hermes整体Δ同为0.13但(\text{Mech})差距明显说明二者分数提升底层机制完全不同仅看Δ会产生错误结论。5.4 Hermes单机制消融实验MiniMax-M2.7配置整体Δ更新任务Δ核心优势场景原生Hermes0.130.12仅E1规划0.140.13仅E2记忆渲染0.130.10仅E3技能路由0.120.05仅E4检索门控0.170.06仅E5收尾刷新0.120.16完整Hermes全部模块0.150.24结论E5单独对更新类任务增益最强多模块叠加产生超加性收益单一机制无法达到完整框架效果。5.5 跨模型泛化测试Hermes在GPT-5.4、Claude Sonnet上Δ分别达0.24、0.22仅DeepSeek、Opus小幅回落证明架构具备跨底座通用性单次运行方差±0.06整体小幅提升小于运行波动但更新能力提升统计显著。5.6 计算开销对比Hermes相较原生Hermes token总量提升约2.5倍推理耗时仅提升1.1倍额外开销主要来自系统提示词扩展不增加大量生成输出API调用成本可控。6 结论现有持久化智能体性能提升无法单纯依靠任务得分判定PAST-Bench通过开关对照轨迹机制分实现增益精准归因当前主流智能体普遍存在五大持久化链路缺陷原生Hermes框架经Hermes五模块改造后经验复用链路完整性显著提升更新类任务收益提升一倍自提升效果高度依赖底座模型特性不存在通用最优智能体架构PAST-Bench提供标准化流水线可用于后续新框架、新机制定量诊断局限当前任务为人工合成缺少真实用户长时序交互样本未来将拓展跨家族经验迁移评测、多智能体协同自提升场景。7 未来研究方向基准拓展引入真实人类交互长时序任务增加跨任务经验迁移子家族归因增强设计干预式评测删除/篡改存档经验观测分数变化实现因果验证自适应持久化路由智能体自主判断内容存入记忆/技能/临时缓存减少人工机制配置安全约束新增持久化内容隐私、污染防御评测维度。资源完整下载清单论文HTML在线版https://arxiv.org/html/2608.04003v1论文PDF全文https://arxiv.org/pdf/2608.04003v1PAST-Bench完整开源仓库数据集评测脚本Hermes实现https://github.com/Gen-Verse/PAST-Bench全套运行bash脚本仓库scripts/目录模型对比、机制消融、批量评测完整任务数据集JSON仓库dataset/204_episodes_full.json实验绘图、统计分析Python代码仓库analysis/附录完整提示词、裁判打分模板仓库prompts/消融实验热力图、归因折线图绘制代码plot/附录关键信息附录A 基准数据集完整分类表总计26个子家族、204段交互四大能力细分样本数量见正文饼图全部样本无真实用户隐私数据由多模态大模型生成并三轮人工校验规避捷径答案、可直接开源使用。附录B 指标完整数学推导包含任务得分、机制分分步计算公式人工裁判一致性校验实验48份盲样双人打分人机匹配度91.7%LLM裁判可靠可大规模自动化评测。附录C 四大智能体框架源码适配说明Hermes原生架构可无侵入插入E1-E5五大模块Agent-Zero、nanobot、ZeroClaw内置持久化逻辑重叠无法干净消融仅作为横向对比基线不做改造实验。附录D 补充实验图表说明机制消融热力图横轴四大能力、纵轴各单模块配置颜色代表Δ增益智能体归因前沿散点图横轴整体自提升Δ纵轴(\text{Mech})机制分Hermes位于最优右上角逐家族成对对比表26个子家族分别给出Hermes/Hermes开关差值细分场景优劣运行方差、单轮token/耗时统计表格完整算力开销数据。附录E 复现完整配置模型推理参数温度0最大输出16384token推理强度中等智能体运行限制单任务最多50轮工具调用300秒超时自动判0分上下文隔离规则每episode强制清空对话仅持久存储文件留存环境依赖Python≥3.11、uv包管理器、Docker容器、各大模型API密钥。附录F 拓展相关工作补充长记忆、技能智能体、时序轨迹评测领域近30篇相关论文对比区分“单次任务打分”“跨会话经验复用”两类评测范式核心差异。

相关新闻

基于Spring Boot与Vue.js的用户偏好声明系统全栈开发实战

基于Spring Boot与Vue.js的用户偏好声明系统全栈开发实战

2026/8/5 23:20:48

最近在开发一个简单的用户偏好收集系统时,遇到了一个有趣的需求:如何将用户一句充满个人情感的口头表达,比如“眼哥最喜欢拉布布了”,转化为结构化的数据,并集成到后端服务中。这看似简单,实则涉及了自然语…

Jenkins构建Maven项目:三种风格详解与实战避坑指南

Jenkins构建Maven项目:三种风格详解与实战避坑指南

2026/8/5 23:20:48

1. Jenkins与Maven:现代软件交付的基石如果你是一名Java开发者,或者正在管理一个Java技术栈的团队,那么“构建”这个词对你来说一定不陌生。从编写完代码到最终生成一个可部署的软件包,这个过程就是构建。在早期,这个过…

为什么IO多路复用搭配用户态线程(协程/轻量级线程)性能极佳

为什么IO多路复用搭配用户态线程(协程/轻量级线程)性能极佳

2026/8/5 23:20:48

先理清两个概念: IO多路复用(epoll/select):内核层面,单一线程监听上万连接,解决「多连接多线程」的线程爆炸问题;用户态线程(协程、轻量级线程,如Java虚拟线程、Go goro…

UE5第三人称相机系统深度解析:SpringArm与Camera组件实战优化指南

UE5第三人称相机系统深度解析:SpringArm与Camera组件实战优化指南

2026/8/6 0:40:53

1. 项目概述:为什么Character相机与弹簧臂是UE5项目的基石在UE5里折腾过角色移动和视角控制的开发者,大概都经历过这样的阶段:一开始觉得不就是个相机跟着角色跑嘛,用个AttachToComponent绑上去不就行了?结果角色一转身…

C++ 竞赛十大作弊算法,学了不一定无敌,但不学绝对吃亏。

C++ 竞赛十大作弊算法,学了不一定无敌,但不学绝对吃亏。

2026/8/6 0:40:53

在 C 算法竞赛(OI / ACM / 蓝桥杯)体系中,存在一类非常规优化技术,被圈内统称为“作弊级算法”。其并非考场违规舞弊,而是通过压榨编译器特性、CPU 硬件指令、位运算压缩、复杂度降维、编译期预计算等手段,…

用LangChain搭FAB问答机器人:踩过的5个坑

用LangChain搭FAB问答机器人:踩过的5个坑

2026/8/6 0:40:53

一、问题背景:工厂真实场景在半导体Fab的实际生产中,工程师每天都会遇到各种系统异常、数据对不上、报警频发的问题。这些问题直接影响良率、产能和报表准确性。以下是我们团队亲历的真实场景,经过脱敏处理后分享给大家。某43英寸晶圆代工厂&…

半导体碳中和:绿色制造的工程师视角

半导体碳中和:绿色制造的工程师视角

2026/8/6 0:40:53

一、问题背景:工厂真实场景在半导体Fab的实际生产中,工程师每天都会遇到各种系统异常、数据对不上、报警频发的问题。这些问题直接影响良率、产能和报表准确性。以下是我们团队亲历的真实场景,经过脱敏处理后分享给大家。某47英寸晶圆代工厂&…

Umi-OCR完整指南:免费开源的离线OCR文字识别软件终极教程

Umi-OCR完整指南:免费开源的离线OCR文字识别软件终极教程

2026/8/6 0:40:53

Umi-OCR完整指南:免费开源的离线OCR文字识别软件终极教程 【免费下载链接】Umi-OCR OCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片,PDF文档识别,排除水印/页眉页脚,扫描/生成二维码。内置多国…

Unity虚拟摇杆开发全解析:从原理到商业级实现

Unity虚拟摇杆开发全解析:从原理到商业级实现

2026/8/6 0:30:52

1. 项目概述:为什么虚拟摇杆是手游的“灵魂”?在手游开发圈子里混了这么多年,我敢说,虚拟摇杆是决定一款动作、RPG甚至部分休闲游戏手感好坏最核心的组件之一。它不像PC上的WASD键盘或者手柄的实体摇杆,玩家能实实在在…

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案

2026/8/4 15:23:37

ncmdumpGUI:一键解锁网易云音乐ncm文件的终极解决方案 【免费下载链接】ncmdumpGUI C#版本网易云音乐ncm文件格式转换,Windows图形界面版本 项目地址: https://gitcode.com/gh_mirrors/nc/ncmdumpGUI 你是否曾经从网易云音乐下载了心爱的歌曲&am…

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比

2026/8/5 6:02:27

分布式配置中心选型实战:Nacos与Consul在创业场景下的对比工程导读:本文深入讨论 分布式配置中心选型实战:Nacos与Consul在创业场景下的对比 在生产工程实践中的核心落地方案。基于 分布式架构与微服务设计 视角,剖析实际痛点、架…

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案

2026/8/5 8:19:55

MoneyPrinterPlus实战指南:AI视频批量生成与自动化发布完整解决方案 【免费下载链接】MoneyPrinterPlus AI一键批量生成各类短视频,自动批量混剪短视频,自动把视频发布到抖音,快手,小红书,视频号上,赚钱从来没有这么容易过! 支持本地语音模型chatTTS,fasterwhisper,…

Unity相机抖动插件Camera-Shake集成与应用实战指南

Unity相机抖动插件Camera-Shake集成与应用实战指南

2026/8/6 0:00:51

1. 项目概述与核心价值最近在做一个动作游戏,需要给主角的重击和爆炸场景加点料,让打击感更足。我第一时间就想到了给相机加个抖动效果,毕竟这是提升玩家沉浸感最简单直接的手段之一。自己手写一个也不是不行,但时间成本高&#x…

Cocos Creator 3.7微信小游戏开发:从架构设计到提审上线的全流程实战指南

Cocos Creator 3.7微信小游戏开发:从架构设计到提审上线的全流程实战指南

2026/8/6 0:00:51

1. 项目概述:为什么需要一份3.7版本的专属适配指南?如果你是一位使用Cocos Creator开发微信小游戏的开发者,并且项目正运行在3.7版本上,那么你很可能已经感受到了那份“甜蜜的烦恼”。一方面,Cocos Creator 3.7是一个功…

AI编程实战:从Prompt工程到工具链集成,打造高效开发工作流

AI编程实战:从Prompt工程到工具链集成,打造高效开发工作流

2026/8/6 0:00:51

1. 项目概述:一次开源AI编程课程的深度重构 最近,我把自己的开源AI编程课程《Claude Code》做了一次从里到外的大更新。如果你对利用Claude、Codex这类大模型来辅助编程感兴趣,或者正在寻找一个能跟上最新AI编码工具迭代节奏的学习路径&#…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/4 13:34:51

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/4 14:25:14

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/4 15:11:03

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…