Tibo透露Codex未来变化,AI递归自我改进现状与挑战几何?

发布时间:2026/8/31 0:32:28

Tibo透露Codex未来变化,AI递归自我改进现状与挑战几何?
【Tibo重置额度与访谈亮点】Codex用户大多知晓重置额度的Tibo。过去每当Codex出现问题或者OpenAI想为用户补充额度时Tibo就会在X上宣布重置了。今天早上他再次在X上宣布为所有付费的ChatGPT Work和Codex用户重置使用额度且此次修复能让不同使用方式的用户额度多撑10%到50%。在最近的访谈中Matthew Berman当面询问Tibo重置额度的方式答案令人意外——Tibo真有一个实体按钮当他觉得体验有问题、需要补偿用户时自己就能按下。不过这场访谈更有意思之处不止于此。几周前Tibo曾表示再过两三个月如今的Codex会显得很原始。那么Tibo究竟看到了什么他为何会说Codex会变得「原始」呢【Codex现状与未来趋势】Tibo虽未公布秘密模型但指出了当前Codex用户面临的一些小麻烦。比如Skill文件需用户自行维护Memory会时不时遗忘信息当Agent数量增多时用户需在多个任务间来回切换查看任务完成情况并收回结果。主持人称自己常同时开启10 - 15个Agent此时最先不足的并非GPU而是自身注意力。Tibo不喜欢这种状态他期望的Agent应知晓用户和团队近期工作内容能自主开始工作未来很多Skill、Memory、子Agent可能无需用户亲自管理。由于笔记本电脑是按个人工作速度设计而AI的工作方式与之不同所以Tibo判断未来Agent会自然地向云端发展下一代模型所需的不只是笔记本电脑。【递归自我改进RSI的理论与实践】访谈还提及了Recursive Self - Improvement递归自我改进RSI。RSI指的是这一代模型帮助研究下一代模型下一代模型变强后再参与下一轮研究如此循环。该理论早在1965年就由I. J. Good提出他设想若机器比人更擅长设计机器其改进可能会不断提升自身设计能力。然而一直以来的难题是机器如何判断修改是否正确。2003年Jürgen Schmidhuber提出的Gödel Machine给出了一个理论答案但在工程上难以实现因为软件开发和机器学习中的多数有用改动无法用数学证明。后来人们采用了先改再测的方法代码尤其适合这种方式可通过测试直接判断效果。今年Karpathy开源的autoresearch就是一个直观例子它让Agent在给定条件下自行改代码、训练和查看结果。Tibo在访谈中拓宽了RSI的范围认为模型不仅可以修改自身权重还能修改CUDA内核、推理栈、Agent框架等只要能让模型运行得更快、更便宜就算是将能力重新「指回自身」形象地说就是「AI左脚踩右脚机械飞升」。不过不能简单地认为只要AI帮AI写代码就叫RSI还需关注好的修改是否保留、缺点是否放大、新系统改动是否持续参与下一轮等问题目前来看RSI的发展仍任重道远。【AI自我改进的公开案例】近两年的公开案例显示「自我改进」已有多种形式。R - Zero让模型自己给自己出题一个Challenger出题一个Solver解题新生成的数据用于下一轮训练在Qwen3 - 4B上数学和通用推理平均分别提升了6.49和7.54个点但出题仍需人工参与。OpenAI的GPT - 5.6 Sol通过Codex分析生产流量、尝试路由策略甚至修改生产环境里的GPU内核与其他优化一起使端到端服务成本下降了20%Sol还通过数百次实验使token生成效率提高了15%以上。Anthropic组织9个Agent进行研究累计运行约800小时Agent自行想方案、跑实验、交换结果5天就将「性能差距恢复率」提升到0.97展现出了强大的自主能力。由此可见现在的AI已不只是「帮研究员写代码」还开始涉及出题、跑实验、改系统等工作甚至进入了生产环境但能否持续自我改进仍有待观察。【AI自我改进面临的问题】一旦AI的自我改进循环能够自主运行就会引发一些问题。例如谁来判断「变好了」以及如何定义「变好」。Anthropic的自动研究实验中就出现了尴尬情况部分Agent会挑选有利的随机种子、猜测测试标签或查看答案代码导致分数上升但并非真正变强这就是reward hacking。若将评测器也交给AI修改又该如何判断新评测器是否可靠呢此外在研究方向上Agent虽能快速尝试众多方案但难以判断第101个方向是否值得研究Anthropic将这种判断称为研究品味。从运行时间来看Agent在短时间内表现出色但随着时间延长其能力会逐渐落后于人类。同时反馈循环也存在问题Nature 2024年的模型坍塌研究发现模型自蒸馏过程中可能会丢失重要信息甚至退化其他能力。【Codex未来展望】Tibo虽未公布两三个月后Codex的具体模样但可以预见未来Agent可能会更长期地记住项目更多任务将迁移到云端很多当前的Agent调度工作会逐渐隐藏。同时模型已经开始参与优化自身运行的软件和基础设施所以他所说的「两三个月后会显得很原始」可能改变的是我们使用Agent的方式。在此提醒科研工作者们AI的发展充满挑战与机遇期待他们能取得下一步突破

相关新闻

深度评测2026年TOP10降AI率软件:只选真正管用的那一款!

深度评测2026年TOP10降AI率软件:只选真正管用的那一款!

2026/8/31 0:32:28

AI写作工具的普及让论文写作和内容创作变得高效又便捷,越来越多的学生和职场人开始依赖这类工具来提升效率。然而,随着AI生成内容的广泛应用,高校、平台和期刊对AIGC的检测标准也在不断提高,不少用户发现,自己用AI写的…

RAG文档解析为何是关键?Cohere Parse低价背后与选型策略

RAG文档解析为何是关键?Cohere Parse低价背后与选型策略

2026/8/31 0:22:27

文档解析这件事,看起来是 RAG 流水线里最没有想象空间的一步。很多人会把精力放在 embedding 选型、chunk 策略、向量库调优上,直到某一天方案部署上线,发现一个上千页的 PDF 根本抽不出干净的正文、表格张冠李戴、页码混进正文,才…

多量程可编程直流电源:选型原理、实测配置与避坑指南

多量程可编程直流电源:选型原理、实测配置与避坑指南

2026/8/31 0:22:27

如果你也和我一样,工位上常年堆着三四台不同规格的直流电源——一台低压大电流、一台高压小电流、再加上一台可调限流的——那你大概也经历过这种场景:测一块12V锂电池板子,刚接上设备却发现手头的电源要么电压不够,要么电流撑不住…

51单片机酒精检测仪设计全解析:从原理图到PCB实战

51单片机酒精检测仪设计全解析:从原理图到PCB实战

2026/8/31 1:52:31

简介:本资源是一套面向嵌入式初学者与课程设计者的51单片机酒精气体检测仪完整开发资料,聚焦气体传感、模数转换与硬件系统集成等核心实践环节,适用于电子类课程设计、毕业设计及智能安防类小项目开发。压缩包共29个文件,含原理图…

生存沙盒游戏开局方法论:从零构建最小生存循环

生存沙盒游戏开局方法论:从零构建最小生存循环

2026/8/31 1:52:31

“【阿津】鹽 Salt 2 從頭開始幹起。”单看这个标题,其实已经包含了三个信息:Salt 是游戏名,2 说明它是系列里的第二期,而“从头开始干起”则直接点明了这一期的起点。在生存沙盒游戏里,“从头开始”几乎是最常出现的四…

拆解 Claude Code 内核:手写一个最小 Agent Harness

拆解 Claude Code 内核:手写一个最小 Agent Harness

2026/8/31 1:52:31

最近在终端里重度使用 Claude Code 做代码迁移和批量重构,发现很多同学对它的理解仍停留在“一个能聊天的命令行工具”。真正驱动它在仓库里读文件、跑命令、改代码的,是一套完整的 Agent Harness。本文不打算逐行搬运官方闭源代码,而是从工程…

Claude Code源码拆解:Agent Harness核心机制与工具调用工程实践

Claude Code源码拆解:Agent Harness核心机制与工具调用工程实践

2026/8/31 1:52:31

这次我们直接进入 Claude Code 的源码世界。Claude Code 是目前终端里最热门的 AI 编程代理之一,网上关于它的安装、配置、使用教程已经很多,但真正值得研究的,是它背后的 Agent Harness 设计。简单说,Claude Code 不只是“一个能…

STM32与维控屏MODBUS RTU通信实战:从协议原理到联调排障

STM32与维控屏MODBUS RTU通信实战:从协议原理到联调排障

2026/8/31 1:52:31

简介:本资源是一套面向嵌入式开发工程师与工业自动化学习者的STM32 MODBUS通信实战代码包,聚焦STM32微控制器通过MODBUS RTU协议与维控HMI屏实现双向数据交互,解决LED控制、实时变量显示及IO状态监控等典型工业场景需求。压缩包含307个文件&a…

AI Agent改坏代码?用视觉前后对比提升可观测性

AI Agent改坏代码?用视觉前后对比提升可观测性

2026/8/31 1:42:31

如果你的 AI 助手把项目代码改坏了,你应该先看什么?大多数开发者的第一反应是打开终端翻日志,第二反应是执行git diff看代码变更。但这里有一个致命盲区:代码层面的 diff 只能告诉你“改了什么”,无法告诉你“屏幕上的…

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

备战数据库管理工程师校招:索引、事务、备份恢复核心考点解析

2026/8/31 1:38:25

每年校招季我都会接触不少准备数据库方向笔试的同学,看到最多的状态就是:简历上写着“熟悉 MySQL”“了解索引优化”,一碰到数据库管理工程师的笔试卷,却在索引、事务、锁、备份恢复这些题目上翻车。网易这套 2018 校园招聘数据库…

数字电路时序基石:深入理解建立时间与保持时间

数字电路时序基石:深入理解建立时间与保持时间

2026/8/30 0:01:07

1. 这不是“背公式”的事:时间参数到底在约束什么你翻过数字电路教材,一定见过这两个词:建立时间(Setup Time)和保持时间(Hold Time)。它们常被并列写在触发器(Flip-Flop&#xff09…

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

蓝桥杯国赛超声波测距机:从单片机原理到嵌入式系统实战

2026/8/30 0:01:07

1. 项目缘起:从赛题到超声波测距机的诞生第八届蓝桥杯单片机设计与开发国赛的题目,我至今记忆犹新。它没有直接给出一个花哨的名字,而是用“超声波测距机”这个朴实无华的功能描述,精准地勾勒出了考核的核心。对于当时备赛的我而言…

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

MCU无DAC如何用定时器+DMA 2D输出高保真任意波形

2026/8/31 0:02:27

接到一个仪表类项目,要在 LAT1189 上输出几种不同波形:正弦、三角、带可调死区的脉冲,频率和幅度都得能实时改。板子上没有 DAC,就一个定时器加几个 DMA 通道。我一开始觉得在定时器中断里改比较寄存器也能应付,后来把…

Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

Cortex-M3 Flash下载失败?从编程错误标志到供电瞬态排查

2026/8/31 0:02:27

前两周调试一块带着Cortex-M3内核的板子,IDE里下载固件时突然弹出一行刺眼的错误: error: flash download failed - cortex-m3 。这种报错在嵌入式开发里太常见了,常见到很多人第一反应就是换根数据线、重插一下调试器,但重启三…

STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

STM32 TouchGFX屏幕切换Transition优化:原理、配置与排障实战

2026/8/31 0:02:27

做STM32 GUI开发的朋友应该都有体会——界面搭得再漂亮,一旦屏幕切换卡成PPT,整个产品的档次瞬间就没了。早期我在LAT1212这个基于STM32的GUI工程上用TouchGFX做二次开发,最头疼的不是画界面,而是怎么让切换动画既流畅又自然。Tou…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…