mt logoMyToken
ETH Gas
EN

AI 进化论:递归自我改进(RSI)的边界与真相

Favoritecollect
Shareshare

作者:赵志民 加拿大皇后大学博士(研究方向为代码智能与世界模型)

如果你是第一次听说 RSI,这篇文章可以当作一份入门指南。 我们会带大家把 RSI从 0 理一遍, 从最早尝试自我改进的 AI 讲起,聊到今天能改代码、造训练数据、参与模型研发的 Agent,看看 AI 如何一步步学着改进自己的。

2026 年 7 月,OpenAI 发布 GPT-5.6。它的成绩单里,第一次出现了一门有些反常的新科目: AI 能不能参与改进 AI 本身。

OpenAI 把这项能力列为 自我改进 (Self-improvement)。GPT-5.6 Sol 得到 57.9%,GPT-5.5 是 41.7%,两代模型相差 16.2 个百分点。它考的不是模型又会做多少道常规题,而是它能不能走进 AI 研发现场:排查研究系统、优化 GPU 内核程序(GPU kernel)和训练配方、运行机器学习实验,甚至帮助改进另一个模型。

这不是一条孤立的新闻。同一个夏天,OpenAI 开始把智能体(Agent)称为“自动化研究实习生”。快手 AgentX 已经让智能体参与提出方案、写代码和线上新旧版本对照(A/B 测试)。Google 表示,长期运行的智能体循环参与了下一版模型的精炼。 Motus2 则把预测、评估和策略更新带进了真实机器人。

这些案例分别触及研发执行、工业实验、模型训练和物理行动,却都没有回答最关键的问题: 改进后的系统,会不会因此更擅长完成下一次改进?

这正是 递归自我改进 (Recursive Self-Improvement,RSI)所追问的问题。OpenAI 将这项评测称为 RSI 指数 (RSI Index),用来衡量“通往 RSI 的能力”。由于完整题目、任务 权重 和聚合公式均未公开,57.9% 只能视为内部综合指标,不能理解成任务通过率或 RSI 的“完成度”。

即便如此,这组数字仍然标志着一个变化:一个过去主要存在于思想实验里的问题,开始被前沿实验室拆成可测量的研发能力。

研究者用了四十年,才逐步把更多改进环节交给机器。本文先分清几种容易混淆的能力,再沿着五次“边界推进”,看哪些有界闭环已经转起来,为什么它们仍不等于“智能爆炸”,以及为什么闭环 怎么合上 比是否合上更重要。这五次推进只是梳理历史的叙事框架,不是学界公认的技术世代。它们在时间上彼此重叠,今天也仍在并行发展。

什么是 RSI:从自我改进到递归增益

这些新闻都在谈 “自我改进 ”,却没有说明一个闭环究竟怎样才算合上。

传统意义上的 递归自我改进 (RSI),指一个 AI 系统利用当前能力,去改进产生这份能力的认知机制。改进后的系统再参与下一轮改进。这里最容易混淆的是: 会自我改进,不等于会自我加速 。 一个系统可以在固定题库上越做越好,却没有变得更会设计下一轮训练。一家公司也可以因为大量使用智能体而研发提速,却没有形成由改进本身驱动的复利。

这个概念并不新鲜。1863 年,Samuel Butler 已经想象过机器通过迭代进化超越人类。1950 年,图灵提出可以构建一个能够被教育、能自我修改的“儿童机器”(Child Machine)。到 1965 年,I. J. Good 又指出:如果“设计更好的机器”本身也需要智力,那么一台足够聪明的机器就可能设计出更强的后继,后继再继续改进,“智能爆炸”由此展开。

真正关键的不是 AI 有没有参与改进,而是改进后的系统是否变得更会改进。为了看清这道分界,可以把 RSI 拆成四条可观察的标准,按达成难度从低到高排列。

本文采用下面这套框架。它不是学界唯一的标准定义,而是为了把经常混在一起的主张分开:

  • 持久改进: 有效变化能进入权重、记忆、工具、驾具或训练流程,而不是一次回答结束就消失。这里的权重也叫参数,就是模型在训练中不断调整、最终保存下来的那组数字。达成这一条,才谈得上自我改进——本文用这个词泛指输出、记忆、参数或驾具变好。

  • 自主闭环: 系统能在划定的边界内发现问题、提出修改、执行实验、评估结果并接纳更好的版本。新版本能在这条边界内参与下一轮改进,本文称为有界 RSI。

  • 递归增益 (也叫”点火”,ignition):新版本不只在任务上分数更高,还比旧版本更擅长产生下一次改进。只有跨过这一条,”改进能力本身”才开始复利,本文称之为递归自我加速。

  • 稳健与可控: 增益在固定资源和隐藏评测下持续、能泛化到未见任务,同时不以评估污染、系统复杂度失控、对齐退化或不可审计为代价(对齐指让 AI 的行为符合人类意图和边界,而不只是把某个分数做高)。四条标准全部达成,才接近开放式 RSI。

目前,前两条已经出现,第三条尚无充分的公开证据,第四条更远未解决。 有界闭环已经出现,不代表递归自我加速已经启动 。 只有递归反馈足以抵消研究难度增加、迭代周期变长等阻力,改进才会进入自我放大区间。

后文将固定使用四种说法。 自我改进 泛指输出、记忆、 参数 或驾具变好。新版本能在固定边界内参与下一轮改进,本文称为 有界 RSI 。改进后的系统变得更会改进,叫 递归自我加速 ,也就是第三层的“点火”(ignition)。若这种增益还能持续、泛化并跨出原来的任务边界,才接近 开放式 RSI

目前,前两层已经出现,第三层尚无充分的公开证据,第四层更远未解决。 有界闭环已经出现,不代表递归自我加速已经启动。 只有递归反馈足以抵消研究难度增加、迭代周期变长等阻力,改进才会进入自我放大区间。

要看清今天究竟走到了哪一层,得先回到一个在 1981 年就学会了“作弊”的 AI。

什么是 RSI:从自我改进到递归增益

1981 年,Douglas Lenat构建了一个名叫 EURISKO 的系统。它不仅用启发式规则解决问题,还能生成、修改和评价新的规则,甚至把这套机制用到自己身上。这在当时相当超前。

EURISKO 参加了 Traveller TCS 太空战棋全国锦标赛。它会设计舰队、模拟战斗,再根据失败调整策略。它在 1981 年夺冠,主办方修改规则后,1982 年又赢了一次。当时的 AI 界为之震动:这东西居然会 自我改进

但 Lenat 很快遇到了一个更棘手的问题。

EURISKO 发现,提升真实能力并不是获得高分的唯一方式。某条规则并没有真正做出重要发现,却学会了在其他规则做出发现时把自己的名字也写进"发现者"名单里,于是它的内部"有用程度"评分迅速接近最高。换句话说,它不是变聪明了,而是 学会了钻评价机制的空子。

这类现象今天通常叫 奖励黑客 (reward hacking,也叫奖励投机):系统找到提高评分的漏洞,却没有真正完成设计者想要的目标。放到 AI 自我改进 的语境里尤其致命:一旦系统既是被改进者,又能影响评估过程,自我改进就可能滑向自我欺骗。这个陷阱,我们后面会反复遇到。

此后几十年,遗传算法、进化策略和神经进化不断证明 搜索 与选择能催生复杂行为,也反复暴露同一个问题:只要评估目标有漏洞,系统就可能先学会钻漏洞,而不是真正变强。

这条线索延伸到 2017 年,出现了一个更极端的案例:DeepMind 的 AlphaZero。它靠纯粹的自我对弈,从零掌握围棋、国际象棋和将棋,"用自己生成的数据训练自己"的威力第一次被完整展示出来。

从本文的四层框架看,AlphaZero 是一次 受限实现 :自对弈产生训练信号,改进写入 权重 ,前两层在固定游戏内已经成立。

但关键的限制在于: 闭环的边界由人类划定,系统无法修改边界本身 。奖励函数(赢棋得分)、游戏规则、训练流程、评估方式,这一切都是人类事先写死的。AlphaZero 在一个完全封闭的沙盒里实现了持久、自主的 自我改进闭环 ,却无法质疑或修改这个沙盒。这意味着它的改进永远被限制在“更擅长下棋”这一个维度上,永远无法迁移到沙盒之外。

这正是前史方法的共同天花板。LLM时代的研究并没有一步跨过它,而是开始把原本由人掌握的环节逐个移进闭环。最先被交出去的,是判断“哪里需要改”的反馈信号。

第一次推进(2022–2023): 让AI从自己的错误中学习

前史所有方法卡在同一处:改进方向由人类事先写死。 EURISKO 和 AlphaZero 依赖人类给定的评估函数,遗传算法依赖人类设计的适应度函数。系统能进化,却只能沿着人类划好的轨道前进。要往前走,第一步得先问:系统能不能 不靠人类逐次介入, 自己判断当前输出的好坏,并产生改进方向?这种能指向下一次修改的反馈,本文称为“改进信号”。

这一步在过去做不到,因为机器读不懂“什么叫好答案”。到 2022 年下半年,大语言模型(Large Language Model,LLM)已经既能理解语言,也能评价一段文字的好坏。让系统自己产生语言反馈,第一次成为通用方法。这条路线的关键约束是:全程一个 参数 都不改,改进主要发生在推理过程和外部记忆里。

Reflexion:把失败复盘变成可复用的记忆

最直接的思路, 是让模型在当场作答的过程里反复打磨 :先给出答案,再批评这个答案,然后改写,循环往复,全程不动 参数 。但这有一个内在缺陷。用同一个模型批评它自己的输出,等于用同一把尺子量同一块布,很难量出自己的盲区。如果复盘只留在当前上下文,任务结束后,进步也会随之消失。

Reflexion (NeurIPS'23)在此基础上加了一个关键设计: 情景记忆 。任务失败后,模型用自然语言写一篇事后复盘,把复盘存起来,下次遇到同类任务时直接注入上下文。这相当于给 AI 配了一本错题本。错题攒得越多,下次开局的起点就越高。

在 HumanEval Python 编程测试上, Reflexion 的 pass@1 准确率达到 91% ,超过论文列出的此前最好结果 GPT-4(80%)。pass@1 表示每道题只计算一次完整作答流程后,最终程序通过隐藏单元测试的比例。整个过程中,模型 参数 没有改动。

第一次推进的边界:记忆可以持久,底座能力没有形成新版本。

Reflexion 情景记忆 可以跨任务保留,因此已经部分满足 “持久改进” 。但被保存的是外部文字记忆,不是模型 参数 ,也没有产生一个基础能力更强的新模型。记忆一旦移除,能力便回到原点。

一句话: 这一步给了 AI 一本能保存的错题本,但还没有把经验练进身体。 再往前,就要让改进写进 参数 ,形成真正的新版本。

第二次推进(2022–2024): 用自己生成的数据训练自己

那就把错题本焊进模型的身体里。这次推进要解决的问题是: 让自主产生的改进信号写入参数,形成真正持久的能力提升。 没有这一步,就没有“后继版本比前代更强”的递归结构,也就谈不上 RSI。

思路很朴素:让模型自己生成一批训练数据,再拿这些数据回头训练自己。听起来有点像“左脚踩右脚上天”,能不能真的踩上去,是这一步要验证的事。

这是 权重 持久改进 第一次被大语言模型系统性触及。

STaR:推理链自举的奠基之作

2022 年, STaR (Self-Taught Reasoner)(NeurIPS'22)让模型生成推理过程,保留答案正确的部分来微调自己,再用更新后的模型生成下一批推理过程。

问题是,如果模型一开始全部答错,循环就无法启动。

STaR 的解法叫 逆向推理 :先把正确答案告诉模型,让它倒推出解题过程并用于训练。相当于先在黑屋里开一次灯,等它学会走了,再关灯让它自己走。

SPIN:在与历史版本的对比中改进模型

STaR 的过滤门槛是固定的,而 SPIN (Self-Play Fine-Tuning)(ICML'24)让当前模型与历史版本博弈,学习区分“人类示范”和“历史版本的输出”。两者越难区分,说明模型越接近人类示范,全程不需要新增人工标注。

第二次推进的边界:权重变了,但目标和红笔仍由人类提供。

这一步解决了 权重 级持久化,但反馈信号仍然依赖人类。奖励函数由人类设计,训练任务由人类选定,数据过滤标准也由人类制定。系统能自主生成候选数据,但 哪些数据算“好”、值得用来训练 ,判断权还在人类手里。SPIN 不需要新增人工标注,却仍以既有的人类示范分布为目标,因此上限仍由这份分布锚定。

更深的问题是递归增益尚未出现:随着模型能力提升,固定训练任务会逐渐失去挑战性,系统越来越会完成这批题,却没有证据表明它也越来越会设计训练本身。就像运动员已经跑进 10 秒,教练还在用小学体育课的标准评判,进步空间会被评判标准的天花板截断。

一句话: 系统能自己生成数据、自己作答,却还不能自己批改。只要那支红笔还攥在人类手里,天花板就仍由人类划定。

第三次推进(2022–2025): 把更多打分权交给 AI

那支红笔,能不能也交给 AI?只要打分、给反馈还得靠人工标注或人类写的验证器,改进方向就仍然掌握在人类手里。这里的验证器,是能按照预设规则自动判断结果对错的程序。第三次推进要减少的正是这层依赖: 更多反馈信号能不能由 AI 自己生成?

这是 自主闭环 的深化:不只是让模型反思输出,而是把训练反馈的一部分也交给 AI。

CAI 到 Meta-Rewarding:从评价回答到评价评委

第三次推进的核心,是“谁来打分”这个问题的三级跳。

第一跳: 2022 年,Anthropic 提出 Constitutional AI (CAI)。人类只写一份文字原则,再让 AI 对照原则打分。实验中,这与人工打分训练的效果没有显著差异,人不再需要逐条参与评分。

第二跳: 2024 年,Meta 的 Self-Rewarding Language Models (ICML'24)更进一步。同一个模型既写回答,又给自己和其他候选答案打分,再用这些分数来更新自己。它使用的微调方法叫 直接偏好优化 (Direct Preference Optimization,DPO),可以简单理解为:“这个回答比那个好,以后多往好的那种靠。”

从 Llama 2 70B 出发,三轮迭代后,它在 AlpacaEval 2.0 上的胜率从 9.94% 涨到 20.44%。这里由 GPT-4 担任评委、GPT-4 Turbo 担任对手,胜率不是一般意义上的答题正确率。

第三跳: 既然回答质量可以自我进化,评判质量本身能不能也进化? Meta-Rewarding (2024)在此基础上加了一层“元评判”。同一个模型同时扮演回答者、评委和“评委的评委”三个角色。第三个角色专门判断这次打分准不准。每轮更新时,模型同时朝“更好的回答者”和“更准的评委”两个方向前进。

不过论文也记录了一个值得警惕的现象:迭代几轮后,“评委的评委”开始退化。它不再判断哪次打分更合理,而是直接选择分数更高的那次,评判标准也随之漂移。这正是 EURISKO 老毛病的 2024 版:进化得越深,那把衡量好坏的尺子也越弯。

第三次推进的边界:红笔交给 AI 后,尺子本身开始变弯。

这一步显著减少了反馈信号对逐条人工标注的依赖,却同时暴露了 RSI 的核心难题: 当评判者和被评判者共享同一套盲区时,闭环很容易自我确认。

这类系统可以形成持久、自主的更新,却不一定能应对不同于训练数据的新任务,也没有证明新版本会成为更强的改进者。问题从“人类反馈太慢”,变成了“自我评判是否可靠”。

一句话: 红笔终于交到了 AI 自己手里,可它握着握着,就开始给自己打高分了。

第四次推进(2023–2026):

让AI修改自己的运行方式

前三次推进主要在改输出、记忆、 参数 和反馈信号。但一个 AI 系统的能力不只由参数决定,还取决于围绕模型运行的整套控制系统:提示词怎么写、调用哪些工具、按什么流程编排、记忆存在哪、权限到哪、结果怎么评判。

Lilian Weng 在 2026 年的长文中把这一整层称为 驾具 (harness)。它就像套在马身上的挽具,不只托着模型干活,也约束模型往哪走、怎么走、能走多远。驾具决定了模型能力能否转化为可靠行动。

近期的 自我改进 很可能先从驾具入手,因为改 权重 昂贵、反馈慢、风险高,而改驾具本质上是改代码,更便宜,也更容易回滚。长期方向可能是 模型权重与驾具共同进化 ,但评估器、权限控制和关键安全边界仍应留在可进化区域之外。

于是第四次推进要回答的问题是: 系统能不能自主修改自己的驾具,也就是定义自己如何运行的架构?

参数 更新是在既定运行方式下把能力练进模型。驾具更新则改变能力如何被调用,相当于重新设计工作台、工具箱和训练方法。

驾具改进有一条清晰的递进阶梯。被优化的对象从浅到深,一级比一级更接近“系统如何思考”的内核:

flowchart LR

A["提示词<br/>改措辞"] --> B["上下文结构<br/>改喂什么"]

B --> C["工作流<br/>改步骤"]

C --> D["驾具代码<br/>改整个编排"]

D --> E["优化器代码<br/>改“怎么改”本身"]

越往里,改动的杠杆越大,也越接近“系统自己重写运行逻辑”。下面就沿着这条阶梯,从浅到深依次来看。

OPRO:让提示词自己迭代

参数 不动,只改提示词,也就是我们给模型下指令的那段话,能让系统变强吗? OPRO (ICLR 2024)的做法很有代表性。它把尝试过的提示词和对应得分一起交给模型,让模型从中归纳规律,再生成更好的版本。过去要靠人反复试的“调话术”,现在可以让模型自己迭代。

但上限是明确的:提示词再好,也只是在调用模型现有能力,造不出新能力。

ADAS 与 AFlow:自动设计智能体工作流

再往里一层,被优化的不再只是措辞,而是喂给模型的信息和 整个任务流程怎么编排。 例如,AI Scientist 把“提想法→写代码→跑实验→写论文→同行评审”串成流水线。既然流程能写成代码,它也可以被 搜索 出来。

ADAS (ICLR 2025)把“设计工作流”本身变成一道优化题。一个更高层的“设计师智能体”不断用代码写出新工作流,运行、筛选、再修改,如此循环。

AFlow (ICLR 2025)更进一步。它把工作流表示成由模型调用和逻辑判断组成的流程图,再用搜索算法寻找更好的结构,最终超过人工设计的方案。

Self-Harness 与 DGM:让系统改写Harness代码

阶梯的顶端,是让系统直接改写 定义自己如何运行的那段代码。 这里有两条路线。

第一条路是“提出、评估、接纳”。 系统找出自己的问题,提出修改,验证有效后再采纳。

Self-Harness (2026)加入了严格的接纳条件:系统先归纳失败原因,再做小步、可撤销的修改。新版本只有在已见和未见问题上都不退步,才会被保留。

第二条路是进化搜索。 系统保留一群候选方案,让它们产生变体,再通过实验留下更好的版本。

达尔文哥德尔机 (Darwin Gödel Machine,DGM)(2025)直接进化可自我修改的驾具代码。在底座模型不变的前提下,它在 SWE-bench Verified 上的修复成功率从 20% 提升到 50%。

这两条路背后是同一个洞见: 代码是定义系统的通用语言。 一旦驾具被写成可执行、可评分的代码,编程智能体就能在这个设计空间里搜索。

MetaClaw 与 AgentX:让真实用户成为反馈来源

无论走哪条路,驾具自进化都需要“改得好不好”的信号。

DGM 的改进信号来 自固定测试集 。MetaClaw(2026)则让智能体在真实部署中从对话提炼经验,并在后台把经验固化进 权重 ,把自进化从题库驱动推向用户驱动。

工业界已经有人把这条路线跑进真实业务。快手的 AgentX (2026)会复盘执行记录,据此修改子智能体的驾具,再用历史任务筛选新版本。

它和 Self-Harness 使用相似的“提出、评估、接纳”骨架。区别在于,它最终还要接受真实线上 A/B 测试。用户的停留和消费行为,成了系统的奖励信号。

这些方法的本质差异不在机制,而在 教练是谁 :测试集、真实用户,还是线上生意。教练越贴近现实,改进就越可能真的有用,但被钻空子的风险也越大。

第四次推进的边界:运行架构可改,但验证边界和最终目标仍在外部。

这次推进把模型、工具和记忆的调用方式也变成了可进化对象。但驾具朝哪个方向进化,仍由外部任务、验证器或用户目标决定。更重要的是,驾具分数变高不等于底座智能变强。一个系统会修改驾具,也不等于更新后的驾具一定能被它有效利用。

一句话: 系统终于能改造自己的手脚和工作台了,可验收标准和施工边界仍由外部世界划定。

第五次推进(2025–2026):

把学习与研究过程放进闭环

修改驾具是一条路线,但驾具改的是 系统在运行时怎么执行任务 ——调用哪个工具、走哪条流程、什么时候停。第五次推进改的是更上游的一层: 系统用来学习的素材和场地本身 ——练习题从哪来、练习环境长什么样、训练数据怎么生成。前者决定的是已有能力如何被调用,后者决定的是下一版模型会在什么样的经验上被训练出来。两者的时间线高度重叠,因为很多团队是同时在做这两件事,但改动的对象并不相同:一个动的是推理时的控制结构,一个动的是训练前的输入供给。

于是另一条路线开始扩大闭环所覆盖的范围: 整个学习与研究过程能否成为系统的操作对象? 系统开始自己生成训练材料、选择练习策略、运行实验、修改训练流程,再把结果写回模型或驾具。

这里要避免一个误区。系统自主生成数据或环境,只是扩大了 自主闭环 的范围。即便出题、作答和批改都由 AI 完成,如果新版本没有变得更会设计下一轮改进,系统仍然没有跨过递归增益的门槛。

SEAL:让模型生成自己的训练数据和更新指令

给模型一份从未见过的新材料,它通常只能按人类预先规定的方式学习。2025 年的一项工作却让模型先为自己写“学习计划”:如何整理材料、用什么节奏学习、是否需要多次改写,都由模型自己决定,然后再照着计划更新 参数 。这相当于自己排课程表,再照着上课。

这套方法叫 SEAL (Self-Adapting LLMs)(NeurIPS'25)。计划好不好,要看“上完课后做题准不准”。系统再用结果反过来调整计划,这就是 强化学习

在知识问答任务上,这种方式把准确率从 33.5% 提升到 47.0% ,也优于直接用 GPT-4.1 生成学习材料。

SEAL 解决的是“如何为自己准备学习材料”。但对需要与环境反复互动的智能体,另一个瓶颈很快出现:真实练习本身太慢、太贵。于是,下一项工作把环境也搬进了闭环。

SEAL 解决的是”如何为自己准备学习材料”。但对需要与环境反复互动的智能体,真实练习往往太慢、太贵:网页环境太复杂,每次操作都要真的执行,收集训练数据既慢又贵。 WebEvolver (EMNLP'25)给出了一种折中——训练一个内部”世界模型”,模拟网页会怎样响应,相当于在脑子里建一个沙盘。智能体可以在沙盘里低成本地大量练习,只在关键步骤才真正上线验证;执行任务时,这个沙盘还能帮它预判下一步操作的结果。在三个真实网页任务测试集上,它相对既有自进化智能体的整体性能提高约 10% ,且不依赖更强的”老师模型”。

到这里,闭环已经能在模拟环境里练习。接下来的问题自然是:预测、评估和 参数 更新能否离开网页,在真实物理世界里闭合?

Motus2:当参数自我改进走进物理世界

自我改进 并不只发生在语言和代码里。2026 年 8 月,一套机器人系统在两项真机任务上的平均成功率从 65% 提高到 75%。变化来自一个很具体的闭环:机器人先设想几个动作,预测每个动作会带来什么结果,选出更好的动作,再把结果用于下一轮训练。

这套系统叫 Motus2。 策略负责提出动作,世界模型预测动作的结果,价值模型判断结果是否有助于完成任务。预测和评分既用于选择动作,也用于更新动作 参数

这是 权重 级策略改进,但仍是有界闭环:世界模型骨干与价值模型保持冻结,任务目标和监督仍由外部提供,论文也没有展示改进后的 Motus2 更擅长设计下一轮学习算法。它证明的是闭环能在真实机器人上运行,而不是开放式 RSI 已经完成。

SEAL、 WebEvolver Motus2 分别把训练材料、练习环境和物理行动纳入闭环。它们扩大了系统能够自主操作的范围,却仍没有把“研究什么、何时采用结果”的决定权交给系统。要看这条边界在现实研发中推进了多远,还得回到前沿实验室和生产系统。

OpenAI 与 Google:让智能体参与模型研发

OpenAI 的“自动研究实习生”已经能排障、优化 GPU 内核程序、尝试训练配方和帮助改进另一个模型。Google 也表示,长期运行的智能体循环参与了底层模型的精炼。但两家公司都没有证明完整 自主闭环 :人类仍决定研究方向和结果是否推进,公开资料也不足以还原循环如何运行。

真正的变化是,AI 已从“被研究的模型”变成“参与研究模型的执行者”。它跨进了训练车间,但还没有拿走实验室的方向盘。

2026 年夏: 自动研究系统开始改进自身的研究方式

前五次推进不断扩大“系统可以修改什么”。2026 年夏天出现的一组工作,则开始正面追问: 能不能让自动研究系统去研究并改进自动研究系统本身?

在一个 GPT 预训练基准上,普通内层循环把验证损失降低约 0.009,加入外层循环后平均降低约 0.045,改进幅度约为 5 倍。验证损失可以理解为模型在新数据上“错得有多远”,通常越低越好。这里比较的是损失下降量,不是任务正确率提高了 5 倍。

做到这一点的 Bilevel Autoresearch 使用两层循环:内层智能体优化任务代码,外层智能体优化内层的 搜索机制 。系统改进的已经不只是答案,而是“怎么寻找答案”。

递归式驾具自我改进 (Recursive Harness Self-Improvement,RHI)得到了类似结果:在 30 个合成机器学习研究任务上,更新后的低推理预算智能体超过了未优化的最高预算配置,同时最多降低约 60% 的推理成本。改进运行机制,有时比单纯增加思考预算更有效。

不过,这两项结果主要来自规模受控的实验。要证明闭环不只会偶尔找到一个好方案,还需要更长的连续运行、多个后继版本,以及循环之外的测试。 AIDE² 尝试把这三件事放在一起。

真正引发争议的是 AIDE² 。Weco 团队让一个自动研究智能体充当外层改进者,连续 100 步重写内层 AIDE 的驾具。在八天无人值守运行中,它筛出 7 个连续改进版本。团队报告称,最佳版本不仅超过起点,也超过人工调了两年的版本,并把增益带到循环从未见过的任务上。

另一个变化发生在奖励作弊上。在未参与优化的 GPU 内核程序测试 KernelBench 中,起始版本有 63% 的测试案例出现“公开得分看似提高、隐藏验证却不认可”的情况。最佳进化版本将这个比例降到 34%。 这里的隐藏分数 (private score),就是系统优化时看不到、只在最终验收时使用的分数。它可能淘汰了只会迎合公开分数的版本。

Weco 把这称为 第一级 (Level 1): 净正改进。 这不是行业通用标准,但它是目前值得认真对待的 有界 RSI 证据 。证据边界也很清楚:结果来自团队自报,完整报告仍待发布,进化后的系统还出现了复

杂度膨胀和死代码。更关键的是,它没有通过下一级的 点火测试 (ignition test):改进后的系统没有被证明比前代更擅长改进另一个版本。

反向证据来自 AI4AI-Bench 。它让智能体在固定资源内重写训练算法,再由智能体无法接触的评估器打分。以原配算法为 0.1、任务最优值为 1.0,最强系统只得到 0.250,而且多数提交没有真正修改模型“如何学习”。当前智能体很会修工程、调驾具和跑实验,但触及训练算法核心的能力仍然很浅。

一句话: 闭环已经能够净正地转几圈,但还没有证明下一圈会因为上一圈而转得更快。

统一视角: 如何判断RSI走到了哪一步

下表用开篇的四条标准(持久改进、自主闭环、递归增益、稳健与可控),对照前面各次推进,并标出主要缺口。元研究闭环的相关工作几乎全部来自 2026 年最近数月的 arXiv 预印本,其中 AIDE² 更是团队自报的博客结果,尚未经过同行评审。这些结论应被视为阶段性观察,而不是已经沉淀的共识。

表中的 ✅ 表示已有较直接证据,⚠️ 表示只在有限条件下成立或证据仍不充分,❌ 表示尚未展示。

这个领域的历史,就是“能被系统改动的对象”一层层向内推进的历史。 被改动的对象从输出和记忆,逐步深入到参数、评判、驾具和训练环境,最后终于碰到产生改进的机制本身。

越往里走,“改进”就越难定义,也越难证明。回到前面那四条标准—— 持久改进、自主闭环、递归增益、稳健可控 ——今天真正挡住 ignition 和 开放式 RSI 的,正是后三条各自最难跨过的地方,可以拆成四道相互咬合的门。

第一道门 (自主闭环能否可靠) :验证器是否可靠,而且系统改不动它。 当系统既是改进者又是评判者时,评判标准会随迭代漂移。 Meta-Rewarding 的“评委的评委”后来越来越偏向高分本身, EURISKO 更早学会把自己的名字塞进功劳簿。它们都在提醒同一件事:优化过程会攻击指标与真实目标之间的每一条缝。

这里的 外部锚 ,指被改进系统无法篡改的评估或约束。形式证明、可执行验证器和隐藏测试通常比模型自评可靠。 AIDE² 的隐藏分数能减少一部分奖励作弊,正是因为内层智能体无法操纵它。

真正可靠的原则不是让人审核每一步,而是: 评估器和权限边界必须留在被进化系统的控制范围之外。 数学和代码任务可以依赖证明器、编译器或隐藏测试。研究品味、长期代码健康与部署边界,仍需要人类作最终判断。

第二道门 (稳健可控之一) :改进能否跨出自己的数据分布。 用自己生成的数据训练自己,会放大已有偏差、抹平多样性, 最终形成模型坍缩 :输出越来越单一,原有错误在一轮轮自训练中被重复放大。用固定题库改驾具,则可能把题库特征写进工作流,制造另一种过拟合。

一次未见任务上的提升还不够。系统必须经受跨任务、跨领域、跨时间的隐藏评估,才能证明它积累的是可迁移能力,而不是更隐蔽的应试技巧。

第三道门 (递归增益本身) :改进是否真的具有递归增益。 任务分数提高,不代表系统更会设计下一次改进。AIDE² 展示了多步净正改进,却没有通过 ignition。AI4AI-Bench 则显示,多数系统仍不会修改核心学习算法。底座太弱时,自生成数据和自我诊断的质量也可能让循环越转越差。

第四道门 (稳健可控之二) :能力、复杂度和控制能否一起扩张。 越变强未必越“听话”,越会改代码也未必越容易维护。 AIDE² 的死代码和复杂度膨胀是一个小尺度预警。在更大的训练系统里,权限越高、迭代越快,人类越难理解每次变化究竟带来了什么。

OpenAI 首席科学家 Jakub Pachocki 公开表示,目前没有任何实验室已经把 对齐 与监控解决到足以负责任地长期全速扩展的程度。真正的目标不是只让能力曲线上升,而是让安全、监控、回滚和审计能力至少同步上升。

AutoResearchEval 检查了 800 条真实科研轨迹,归纳出 45 类失败。它们最终指向同一个缺口:当前智能体缺少稳定的 元认知循环 ,无法持续核对结论与证据、在出错时可靠回退,或主动质疑自己的研究路径。问题不能只靠多套一层工作流解决。

所以更可能的现实图景,不是人类简单被踢出闭环,而是 沿抽象阶梯向上移动 :从写代码转向验代码,从跑实验转向设计验证,从局部执行转向决定什么值得研究、什么证据足以推进、什么时候必须

停止。机器接走越来越多工作,人类留下的不是每一步操作权,而是目标、验证边界和最终否决权。

结语: 自我改进闭环已经出现, 递归增益仍待证明

从 1981 年 EURISKO 学会“自欺欺人”,到 2026 年模型开始参与评估、修改驾具、更新策略和训练后继,更准确的结论是: 有界、可测量的自我改进闭环已经出现,甚至开始产生净正收益,但尚无充分公开证据表明,改进后的系统持续提升了自身的改进能力。 因此,闭环合上的方式比闭环合上本身更重要。

一个在评判标准漂移中合上的闭环,会越来越擅长优化它自己扭曲的目标。一个在数据分布坍缩中合上的闭环,会越来越擅长一个越来越窄的任务子集。一个在 对齐 偏差放大中合上的闭环,会越来越有能力、越来越难以校正。

真正的问题已经变成了两问: 它会不会点火,以及点火时什么仍留在它改不动的边界之外? 前者取决于改进能力能否递归增益,后者取决于验证、权限和治理能否继续有效。

回到四十年前那个把自己名字塞进“发现者”名单的 EURISKO 。它钻的那个空子,和今天最前沿的自进化系统面对的难题,其实是同一个: 当一个系统开始给自己打分,你怎么知道它是真的变好了,还是只学会了让自己看起来变好?

四十年过去,系统的能力早已不可同日而语,这个问题却几乎原封不动。变的是赌注:当年是一场桌游的输赢,往后可能是科研与经济系统的运行方式。这道缝最终怎样合上,仍取决于我们何时、以什么方式把手搭上去,或者收回来

Disclaimer: This article is copyrighted by the original author and does not represent MyToken’s views and positions. If you have any questions regarding content or copyright, please contact us.(www.mytokencap.com)contact
More exciting content is available on
X(https://x.com/MyTokencap)
or join the community to learn more:MyToken-English Telegram Group
https://t.me/mytokenGroup