智猩猩 2小时前
字节Seed同一天连发三篇RSI论文,直指闭环自我进化!
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_guoji1.html

 

智猩猩 AI 整理

编辑:林夕

2026 年 9 月 1 日,ByteDance Seed 与 TokenWave 发布了一个名为Self-Developing Agents的项目,三篇论文同步挂上 arXiv。

项目页直接把它定义成:

From Half-Loop to Closed-Loop RSI

也就是从半闭环的递归自我改进,走向真正的闭环 RSI。

在研究团队看来,今天很多所谓的 RSI 系统,看起来已经形成了一个循环:模型执行任务,获得反馈,根据反馈修改自己,然后再次执行。

但这个循环里,依然有一个隐藏的人类 "Golden Verifier"

人类提前告诉模型应该优化什么,提供评价标准,设计验证器,再让模型沿着这条路不断寻找更好的答案。

所以模型虽然在 " 自己改自己 ",但它并没有真正决定自己应该往哪里进化,这就是所谓的Half-Loop

真正的Closed-Loop RSI,则需要把缺失的那一半补回来。

项目没有直接宣布RSI 已经实现,反而做了一件更有意思的事情:把现在的 Self-Improvement 为什么还没有形成真正闭环,拆成了三个具体问题。

01

Aspire:模糊目标首先消耗的

不是算力,是判断力

传统的 Self-Improvement 通常从一个已经定义好的任务开始。

研究人员告诉模型要提升数学能力,再给出训练数据、Reward 和验证集,模型只需要在这个明确的优化空间里不断寻找更好的结果。

但如果把这些东西全部拿走,只告诉 Agent 一句:" 提升数学推理能力。"

事情马上就变了。

它首先要自己回答:应该学习什么?需要什么数据?采用什么训练方法?怎样判断训练有没有效果?什么时候应该停止?

也就是说,模型不再只是执行优化,而是必须先定义自己的优化问题

这正是 Aspire 要解决的问题。

论文设计了6 个能力目标,并准备了一个由专家构建的520 道题隐藏评测集

Agent 看不到最终测试题,也没有一个明确的下游 Benchmark 告诉它应该往哪个方向优化。

它需要自己完成一整套循环:

理解目标 → 选择学习方向 → 构造数据和训练信号 → 更新模型或 Harness → 自我评估 → 再决定下一步。

真正的效果,最后由隐藏评测集来判断。

Aspire 一共进行了30 个实验单元,其中 28 个产生了可以进一步评估的 checkpoint。

但真正能够在隐藏评测中留下有效提升的,只有1 个

模型并不是不会训练,恰恰相反,它可以非常顺利地完成数据生成、训练、Harness 修改等一系列操作。

真正困难的是它很难判断自己到底应该优化什么。

实验中,Agent 经常会选择与最终目标并不完全匹配的数据,或者依赖过于狭窄的自我评测。

更麻烦的是,即使某一次训练真的带来了局部提升,继续训练也可能把之前的提升重新抹掉。

这就暴露出了 RSI 的第一个核心缺口:Target Formation

人类通常默认目标已经存在,但对于真正的自我进化系统来说,目标本身也需要被理解、拆解和验证。

Aspire 实际上是在问:如果没有人告诉 AI 具体该优化什么,它还能不能自己找到正确的优化方向?

目前的答案并不乐观。

02

S ³ Gym:经验不会自己

长进下一次决策

如果 Aspire 解决的是我应该改什么,那么 S ³ Gym 进一步追问:过去发生的事情,能不能真正改变未来的行为?

对于人类来说,这是一件非常自然的事情,一次任务失败之后复盘,找到问题,下次遇到类似情况时换一种策略。

但 Agent 拥有经验,并不意味着它真的能够从经验中学习。

它可以保存完整的 History,也可以把历史压缩成 Summary Memory,甚至可以直接通过参数训练,把过去的经验写进模型。

问题就在这里:哪一种方式真的有效?

S ³ Gym 把这个问题拆成三个步骤:

Self-Testing → Self-Judging → Self-Improvement。

Agent 首先与环境交互并产生经验,然后自己测试和判断哪些行为有效,最后把这些判断用于下一轮决策或者模型更新。

研究团队设计了7 个带有可执行 Verifier 的文字游戏环境,并比较了三条经验利用路径:

History ICL、Summary Memory、Parameter Training。

History 直接保留过去发生过什么;Summary Memory 尝试把过去压缩成更抽象的策略;Parameter Training 则试图直接把经验写进模型参数。

结果并没有出现一个能够通吃所有环境的方案。

在不同游戏里,History 和 Summary 各有优势。

有些环境更适合保留具体的历史状态信息,因为下一步决策高度依赖过去发生的细节;另一些环境则更适合把经验压缩成可以反复使用的策略规则。

而参数训练虽然在部分任务上确实可以带来提升,但稳定性并不好,还可能出现明显的负迁移。

更夸张的是,在 Qwen3-8B 的连续 checkpoint 实验中,模型在某些环境里的性能并没有随着训练持续上升。

其中 PvZ 任务的表现甚至从23 一路下降到 6,之后长期停留在较低水平。

而 S ³ Gym 最值得注意的结果是Agent 的自我判断并不可靠。

如果模型能够准确判断自己刚才的经验是否有价值,那么理论上,它的 Self-Judging 结果应该能够预测下一轮性能变化。

但实验显示,两者几乎没有相关性,论文报告的相关系数只有:ρ = − 0.010 和 − 0.018。

AI 认为 " 这次经验很好 ",并不意味着下一次真的会做得更好。

这就对应了 RSI 的第二个核心问题:Experience Integration。

真正的自我进化不能只是把历史存下来,也不能只是让模型自己总结。

关键在于这些经验能不能真正转化成下一次任务中的能力,如果不能,那么所谓的 " 学习 " 就只是记忆,甚至可能变成负迁移。

03

HarnessDev:能跑通的 harness,

不等于留下了真实机制

前面两个实验分别解决了改什么和怎么从经验中学习。

但对于 Agent 来说,还有一个经常被忽略的问题:这些能力到底应该被放在哪里?

一个 Agent 真正执行任务时,影响结果的不只有模型参数。

它怎么拆任务、什么时候调用工具、如何管理 Memory、如何保存状态、怎样组织执行流程,同样会决定最终效果。

这整套位于模型之外的执行基础设施,就是Agent Harness

HarnessDev 因此把自我进化的对象进一步扩大了:不仅让模型改自己,还让 Agent 学会修改自己的工作方式。

HarnessDev 的整体流程可以概括为:

Seed Harness → Task Execution → Feedback → Harness Revision → New Harness → Held-out Evaluation。

首先给模型一个最小的初始 Harness,让它自己构建出完整的 Agent 执行系统。

随后不断执行任务,根据真实运行结果寻找问题,再修改 Harness。

和普通的代码生成最大的区别在于:修改之后的 Harness 必须真正运行起来。

因为一段代码里写了 Memory,并不意味着 Agent 真的会使用 Memory。

实验中,模型一共生成了18 个 Code Harness,而这些 Harness 全部能够运行。

但研究团队进一步检查发现,一些 Harness 在代码层面加入了 State Management、Memory 等机制,实际执行过程中却根本没有出现。

这意味着,代码中存在一个机制,不等于运行时真正拥有这个能力。

而在后续的 Harness Evolution 中,模型修改最多的也不是 Memory 和 State Management,而是 Execution Flow 和 Tools。

这说明模型确实能够修改自己的系统,但它并不一定知道:究竟什么才是影响最终性能的关键。

所以 HarnessDev 真正关注是它修改出来的东西,能不能在新的任务里继续有效。

这也是为什么实验专门加入了 held-out 任务。

在 64 次可以进行比较的版本切换中,只有34 次的可见任务变化方向与 held-out 任务一致,也就是:53.1% 的方向一致率。

最终 9 个被 Agent 自己认为最好的版本中,只有2 个在 held-out 数据上真正达到最优。

自我修改和自我改进,是两件完全不同的事情,Agent 可以非常积极地修改自己。

但如果这些修改不能迁移到新的任务,它就只是 " 变化 ",还不能叫 " 进化 "。

04

距离真正的 " 自己进化 ",

还有很长一段路

三篇论文给出的结果并不是AI 已经学会自己进化,恰恰相反,大量实验都在说明,这件事现在还非常不稳定。

AI 可以自己生成训练方案,可以自己总结经验,也可以自己修改 Harness。

但每一步都可能出现问题,最关键的是,局部变好,并不等于整体变强。

在一个测试集上拿到更高分,不代表换个任务还能继续提升;总结出一条经验,不代表下一次真的会用;代码里加入一个机制,也不代表运行时真的会触发。

这也是项目页里最值得注意的一句话:

"The goal is not constant change. It is knowing which changes to keep."

让 AI 知道:什么值得改,什么真的有效,以及什么应该留下。

如果说过去的 Agent 是在完成任务,那么 Self-Developing Agent 想做的事情显然更进一步:让 Agent 开始参与自己的成长过程。

这条路现在还远没有走通。

关注 + 星标,获取 AI 前沿进展与开源一线动态

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

效果 数学 ai
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论