约 8 分钟
递归自我改进:2026 年的四条路线与共同警告
梳理 2025 到 2026 年 RSI 领域的概念界定、代表性工作、不训权重的产品形态、监督与评测手段,以及学界反复给出的失败模式。最后说明 createrole 如何把这些结论落到数字员工的成长闭环里。
- RSI
- 调研
- 成长闭环
- 评测
这篇文章整理我们在 2026 年 8 月对递归自我改进(Recursive Self-Improvement,RSI)研究与工程实践的一次梳理。它是我们设计数字员工成长机制时的外部依据,出处随文附链接。
严格 RSI 与有界自我精炼
2025 到 2026 年,学界已经把两件事分开:严格 RSI 指系统自主修改自身权重或训练机制、没有固定外部锚点的开放式改进;有界自我精炼(bounded self-refinement)指对着固定外部评估器做收敛式改进。一篇覆盖约 1250 篇文献的综述指出,几乎所有已发表工作都属于后者,严格 RSI 仍是安全讨论的假想焦点,不是工程现实(arXiv 2607.07663)。该综述用两条轴分类:改进什么,以及回路闭合到什么程度(human-in-the-loop、human-on-the-loop、全闭环)。它的核心论断是:精炼回路的质量上限由反馈通道质量决定。
Tom Cunningham 给出另一组区分:反馈效应、自主进步、超指数反馈是三件不同的事;他引用 Clark (2026) 把「自主设计后继系统」的 maximalist RSI 与「研究生产力复合加速」的 prosaic RSI 分开(Cunningham, RSI Definitions)。
按「改什么」,改进路线可以分成四条:
| 路线 | 改什么 | 代表工作 |
|---|---|---|
| 改权重 | 用 RL/SFT/DPO 自训练 | SEAL、STaR、Self-Rewarding |
| 改上下文与记忆 | 权重冻结,上下文演化 | ACE、Reflexion、Memento |
| 改工具与技能库 | 成功轨迹沉淀为可复用技能 | Voyager 系、Agent Skills |
| 改自身代码 | 编辑自己的运行代码或脚手架 | DGM、SICA、Self-Harness |
ICLR 2026 设立了专门的 RSI Workshop(链接,Workshop Summary),标志 RSI 进入可审计部署系统的学术主流。CSA 的报告定义了一个更早到来的安全门槛:AI 在人类监督下实质性参与后继 AI 系统的开发;RSI 相关论文从 2024 年初的每季度个位数涨到 2026 年第二季度约 500 篇(CSA Lab)。agent 侧的综述是《A Survey of Self-Evolving Agents》(arXiv 2507.21046,配套 repo)。
代表性工作
2025 年是弱 RSI 的实证元年,四条路线各自拿出了可复现的量化收益。
- Darwin Gödel Machine(Sakana AI + UBC,2025-05):agent 变体谱系做达尔文式开放演化,以 SWE-bench 为适应度函数,20.0% 提升到 50.0%。安全机制是沙盒、修改限制、全程可追溯。官方博客,arXiv 2505.22954
- AlphaEvolve(DeepMind,2025-05):进化式编码 agent 配自动评估器,改进了矩阵乘法算法和数据中心调度,并将 Gemini 训练时间缩短 1%。DeepMind 博客,arXiv 2506.13131
- SEAL(MIT,NeurIPS 2025):改权重路线的代表,模型用 RL 学会生成 self-edits 并据此更新自身权重。arXiv 2506.10943,MIT News
- SICA(Bristol,2025):单 agent 直接编辑自己运行中的代码库,SWE-bench Verified 子集 17% 提升到 53%。arXiv 2504.15228,GitHub
- Voyager 系:技能库范式,公认短板是技能生命周期管理,库只增不减。Agent Skills 综述,SkillAudit
- Self-Rewarding / STaR 系:近两年的主要进展是理论化与失败模式刻画。《Why Self-Rewarding Works》(arXiv 2601.22513);《Can Large Reasoning Models Self-Train?》在真实数学题上发现 reward hacking(arXiv 2505.21444);《Self-Improvement Can Self-Regress》命名了「先升后崩」(arXiv 2606.21090);Meta-Rewarding 让模型当 meta-judge 改进自己的评判能力。
- Absolute Zero Reasoner(NeurIPS 2025):单模型同时扮演出题者与解题者,代码执行器做可验证反馈;出题者因「不太易也不太难」的任务获奖励,零外部数据达到 SOTA 推理性能。arXiv 2505.03335,GitHub
2026 年的新范式:harness 自改进
2026 年的新范式不动模型,让 agent 挖掘自己执行轨迹里的失败模式、提出脚手架修改、经回归验证后合入。
Self-Harness(2026-06)分三阶段:Weakness Mining(跑评测、记录全部工具调用与报错轨迹、聚类失败模式)、Harness Proposal(最小化定向修改)、Validation(held-in 与 held-out 双集回归,零回退才合入)。Terminal-Bench 2.0 上 MiniMax M2.5 从 40.5% 提升到 61.9%。explainx 解读,Ben Dickson primer
Lilian Weng 的《Harness Engineering for Self-Improvement》(2026-07)列出七类可改进的 harness 组件:系统提示词、工具描述、工具实现、中间件、技能定义、子 agent 配置、长期记忆管理。她强调设置只读保护区,runs 目录、tracer、verifier、LLM 配置不可改,从结构上禁用 reward hacking。lilianweng.github.io
《Learning from Failure》(2026)把失败轨迹组织成可行动信号,零训练即插即用。arXiv 2606.31270
头部实验室也从表态走向量化披露。Anthropic 的口径是「尚未到达 RSI,但可能比大多数机构准备好的时间更早到来」(Scientific American),并披露 Claude 写了其代码库 80% 以上的合入代码;产品侧的 Agent Skills 已开放为标准,是技能库自扩展路线的产品化事实标准。OpenAI 披露 GPT-5.3-Codex 参与调试自己的训练过程,并推出内部 RSI Index。DeepMind 的 AlphaEvolve 是「AI 改进 AI 基础设施」的旗舰案例,白皮书刻意闭源。
不训权重的产品形态
产品界的共识路线是权重冻结、上下文与记忆与技能演化。
- ACE(2025-10)把上下文当作演化的 playbook,Generator、Reflector、Curator 三角色回路,用增量 delta 更新和 grow-and-refine 防止整体重写导致的 context collapse;演化上下文可让开源小模型追平 GPT-4.1 级生产 agent。arXiv 2510.04618
- Memento(2025-08):冻结规划器加可训练的情节式案例记忆,只训练案例检索的 Q 函数,GAIA validation 87.88%。arXiv 2508.16153
- mem0 是部署最广的开源记忆层,局限是抽取与裁决依赖 LLM、无运行时归属(2026 记忆系统横评)。Letta 的 sleep-time compute 把记忆管理移出用户关键路径,「睡眠 agent」在空闲时异步清洗、压缩、提炼记忆(Letta 博客)。
- DSPy GEPA(ICLR 2026 oral):遗传 Pareto 反思式 prompt 演化,以 35 倍更少的 rollout 打败 RL。核心洞见是文本反馈比标量奖励的信息密度高得多。arXiv 2507.19457
- 领域索引:Adaptation of Agentic AI: A Survey of Post-Training, Memory, and Skills
三个反复出现的工程坑:brevity bias(迭代摘要丢细节)、context collapse(整体重写侵蚀历史)、技能库单调膨胀无淘汰。
怎么防止越改越差
综述给出一个验证层级:形式化验证器 > 执行反馈(测试、编译器、沙盒)> 学习型 judge > 内在信号(自信度)。已被证实的自改进强度严格追随这个层级(arXiv 2607.07663)。
LLM-as-judge 有两个实锤漏洞。一是验证不对称:self-play 系统会系统性演化出「更有说服力而非更正确」的输出(arXiv 2607.05904)。二是 master key 攻击:单个 token 就能骗过 judge(arXiv 2507.08794)。生成器与评判器共享权重还会产生自确认回路,系统性强化模型最自信的错误。
防坍缩的共识配方是:外部锚定信号不可趋零,加数据门控,加早停与课程难度控制。常见设计模式:
- 零回归门:候选修改在 held-in 与 held-out 双集上零回退才合入。
- 证据驱动修改:每个修改附「失败证据、根因推断、定向修复、预测影响」;verifier、tracer、评分配置只读,让 agent 结构上无法改评分器。
- 评测驱动开发(EDD)与 CI 门:先写评测再写功能,评测集即规范,线上失败样例自动变成新的评测用例,均分不过阈值不放行。Braintrust,FutureAGI
- 人类监督三档:in-the-loop 直接审改动,on-the-loop 自动改加人工审计,全闭环。
- 课程难度作为隐式监督:只奖励部分成功的任务,见 Frontier of Learnability。反面教材是共演化回路的 diversity collapse。
风险与共识
主流观点已经从「RSI 是否可能」转到「弱 RSI 已在发生,怎么设护栏」。被点名的新风险是:持久的技能与记忆积累,会让对抗性影响被永久编码、跨代自增强,并在 agent 群体间传播。对记忆和技能可成长的产品,这是最直接的警告。
产品化护栏的标准件有四样:bounded self-editing(显式的可编辑面白名单)、全量审计日志、版本化与可回滚(回滚流程要实测)、blast-radius 门控。EU AI Act 于 2026 年 8 月生效,把血缘可审计和人类监督变成高风险系统的合规硬要求。治理级的自改进度量被认为是全领域最空缺的生态位。
出处:CSA · Sakana DGM 护栏 · FutureAGI 治理指南 · Governed Capability Evolution
createrole 怎么用这些结论
createrole 的数字员工属于有界自我精炼:模型权重冻结,改的是记忆、记事和人设。
- 增量更新,不整体重写。数字员工自己写三册记事:关于自己、和用户的相处、踩过的坑,每册 1500 字硬上限。这对应 ACE 的增量 delta 思路,也直接限制了 context collapse 的空间。
- 固化移出关键路径。每晚做记忆固化、复盘和用户画像更新,与 Letta 的 sleep-time compute 同一个方向。
- 外部锚点不趋零。夜校按岗位生成考纲与题库,由用户触发;评测由 judge 模型对照人工标准答案打分,答题模型不给自己打分。这是对验证层级和自确认回路警告的直接回应。
- 候选先过门,再由人裁决。代练在快照副本上生成候选灵魂,只有分数严格高于基线的候选才会等用户确认;低于基线的自动否决,本体零改动。这是零回归门加 human-in-the-loop。
- 版本化与可回滚。灵魂每次修订都存全文快照,可以恢复到任一版。
我们目前没有做的:不自训权重,不自动在夜里跑夜校或代练,不让记事自动变成技能。文献里的失败模式大多来自回路闭得太快,我们宁可先把门槛留在人手里。