约 3 分钟
为什么我们把递归自我改进收敛成一个有边界的闭环
RSI 从思想实验变成了工程主流,但几乎所有能跑起来的工作都是「有界自我精炼」。createrole 明确站在这一侧:模型权重不动,改的是记忆、记事、技能和考核体系,人在环上,每一步可回滚。
- RSI
- 方法论
- 成长闭环
2026 年的 AI agent 产品,能力清单几乎一致:多轮对话、任务计划、工具调用、沙盒执行、文件交付、MCP 接入、本地部署。这些是入场券,不再是差异。真正没被解决的问题是:agent 今天学到的东西,明天还在吗?下一次它会不会做得更好?
RSI 从假想到工程
RSI(Recursive Self-Improvement,递归自我改进)过去是 AI 安全讨论里的假想话题。2025 到 2026 年,它变成了可复现的工程路线:Darwin Gödel Machine、AlphaEvolve、SEAL 各自拿出量化收益;「harness 自改进」范式主张不动模型权重,让 agent 从自己的执行轨迹里挖失败、提修改、过回归门再合入。
覆盖上千篇文献的综述给出了一个清醒的结论:几乎所有已发表的工作都属于有界自我精炼,即对着固定的外部评估器做收敛式改进。严格意义上的 RSI,也就是自主改权重、没有外部锚点,仍然是安全讨论的对象,不是工程现实。
同一批文献反复给出两条警告:
- 没有外部锚定的纯闭环自改进,默认走向「先升后崩」。
- 生成器和评判器共享权重,会产生自确认回路。
createrole 站在哪一侧
我们明确站在有界自我精炼这一侧。模型权重冻结,改的是四样东西:
| 改什么 | 在产品里是什么 | 谁能改 |
|---|---|---|
| 上下文 | 数字员工自己写的三册记事:关于自己、和你的相处、踩过的坑 | 它自己,1500 字硬上限 |
| 记忆 | 夜间固化出的六型认识页面 | 夜间任务,按日只跑一次 |
| 技能 | 云盘里的技能文件 | 它自己写、商城安装 |
| 考核体系 | 按岗位生成的考纲与题库 | 出题人模型,人工可抽查改题 |
灵魂,也就是职业与风格,是数字员工的天性。它的权威源在数据库,云盘上没有对应文件,沙盒内不可见不可改。这是唯一没有旁路的注入防护,也堵死了「agent 改写自己人格」这条最危险的路。
闭环长什么样
把它落到一天里,就是六个环节:
- 干活:在自己的沙盒电脑里完成任务,交付文件。
- 记事:学到的、答应的、做错的,当场写进自己的记事。
- 固化:凌晨把今天蒸馏成记忆页,复盘关系与教训,更新对你的了解。
- 评测:夜校按岗位出题,judge 模型对照人工标准答案给当前版本打基线分。
- 代练:在快照副本上生成候选灵魂并重新评分,只有严格超过基线的候选才会等你裁决。
- 你确认:看改进说明和逐行差异,点应用,版本号加一。
对文献里的两条警告,我们的回答是结构性的:评测题集必须有人工标准答案,答题的模型从不给自己打分,出题人和学生用不同模型;低于基线的候选自动否决,本体零改动;灵魂每次修订存全文快照,修订历史可回滚到任一版。
我们不宣称什么
我们不宣称「AI 自己变聪明」。我们交付的是一个更朴素的承诺:一个数字员工,用得越久越懂你的业务、越懂你本人,而且每一步成长都能翻出来看。