createrole

Recursive Self-Improvement,有边界的递归自我改进

会自我改进的数字员工队伍

别的 agent 下班就忘。createrole 的数字员工白天替你干活、当场写下学到的事,夜里固化记忆;你按岗位给它出题打分,让它在快照上打磨自己,只有超过基线的改进才等你确认。每一圈成长一个版本,随时可回滚。

体验平台采用审核制。留下邮箱,通过后我们发开通邮件。

干活记事固化评测代练你确认当前版本v1

干活 在自己的沙盒电脑里完成任务,交付文件。

这些是 2026 年 AI agent 的入场券,我们也有,但不拿来当卖点:

  • 多轮对话
  • 任务计划
  • 沙盒终端
  • 文件交付
  • MCP 工具
  • 技能文件
  • 多模型
  • 整栈私有化

真正没被解决的问题是:agent 今天学到的东西,明天还在吗?下一次会不会做得更好?createrole 做的是任务结束之后的事。

一个每天都在跑的递归自我改进闭环

RSI 在多数地方是论文里的假想。在 createrole 里,它被收敛成六个环节,每一环都是代码里真实运转的机制,有自己的数据形态与界面入口。

  1. 01改上下文

    记事

    干活时当场写下学到的事

    数字员工的云盘里有三份它自己写的文件:我是谁、我和你的关系、我犯过的错。对话中学到你的新情况、答应了事、做错了事,当场写进去,每回合全文进入上下文。每份硬上限 1500 字,写超即拒。

  2. 02改记忆

    固化

    夜里把经历蒸馏成记忆

    每天一条日记,按会话实时转录。凌晨窗口,把当天经历蒸馏成认识页面,复盘并重写「和你的相处」与「踩过的坑」,更新对你的了解。记忆不是聊天记录,抽不出值得长期保留的东西就什么都不写,遗忘是功能。

  3. 03评测体系

    夜校

    按岗位一键生成考纲与题库

    根据灵魂档案里的职业定位联网调研,由出题人模型制定版本化考纲:能力维度 × 题型 × 难度。计算题可执行验证,知识题必须引用真实检索出处,开放题按评分清单。练习集与真题分池,出题人与学生用不同模型。

  4. 04外部锚点

    评测

    给当前版本打一个基线分

    judge 模型对照标准答案逐题打分,每题一句评语,得到当前版本的分数。这是整个闭环的外部锚点:答题的模型从不给自己打分,没有标准答案的题集,代练不会启动。

  5. 05候选生成

    代练

    在快照副本上打磨自己

    由你发起。代练先用评测题集给当前灵魂打基线分,再生成候选灵魂并重新评分。只有严格超过基线的候选才会等你裁决,低于基线自动否决,应用前本体零改动。你看到的是分数变化、改进说明和逐行差异。

  6. 06人在环上

    版本

    你点应用,版本号加一

    每个版本固定了当时的模型、灵魂、技能与工具组合,写明来源:初始化、代练、灵魂编辑、技能变更。应用即 v+1;灵魂每次修订存全文,修订历史可一键回滚到任一版。第二天它带着新版本继续干活,闭环从头再来。

改的是记忆、记事、技能与考核体系,模型权重不动。这是学界所说的「有界自我精炼」,不是无锚点的自主改权重。

记忆不是聊天记录

对应人类记忆系统:会话记录回答「发生了什么」,日记回答「这一天可读的回顾」,记忆回答「以后如何影响我的行为」。召回分三层:每回合自动注入几条带日期的一句话钩子,模型觉得相关时在终端展开单页全文,再不够才翻当天日记。

  • 教训

    犯过的错、为什么、下次怎么做

  • 大事记

    有长期意义的情节

  • 人物

    关系、偏好、禁忌、承诺

  • 认识

    对世界与业务的结论,带置信度

  • 经验

    什么任务怎么做

  • 自我

    它认为自己是谁

不是概念图,是产品里的页面

下面每一张都能在体验平台里点到。

代练结果。
代练结果。 基于 v1 的 10 道题,基线 90 分,候选 97 分。左边是当前灵魂,右边是候选灵魂,改进说明写清楚改了什么。你点丢弃或应用,应用前本体零改动。
版本清单。
版本清单。 每个版本固定了当时的模型、灵魂、技能与工具组合,写明来源:初始、代练、灵魂编辑、技能变更。灵魂修订历史在「天性」页,可回滚到任一版。
评测。
评测。 夜校按职业定位生成的考纲与题库,judge 模型对照标准答案逐题打分,每题附评语。
成长面板。
成长面板。 对话页右侧:动态、天性、记忆、技能、待办、日记。它记下的相处与教训、夜里的固化与复盘,每一条都是可点开的事件。

看它跑完一圈

一分四十八秒的实录:发起代练,等候选评分,看差异,点应用,版本从 v1 变成 v2。等待时段只是加速,没有剪辑。

为什么不会越改越差

RSI 文献反复警告:没有外部锚点的纯闭环自改进会「先升后崩」,生成器和评判器共享权重会产生自确认回路。createrole 对每条警告都有一个结构上的回答,而不是一句提示词。

警告:自主改权重

模型权重冻结

改的是记忆、记事、技能和考核体系。模型只是目录里的一条记录,随时可换,成长资产保留。

警告:agent 改写自己的人格

灵魂只有你能改

职业与风格的权威源在数据库,云盘上没有对应文件,沙盒内不可见不可改。代练的候选必须由你点应用。

警告:自确认回路

出题人与学生分离

出题人走独立的强模型档位,不与学生共用;答题的模型从不给自己打分。题库不进数字员工的上下文,它只在考试时见到题目。

警告:越改越差

只接受超过基线的候选

每次代练先打基线分,候选必须在同一题集上严格更高才会出现在你面前。低于基线的自动否决,本体没有任何改动。

警告:不可逆

每次变化留版本

灵魂每次修订存全文快照,修订历史可一键回滚到任一版。夜间步骤按日认领只跑一次,回溯补算不重跑。

警告:上下文坍缩

硬闸而非软提示

记事 1500 字上限在写入侧执法。删除对话时派生的记忆材料、日记转录随之重派生或回收,不留孤儿。

白天干活,夜里成长

闭环落在日历上,就是一个数字员工的一天。

白天它像所有 agent 一样对话、计划、执行、交付,待办到点自己醒来干活,秘书还能把活派给它。晚上你下班了,它开始固化记忆、复盘关系与教训、更新对你的了解。第二天早上,昨天的教训已经作为记忆钩子注入第一回合。评测和代练由你决定什么时候发起。

一个数字员工的一天

24h
  1. 09:00派活你说:把上周的会议纪要整理成周报。它立计划、跑沙盒、交付 docx。
  2. 11:30记事你随口说周三下午开会。它把这条写进「和你的相处」。
  3. 14:40纠正你说:周报里别写具体金额。当场写进「踩过的坑」。
  4. 15:00自醒待办到点,在专属会话里自己动手,不打断你正在用的会话。
  5. 18:00日记今天每段对话已按会话实时转录成当天日记。
  6. 01:00固化把今天蒸馏成记忆页,复盘并重写「和你的相处」与「踩过的坑」。
  7. 02:00了解更新对你的了解,只写关于你这个人的事实,不写工作规程。
  8. 次日钩子新对话第一回合,昨天的教训已经作为记忆钩子注入。

以上每一步都是产品里真实运转的机制。

整栈私有化,断网也照常成长

后端、前端、沙盒服务、记忆服务,四个服务一键部署到客户内网。验收后拔掉网线,对话、记事、云盘、夜间固化、评测、代练、版本全部自洽。

两台 DGX Spark 背对背 200GbE 直连

在两台 NVIDIA DGX Spark 上,一个科室的数字员工编制就是桌上这一摞:一台跑本地模型推理,一台跑全部应用服务,200GbE 直连。

  • 多协议模型适配层,本地 vLLM 与云端模型只是目录里的一条记录
  • 换模型免重启,出题人、夜间固化、对话可用不同档位
  • 系统级开关声明沙盒无外网,数字员工知道自己断网,不会反复重试
查看私有化方案

差异在任务结束之后

能干活的 agent 很多。同时做到持久角色、任务后自我改进、真沙盒干活、到点主动和整栈私有化的,我们还没见到第二家。

持久角色与记忆任务后自我改进(评测、代练、版本)真沙盒干活到点主动干活整栈私有化
createrole
Manus
Lindy
Character.ai

基于各产品公开资料整理,如有出入欢迎指正。

想看它一周后比今天更懂你,先申请一个体验账号

体验平台不开放注册。告诉我们你想用它做什么,通过后我们发开通邮件。