约 5 分钟
夜校:为什么数字员工需要自己的考核体系
数字员工的成长不能只等用户反馈。夜校按职业定位生成考纲与分层锚定的题库,出题人与学生分离,练习集与真题库分池,评测分数成为代练的外部锚。这篇文章讲背后的设计取舍。
- 夜校
- 评测
- 设计
数字员工上岗之后,最难回答的问题不是「它今天做了什么」,而是「它明天会不会做得更好」。要回答这个问题,先得有一把尺子。夜校就是这把尺子的来源:按职业定位生成考纲与题库,让评测有据可依,再让代练围绕分数改进。这篇文章讲它背后的几个设计取舍。
不能只等用户反馈
最直观的成长信号是用户反馈:用户不满意,数字员工就改。我们没有把它作为主发动机,原因有三。
第一,很多用户不会用 AI,甚至问不好问题。反馈稀疏、含糊,很难变成可执行的改进目标。
第二,用户反馈只覆盖用户碰到过的任务。没被问到的能力永远测不到。
第三,反馈到达时问题已经发生。对企业用户来说,这个代价不低。
所以成长的发动机必须是产品自己的考核体系:主动办学,不等用户开口。用户反馈可以在后面作为补充的题源,但不是起点。
从职业定位到考纲
每个数字员工的灵魂档案里有职业定位与职责描述。夜校以此为输入,先联网检索这个职业在真实世界的工作任务形态,再蒸馏成一份考纲:能力维度乘以题型乘以难度,每个格子里填题数。题型包括问答、计算、分析文档、图表报表。
考纲是版本化的。每次生成产生一个新版本,旧版本保留。职业定位变了,可以重新生成。
考纲之后是出题。出题人模型按考纲的分布逐格出题,每道题带题面、题型、参考答案、评分要点与难度。生成的题直接进入题库,与人工录入的题放在一起,可以改题、改答案、停用。人工不需要逐题录入,只做抽查。
三级锚定
自动出题最大的风险是标准答案不可靠。如果参考答案是模型凭印象写的,评分就成了模型给模型的印象打分,没有任何外部依据。
我们按题型把答案的可靠程度分成三级,每道题都标注属于哪一级。
| 层级 | 适用题型 | 锚定方式 | 可靠性 |
|---|---|---|---|
| L1 可执行验证 | 对账、数据计算 | 答案可确定性判定对错 | 最高 |
| L2 检索锚定 | 事实、流程类问答 | 标准答案必须引用真实检索出处 | 中 |
| L3 评审清单 | 分析文档、图表等开放交付物 | 没有唯一答案,改为逐项打勾的清单 | 最弱,配人工抽查 |
两条纪律随之而来。
L2 的题引不到有效出处就直接丢弃,不降级为 L3。检索不可用时干脆不出 L2 题。
L3 不允许阅卷模型给「感觉分」。清单写明结构是否完整、数据是否有真实引用、结论是否有依据,阅卷逐项核对。这一层最弱,所以人工抽查优先看这里。
练习集与真题库分池
题库分成两个池。练习集面向日常改进,真题库对学生隐藏,只用于回归验证。
分池的目的是防过拟合。如果改进过程对着考题做,分数会涨,能力未必涨。把一部分题隐藏起来,改进后再用它们验证,才能区分「学会了」和「背下来了」。分池按比例分层轮转,两个池的题型与难度分布保持一致。
评测和代练的门禁两个池都算。隐藏是针对改进过程的,不是针对考核。
出题人、阅卷人与学生分离
出题人用更强的模型档位,与数字员工绑定的对话模型分开。阅卷的 judge 模型同样与答题模型分离,答题的模型从不给自己打分。
这是一条硬规则,依据是自我改进领域反复出现的失败模式:生成者与评判者共享同一个模型时,会形成自我确认循环,分数上升而能力停滞甚至倒退。分离出题人、阅卷人与学生,等于给系统一个不随学生一起漂移的参照物。
阅卷本身也有约束:judge 模型对照人工可审阅的参考答案给出 0 到 100 的分数,每题附一句评语说明扣分点。分数有据可查,评语可以追溯到具体的题。
评测分数如何成为代练的外部锚
有了题库与分数,代练才有落脚点。
代练由用户发起。它先用当前灵魂作答并打分,得到基线;再在快照副本上生成一份候选灵魂,用同一套题、同一个阅卷模型重新打分。只有分数严格高于基线的候选才会送到用户面前等待批准。用户点应用之前,数字员工本体没有任何改动。
每一次灵魂修订都是完整快照,可以随时回滚到任一版本。改进不是不可逆的操作,而是版本历史里的一条记录。
这就是「有界自我改进」的含义:改进的目标由外部考核定义,改进的结果由同一考核验证,每一步可回退,人在环上做最终裁决。
尚未实现的部分
设计稿里还有几件事,目前没有做,写在这里避免误解。
- 考试在沙盒里跑完整的工作回合,让评测覆盖记忆、技能与工具调用。目前评测是模型直接作答。
- 补习与再考的自动循环:阅卷意见转成安装技能、写入记忆等动作,补习后再考,达阈值收敛。目前代练只改灵魂,不改技能与记忆。
- 夜间自动刷新考纲与自动考试。目前夜校与代练都由用户手动发起。
这些是同一条路线上的后续阶段。先把考纲、锚定、分池与分离这几条基础纪律立住,再谈自动化。