人类数据需要 harness 级的纪律
Benchmark 依靠 harness 纪律赢得信任:每个数字有出处、方法可复现、过程有记录。关于“人”的数据值得同样的待遇——授权写进 schema、读取留痕、撤回真实有效。

评测的爆发给这个行业留下了一条经久不衰的教训:没有出处的数字只是装饰。Benchmark 变得有用,恰恰是 harness 让它们变得可追溯的那一刻——每个分数链接到产生它的运行,每种方法公开可查,每次复跑可以复现。我们信任模型分数,不是因为信任实验室,而是因为 harness 让主张变得可检验。
关于人的数据值得同样的纪律。一份职业画像就是关于一个人的成套主张,而消费这些主张的系统会据此采取行动。如果 benchmark 分数都需要出处,那么关于一个人的主张需要的只会更多。
可追溯,贯穿两端
在 ProfileClaw 里,每一条结论都能向下追溯到证据。一个维度分数链接到它背后的已答题;一份摘要引用它所压缩的分数。画像里没有孤儿主张——“这从哪来”永远是一次查询,而不是一场辩论。
对外同样如此:每一次读取都在记录上。哪个客户端、哪些层、什么时间、依据哪个版本的授权——有日志、可导出、数据的主人自己可见。
授权活在 schema 里
大多数产品把授权当成数据库前面的一道勾选框。授权失败,恰恰就失败在这个位置上:勾选框只在门口看守一次,而数据在门后一活就是很多年。
我们把授权放进 schema 内部,放在它所看守的数据旁边。Scope 直接挂在层上——某个客户端被授予摘要,或者分数,或者什么都没有——而每次读取都按照当前存在的授权在请求时求值。不存在一份“在规则改变之前就流出去”的数据副本,因为客户端是穿透这个层来读的,从来不把数据整包带走。
真正有效的撤回
撤回是检验一切授权故事的试金石。如果系统只在导出时检查授权,那撤回就是一场表演。
因为访问是一个“读取时求值”的属性,关掉它是件无聊的事:下一个请求按更新后的授权求值,失败。审计日志记下这次失败。不需要“召回”任何东西,因为没有任何东西被复制走。
机构真正问的是什么
企业客户不问氛围,问的是性质。按我们的经验,反复出现的需求是这几条:
- 聚合而不暴露——教练和管理员看到的队列视图,默认封存成员的原始作答;
- 按角色的 scope——教练可读的与管理员可读的不同,由层来强制,而不是靠信任;
- 有期限的保留——数据保留一个明示的窗口,删除真正排上日程,而不是停留在承诺里;
- 导出——本人自己的记录,以可迁移的格式敞着拿走。
这些没有一条是政策文档。每一条都是中间层要么用代码强制、要么根本不具备的性质。
对人类数据的信任不会经由隐私政策到来——每个人都同意它,没有人读它。信任会以 benchmark 信任到来的方式到来:当 harness 让每一条主张可查、每一次读取留痕、每一次撤回为真。