返回博客

测评是 schema,不是问卷

自陈式测评本质是一套测量 schema:可版本化的计分、作为一等公民的置信度、面向不同受众的独立分层。问卷只是界面——schema 才是产品。

2026年8月14日ProfileClaw TeamProfileClaw Team
测评是 schema,不是问卷

从外面看,职业测评像一份带着观点的表格:几十道题、几个字母、一份 PDF。正是因为这种理解,大多数测评工具最终死在文件夹里——它们优化的是那份产物,而不是数据。

ProfileClaw 从相反的方向构建。测评是一个测量 schema,问卷只是它的界面。真正有趣的事情都发生在最后一道题之后——数据如何被结构化、版本化、供给。

测评是一种测量

以 RIASEC 为例。它不是六个字母,而是几十道已作答的题目收敛成六个维度分,每个分数带着由作答一致性与极端程度推导出的置信度。大五用五个因子对工作风格做同样的事;我们的价值观与技能测评又各是一张带独立计分方法的表。

具体地说:48 道已答题变成 6 个兴趣维度;四份测评的 22 个维度收敛成一份画像。题目只是采集机制——schema(维度、分数、置信度、版本)才是下游系统真正消费的东西。

三层,三种受众

最关键的设计决策是这个:原始作答、维度分数、叙事摘要,是三种不同的产品,作为独立的层分别存储与供给。

  • 作答是证据地层——最敏感的一层,用于审计与重新计分,几乎不适合任何消费方;
  • 分数是定量层——可比较、可排序、对机器友好;
  • 摘要是叙事层——大多数 agent 和人真正想要的东西,且是可以直接引用的语言。

集成方读取的不是“这份数据”,而是某一个层。选哪个层,本身就是授权决策。教练可以被授予分数;问答 agent 拿到摘要;除非本人明确同意,谁也拿不到作答。

版本不是可选项

测评方法会改进。计分方法会重新校准,题目会打磨。如果你的中间层没有 schema 版本,那么每一次改进同时也是对历史的一次静默改写——昨天的结论,被明天的方法悄悄重新解释。

每一份 ProfileClaw 画像都带版本。当计分方法变化时,对旧作答重新计分是一个显式的、可见的动作——画像带着完整历史迁到新版本,绝不会被原地重新解释。任何下游都可以固定、比较或迁移。

置信度,否则等于没说

自陈数据有信号质量。一个作答前后不一的人,产出的和作答干净稳定的人是不同种类的真相,而把这种差异抹平的中间层是在用四舍五入撒谎。

所以置信度作为一等字段,与每个分数一同交付。读到“艺术型 0.84、置信度 0.81”的消费方可以相应地加权——或者追问,或者复核。没有置信度的数字会引来下游的过度自信;我们宁可把不确定性交出去,也不把它藏起来。

一个信封,两种传输

同一份画像,走 REST 和走 MCP 读到的形状一致。程序拿到 JSON;agent 客户端拿到原生工具。一个规范形状,没有各说各话的方言——对不同客户端说不同话的中间层不是中间层,是一个披着营销预算的兼容性问题。

问卷从来不是产品。它只是门。门后面那个 schema,才是让人类数据可以被 harness 真正依赖的东西。