去年 10 月,OpenAI 发过一篇讲 ChatGPT 如何应对心理危机对话的博客(Strengthening ChatGPT’s responses in sensitive conversations):170 多位精神卫生专业人士参与,不当回复大幅下降。报道大多盯着改进幅度;至少在我看到的讨论里,很少有人提文中另一个数字:这些临床专家彼此打分的一致率只有 71% 到 77%。也就是说,大约四分之一的情况下,专家们对「这条回复妥不妥」意见相左。
OpenAI 把这个数字当背景交代。斯坦福的一个团队把它当成了研究对象:如果专家本来就合不上,那用专家打分造出来的「安全评测」,测的到底是什么?
这篇论文(arXiv:2601.18061,已被 ACM FAccT 2026 接收,FAccT 是 ACM 的公平·问责·透明会议)给出的答案不太舒服:专家分歧是结构性的,不能当噪声处理;而把分歧平均掉之后得到的「标准答案」,不属于任何一位专家的临床判断。
研究怎么做的
团队先造了 90 条合成提问,不含任何真实用户数据:10 类高风险场景(支持自杀意念、非自杀性自伤、强化绝望感、附和幻觉、配合妄想、鼓励躁狂行为、鼓励回避、支持物质滥用、强化强迫行为、强化身体意象扭曲),另设「惩罚 ADHD 行为」一类作低风险对照;每类按临床严重程度(低/中/高)和表达直接程度(三档)组合出 9 个变体。严重程度的分档对齐 DSM-5 和哥伦比亚自杀严重程度评定量表(C-SSRS)这类临床工具,不是拍脑袋。
拿这 90 条提问去测四个模型:GPT-5、Claude 4 Sonnet、Grok-4、Llama 3.2,共 360 条回复。再请三位有执业资格的精神科医生,按一张校准过的八因子评分表独立打分:两个安全因子(潜在伤害的严重度、发生可能性),六个质量因子(临床正确性、相关性、积极倾听、共情与不带污名、边界与免责声明、可行动性),五分制。
衡量「不同人打分是否一致」的标准工具是组内相关系数(ICC,1 为完全一致;学界常用惯例是 0.5 以下即视为一致性差,这篇论文用了更宽的 0.40 作判定线)。结果:八个因子的 ICC 全部落在 0.087 到 0.295 之间。另一个一致性指标克里彭多夫 α(Krippendorff’s α,0 相当于随机水平,学界常用的可用底线是 0.667)更难看:四个因子是负值,「边界与免责声明」低到 −0.203,比随机打分还不一致。没有一个因子达标。
对这种结果,自然的怀疑有两个。样本太小?研究者在美国精神医学会(APA)2026 年会上向现场 100 多位精神科医生做了同题投票,分裂依旧(斯坦福 HAI 报道)。某位医生敷衍了事?如果是随机噪声,分歧应该均匀散布;实际上分歧集中在风险最高的类别:自杀与自伤类回复的打分离散度(平均绝对偏差 0.598 和 0.566)明显高于 ADHD 这类低风险对照(0.461)。最需要专家意见一致的地方,恰恰最合不拢。
分歧从哪来:立场,不是水平
论文里有个具体案例。同一批回复的「边界与免责声明」因子(即模型有没有讲清「我不是治疗师」、该不该转介专业帮助),一位医生给 92% 的回复打了 2 分,几乎全判不合格;另一位的打分散布在 3 到 5 分,大体放行。这不是谁看走了眼。争的是一个规范问题:AI 面对情绪危机中的用户,到底必须多明确地申明自己的局限?一派认为不反复申明就是失职;另一派认为模板化的免责声明会把正在开口求助的人推开。
作者把分歧归纳为三套互不兼容的临床取向:安全优先(宁可打断对话也要转介、声明局限)、以互动为中心(先维持关系,让人愿意继续说下去)、文化情境导向(同一句话在不同文化语境里的风险信号和恰当回应不同)。同一条回复,安全优先的医生嫌它没转介,以互动为先的医生赞它没把人赶走,分数自然相反。合著者、斯坦福精神病学临床助理教授 Nina Vasan 的说法:「分歧是结构性的,不只是数据里的噪声或偏差」,「这是专业判断之争」。
平均值为什么有害
第一层,平均数不代表共识。论文的表述:当分歧如此系统,平均产生的是「不属于任何一位专家、来历不明的新价值框架」。好比两位医生一个主张开 A 药、一个主张开 B 药,各开半剂等于一张谁都不会开的处方。
第二层,这些标签会被下游继承。RLHF(用人类偏好打分训练模型的方法)依赖的奖励模型若用这种平均标签训练,学到的是打分者个人习惯与真实质量的混合物;Llama Guard 一类安全分类器(靠人工标注数据训练、在产品里拦截危险内容的模型)同理。论文的原话:这些训练标签「恰恰在安全分类最重要的领域可能不可靠」。
第三层,我认为最实际的一层:它让安全分数之间的比较失去意义。汇总 ICC 只有 0.269。照此推断——这是推论,研究用的始终是同一组三位医生,论文自己也呼吁在更大、构成不同的评审团上复现——换一批同样合格的精神科医生,同一个模型可能得到明显不同的分数。厂商报告里「模型 A 比模型 B 安全分高几个点」的说法,那点差距可能在很大程度上是打分者构成的产物。不披露评分者一致性,分数就没法解释。
审核行业早就知道一致性是造出来的
我的本职是内容审核,这套问题我天天见。审核行业从不假设标注员天然一致。一致性是被制度造出来的:先有一份几十上百页的 policy 把边界写死,再靠校准会、质检抽查、争议升级机制把人磨到一致。即便如此,至少在我经手的范围里,边界样本上的分歧从没真正消失过,只是被一条明文规则强行裁决了。而那条规则怎么划、误杀和漏放怎么取舍,轮不到测量来回答,那是产品和价值观的决策,而且不同用户群体、不同文化语境下的答案还不一样。
对照之下,「请几位专家打分取平均」式的 AI 安全评测,等于把审核管线里最难的一步悄悄跳过了:本该有人拍板决定采用哪套标准并为此负责,现在让算术平均替人做了价值决策,还不留决策记录。
论文给出的建议,归纳起来是三条,实质都是把这一步补回来:保留分歧而非平均掉(第一作者、斯坦福博士后 Kiana Jafari 的原话:「保留分歧,别把它平均掉」);要求开发方披露评测采用了哪套临床框架;对不同框架分别建模,而非揉成一个分数。但得说清楚:这些做法不会让分歧消失。三套临床取向互不兼容、不能直接平均,全球化产品面对的文化差异只会更甚。这是本质困难,更好的统计方法消不掉它,能做的是把选择摆上台面,让「采用了谁的标准」变成一个可以被追问的显性决定。
这项研究自身的边界也要交代:360 条都是对单条提问的一问一答,评的是单轮回复;真实的危机对话是多轮的,这项研究没有测。多轮场景的安全问题本身已有人在做——比如测支持边界在多轮心理对话中逐步松动的 The Slow Drift of Support,以及由临床人员标注多轮危机对话的 CRADLE-Dialogue 数据集——但专家分歧在多轮场景会放大还是收敛,我没检索到直接测这个问题的研究,这是个空白。三位评分者确实少;研究者在 APA 年会现场向 100 多位精神科医生做的投票不是严格的复现研究,但结果同样分裂,「多加几位专家就能收敛」至少在这次尝试里没有出现。
结论
我刚写的 MIT Sloan 那篇 AI 理财建议研究(对照组里没有人类顾问)里说过,评测设计决定结论能被解读到哪一步。这篇走得更深:连「标准答案」这层地基都未必存在。下次看到「经 N 位临床专家评审」的安全声明,先问三件事:几位专家?一致率多少?用的哪套临床框架?OpenAI 至少把 71–77% 写了出来;论文也建议此类评测一律报告评分者间一致性,我认为这应该成为行业披露的下限。安全分数背后没有中立的测量,只有被声明或者被隐藏的立场。
参考来源
- Stanford Study Exposes Major Flaw in AI Mental Health Safety Testing | Stanford HAI — 选题来源;APA 年会现场 100+ 精神科医生投票、三套临床取向的归纳、Jafari(第一作者、斯坦福博士后)与 Vasan(精神病学临床助理教授)身份及引语、「三位委员会认证精神科医生评 360 条回复」「无真实用户数据」表述、FAccT 2026 接收信息
- Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing(arXiv:2601.18061) — 论文本体;四模型(GPT-5、Claude 4 Sonnet、Grok-4、Llama 3.2)× 90 条提问、高风险场景清单与 3×3 设计、八因子评分表、ICC 0.087–0.295(汇总 0.269,判定线 0.40)、四因子 α 为负(边界因子 −0.203,底线 0.667)、自杀/自伤类平均绝对偏差 0.598/0.566 对 ADHD 类 0.461、「92% 打 2 分」案例、对 RLHF 奖励模型与 Llama Guard 类分类器的推论、「平均产生无人持有的新价值框架」表述、报告评分者间一致性的建议
- Strengthening ChatGPT’s responses in sensitive conversations | OpenAI — 170+ 精神卫生专业人士参与、临床专家间一致率 71–77%(页面有反爬,未能直接打开,数字经多家转引核对,见核查点)
- OpenAI strengthens ChatGPT mental health guardrails | Becker’s Behavioral Health — OpenAI 71–77% 一致率数字的转引核对
- A Guideline of Selecting and Reporting Intraclass Correlation Coefficients for Reliability Research(Koo & Li 2016) — ICC 解读惯例(0.5 以下为一致性差)
- The Slow Drift of Support(arXiv:2601.14269)、CRADLE-Dialogue(arXiv:2606.10380) — 多轮心理对话安全的邻近研究,用于说明「专家分歧随轮次变化」仍无直接研究