OpenAI 这次把评测里最难啃的一块摆到了台面上:MentalHealthBench 是一个完全开放的基准,用来衡量 AI 在真实心理健康对话中的表现。它不是关起门来写几道题,而是由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。这个规模本身就说明了一件事——心理健康对话没有统一的正确答案,想让评测站得住,先得让不同文化、不同语言的临床从业者都点头。
真正难的不是收集对话,而是打分。一段咨询式的回应里,共情、边界感、风险识别、要不要建议就医,每一项该怎么加权?权重稍微一变,结论就可能翻盘。MentalHealthBench 把评分权重设计和构建方法一并公开,研究者可以照着复现,也能在此基础上做自己的扩展。对做模型的团队来说,这比一个孤零零的分数值钱得多。
开放发布才是这次更值得注意的信号。心理健康方向的模型评测长期处于碎片化状态,各家拿自己的题库证明自己的模型好,外界很难验证。把构建流程摊开,争议至少有了共同的坐标系。当然,基准不等于临床结论,模型在对话里说得像样,也不意味着它能替代任何一位心理医生。但先有一把公开的尺子,总比继续各说各话强得多。

