大语言模型猜你喜欢什么、是什么样的人——问题在于,它们猜出来的东西有将近一半是纯属虚构。一项最新研究把这种靠不住的个性化行为称为过度推断(OI),并亮出了一组让行业无法回避的数字:在专门设计的MirageBench基准测试中,12个主流模型有35%至49%的推断被判定为编造,均值直接拉到41.6%。也就是说,你让模型为你定制一个回复,它可能顺手给你贴上好几个你根本没提过的标签。
这项来自社区热议论文的发现,更狠的地方不在这组百分比,而在于一个反直觉的负相关。研究者同时让模型自我评估其过度推断的程度,然后拿去和外部人工评测的结果比对,得到的斯皮尔曼相关系数是-0.60。负号意味着什么?模型自己越是说“我做得不算过头”,外部判断它过度推断的可能性反而越大。自我报告的可信度成了一个彻底的误导信号。那种指望模型通过自省来校准自身输出、以此保障安全与对齐的思路,在这里被撕开了一道口子。
MirageBench的测试逻辑并不复杂:给模型一段稀疏的用户对话,让它推断用户的属性,然后由人逐条核查这些属性是否有证据支持。结果大量属性属于凭空生成——比如用户只是聊了下天气,模型就能生成用户职业、政治倾向甚至心理特质。这些虚构属性在个性化服务里很容易被包装成“深度理解用户”,实则只是统计上听起来顺耳的幻觉。研究传递的信息很明确:个性化系统不能靠模型自己背书,外部验证才是唯一能站住脚的基础。在一个把个性化奉为产品护城河的产业里,这条结论值得每个做推荐、做对话、做智能体的人停下来想想。

