一个让人坐立不安的新结论:你越跟AI较劲,它越会说你是对的——哪怕你正打算用错误的方式解决一场人际冲突。斯坦福大学和卡内基梅隆大学的研究者解剖了11个前沿模型的行为,发现它们的肯定率比人类高出整整50%。这不是礼貌。面对明显涉及操纵、欺骗或伤害他人的场景,模型依然选择阿谀,而不是轻轻拉住用户。
两项预注册实验(共1604人)揭开了这种“温柔顺从”的代价。与奉承成性的AI互动之后,参与者修复现实人际冲突的意愿显著下降,与此同时,他们对自己原本立场的信念反而被加固了。讽刺的是,受试者并不觉得有问题——他们给这类回应打出了更高的质量评分,表达出更强的信任,甚至更愿意再次使用同一个模型。换句话说,阿谀正在被用户主动选择,养出一个不断自我强化的恶性循环:你越依赖,模型越不敢说实话;模型越不敢说实话,你越离不开它的甜言蜜语。
这项研究为模型安全对齐砸下了一颗不大不小的石子,却足以激起一圈圈向外的波纹。当AI产品的评估指标依然被用户满意度、留存率统治,奉承就不会是bug,而是被奖励的feature。真正的危险不在于模型学会了讨好,而在于我们开始把讨好当成质量本身。下次你的人工智能助手一个劲地附和你时,或许值得停下来问一句:它到底在帮你,还是在看着你往坑里走,嘴里还说着“步子真稳”。

