Anthropic 的前沿红队(Frontier Red Team)刚刚放出一组评测,名字读起来像一份军方简报:情报定位,常规武器。他们把几个前沿模型塞进模拟场景里,让它们从一张照片推断拍摄坐标、把散落在不同平台的账号拼成同一个人,也试着让它们接管无人机的最后一段航程、在 GPS 被压制的条件下找路。结果相当分裂——凡是靠知识和检索吃饭的任务,模型已经越过了人类基线;凡是靠手感和实时判断的任务,它们还差得远。
情报定位:机器翻得比人快
先要把这两组任务的区别说清楚。情报定位考验的是模型脑子里装了多少世界知识,常规武器考验的是它在实时环境里做判断的手感。一个是检索加推理,一个是控制加操作。这次评测的价值,恰恰在于它把这两件事分开了测。
照片定位:门槛已经跨过去
任务设定很朴素:给模型一张不带 GPS 元数据的照片,要求它给出拍摄坐标。模型能用的线索只有画面本身——路牌的字体、电线杆的样式、植被类型、建筑立面、山脊走向,甚至阴影的方向。Anthropic 用“是否落在目标点 25 公里范围内”这类硬指标打分,几个前沿模型的成绩都超过了他们设置的人类对照组。这个结果的意义不在于模型变成了精准的定位仪,而在于过去需要一名分析师对着地图比对半天的工作,现在成了一次几秒钟的推理调用。门槛不是被推高了,是被整体搬走了。
账号关联:把碎片拼成一个人
另一项任务更像拼图。同一批素材里混着来自不同平台、不同化名、语种不一致、写作习惯有细微差别的账号,模型要判断哪些背后是同一个人。这类能力对情报机构、执法部门,乃至做反欺诈的商业团队都有直接价值。模型在一部分子任务上的表现同样高于人类基线,尤其在需要跨语言和大规模横向比对的时候——一个人盯几百个账号会累会走神,模型不会。
为什么偏偏是这两项扩散得最快
因为它们不需要模型动手。定位和关联都是纯信息处理:输入文本和图像,输出判断。中间没有机械臂,没有执行环节,也没有物理世界那种带延迟的反馈。这恰好是当前模型最擅长、同时也最难设防的地带。你没法用一个“禁止定位”的过滤器拦住所有地理推理,因为那些推理看起来跟普通的看图说话没什么区别。
无人机那条线上,模型反而输给了人
只看前面那部分,很容易得出“AI 已经能顶半个情报分析员”的结论。第二组评测把这个结论刹住了。
末段制导:人类操作员仍然更强
Anthropic 搭了一个模拟环境,让模型接管无人机的最后一段飞行:目标就在视野里,但需要根据实时画面不断调整航向,处理遮挡、抖动和目标移动。人类操作员在这项任务上保持领先。模型不缺知识,缺的是对连续画面的稳定控制,以及在误差逐步累积时依然守住判断的能力。看一帧图和操作一个正在移动的东西,本来就是两种本事。
GPS 被干扰之后靠什么走
干扰环境下的导航是另一个测试点。卫星信号没了,模型得靠地形、地标和视觉线索维持航向。这项能力介于前面两者之间:场景化的推理它做得不差,但产出是断续的、会漂移的,拿来跟真实导航系统那种连续、带容错的输出相比,差距依旧摆在明面上。
投送链条上的短板在物理世界
把任务链条拉长到投送环节,模型真正能贡献的部分集中在规划和文字工作上——航线设计、参数计算、材料选择。一旦进入装配、调试、现场应变,能力曲线就塌下去了。这组评测共同指向一个判断:现阶段的瓶颈不在“想”,而在“做”。
分数之外,三个更值得琢磨的信号
知识密集的任务先失守
这组结果给出的排序相当反直觉。人们习惯以为越“动手”的任务越危险,实际上最先被攻破的是那些纯粹依赖知识积累的环节。原因不难理解:预训练已经把海量地理、语言、社会常识灌进了权重,模型要做的只是把这些知识调出来做匹配。而需要闭环控制和实时反馈的能力,模型没有可以偷懒的捷径。
“模型会拒绝”不等于安全边界
在模拟评测里,模型确实会对一部分请求说不。但拒绝是概率性的、随场景波动的,换个提问角度、换种语言描述,结果就可能翻转。把安全寄托在“模型有时候会拒绝”上,等于把风险交给一枚硬币。真正能兜底的还是部署层面的限制、访问控制和监测,而不是模型自己的心情。
真正改变的是门槛,不是天花板
Anthropic 在结论里强调的担忧,不是某个模型突然具备了专家级的情报或武器设计能力——评测显示离那还远。真正的变化在于门槛:过去需要专业训练才能完成的工作,现在一个没有相关背景的人,借助模型就能做出及格线以上的结果。能力上限没怎么动,能力下限被抬起来了。而大规模风险从来都是下限决定的。
这些数字最终该落到谁手上
评测本身不会让任何人更安全,怎么用它才会。
对模型厂商:把这类评测变成常规动作
前沿红队的意义不在于发布一份报告,而在于把“测什么”固定成流程。情报定位、地理定位、账号关联这些方向,过去很少被写进标准测试清单,因为它们看起来不像 CBRN 或网络攻击那么刺眼。但只要模型在持续变强,评测就必须跟着换题,而不是守着几年前那张卷子反复打分。
对政策圈:谁来定义“有用”
这组评测最难的地方在于,它测的每一项能力都同时有正当用途和不正当用途。地理定位可以用来救灾、核实新闻、保护野生动物;账号关联可以用来打击人口贩运,也可以用来追踪异见者。同一条能力曲线,落在不同的制度环境里,产生的后果完全不同。所以接下来的争论不会停留在“模型会不会做”,而会转向更麻烦的问题:谁能用,用到什么程度,由谁来判断越界。
Anthropic 把这份评测公开,本质上是在把问题提前摆到桌面上。模型的能力边界还在移动,而这次的结果至少说清了一件事:该盯紧的不是模型会不会自己造出武器,而是它正在把多少原本需要专业训练的门槛,变成一次普通的对话。

