Anthropic 从来没干过这种事——让一个 AI 关掉中间件,直接从传感器像素一路控制到旋翼转速,在室内实打实地操纵一架四旋翼无人机去追踪某个指定的人。这个新基准叫 Drone-Bench,与 Andon Labs 联合推出,在圈内扔下了一颗不是技术、而是伦理当量的炸弹:这是 Anthropic 首次公开的端到端无人机监视任务评测。Fable 5 几乎通关,唯一卡住它的是 3D 地图重建的微小瑕疵,而六个月前的模型在这个任务链上连一致性都稳不住。
任务被拆得极其干脆:三维场景重建、自身定位、路径导航、人体检测、持续跟随——五个子任务环环相扣,任何一个断掉整个链条就散架。整套评估跑在软件复现环境里,速度快到可以当成日常回归测试。这种设计立刻暴露出不同模型的“智商”差距,不是多模态问答那种坐在电脑前的聪明,而是物理空间里连续的、不可回滚的操控力。研究人员原话很克制,但数据很直白:任务难度已经足够区分浅层的模式匹配和真正的空间感知,而且最近几次迭代让模型在六个月内从磕磕绊绊跳到近乎连贯,提升曲线陡得让人既兴奋又不安。
不安是对的。一个能自主定位、规划路径并持续锁死目标人物的无人机系统,技术瓶颈正在以肉眼可见的速度瓦解,可安全框架连像样的刹车踏板都没装好。安全压力远比技术潜力更紧迫,这是整个 Drone-Bench 释放出的最刺眼的信号。现在还只是室内测试,还没有 payload,还打着基准的旗号——但谁都知道,门一旦被推开一条缝,后面的事情就不是写论文的人能决定的了。

