计算机操作智能体一年前还在及格线上挣扎,现在已把人类甩在身后。a16z 追踪的 OSWorld-Verified 基准里,最强选手 Claude Fable 5 拿下 85%,人类测试者大约 72%,而去年这时候最好成绩是 42%。数字很直接——让 AI 替你操作浏览器、桌面应用,不再是一个“也许明年”的幻想。但这组数据只是明面上的热闹。
真正值得细读的是 a16z 藏在数据背后的判断:基础模型正在成为一层可替换的底衬,上层的上下文、验证与故障处理才是真正的壁垒。这比任何性能曲线都冷静。你能抓来一个超强的基座模型,但让它连续可靠地完成真实任务,需要把每一步操作的语义都钉在上下文里,需要能在动作坍缩时自动回弹的故障处理,需要一套让行为结果可校验的验证链。这些“脏活”不会出现在炫目的基准榜单上,却直接决定一个智能体是从 demo 走向交付,还是永远留在演示视频里。
Claude Fable 5 的领先不是偶然。它背后的思路恰恰证明,把力气花在“让模型理解自己正在操作什么”比单纯堆参数量更有效。OSWorld-Verified 的难度升级也很有意思——以前的基准只要求完成操作,现在要验证操作的意图是否正确,这让纯粹的模仿型方案大幅失效。一句话概括当下:能操作计算机不再是新闻,能可靠地、可解释地、出错后还能找回来的操作,才是下一个阶段的分水岭。而这一点,模型本身给不了你答案。

