Google DeepMind 又一次把边界推向了物理世界。他们最新放出的 Gemini Robotics ER 2,是一个基于 Gemini 的机器人基础模型,核心叙事围绕三件事:视频理解、工具编排和多机器人协作。听起来很猛——一个能看懂操作视频、拆解任务步骤、再指挥多台机械臂协同执行的通用大脑。但看完整篇博客,你会发现一件事:全是能力描述,没有一条实测数据。
这不是 DeepMind 第一次在机器人上画大饼,但这次饼的半径明显更大。他们试图让模型理解人类演示视频里隐含的因果链条,然后把抽象任务下发给不同硬件去执行。换句话说,模型不仅要“看懂”,还要能“指挥”。这个方向并非孤例,整个具身智能赛道都在往通用大脑上挤,但 DeepMind 挂着 Gemini 的金字招牌,自然把期望值拉到了天花板。问题在于,没有基准测试、没有成功率、没有对比实验,所有的“step change”都还停留在句子层面。做机器人的人都知道,从视频里的优雅推理到真实产线上的扭矩波动,中间隔着几百个坑。
这并不意味着 Gemini Robotics ER 2 没有价值。它的路线图清晰,野心也足够大,只是现阶段更像一份高级白皮书。对于产业里的团队来说,最好的策略不是兴奋,而是建个追踪条目。等下一次更新时,再看 DeepMind 能不能让这些漂亮的概念,在扭矩和碰撞的物理约束里跑起来。

