Grok 开始看视频了。不是读文件名、不是抓取标题字幕,是实实在在地“看”画面里发生了什么。埃隆·马斯克亲自扔出了一条演示——上传一段视频,Grok 能像描述一段文字那样,把视频中的动态、场景甚至逻辑链条给你掏出来。这件事之所以值得单独拿出来说,不是因为“又一个模型能处理视频了”,而在于 xAI 这次把视频丢进了同一个通用理解引擎里,没有为视频单独挂一个专用小模型,也没有让分析过程退化成抽帧看图。它就是在对话界面里,直接对一段视频做连贯描述和推理,跟你让它看一篇长文没什么两样。
实际分享一下就能看出端倪:用户上传车辆行驶视频,Grok 不仅告诉你车型、道路环境,还能抓取到车辆变道时后方车的反应。这种连贯理解,对于从视频素材中快速提取事件脉络的人来说,比逐帧截图再问GPT有用得多。当然,演示里没上难度——没有一小时长的纪录片,没有带复杂字幕和多语言交杂的会议录像。长视频、高噪声场景下的稳定性还有待检验,但基本姿态已经摆出来了:视频从此是对话的一部分,不是附加件。
多模态这条路上,各家此前争的是图片和文档,现在 xAI 直接用 Grok 把战火烧到了视频流。这意味着竞争不再是“谁能看懂一张图”,而是谁能像水一样渗透进信息密度最高的动态媒介里。对内容创作者、调查记者、甚至只是每天要消化大量视频资料的人来说,一个能真正读懂视频内容的助手,远比再多一个聊天机器人实在。剩下的悬念,无非是它能吞下多长、多复杂的画面,以及何时对所有人敞开使用——而照马斯克一贯的节奏,这个“何时”通常不会太久。

