Greg Brockman 在 X 上扔出一句话,信息量不轻。他说 GPT-Live 是一种全新的实时音频架构——能让 ChatGPT 在说话的同时继续聆听。这意味着什么?你再也用不着等模型“想”完了再开口。音频流不断,哪怕模型正在深度推理,或者调外部工具。语音交互里那个最让人出戏的停顿,被干掉了。
看懂本质才会明白这有多狠。OpenAI 的团队不是修修补补,而是从客户端到模型把整个语音栈推翻重来。传统的语音助手,录音、转文本、模型跑、再合成——每步都是阻塞的,像接力掉棒。但 GPT-Live 把音频当作持续流动的信号,模型在其中实时“游泳”。更绝的是工具调用也不打断对话,你可以让 ChatGPT 查天气,它一边检索一边还能用自然语调说“我看看”。这可不是加个插件的事,这是流式推理、实时语音合成和信号处理,在同一个低频延时管道里硬核耦合。
方向已经很清楚了:真正的实时智能,容不下哪怕半秒的静默。陪伴类应用最先嗅到香,因为对话的呼吸感和情绪连贯性不再被算法割裂;在协作场景里,边动手边聊 AI 也变得顺滑。当模型学会像人一样边听边想边说,它就从“发指令”的工具,变成了能跟你真正聊天的东西。

