做语音 Agent 的人这两年都在同一条流水线上拧螺丝:音频先转文字,交给大模型想,再把答案合成为语音。三段拼装,延迟叠加,体验卡在"你说完我才能开口"的乒乓球节奏里。OpenAI 这次在 API 里放出的 GPT-Live-1,就是冲着这套分层架构来的——它一边听一边说,还能把推理和工具调用甩给 GPT-6 Astra 这类后端模型,而前端语音层标价每分钟 0.05 美元。
三段式流水线,第一次被正面挑战
语音助手为什么总像在打乒乓球
问题不在识别率,也不在音色。传统方案靠 VAD 判断"用户说完了没",这个判断本身就要吃掉几百毫秒;识别模型出字、大模型吐 token、语音合成再逐帧输出,链路一长,沉默就变成了尴尬。人在真实对话里平均两百毫秒就开始给反馈,"嗯""对""我在听"这类 backchannel 更是常态。流水线架构给不了这种东西——它压根不知道自己能不能插话,得等上一环把控制权交出来。
同时听和说,改的是底层假设
全双工的关键词是"同时",但真正的变化在状态管理。轮次制对话里,谁在说话是一个外部变量,由代码维护,由超时和静音阈值裁决。GPT-Live-1 把这件事收进了模型内部:音频进、音频出,中间不再被切成离散的回合。它听得见打断,接得住插话,甚至能主动发一个语气词把对话托住。这类行为过去要靠工程 trick 硬凑出来,效果时好时坏,现在成了模型的默认能力。
每分钟五分钱,这笔账得重算
0.05 美元一分钟,一小时三美元。单看数字不吓人,但语音产品的成本从来是被拆开算的:流式识别按秒计费,大模型按 token 计费,合成再按字符计费,中间还夹着一层编排服务的开销和几次失败重试。现在这些被压成了一行单价,报价单干净了,账却要算得更细。对长时间在线的场景——客服、陪练、陪伴类应用——成本模型会明显变形;对每次只聊三十秒的工具型调用,差距就没那么悬殊。别盯着单价,去看会话时长的分布。
脑子交给谁,是个新问题
语音层只负责实时性最强的那部分
GPT-Live-1 的定位很清楚:耳朵和嘴。韵律、停顿、打断时机、情绪色彩这些必须在几十毫秒内决定的东西,它自己扛;需要检索、规划、调工具、跑多步推理的部分,它转手交出去。这个切法看着简单,实则把语音 Agent 的形态从"三明治"改成了两层——实时层和思考层,中间靠一次明确的委派连接起来。
后端换模型,前端不用重训
委派机制的隐性价值在这里。过去换一个更强的语言模型,整条链路都要重新调优,延迟、断句、指令遵循全得重测,语音侧的参数也可能要跟着动。现在思考层是可插拔的,今天的 GPT-6 Astra 明天换成别的,语音层不用动一根手指。代价是多了一跳网络往返:端到端延迟不再由单一模型决定,而是两端加上中间那次调用的总和。工具调用的超时兜底、失败重试、降级话术,也都要在委派这一层重新设计。
正在做语音产品的团队,该想什么
先别急着把现有架构推倒
已经在跑的流水线系统,迁移成本不只写在代码里。提示词、工具定义、评测集、灰度策略、线上告警阈值,全都长在旧架构的骨头上。判断要不要动,看两个东西:用户单次会话的时长,以及"打断"这个动作在日志里出现的频率。如果产品本来就是一问一答的短会话,全双工带来的体验增益有限,先做旁路对比,别直接切流量。
竞争点从模型能力挪到了编排能力
当听、说、打断这些能力被厂商收进单个模型,语音产品之间的差距就不再是谁的识别更准、谁的音色更像真人。真正拉开距离的问题是:什么时候把话交给后端,交给哪个后端,超时了怎么接,用户情绪激动时要不要先安抚再查数据,工具返回一堆噪声结果时该念哪一条。这些决策没有标准答案,也抄不走,它们才是产品本身。模型越标准化,编排越值钱。
评测方式也得跟着换
轮次制时代的评测集,大多是"给一段音频,看输出文本对不对"。全双工下这套指标基本失效——对话的成败往往写在时序里:该插话时插了没有,被打断后多久恢复,语气词是不是落在节骨眼上,沉默超过两秒时有没有主动救场。想认真做这块的团队,得开始攒带时序标注的对话数据,而不是继续堆转写准确率。
全双工不是免费午餐
抢话、误触发,还有"它到底听没听见"
能同时听和说,意味着模型也可能在你没说完的时候抢话。环境噪音、背景人声、电视里的对话,都可能被当成有效输入。轮次制架构里这些问题被 VAD 挡掉了一部分,全双工把判断权交给模型,也把责任一并交了出去。调试这类问题的难度不小:日志里显示的是一段连续音频,而不是清晰的回合边界,你得靠人工听回放才能定位到底是哪半秒出的错。
省钱的前提是用对场景
按分钟计费听起来比按 token 计费更好预测,但"每分钟都在烧钱"这件事,对空闲会话非常不友好。用户把麦克风开着不说话,计时照样走。真要用,客户端就得做静音检测和会话挂起,别把计费时长交到用户的手上。全双工确实抹平了很多工程复杂度,可它没有抹平商业上的取舍——该省的还得自己省,该测的还得自己测,只是现在轮到你决定,这层语音该配一个多聪明的大脑。

