0.2 分。这是评测误差的量级,但 Artificial Analysis 刚刚上线的 Speech to Speech Index,榜首就卡在这个数字上:OpenAI 的 GPT-Live-1 拿到 81.5 分,配置写着 Astra 后端、medium 推理强度;Grok Voice Think Fast 2.0 在 High 档跑出 81.3,排在后面。第三名 80.1,来自 Sol 后端配置。真正值得看的不是名次,是括号里那行小字——冠军开的是中档,亚军开的是满档。
先别急着看名次,看配置
冠军开中档,亚军开满档
推理强度是这两年最被滥用的旋钮。文本场景里多花点 token 想清楚,账算得过来;语音场景里,“想”是要占时间的,而且用户听得见。Grok Voice Think Fast 2.0 把档位拉到 High 才拿到 81.3,GPT-Live-1 用 medium 拿到 81.5。0.2 分可以当噪声处理,但配置不对称是实打实的信息:Astra 后端的底子够厚,不必把推理时间拉满就能顶到榜首。
对一个要卖给客服系统、外语陪练、智能硬件的语音模型来说,这种“省下来的延迟”比排行榜上多 0.2 分值钱得多。用户不会比较分数,用户只会觉得对方反应快还是慢。
Astra 和 Sol 之间那道 1.4 分的沟
换个后端,成绩从 81.5 掉到 80.1。榜单把后端写进配置名,等于公开承认:模型名字已经不是唯一变量。
“后端”这两个字很含糊,实际包含推理芯片、批处理调度、流式输出的分块大小、网络路径,甚至同一批卡上跑的是不是同一版 kernel。文本模型上,这些差异通常被吐字速度掩盖;语音藏不住,因为输出是连续的音频流,任何一次抖动都会变成听感上的卡顿和语调断裂。同一个模型在两套后端上,用户可能给出完全相反的评价。
语音到语音,终于被当成一个整体来测
过去的语音评测习惯拆开做:识别错字率一张表,对话质量一张表,合成自然度再一张表。三段都好看,拼起来未必好用,问题恰恰出在接缝处——识别把语气词抹平,语言模型按纯文本逻辑作答,合成再补一个平滑的语调。Speech to Speech Index 把整条链路当黑盒,端到端给分,这个动作的意义比谁拿第一更大。
串联流水线的老账该清了
每一跳都在丢东西
语音识别转文本、大模型生成回复、文本再转语音,这条三段式流水线跑了很多年。笑声、犹豫、叹气、语速突然加快,在转写成文字的那一刻就没了,模型看到的是一句干巴巴的话,回答自然也是干巴巴的。
延迟还是叠加的。三段各自引入几百毫秒,加起来就压过了人类对话能忍受的轮换间隔。用户感知到的从来不是“识别不准”,而是“这人反应慢、听不懂话”。
端到端换来了什么,又拿走了什么
一条模型直接吃音频、吐音频,省掉中间层,代价是可解释性下降。出了错,你很难判断是听错了、理解偏了,还是语气用错了。工程团队的调试成本会明显上升。所以不少厂商在后台留两套:端到端跑主链路,串联结构留着做兜底和问题回放。
延迟是硬约束,不是优化项
文本场景里,用户愿意等三秒换一段更完整的回答。实时对话不给你这个空间,沉默超过一秒半,对话节奏就散了,接下来是抢话、重复、挂断。这条线一划,推理强度、上下文长度、工具调用次数全都成了受限资源。medium 档能夺冠,放在这个框架下才看得懂:它省下的算力不是重点,省下的时间才是。
排行榜之外,选型还看什么
三个筛子一起用
单看分数,81.5 和 80.1 的差距落在可接受区间内;把延迟和每分钟成本叠上去,排序经常会变。AA 这次把三项数据放进同一张表,对做选型的人最有用的就是这点。操作也简单:用分数砍掉明显不够用的,用延迟砍掉会卡顿的,用成本砍掉算不过账的。三轮筛完,剩下的选项通常只有两三个。
实时对话会最先打价格战
文本 API 的降价打了好几年,语音是新的战场。按分钟计费的语音模型,成本结构和 token 完全不同:同一句话,说得快说得慢,音频时长一样,但背后的算力占用受并发规模影响极大。谁把单位时长的成本压下来,谁就能吃下客服中心、外语陪练、智能硬件这些跑量场景。榜首那 0.2 分,在这个量级的竞争里几乎构不成壁垒。
还测不出来的,才是用户天天骂的
打断、抢话、静音检测、方言口音、多人环境的背景噪声、跨轮次记住上一句话的情绪——这些体验层的细节,目前还没有哪个指数能完整覆盖。一个模型在安静录音棚里表现最好,和它在你家厨房的油烟机旁边表现最好,完全是两件事。评测体系接下来要补的,大概率就是这块。对做产品的人来说,榜单帮你排除错误答案,最后一公里还得自己听。

