音频输入每小时的价格砍掉 98%,音视频一起进的价格降了 93%。Qwen3.8-Omni-Flash 这次发布里最扎眼的不是榜单,是价目表。一家模型团队敢把数字打到这个位置,通常说明两件事:底层推理成本确实压下来了,以及他们想用价格把一整类还没长成的应用硬拽出水面。1M token 上下文、文本图像音频视频全收、29 项评测平均分比上一代高出四分之一——这些是能力说明。真正决定谁能靠它赚钱的,是那两条向下的价格曲线。
先把那 98% 看明白
计价单位是小时,这本身就交代了场景
注意单位:不是每百万 token,不是每千次调用,是每小时。按音频时长收费的模型,只为一种活法而设计——长时间一直听着的应用。会议记录、客服质检、直播风控、常驻语音助手,这些活儿有个共同点:用户沉默的时候,钱照烧。价格降下来之前,一个 8 小时不间断的语音工位每天的开销足以让产品经理当场砍掉需求;降完之后,它从预算表上的一个大项变成一行可以忽略的运营成本。这才是 API 定价 变化真正的分量,它改的不是毛利率,是这门生意有没有资格存在。全球同时在线几万个音频会话,在旧价目表下是灾难,在新价目表下是日常。
25% 的均值背后,方差可能大得吓人
官方口径是 29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%。平均分是个省事的指标,也是个会骗人的指标。29 项里如果有几项是从接近随机跳到接近可用,均值一样能被拉上去,剩下那些几乎没动的能力,照样会在生产环境里出事。另一个容易滑过去的点:对比对象是自家上一代,不是友商。这份成绩单回答的是“进步多快”,不是“现在排第几”。对做技术选型的人来说,前者管情绪,后者才管决策。
“原生”这两个字,值多少钱
一个窗口装下一场会,不用再切片
1M token 的上下文,配上音视频输入,直接消掉了一整层工程麻烦。过去做长会议理解,标准打法是切片、向量化、检索、再拼——每一刀都在丢信息。会议开头定的结论和结尾改掉的口径,切完片之后就再也对不上。现在可以把整场会连同屏幕共享一起塞进一个窗口,让模型自己决定回头看哪一段。具体能装下多少小时取决于编码压缩率,官方没细说,但“不用先切再理解”这件事的价值,跑过这条链路的人都清楚。省下的不只是 token,还有那一堆调参调不明白的切分策略。
音视频同时对进来,真正的难题是对齐
把音频和视频分别送进两个模型,再用时间戳在后处理里缝合,是过去两年最常见的做法,也是最容易崩的做法。谁在说话、说的是哪张图、图在第几分钟被翻页、翻页那一刻谁在插话——这些信息一旦被拆进两条管道,再想还原就只能靠猜。原生全模态的意义在于它们从输入那一刻就在同一个表示空间里,对齐变成模型内部的事,而不是工程师在业务层写规则的事。做 音视频智能体 的人,应该最能算清这中间省掉的胶水代码值多少人力。
开源的那部分,其实不是权重
插件和运行时,补的是智能体的手脚
这次除了开放 API,官方还放出了插件和运行时。权重开源大家早就见惯了,真正稀缺的是后者。一个能跑实时音视频的智能体,难点从来不在模型会不会说话,而在于打断怎么处理、工具调用和音频流怎么并行、会话状态在几十轮之后还剩什么。开源运行时 把这些脏活的标准答案摆到台面上,小团队不用从零再踩一遍。生态的门槛经常就卡在这一层:模型谁都能调,能把模型接进真实业务流程的脚手架,没几个人愿意白写。
剪辑、会议、实时交互,三条路的难度差着一个量级
剪辑是最先能吃到的果子。离线处理,慢一点无所谓,便宜就是王道,98% 的降价直接改写单条视频的毛利结构,批量跑素材从“划不来”变成“顺手做”。会议场景夹在中间:准不准是生死线,合规和私有化部署是另一道坎,开源的运行时在这里比托管 API 更受欢迎,因为数据不出内网这条要求往往一票否决。实时交互最难,延迟按毫秒算,成本只是入场券。同一套模型,三种活法,别拿同一组指标去衡量。
现在下注,还是再等一代
成本塌了,产品形态才敢重新想
很多今天看起来理所当然的产品设计,其实是旧成本结构下的妥协产物。语音助手之所以只在你按下按钮之后才开始听,不是技术上做不到常驻,是常驻太贵。当每小时音频的开销掉到原来的百分之二,一批被成本否掉的方案会重新回到桌面上:全天候的会议副驾、永远在线的销售陪练、给每个客服配一个实时复盘助手。这时候最该做的不是把新模型塞进旧架构,而是翻出当年被砍掉的那几份需求文档,重新算一遍账。
该盯的不是分数,是延迟和脏数据
评测集里的音频干净、单一说话人、标准口音。真实世界里是回声、串音、方言、长达几分钟的沉默,还有背景里永远关不掉的空调。接入之前值得问几个具体问题:端到端 P95 延迟多少,并发上限和限流规则怎么定,98% 的降幅在用量放大十倍之后还成不成立。发布当天的数字都漂亮,能扛住三个月线上流量的才算数。

