Qwen 发布 Qwen-Audio-3.1 全家桶,ASR、TTS、Realtime 升级并新增 TTS-Next 与 ASR-Next

发布时间: 2026-09-23 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

阿里通义千问把 Qwen-Audio-3.1 放出来了,而且是五个模型一起上。ASR、TTS、Realtime 三条老线全线升级,另外塞进两个新面孔:音频理解模型 ASR-Next 和音频创作模型 TTS-Next。价格同步被砍到近乎失真的地步——TTS 降约七成,Realtime 降约 85%,ASR 最高降 95%。发布干脆,定价更干脆。

五个模型打包,野心不在数量

理解、生成、交互、创作,四条线一次补齐

先看这五个模型的排列方式。ASR 管听懂,TTS 管说清楚,Realtime 管来回对话,这是语音技术里被反复打磨的三件套。新加的两个才是这次的关键动作:ASR-Next 被官方放在"音频理解"的位置上,TTS-Next 则直接指向"音频创作"。

理解、生成、交互、创作,四个方向覆盖下来,等于把一条音频链路上的所有环节都握在自己手里。过去很多厂商只做单点,ASR 强的 TTS 一般,Realtime 做得好的往往在模型层没有话语权。这次是一次性补齐,不给你挑短板的余地。

ASR-Next:声音里的信息,不止是字

传统 ASR 的任务很明确,把语音转成文字,交付物是一段文本。ASR-Next 定位为音频理解模型,意味着它要处理的东西超出了字面。语气、停顿、背景声、说话人的状态,这些都藏在音频信号里,而纯转写会把它们全部丢掉。

一旦模型开始对这些信息建模,下游能做的事就变了。会议记录不再只是逐字稿,可以标记谁在犹豫、哪段讨论情绪最激烈。客服质检不必只听关键词,能听出用户到底是在客气还是在发火。这不是转写精度的改良,是输出物的性质变了。

TTS-Next 想做的不只是"读得好听"

另一边的 TTS-Next 被贴上"音频创作"的标签。这两个字很讲究。朗读、配音、播报,本质上是把已有文本换一种媒介输出,创作则暗示模型可以参与内容的生成过程。

声音风格的迁移、情绪的设计、语气在长文本里的起伏安排,这类需求过去要靠人工调参或者多段拼接,成本高、周期长。如果 TTS-Next 能在一次生成里把这些变量都考虑进去,短视频创作者、有声书制作方、游戏团队的用法会完全不一样。它到底能做到哪一步,得看实际接口开放的程度,但方向已经很清楚。

降价幅度才是这次真正的头条

95% 这个数字,行业里不常见

能力升级是常规动作,价格才是这次发布最扎眼的部分。ASR 最高降 95%,意味着原来一百块的调用成本,现在五块就能拿下。Realtime 降约 85%,TTS 降约七成,三档跌幅没有一档是象征性的。

语音模型这个赛道,过去几年价格一直在往下走,但单次降幅到这个量级并不常见。它传递的信号很直接:音频能力的调用成本,正在从"需要专门预算"变成"可以忽略不计的边际开销"。

谁会先感到压力

首当其冲的是那些靠语音 API 差价吃饭的中间层。自己不做模型,把几家能力包一层卖给客户,商业模式的前提是上游价格足够高、信息足够不透明。95% 的降幅一出来,这层空间被压得极薄。

其次是垂直语音工具。转写工具、配音工具、智能客服,如果核心能力完全依赖外部模型,定价权就不在自己手上。上游一降价,用户会直接问:为什么你还收这个价。

替换成本这笔账,得算细

看到降价就迁移,是最容易犯的错。真实成本要算四项:接口改造成本、效果回归的验证成本、长尾场景的表现差异、以及供应商锁定风险。语音模型的坑通常在长尾——方言、口音、嘈杂环境、专业术语,这些在演示里看不出来,上线之后才暴露。

建议的做法是先拿一条非核心业务线做对照测试,把准确率、延迟、并发上限这些硬指标跑一遍,再决定是不是整体切换。降价是入场券,能不能接住业务是另一回事。

Realtime 开始"看脸色"了

随时打断,是语音交互最难的一关

Realtime 这次明确支持边说边听、随时打断。听起来是基础体验,做起来极难。模型必须在输出语音的同时持续处理输入音频,判断对方是在附和、在思考,还是真的要抢话。判断早了会误停,判断晚了体验就崩。

这套机制背后是对轮次管理的重新设计。传统语音对话是回合制,你说完我再说。真实对话不是这样,打断、重叠、抢话才是常态。能处理这个,交互才谈得上自然。

放慢语速、共情回应,产品判断还是技术炫技

更有意思的是情绪处理。官方提到,Realtime 检测到用户情绪低落时,会放慢语速并给出共情回应。这一个细节,把语音助手从"执行指令"推向了"回应状态"。

它的价值场景很具体:心理支持类应用、老年陪伴、儿童教育。这些场景里,回答内容对不对只是一半,说话的方式对不对是另一半。语速降下来这个动作,比任何一句安慰的话都更早被感知到。

情绪识别落地,边界在哪

反过来看,情绪识别也有明显的风险面。误判会让人不适,过度回应会显得刻意,而在客服、催收这类场景里,识别用户情绪并据此调整话术,很容易滑向操纵。技术能力开放之后,用在哪、怎么用,责任在调用方。

对开发者来说,比较稳妥的做法是把情绪信号当成一个可选输入,而不是默认开启的行为。让用户知道系统在读什么,比让系统偷偷读要安全得多。

把这几件事放在一起看,Qwen-Audio-3.1 这次的动作是两条腿走路:能力上补齐从理解到创作的完整链路,价格上把门槛直接打穿。真正值得关注的不是哪个模型更强,而是当音频理解和生成都变得足够便宜、足够好用时,会冒出什么现在还没有的产品形态。这个答案,不会由模型厂商给出。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 9

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
下一篇: 没有了
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线