Suno 把语音生成也端上了桌。新发布的 Speech beta 号称首个能把语音与原创背景音乐作为一条完整曲目生成的音频模型,不是先配音再贴 BGM,而是一次成型。用户只要输入文字,再描述想要的声音和音乐风格,系统便会吐出带配乐的语音作品。目前 beta 已向所有用户开放,门槛几乎等于没有。
这显然不只是“AI 朗读”换皮。语音和音乐若在同一模型里协同生成,节奏、情绪、停顿和配器就可能互相咬合,Suno 想抢的,是播客片头、短剧对白、有声故事甚至广告 demo 的创作入口。但官方也没藏着掖着:口音漂移、停顿过重等问题仍在,效果还没到“直接交付”的程度,团队会持续改进。换句话说,能生成和能用好之间,还隔着一段路。
真正值得盯的是,当音乐生成平台开始吞掉语音,内容生产链条又被压短一截。写词、配音、配乐、混音,原本各管一段,现在一个提示词就能跑通雏形。工具越像“一条龙”,创作者的判断力反而越值钱:知道要什么声音、什么情绪、什么节奏,比会点按钮更难。Speech beta 眼下不完美,却把方向摆明了。

