阿里通义实验室发布 Qwen-Audio-3.0-TTS:Flash 与 Plus 双版本,覆盖 16 种语言
决策简报
Brief- 发生了什么
- 阿里通义实验室推出 Qwen-Audio-3.0-TTS,包含实时交互版 Flash 与高质量音色版 Plus,通过阿里云模型工作室以托管 API 形式提供。
- 为什么重要
- Qwen 相关结果会影响评测基准、技术路线和后续产品判断。
- 影响谁
- Gemini · Qwen
- 建议动作
- 升级或复核变更版本
- 地区可用性
- 暂未验证地区可用性差异。
关键事实
- 阿里通义实验室推出 Qwen-Audio-3.0-TTS,包含实时交互版 Flash 与高质量音色版 Plus,通过阿里云模型工作室以托管 API 形式提供。 [src-marktechpost]
- Flash 首包延迟约 300ms 适合实时场景,Plus 在 Artificial Analysis 排行榜上 Elo 分数最高(约 1236),价格仅为竞品三分之一,但吞吐量较低(Plus 约 16 字符/秒)。 [src-marktechpost]
由事件证据自动生成。
Qwen-Audio-3.0-TTS 提供两个变体:Flash 面向实时交互,首包延迟约 300ms;Plus 面向高质量生成,在 Artificial Analysis 语音竞技场中取得第一名(Elo 约 1236),价格约 27.59 美元/百万字符,约为 ElevenLabs 和 MiniMax 同类产品的三分之一。但 Plus 吞吐量仅约 16 字符/秒,低于 Simba 3.2(30.2)和 Sonic 3.5(120)。模型支持 16 种语言和 20 种中文方言,在 10/16 种语言中字错率最低(Flash 平均 3.87%,Plus 3.96%),Plus 在说话人相似度上平均 82.75 分,排名第一。新增 86 个细粒度内联标签,可控制笑声、呼吸、咳嗽等非语音事件,但仅在单向流模式中支持。模型基于 12.5Hz 低帧率语音分词器和五阶段渐进训练范式,支持最长 3 分钟一次合成、48kHz 输出。对于需要低延迟实时 TTS 的开发者,Flash 是理想选择;追求音质和自然度的语音应用团队,Plus 在音质和价格上极具竞争力,但需评估吞吐量瓶颈。
摘要依据:已读全文详摘依据上方标注的来源范围整理,内容以原文为准。
来源
- MarkTechPost
Fast research-paper and ML tooling summaries, useful for infra and agent updates.
- MarkTechPost
留言
登入后即可留言,和其他 builder 交换实测心得。
还没有留言,抢头香。