欢迎访问乐酷家

千问大模型推出Qwen-Audio-3.0-TTS,语音合成迈向精准灵活表达新阶段

金融科技 2026-07-21 user34782

千问大模型近日正式推出语音合成领域的全新力作——Qwen-Audio-3.0-TTS,该模型通过技术创新实现了语音合成能力的质的飞跃。此次发布的版本包含两个核心模块:面向实时交互场景的Flash版本,其首包响应延迟控制在300毫秒级别;以及专注高质量输出的Plus版本,可满足专业级语音生成需求。

在技术突破方面,新模型构建了多维度语音控制体系。通过引入细粒度标签系统,用户能够直接在文本中嵌入结构化指令,精准调节语气的轻重缓急、情绪的喜怒哀乐等微观特征。这种设计打破了传统语音合成中"一刀切"的调控模式,使语音输出更具情感表现力。

针对非专业用户的使用痛点,研发团队开发了Free-style自然语言指令系统。用户无需掌握声学专业术语或标注规范,只需用日常语言描述期望的语音特征,例如"用老年男性的声音,带着焦急的情绪,在嘈杂环境中快速讲述"等复合指令,系统即可自动解析并生成符合要求的语音。

多语言支持能力实现重大扩展,Plus版本现已覆盖16种主流语言及20种中国地方方言。在声学鲁棒性方面,模型通过引入复杂环境模拟训练,显著提升了在背景噪音、口音偏差、语速变化等实际场景下的合成质量,确保语音清晰可辨且自然流畅。

该模型的推出标志着语音合成技术从"机械发声"向"智能表达"的转型。通过将专业声学参数转化为直观的可操作维度,既降低了技术使用门槛,又拓展了语音合成的应用边界,为有声内容制作、智能客服、无障碍交互等领域提供更强大的技术支撑。

The End
免责声明:本文内容来源于第三方或整理自互联网,本站仅提供展示,不拥有所有权,不代表本站观点立场,也不构成任何其他建议,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容,不承担相关法律责任。如发现本站文章、图片等内容有涉及版权/违法违规或其他不适合的内容, 请及时联系我们进行处理。

Copyright © 2099 乐酷家 |中华人民共和国增值电信业务经营许可证号:苏B2-20221286

苏ICP备2022030477号-14 |——:合作/投稿联系微信:nvshen2168

|—— TXT地图 | 网站地图 |