小米 AI 实验室发布 ZipVoice 系列语音合成 TTS 模型,解决零样本语音合成痛点

9 月 12 日消息,小米集团 AI 实验室今日宣布,旗下 Kaldi 团队上个月发布了基于 Flow Matching 架构的 ZipVoice 系列语音合成(TTS)模型,包括:
ZipVoice(零样本单说话人语音合成模型)
ZipVoice-Dialog(零样本对话语音合成模型)
据最新介绍,作为 zipformer 在语音生成任务上的应用和探索,ZipVoice 解决了现有零样本语音合成模型的参数量大、合成速度慢的痛点,在轻量化建模和推理加速上取得了重要突破。
ZipVoice-Dialog 则解决了现有对话语音合成模型在稳定性和推理速度上的瓶颈,实现了又快又稳又自然的语音对话合成。
从小米最新获悉,ZipVoice 首次将原本为自动语音识别(ASR)设计的 Zipformer 架构引入 TTS 任务作为模型的骨干网络,Zipformer 中的三大设计:基于 U-Net 的多尺度高效率结构、卷积与注意力机制的协同处理、以及注意力权重的多次复用都高度适配语音合成任务,从而实现了语音合成模型的高效建模。
得益于这一设计,相比基于 DiT 的语音合成模型,在性能相似的情况下,ZipVoice 的参数量减少了约 63%。
性能方面,ZipVoice 和 ZipVoice-Distill 在具备更小参数量和更快推理速度的同时,在三个客观指标,即说话人相似度(SIM-o)、词错误率(WER)和 UTMOS,以及两个主观指标(CMOS、SMOS)上都极具竞争力,达到了零样本语音合成模型的 SOTA 性能水平,同时显著减少了模型参数量,加快了推理速度。
小米最新表示,ZipVoice 零样本语音合成模型具备了低参数量、高推理速度、高语音质量三大优点,ZipVoice-Dialog 提供了又快又稳又好的对话语音合成新方案。ZipVoice 系列模型为轻量化、高速度要求的语音交互应用场景提供了新的解决方案。
此外,小米表示未来团队将持续对 ZipVoice 系列模型进行优化,致力于让每一个人都能享受到低成本高质量的语音合成技术。
参考地址:
ZipVoice 系列的模型文件、训练代码和推理代码以及 6.8k 小时的语音对话数据集 OpenDialog 已全部开源:https://github.com/ k2-fsa / ZipVoice
Zipvoice 论文已被 ASRU2025 接收:https://arxiv.org/ pdf/2506.13053
样例体验请访问:https://zipvoice.github.io
免责声明
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
土星F环现罕见光影奇观,观测角度揭秘"幻影"真容
在浩瀚的宇宙中,土星以其独特的光环系统吸引着无数天文爱好者的目光。近日,一项关于土星环的新发现再次引发了科学界的关注——在土星著名的F环外侧,隐藏着一个神秘的“幻影环”,它如同宇宙中的幽灵,只有在特
UCLA团队发现AI与小鼠协作机制 或将重塑智能Agent未来
合作是人类社会的基础,理解合作如何产生并维持,不仅对解决冲突、治疗影响社会行为的疾病具有深远意义,也对设计更优的人工智能(AI)系统至关重要。 随着多 AI Agent 系统在自动驾驶、分布式机器
MOVA三款旗舰扫地机升级智能管家体验
从SIRIUS 60的“主动服务”,到V60 MOBIUS的“精准定制”,再到Z60 Pro的“全能覆盖”,MOVA通过三款旗舰产品,展示了其以用户为中心、以技术驱动力解决核心痛点的强大创新能力。而
华为MateBook Fold折叠屏PC重塑高端笔记本市场
折叠屏技术正从智能手机领域加速向高端PC市场渗透,而华为凭借持续的技术创新与产品迭代,再次成为这一变革的引领者。近期,权威市场调研机构GFK发布数据显示,华为首款鸿蒙折叠电脑MateBook Fol
地平线机器人配股募资63.4亿港元,加速海外及新兴业务发展
地平线机器人近日在港交所发布公告称,公司已与现有股东及经办人于2025年9月25日签订配售及认购协议。根据协议,配售股份的定价为每股9 99港元,较市场价折让约5 75%。此次配售预计可为公司筹集约
热门推荐
热门教程
更多- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程


















