OmniVoice
免费开源的AI语音生成器
支持646种语言,克隆3秒音频样本,或通过文字描述设计全新音色

核心功能
自然语音合成
输入文字即可生成自然流畅的语音,支持646种语言,无需切换模型或额外配置
零样本声音克隆
上传3-25秒音频样本,即可克隆该声音,并用于生成任意支持语言的语音,无需训练
文本描述设计音色
通过描述年龄、音高、口音和风格等特征,无需参考音频即可创建全新的自定义声音
表现力语音标签
在脚本中嵌入[laughter]、[sigh]等标签,让语音自然地带有笑声、叹息等非语言表达
高性能推理
在GPU上以约45倍实时速度运行,生成60秒音频仅需约1.3秒,适合实时与大规模批处理
产品特色
- 01
单统一模型覆盖646种语言
单一模型支持从主要语言到低资源语言的646种语言覆盖,跨语言克隆无需额外样本
- 02
更低的词错误率与更高相似度
在24种语言基准测试中词错误率仅2.85%,说话人相似度得分0.830,表现优于主流商用平台
- 03
完全开源且免费商用
Apache 2.0许可证授权,无订阅费用与字符限制,个人和企业均可自由使用
- 04
支持灵活的部署方式
提供Python API与命令行工具,可在NVIDIA GPU、Apple Silicon及CPU上运行,支持本地部署
应用场景
✅ 有声内容制作
为有声书、播客生成长篇叙述,在剧集间保持一致的音色身份
✅ 游戏角色配音
快速为游戏NPC生成动态对话语音,支持快速原型设计与批量制作
✅ 全球本地化
用统一声音模型生成646种语言版本,在各地区保持品牌音色一致
✅ 在线教育与语言学习
生成清晰发音示例,播放速度0.5至2.0倍可调,适合跟读与理解练习
常见问题
解答您关于"OmniVoice"的常见疑问,让您更好地使用这款AI工具
-
由k2-fsa团队开发的开源AI语音生成器,支持646种语言的文本转语音、3秒零样本声音克隆和文字描述音色设计,采用Apache 2.0许可。
-
是的。OmniVoice在Apache 2.0许可证下发布,个人和商业用途均免费,无订阅费、无字符或时长限制。
-
支持646种语言,涵盖主流语言和数百种低资源语言。完整语言列表可在官网或GitHub项目中查看。
-
3到25秒的清晰音频样本即可。音频质量比时长更重要,背景噪音会降低克隆效果。
-
无需任何音频参考,通过纯文本描述想要的音色特征(如女性、低沉、英式口音),模型即可生成匹配的声音。
立即体验 OmniVoice
OmniVoice是免费开源的AI语音生成器,支持646种语言,提供文本转语音、零样本声音克隆和文本描述音色设计功能。基于58.1万小时开源语音数据训练,采用单阶段架构,词错误率仅2.85%,推理速度达实时45倍。Apache 2.0许可,个人与商业用途免费,无订阅费和字符限制。