AuK
用一句话指令完成语音生成和编辑的开源模型
指令式TTS免参考音频,改词调音色一步到位,MIT协议权重可下载。

核心功能
零样本语音克隆
给几秒参考音频,就能用那个人的音色说出任意新文本,不需要提供参考录音的文字稿。
指令式TTS
只用文字描述声音特征就能生成语音,比如“沙哑的中年男声,语气果断带着审视感”,完全不需要参考音频。
语音内容编辑
在不改变音色和语调的前提下,替换、插入或删除录音里的字词,念错一句话不用整段重录。
歌词编辑
保留原曲的旋律和歌声特质,只改写歌词内容,适合翻唱改编和二创。
声学属性调节
音高以半音为单位、语速按倍速、音量按分贝精确调整,改多少有具体数字可调。
情绪与音色编辑
不换字就能改变情感色彩,或者保留内容只换一种音色,适合有声书和配音场景。
口音去除与降噪
去掉方言口音、消除背景噪音和混响,提升录音的清晰度和可用性。
副语言事件编辑
添加或移除呼吸声、笑声、咳嗽,还能在正常语音和耳语之间互相转换。
语音与音乐分离
按说话顺序拆分多人音频,或者按内容描述提取目标说话人,从歌曲里也能分出人声和伴奏。
产品特色
- 01
编辑类任务是它最特别的地方
大部分语音模型只管生成,AuK能把一段录音当输入,只改你指定的那部分,音色和旋律基本不受影响。流匹配扩散架构在这里帮了忙,用原始音频作为去噪起点,没改的内容几乎零损伤。
- 02
多语言混说不用提前选
不像有些ASR要求先选语言,AuK一句里中英文混着说也能识别,对涉及外语词汇的内容比较省事。
- 03
AuK-Flash四步出结果
蒸馏版本AuK-Flash只要4步推理,速度提升约4.5倍。有意思的是它在部分评测中反而超过了完整版,不完全是“降级替代”的逻辑。
- 04
MIT协议没什么附加条件
代码和权重都放出来了,Hugging Face和魔搭都能下载。想拿去改、拿去用、甚至商用,协议上都比较干净,这在开源语音模型里不算常见。
应用场景
✅ 影视短剧台词修复
演员念错词或剧本微调时,直接替换录音里的个别句子,保留原表演情绪,不用重新进棚配音。
✅ 播客与采访后期
删口误和废话、调语速、去背景噪音,把粗剪素材整理成成片,省掉反复录音的时间。
✅ 有声书多角色制作
用Instruct TTS按角色描述生成不同音色,同一个叙述者还能后期调整情绪和语调。
✅ 音乐翻唱与二创
改写歌词但保留原旋律和歌声特质,或者从歌曲里提取人声做remix素材。
✅ 语言训练与无障碍
为有口音或语言障碍的使用者去口音、调语速和音量,生成更清晰易懂的语音内容。
常见问题
解答您关于"AuK"的常见疑问,让您更好地使用这款AI工具
-
免费且开源,代码和模型权重都是MIT协议,可以从Hugging Face或GitHub下载。但推理本身需要自己的GPU。
-
官方建议24GB显存的NVIDIA GPU,比如RTX 3090或4090。测试中在24GB笔记本上跑完整流程用了约21.3GB显存。
-
普通TTS只做文字转语音,AuK还能编辑已有录音:改词、换情绪、调音高、去口音、分离人声,相当于一个统一的语音处理工具箱。
-
支持,中文准确率在评测中达到83.37%,也能处理中英文混说的场景。
-
CosyVoice侧重TTS生成,AuK多了编辑类任务,比如改词、插句、调声学属性。两者定位不太一样。
-
不一定,但模型目前不能稳定理解所有自由形式的自然语言,官方提供了Prompt Enhancer来帮你把指令整理成任务和参数格式。
-
要最高质量选AuK,要速度选AuK-Flash。Flash在部分编辑和增强任务上表现甚至更好,不只是牺牲质量换速度。
-
从GitHub克隆Tencent-Hunyuan/AuK仓库,下载权重和Qwen2.5-Omni-3B编码器,按Cookbook配置环境就能跑。也有ComfyUI节点可以用。
立即体验“AuK”
AuK是腾讯混元开源的15亿参数语音生成与编辑基础模型,用自然语言指令加参考音频就能完成零样本TTS、内容编辑、情绪调节、降噪去口音等16种任务。MIT协议开源,权重和代码都能下载,24GB显存即可本地运行。

