FireRedAudio
小红书 FireRed 团队推出的通用音频语言模型
支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。

核心功能
音频理解
在MMAU、MMSU等综合音频问答评测中表现靠前,能区分语音、音乐和环境声,还支持思维链推理。
多语种ASR
覆盖102种语言识别,中文AISHELL-1字错率0.71%,低资源语种表现也不错。
Zero-shot TTS
给一段参考语音就能克隆音色,中英文内容准确率和说话人相似度在对比表中领先。
Instruct TTS
用“慢一点、温和一些”这样的自然语言就能控制语速和情绪,六项评测指标全部靠前。
语音编辑
支持语义级的删改插入和声学级的变速变调变音量,不用重新录制整段音频。
长音频处理
能整段处理最长1小时的录音,输出带秒级时间戳的结构化摘要,不用先切片再拼接。
产品特色
- 01
理解和生成各走各的通道,共享一个大脑
多数统一音频模型把理解和生成塞进同一套表征里,两边互相妥协。FireRedAudio让理解走Audio Encoder、生成走RedAE通路,各自保留最适合自己的表示方式,但共享同一个LLM做推理,听和说都不用将就。
- 02
代码和权重Apache-2.0开源
训练用了约2.66T非填充多模态token,输出24kHz波形,GitHub和Hugging Face都能拉取,个人和企业都可以自由部署和二次开发。
- 03
五阶段渐进训练逐步叠能力
训练从适配器对齐开始,再到编码器适配、理解生成联合训练、多任务后训练,最后做200k长上下文扩展,能力是一层层加上去的,不是一次性混合所有任务。
- 04
ComfyUI和桌面端已有现成集成
社区做了ComfyUI节点和桌面端应用,提供Lite和Full两种配置,不需要自己从头写推理代码也能跑起来。
- 05
一条指令切换任务
同一个模型实例处理ASR、问答、TTS、编辑等任务,只需要改变输入格式和prompt,不用为每个任务单独加载一套模型。
应用场景
✅ 会议录音整理
把1小时会议录音整段转写成带秒级时间戳的纪要,自动提取关键决策和待办事项。
✅ 多语种内容配音
输入中文视频,自动识别原声并生成英语、日语等配音,保留原说话人音色和情感。
✅ 播客后期修补
用自然语言指令调整语速、替换特定语句,不用重录整段,只改动需要修改的部分。
✅ 音频内容检索
对长音频平台的海量内容做语义级检索,比如找出所有提到某个话题的片段并标注时间点。
✅ 智能客服语音
实时理解带口音和环境噪音的用户语音,以指定音色和语速生成回复,实现端到端语音交互。
常见问题
解答您关于"FireRedAudio"的常见疑问,让您更好地使用这款AI工具
-
官方提供Lite和Full两种配置,Lite约需20GB显存,只跑ASR和理解;Full约28GB,加上TTS和编辑功能。显存不够可以试试int8量化版,大约15GB。
-
Python 3.10是硬性要求,系统需要装好CUDA toolkit和ffmpeg。官方wheel默认针对CUDA 12.8,其他版本需要改pyproject.toml里的索引地址。
-
预训练模型大约20GB,从Hugging Face或ModelScope都能下载。国内访问HF慢的话用ModelScope替代比较方便。
-
ASR覆盖102种语言,中文和英文效果最好。TTS、语音编辑和音色设计目前主要支持中英双语。
-
拼接方案是先把音频转文字再单独做合成,两套系统中间容易丢信息。FireRedAudio用一个模型完成理解到生成的全过程,长音频的时间对齐也是原生支持的。
-
官方对声音克隆功能标注了“仅供学术研究用途”,商用前建议先确认具体场景的合规边界。其余能力在Apache-2.0协议下可以商用。
立即体验“FireRedAudio”
FireRedAudio是小红书FireRed团队开源的通用音频语言模型,基于9B参数Qwen3.5架构,用解耦连续表征设计让理解和生成各走独立通道。一个模型同时支持102语种ASR、音频问答、1小时长音频理解、Zero-shot TTS、指令TTS和语音编辑,MMAU、MMSU等评测均列前茅。

