AI工具集 首页
💬 AI聊天助手
🖼️ AI图像工具
🎬 AI视频工具
✍️ AI写作工具
📄 AI办公学习
🤖 AI智能体
👨‍💻 AI编程工具
🖥️ AI开发平台
🎧 AI音频工具
🎨 AI设计工具
🏢 AI行业服务
📚 AI文章教程
🗂️ 更多分类
AI工具集 首页
FireRedAudio logo

FireRedAudio

小红书 FireRed 团队推出的通用音频语言模型

支持 ASR、音频问答、长达1小时的录音理解、Zero-shot TTS、指令 TTS 及语音编辑,在 MMAU、MMSU、多语种 ASR 和 Instruct TTS 等评测中均取得领先表现。

GitHub仓库 AI工具导航
小红书开源的全能音频AI模型

核心功能

  • 音频理解

    在MMAU、MMSU等综合音频问答评测中表现靠前,能区分语音、音乐和环境声,还支持思维链推理。

  • 多语种ASR

    覆盖102种语言识别,中文AISHELL-1字错率0.71%,低资源语种表现也不错。

  • Zero-shot TTS

    给一段参考语音就能克隆音色,中英文内容准确率和说话人相似度在对比表中领先。

  • Instruct TTS

    用“慢一点、温和一些”这样的自然语言就能控制语速和情绪,六项评测指标全部靠前。

  • 语音编辑

    支持语义级的删改插入和声学级的变速变调变音量,不用重新录制整段音频。

  • 长音频处理

    能整段处理最长1小时的录音,输出带秒级时间戳的结构化摘要,不用先切片再拼接。

产品特色

  • 01

    理解和生成各走各的通道,共享一个大脑

    多数统一音频模型把理解和生成塞进同一套表征里,两边互相妥协。FireRedAudio让理解走Audio Encoder、生成走RedAE通路,各自保留最适合自己的表示方式,但共享同一个LLM做推理,听和说都不用将就。

  • 02

    代码和权重Apache-2.0开源

    训练用了约2.66T非填充多模态token,输出24kHz波形,GitHub和Hugging Face都能拉取,个人和企业都可以自由部署和二次开发。

  • 03

    五阶段渐进训练逐步叠能力

    训练从适配器对齐开始,再到编码器适配、理解生成联合训练、多任务后训练,最后做200k长上下文扩展,能力是一层层加上去的,不是一次性混合所有任务。

  • 04

    ComfyUI和桌面端已有现成集成

    社区做了ComfyUI节点和桌面端应用,提供Lite和Full两种配置,不需要自己从头写推理代码也能跑起来。

  • 05

    一条指令切换任务

    同一个模型实例处理ASR、问答、TTS、编辑等任务,只需要改变输入格式和prompt,不用为每个任务单独加载一套模型。

应用场景

  • ✅ 会议录音整理

    把1小时会议录音整段转写成带秒级时间戳的纪要,自动提取关键决策和待办事项。

  • ✅ 多语种内容配音

    输入中文视频,自动识别原声并生成英语、日语等配音,保留原说话人音色和情感。

  • ✅ 播客后期修补

    用自然语言指令调整语速、替换特定语句,不用重录整段,只改动需要修改的部分。

  • ✅ 音频内容检索

    对长音频平台的海量内容做语义级检索,比如找出所有提到某个话题的片段并标注时间点。

  • ✅ 智能客服语音

    实时理解带口音和环境噪音的用户语音,以指定音色和语速生成回复,实现端到端语音交互。

常见问题

解答您关于"FireRedAudio"的常见疑问,让您更好地使用这款AI工具

  • 官方提供Lite和Full两种配置,Lite约需20GB显存,只跑ASR和理解;Full约28GB,加上TTS和编辑功能。显存不够可以试试int8量化版,大约15GB。

  • Python 3.10是硬性要求,系统需要装好CUDA toolkit和ffmpeg。官方wheel默认针对CUDA 12.8,其他版本需要改pyproject.toml里的索引地址。

  • 预训练模型大约20GB,从Hugging Face或ModelScope都能下载。国内访问HF慢的话用ModelScope替代比较方便。

  • ASR覆盖102种语言,中文和英文效果最好。TTS、语音编辑和音色设计目前主要支持中英双语。

  • 拼接方案是先把音频转文字再单独做合成,两套系统中间容易丢信息。FireRedAudio用一个模型完成理解到生成的全过程,长音频的时间对齐也是原生支持的。

  • 官方对声音克隆功能标注了“仅供学术研究用途”,商用前建议先确认具体场景的合规边界。其余能力在Apache-2.0协议下可以商用。

立即体验“FireRedAudio”

FireRedAudio是小红书FireRed团队开源的通用音频语言模型,基于9B参数Qwen3.5架构,用解耦连续表征设计让理解和生成各走独立通道。一个模型同时支持102语种ASR、音频问答、1小时长音频理解、Zero-shot TTS、指令TTS和语音编辑,MMAU、MMSU等评测均列前茅。

进入 FireRedAudio
发现更多

FireRedAudio官网入口·本页面为非官方内容聚合页面,提供相关介绍和快捷入口,内容仅供参考,具体以官网为准。

特别声明 :AI导航站提供的【FireRedAudio】产品信息来源于网站整理或服务商提交,从本站跳转后由【FireRedAudio】网站提供服务,请用户注意自行甄别该产品的服务条款及隐私政策。在收录时,该网页上的内容都属于合规合法,后期【FireRedAudio】产品网页内容如出现违规,请及时联系站长删除,AI导航网不承担任何责任。

最新收录

UP求职
UP求职 一款会直接帮你做事的AI求职Agent
ChatCut
ChatCut AI视频编辑器,用提示词剪视频
水印云
水印云 一款在线图片、视频去水印工具
Loomy网页版
Loomy网页版 你的AI工作搭子,打开浏览器就能用
AionClaw
AionClaw 真正能做事的桌面 AI 智能体
BigQuant
BigQuant 领先的一站式AI量化投资平台
精选推荐
LovartLovart
全球首个专业AI设计Agent
LoomyLoomy
讯飞推出的桌面级AI助理
LibTVLibTV
专业级一站式 AI 视频创作平台
豆包豆包
AI智能聊天对话问答助手(网页版)
蛙蛙写作蛙蛙写作
AI帮你写小说、剧本和内容创作工具
即梦AI即梦AI
字节跳动出品的一站式AI创作平台
火山引擎火山引擎
字节旗下企业级云与AI服务平台
SekoSeko
商汤全链路AI短剧生成工作台
类似工具
立刻MV立刻MV
AI 一站式音乐视频(MV)创作工具
逗哥配音逗哥配音
短视频爆款解说AI配音工具
SunoSuno
高质量的AI音乐创作平台
谱乐谱乐
一站式AI音乐创作与发行平台
讯飞配音讯飞配音
AI数字人视频与配音创作平台
音述AI音述AI
用声音述说故事,AI音乐创作/分享
千音漫语千音漫语
AI声音创作,涵盖多种语言和音色
配音神器PRO配音神器PRO
文字转语音软件,专业配音工具