StepAudio 3
覆盖听说想做全链路的语音模型矩阵
五款模型分别搞定实时对话、高精度转写、真人级语音合成、音频生成和音乐创作,API已开放

核心功能
Realtime实时对话
支持原生全双工交互,能判断何时接话何时等待,处理打断和连续反馈,可边聊边异步跑长任务
ASR语音识别
词错误率1.7%并列全球第一,支持中英文、方言、中英混说,能处理低声快语速和背景音乐等复杂输入
TTS语音合成
面向真人级语音生成,能还原语气情绪和笑声迟疑等副语言细节,流式架构实现边生成边播放
Gen音频生成
一次生成人声、音效、环境音和背景音乐,支持对多个角色的音色情绪及声音出现时序进行精细控制
Music音乐创作
支持从零生成歌曲和清唱配乐,可用ABC记谱法做多轮交互创作,覆盖歌曲翻唱和编曲完善
产品特色
- 01
实时对话终于有了节奏感
全双工架构让AI能感知语气和对话节奏,知道什么时候该接话什么时候该等,用起来没那么像在跟机器说话
- 02
音频生成不用拼工具了
配音、音效、环境声、配乐原本要找不同的工具分开做,现在一次生成就带完整声音层次,还能精确安排各类声音出现的时间顺序
- 03
语音识别卷到了专业领域
ASR把大模型的上下文理解能力接进来了,人名地名、专业术语、中英混说的场景比传统识别准确不少,医疗法律这类领域也能用
- 04
音乐创作主动权还在你手里
不是一句话生成一首歌就完事,你可以用清唱、歌词或者ABC记谱法参与创作,AI帮你续写和完善,更像协作
应用场景
✅ 实时语音助手
做语音Agent或者智能客服,支持全双工对话和异步工具调用,用户说完不用僵在那里等结果
✅ 会议语音转写
高精度识别中英文和方言,支持长音频和专业领域术语,适合会议记录、媒体内容处理等场景
✅ 有声内容配音
生成真人级语音,能还原情绪和副语言细节,适合有声书、广播剧和短视频配音
✅ 影视游戏音效
用自然语言描述角色和场景,一次生成对白、音效和背景音乐的完整声音设计,省去反复切换工具的麻烦
✅ 歌曲创作编曲
用清唱或歌词作为输入,AI补齐编曲和和声,适合音乐创作者快速把灵感变成完整作品
常见问题
解答您关于"StepAudio 3"的常见疑问,让您更好地使用这款AI工具
-
上阶跃星辰开放平台注册获取API Key就能接入,也可以先去语音体验中心在线试用,目前限时免费
-
不用,五款模型都在同一个开放平台上线了,按需选用对应的模型调用即可
-
ASR的词错误率是1.7%,在Artificial Analysis的非流式语音识别榜上并列全球第一,复杂环境和专业领域也有优化
-
可以,Tool Call和长任务支持异步执行,在任务跑的过程中你还能继续对话,不会把当前会话卡住
-
可以,它支持对白、音效、环境声和背景音乐的时间与顺序编排,不是简单叠在一起
-
目前预览阶段免费,后续费率还没公布,ASR和TTS有参考价格,ASR是0.15元/小时,TTS最低0.9元/万字符
立即体验“StepAudio 3”
StepAudio 3 是阶跃星辰推出的语音大模型系列,包含 Realtime、ASR、TTS、Gen和 Music五款模型。StepAudio 3能听懂和说话,更能理解情绪语气、完成复杂推理、统一生成人声与音效、参与音乐创作全流程,覆盖实时对话、字幕转写、影视配音、音乐制作等场景。

