Qwen Audio
毫秒级响应的实时语音交互模型
采用“听思同步”架构,支持Agent工具调用与情感共情对话,全双工流式交互不打断。

核心功能
毫秒级实时响应
采用并行推理和全向流式优化,端到端响应时延极低,日常对话可直接生成回复。
智能Agent工具调用
模型可自行调用外部工具,结果融入对话记忆,支持多轮追问,基于FunctionCall标准引入MCP、API及知识库。
全双工流式交互
内置“多模态感知的双工控制”子模型,支持边听边打断,嘈杂环境不被误打断,多说话人场景锁定主对话对象。
多模态情感共情
根据对话语境动态调整语气、节奏、音调与情感表达,能识别用户情感状态并提供共情回应。
多语言与方言支持
支持30种语言、8大方言区共16种方言,适配20+地区口音官话。
产品特色
- 01
“听思同步”架构,又快又聪明
语音输入与语义推理并行,打破“快速响应”与“准确推理”二选一的困局。
- 02
会自己调用工具,不止是聊天
模型能自行判断何时该调工具,自动触发知识图谱和业务API,把“能聊天”变成“能办事”。
- 03
像真人一样边听边聊
支持打断、多意图叠加、跨轮次指代消解,对话自然流畅,不会因为背景噪声误判打断。
- 04
有温度的语音,不是机械回应
能从语气停顿、基频抖动中识别情绪,在情感陪伴场景里提供真正的情感共鸣。
- 05
两个版本按需选择
Plus版本推理更强,Flash版本速度更快,不同场景灵活适配。
应用场景
✅ 智能客服与咨询
边听边判断何时调工具,自动触发知识图谱和业务API,适用于电商、金融、政务等领域。
✅ 在线教育与培训
支持打断续聊、多意图叠加,学生能像与真人教师一样自然问答互动。
✅ 情感陪伴与娱乐
通过声纹建模识别用户情感状态,适用于心理健康、老年陪伴等需要情感共鸣的场景。
✅ 会议与实时转录
支持“边说边出字”的流畅体验,适用于会议同传、实时字幕、会议纪要整理。
常见问题
解答您关于"Qwen Audio"的常见疑问,让您更好地使用这款AI工具
-
阿里云推出的实时语音交互模型系列,包含语音识别ASR、语音合成TTS和实时交互Realtime三类模型。
-
采用“听思同步”架构,毫秒级响应且不牺牲推理深度,支持全双工流式交互和Agent工具调用。
-
支持30种语言、8大方言区共16种方言,适配20+地区口音官话。
-
Plus版本推理能力更强,Flash版本响应速度更快,可按需选择。
-
阿里云提供免费试用,可通过消耗试用点进行部署体验。
立即体验“Qwen Audio”
Qwen-Audio是阿里云推出的实时语音交互模型,采用“听思同步”架构,实现毫秒级端到端响应。支持全双工流式交互,可边听边打断。模型具备智能Agent工具自主调用能力,能基于FunctionCall标准调用外部工具和知识库。同时支持多模态情感共情对话,能根据语境调整语气与情感表达。适用于智能客服、在线教育、情感陪伴等场景。

