Spark-Audio
科大讯飞语音基座大模型的官方在线体验入口
直接打字对话;带上音频时选一条任务,识别、翻译、理解都在这一个框里完成。

核心功能
语音转写
把音频里的内容转成文字,支持99种语言和202种方言识别,中英文混合、专业术语场景也能处理。
多方言识别
粤语、温州话、四川话这些都能听懂,覆盖202种方言。在同尺寸模型对比中,多方言识别效果有优势。
情感分析
捕捉语音里的语气和情绪变化。比如用户语气不耐烦时,系统能识别出来,而不是只看到文字内容。
说话人识别
自动区分一段录音里有几个人在说话,适合会议记录、访谈整理等多人对话场景。
音频问答
针对一段录音直接提问,模型会结合声音里的信息给出回答,长音频和嘈杂环境也能处理。
产品特色
- 01
全国产算力训练
整个训练流程跑在国产芯片集群上,用1300万小时音频数据完成。是国内首个基于纯国产算力训练出来的语音基座大模型。
- 02
端到端直接理解语音
不走“先转文字再理解”的老路,音频直接输入模型,语气、情绪、背景音都保留着,信息不丢。
- 03
高噪声小音量场景领先
在嘈杂环境和小声说话这类真实条件下,语音识别效果比同尺寸模型有明显优势。不像实验室数据那么好看,但实际用起来更踏实。
- 04
文本能力没落下
很多语音模型一训就“变笨”,通用知识和数学能力会下降。这个模型在文本任务上没出现明显降智,算是个不容易的地方。
- 05
架构轻量
0.65B的音频编码器配30B-A3B的MoE语言模型,参数规模不算大,但效果接近更大尺寸的闭源模型。
应用场景
✅ 智能客服
识别用户说话时的情绪和表达方式,让机器回应更贴合当时的状态,而不是照本宣科。
✅ 汽车座舱
车载环境嘈杂,方言口音也多。模型能在这种条件下更准地听懂驾驶员指令。
✅ 会议转写与纪要
自动区分谁在说话,提取讨论要点,减少会后整理录音的重复劳动。
✅ 跨语言会议
做语音翻译时保留说话人的语气和节奏,不只是生硬地转换文字。
✅ 医疗电子病历
医生口述病历内容,模型直接转成结构化文字,减少手工录入的负担。
常见问题
解答您关于"Spark-Audio"的常见疑问,让您更好地使用这款AI工具
-
在讯飞研究院的体验中心页面就能用,地址是 iflytekresearch.iflytek.com/experience/spark-audio。需要用讯飞账号登录。目前是网页端免费体验,API后续会上线讯飞开放平台。
-
如果你只是好奇,可以上传一段录音试试转写、方言识别或者情感分析。日常开会、采访、整理录音素材,也能拿它辅助处理。不需要写代码,网页上直接操作。
-
Spark-Audio是底层的语音基座模型,讯飞听见和输入法是上层的产品应用。这个体验站让你直接接触底层模型的能力,而不是已经包装好的产品功能。
-
API还没正式上线,需要关注讯飞开放平台。有定制需求的企业可以基于这个语音基座做微调,开发自己业务场景的专用模型。
立即体验“Spark-Audio”
讯飞研究院上线的Spark-Audio体验中心,提供全国产语音基座大模型的在线试用。你可以上传音频,试试语音转写、方言识别、情感分析和音频问答,看看机器从“听清”到“听懂”到底能走多远。

