讯飞星火语音基座大模型上线:0.65B 编码器配 30B MoE,纯国产算力训练

举报
yd_244366335 发表于 2026/09/17 08:42:24 2026/09/17
【摘要】 科大讯飞宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产化算力训练的语音基座大模型。过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法有两个明显短板:一是信息丢失——文字只能记录说了什么,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景判断不完整;二是链路割裂——语音转写、声纹识别、语音翻译等能力被拆成独立模块...

科大讯飞宣布 Spark-Audio-1.0-Preview 上线,这是一款基于全国产化算力训练的语音基座大模型。

过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法有两个明显短板:一是信息丢失——文字只能记录说了什么,会丢掉语音里自带的语气、情绪以及背景环境音等关键信息,导致模型对场景判断不完整;二是链路割裂——语音转写、声纹识别、语音翻译等能力被拆成独立模块串联运行,模块之间存在断点,容易累积错误,体验上也会出现延迟、卡顿。

不再只做转写,而是直接“听懂”语音

语音基座大模型不再只做语音转文字,而是直接理解语音:一次性听懂人声、环境音、音乐等,还能理解声音里的语义、情绪和场景。

此次首发的 Spark-Audio-1.0-Preview 采用 0.65B(Dense 结构)的音频编码器,搭配 30B-A3B(MoE 结构)的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。与讯飞星火大模型的“1+N”体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或系统。

支持 99 种语言、202 种方言,复杂场景优势明显

官方称,Spark-Audio-1.0-Preview 在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,表现也十分接近。

该模型可支持 99 种语言及 202 种方言的识别。在多项任务中,与同尺寸的 Qwen3.5-omni-flash(35B-A3B)相比,在多语言、多方言语音识别的平均效果上表现出优势;与尺寸高一个数量级的 Qwen3.5-omni-plus 效果接近。在 Fleurs、Kespeech、LibriSpeech 等中英文、多语言、多方言语音识别评测中,其得分高于 Gemini-3.1 Pro,并在 Fleurs 中文测试集中取得 SOTA。

讯飞也坦言,此次发布的版本在通用知识、数学与代码等任务上没有出现明显降智,但在指令遵循、对话、音频理解等任务上仍有进步追赶空间,下一步将在巩固优势的同时补齐短板。目前,Spark-Audio-1.0-Preview 已正式开放体验,API 后续将上线讯飞开放平台。

【声明】本内容来自华为云开发者社区博主,不代表华为云及华为云开发者社区的观点和立场。转载时必须标注文章的来源(华为云社区)、文章链接、文章作者等基本信息,否则作者和本社区有权追究责任。如果您发现本社区中有涉嫌抄袭的内容,欢迎发送邮件进行举报,并提供相关证据,一经查实,本社区将立刻删除涉嫌侵权内容,举报邮箱: cloudbbs@huaweicloud.com
  • 点赞
  • 收藏
  • 关注作者

评论(0)

0/1000
抱歉,系统识别当前为高风险访问,暂不支持该操作

全部回复

上滑加载中

设置昵称

在此一键设置昵称,即可参与社区互动!

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。

*长度不超过10个汉字或20个英文字符,设置后3个月内不可修改。