科大讯飞发布语音识别大模型Spark-ASR-2.0 推理成本仅增10%

AI 驱动中国 柳深 768次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

科大讯飞今日发布新一代语音识别大模型Spark-ASR-2.0,通过非自回归与LLM增强自回归协同等技术,实现中英文混合及复杂场景下的流畅成文识别。该模型在效果显著提升的同时,整体推理成本较上一代仅增加10%,将于明日逐步上线讯飞输入法。

驱动中国9月23日消息,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。该模型在保持高识别准确率的基础上,重点优化了文本的流畅性与规范性,实现了从“还原内容”到“流畅成文”的技术跨越。

官方数据显示,Spark-ASR-2.0在通用识别(涵盖中英文混合、方言及专业术语)、复杂声学场景识别(包括高噪、小音量、快语速及儿童语音)、上下文识别以及文本流畅规范性等方面均有显著改善。相较于前代产品Spark-ASR-1.0,新版本在核心场景下的词错误率(WER)明显降低,尤其在处理中英文混合、方言及高噪声环境时表现更为突出。

在技术创新层面,Spark-ASR-2.0采用了非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术。通过结合上下文逻辑与语境理解,该模型能够精简冗余表达并精修细节,使输出文字更加连贯、语义更加清晰。值得注意的是,在性能大幅提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。

据官方介绍,Spark-ASR-2.0在方言、高噪和小音量等复杂声学场景上的表现优于当前业界最好水平,主要任务效果均达到行业领先标准。这一成果进一步验证了科大讯飞在复杂环境下的语音识别技术实力。

在落地应用方面,Spark-ASR-2.0将于9月24日起逐步上线讯飞输入法,并通过讯飞开放平台提供API服务。此外,该模型还将陆续部署至讯飞AI眼镜、讯飞智能办公本、讯飞听见等多款产品业务中,以拓展其在智能硬件及办公场景的应用范围。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 5 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友