科大讯飞发布语音识别大模型Spark-ASR-2.0 推理成本仅增10%
科大讯飞今日发布新一代语音识别大模型Spark-ASR-2.0,通过非自回归与LLM增强自回归协同等技术,实现中英文混合及复杂场景下的流畅成文识别。该模型在效果显著提升的同时,整体推理成本较上一代仅增加10%,将于明日逐步上线讯飞输入法。
驱动中国9月23日消息,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。该模型在保持高识别准确率的基础上,重点优化了文本的流畅性与规范性,实现了从“还原内容”到“流畅成文”的技术跨越。
官方数据显示,Spark-ASR-2.0在通用识别(涵盖中英文混合、方言及专业术语)、复杂声学场景识别(包括高噪、小音量、快语速及儿童语音)、上下文识别以及文本流畅规范性等方面均有显著改善。相较于前代产品Spark-ASR-1.0,新版本在核心场景下的词错误率(WER)明显降低,尤其在处理中英文混合、方言及高噪声环境时表现更为突出。
在技术创新层面,Spark-ASR-2.0采用了非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术。通过结合上下文逻辑与语境理解,该模型能够精简冗余表达并精修细节,使输出文字更加连贯、语义更加清晰。值得注意的是,在性能大幅提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。
据官方介绍,Spark-ASR-2.0在方言、高噪和小音量等复杂声学场景上的表现优于当前业界最好水平,主要任务效果均达到行业领先标准。这一成果进一步验证了科大讯飞在复杂环境下的语音识别技术实力。
在落地应用方面,Spark-ASR-2.0将于9月24日起逐步上线讯飞输入法,并通过讯飞开放平台提供API服务。此外,该模型还将陆续部署至讯飞AI眼镜、讯飞智能办公本、讯飞听见等多款产品业务中,以拓展其在智能硬件及办公场景的应用范围。