讯飞星火语音基座大模型上线 全国产化算力训练
9月16日,讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线,该模型基于全国产化算力训练,标志着语音AI技术自主可控迈出关键一步。
驱动中国9月16日消息,科大讯飞旗下讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线。该模型完全基于全国产化算力平台训练,是语音AI领域在自主可控技术路线上的一次重要突破,为行业提供了从底层算力到上层应用的全链路国产化解决方案。
Spark-Audio-1.0-Preview定位为语音基座大模型,具备语音识别、语音合成、声纹理解、情感表达等多模态语音处理能力。与通用大模型不同,语音基座模型更侧重于对音频信号的深层语义解析,能够捕捉语调、停顿、重音等副语言信息,从而在复杂场景下实现更精准的语音交互。
此次发布的模型采用全国产化算力进行训练,意味着从芯片、框架到算法均不依赖国外技术栈。在当前全球AI算力供应链面临不确定性的背景下,这一举措不仅降低了外部技术封锁的风险,也为国内语音AI的大规模商业化落地提供了更稳定的基础设施保障。
从技术架构上看,Spark-Audio-1.0-Preview融合了讯飞在语音领域多年的技术积累,包括端到端语音识别、自适应声学建模以及基于注意力机制的语音编码器等。该模型支持多语种、多方言的识别与合成,并针对会议转写、智能客服、车载语音、教育评测等高频场景进行了专项优化,能够显著提升嘈杂环境下的识别准确率。
值得关注的是,语音基座大模型被视为AI大模型竞争的下一个关键赛道。相较于文本大模型,语音交互更贴近人类自然沟通方式,在智能硬件、物联网、无障碍服务等场景中具有不可替代的价值。讯飞此次选择以全国产化算力作为训练底座,既是对自身技术实力的展示,也反映出国产AI产业链协同发展的趋势。
目前Spark-Audio-1.0-Preview以预览版形式开放,开发者可通过讯飞开放平台申请接入。后续讯飞计划根据反馈持续迭代模型能力,并逐步开放更多细粒度语音控制接口,以支持开发者构建个性化的语音应用。这一动作有望加速语音AI在金融、医疗、政务等对数据安全要求较高的行业中的渗透。
业内分析认为,语音基座大模型的成熟将推动人机交互范式从“命令式”向“对话式”演进。随着国产算力生态的不断完善,类似Spark-Audio-1.0-Preview这样的全栈自主模型将成为行业标配,进而带动整个AI应用生态的繁荣。