讯飞星火语音基座大模型上线 全国产化算力训练

AI 驱动中国 苏木 905次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

9月16日,讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线,该模型基于全国产化算力训练,标志着语音AI技术自主可控迈出关键一步。

驱动中国9月16日消息,科大讯飞旗下讯飞星火语音基座大模型Spark-Audio-1.0-Preview正式上线。该模型完全基于全国产化算力平台训练,是语音AI领域在自主可控技术路线上的一次重要突破,为行业提供了从底层算力到上层应用的全链路国产化解决方案。

Spark-Audio-1.0-Preview定位为语音基座大模型,具备语音识别、语音合成、声纹理解、情感表达等多模态语音处理能力。与通用大模型不同,语音基座模型更侧重于对音频信号的深层语义解析,能够捕捉语调、停顿、重音等副语言信息,从而在复杂场景下实现更精准的语音交互。

此次发布的模型采用全国产化算力进行训练,意味着从芯片、框架到算法均不依赖国外技术栈。在当前全球AI算力供应链面临不确定性的背景下,这一举措不仅降低了外部技术封锁的风险,也为国内语音AI的大规模商业化落地提供了更稳定的基础设施保障。

从技术架构上看,Spark-Audio-1.0-Preview融合了讯飞在语音领域多年的技术积累,包括端到端语音识别、自适应声学建模以及基于注意力机制的语音编码器等。该模型支持多语种、多方言的识别与合成,并针对会议转写、智能客服、车载语音、教育评测等高频场景进行了专项优化,能够显著提升嘈杂环境下的识别准确率。

值得关注的是,语音基座大模型被视为AI大模型竞争的下一个关键赛道。相较于文本大模型,语音交互更贴近人类自然沟通方式,在智能硬件、物联网、无障碍服务等场景中具有不可替代的价值。讯飞此次选择以全国产化算力作为训练底座,既是对自身技术实力的展示,也反映出国产AI产业链协同发展的趋势。

目前Spark-Audio-1.0-Preview以预览版形式开放,开发者可通过讯飞开放平台申请接入。后续讯飞计划根据反馈持续迭代模型能力,并逐步开放更多细粒度语音控制接口,以支持开发者构建个性化的语音应用。这一动作有望加速语音AI在金融、医疗、政务等对数据安全要求较高的行业中的渗透。

业内分析认为,语音基座大模型的成熟将推动人机交互范式从“命令式”向“对话式”演进。随着国产算力生态的不断完善,类似Spark-Audio-1.0-Preview这样的全栈自主模型将成为行业标配,进而带动整个AI应用生态的繁荣。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 3 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友