阿里千问发布Qwen3.8-LiveTranslate,字均延迟降至2.3秒

AI 驱动中国 纪行 5,998次阅读 18 条评论
分享 Q
AI摘要
由 AI 生成 · 仅供参考

阿里千问推出同声传译大模型Qwen3.8-LiveTranslate,采用Interleave架构重构实时同传,字均延迟从2.8秒降至2.3秒。该模型基于Hybrid MoE设计,支持60种语言及长上下文消歧,在Omnilingua-MSpeaker和FLEURS评测中表现优于主流系统。

驱动中国9月19日消息,阿里千问正式发布同声传译大模型Qwen3.8-LiveTranslate。该模型通过Interleave架构重构实时同传技术,显著提升了翻译的准确度、流畅度与简洁度,将字均延迟(LAAL)从2.8秒降低至2.3秒。

官方介绍,Qwen3.8-LiveTranslate在支持60种语言的基础上,新增三项核心能力以拓展其在真实场景中的应用范围。其中,长上下文消歧功能能够联系前文语境理解当下内容,从而提高人名与专业术语翻译的精准度。

技术层面,该模型采用基于Hybrid MoE的Thinker–Talker双模块设计,利用Interleave方式衔接流式理解、文本输出与语音生成。Thinker模块将视频、音频、原文与译文编排进同一条因果序列,按时序交替排列并端到端产出,实现理解与翻译在单一序列内的完成;Talker模块则结合译文与源音频,将译文合成为保留原说话人音色的语音。

评测数据显示,在覆盖14个语向的多说话人长音频评测集Omnilingua-MSpeaker上,Qwen3.8-LiveTranslate在翻译忠实度、流畅度、简洁度以及说话人分离错误率(DER)四个维度上,均优于当前行业主流实时同传系统。

此外,官方在公开FLEURS音频测试集上对70个语言方向的实时同传表现进行了评测。结果表明,Qwen3.8-LiveTranslate在翻译质量、字均延迟、语音识别准确率及语音合成质量四个维度上,领先于上一代模型及当前主流实时同传系统。

用户可通过官方提供的体验链接尝鲜,相关模型API接口也已同步开放。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 4 44 人已评
登录后为本文打分
网友评论18 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友