谷歌推Gemini 3.8 Live实时对话模型 支持97种语言

AI 驱动中国 陆离 901次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

谷歌发布Gemini 3.8 Live及Extended Thinking实时对话模型,支持97种语言切换,强化多模态交互与推理能力,推动AI实时对话体验升级。

驱动中国9月16日消息,谷歌正式推出Gemini 3.8 Live与Gemini 3.8 Live Extended Thinking两款实时对话模型,将多语言支持范围扩展至97种,进一步强化了AI在跨语言实时交互场景中的表现。此次更新被视为谷歌在生成式AI对话赛道上的又一次重要迭代,旨在提升模型在自然对话、即时响应与复杂推理任务中的综合能力。

Gemini 3.8 Live主打低延迟的实时语音与文本对话体验,适用于需要快速反馈的交互场景,如智能助手、实时翻译、在线教育及客服系统等。模型在语音识别的准确性、上下文理解的连贯性以及多轮对话的稳定性上均有针对性优化,能够更自然地处理用户的口语化表达与打断式交流,减少传统对话模型常见的延迟感与机械感。

同步推出的Gemini 3.8 Live Extended Thinking版本则侧重于深度推理与长程思考,面向需要复杂逻辑分析、多步骤问题拆解及专业领域问答的任务。该版本在保持实时交互能力的同时,引入了更长的思考链路,使模型能够在回答前进行更充分的内部推演,从而提升答案的严谨性与可解释性,尤其适合科研辅助、法律咨询、编程调试等对准确性要求较高的场景。

多语言能力的扩展是本次更新的核心亮点之一。Gemini 3.8 Live系列将支持语言数量提升至97种,覆盖范围包括英语、中文、西班牙语、法语、阿拉伯语、印地语等全球主要语种,以及部分小语种和区域性语言。这一举措显著降低了语言壁垒,使得不同母语的用户都能以更自然的方式与AI进行实时对话,也为跨国企业、国际教育及全球化服务提供了更便捷的AI基础设施。

从技术架构来看,Gemini 3.8 Live系列延续了谷歌在多模态大模型上的技术积累,能够同时处理文本、语音乃至图像等多种输入形式,并在统一框架下完成跨模态的理解与生成。谷歌方面表示,新模型在训练过程中采用了更高效的注意力机制与推理优化策略,在保证性能提升的同时,也兼顾了部署成本与能耗控制,为后续在移动端及边缘设备上的应用铺平了道路。

行业分析人士指出,谷歌此次发布实时对话模型的时机正值全球AI大模型竞争白热化阶段。OpenAI、Anthropic等竞争对手也在持续迭代各自的对话模型,多语言支持与实时交互能力正成为衡量模型实用性的关键指标。Gemini 3.8 Live的推出,不仅是对其产品线的补强,更反映出谷歌试图通过差异化功能——尤其是对长尾语种的覆盖——来争夺全球市场份额的战略意图。

目前,Gemini 3.8 Live与Extended Thinking版本已向开发者开放API接入,企业用户可通过谷歌云平台调用相关能力。谷歌同时公布了配套的开发工具与文档,帮助开发者快速将实时对话功能集成到自有应用中。随着API的开放,预计将有更多第三方应用和服务接入这一模型,推动实时AI对话技术在客服、教育、医疗、娱乐等行业的落地。

值得注意的是,多语言实时对话模型的普及也引发了关于数据隐私与内容安全的讨论。谷歌在发布说明中强调,新模型在训练与部署过程中遵循了既有的安全与隐私规范,并提供了内容过滤与使用审计等机制,以应对潜在的滥用风险。如何在开放能力的同时保障用户权益,仍将是AI厂商需要持续面对的课题。

总体来看,Gemini 3.8 Live系列的发布标志着实时对话AI在语言覆盖与推理深度上迈出了新的一步。随着模型能力的持续增强和应用场景的不断拓展,AI实时交互有望从简单的问答工具演进为更智能、更自然的数字伙伴,而谷歌此次的更新无疑为这一进程注入了新的动力。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 4.5 2 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友