高管称语音AI尚未迎来ChatGPT时刻

AI 驱动中国 陆离 554次阅读
分享 微 Q 信
AI摘要
由 AI 生成 · 仅供参考

据TechCrunch报道,语音AI资本热度上升,但PolyAI首席技术官肖恩·文认为,全双工模型虽已出现,语音AI在推理速度、上下文理解和自然对话上仍未达到ChatGPT时刻。

驱动中国10月12日消息,语音AI(Voice AI)长期被视作下一代人机交互界面,资本与产品迭代持续升温,但企业语音AI平台PolyAI首席技术官肖恩·文(Shawn Wen)表示,尽管全双工(full-duplex)模型已经出现,语音AI仍未迎来属于自己的“ChatGPT时刻”。

据TechCrunch报道,围绕语音交互的创业和投资热度仍在上升。投资者向语音AI初创企业投入数十亿美元,覆盖模型研发、企业客服、会议记录、AI听写等多个方向。几乎每周都有新的模型或工具发布,宣称声音接近真人、对话也像真人。

不过,实际体验与宣传之间仍存在差距。报道提到,语音AI常会遗漏上下文层中的关键信息,进而导致整个处理链路中断。对于需要连续理解、实时回应和稳定执行的企业场景来说,这种问题会直接影响可用性。

肖恩·文在上月举行的HumanX大会现场表示,行业已经达到开发全双工模型的里程碑。所谓全双工模型,可以在“听”的同时继续“说”,更接近人类对话中的实时互动。但他认为,下一步挑战不是单纯模仿声音,而是让推理速度足够快,使模型能够迅速获取答案,让对话显得自然。

这一判断指向语音AI从“拟人化”向“可靠化”推进的关键瓶颈。模型不仅要生成流畅语音,还要在复杂对话中准确识别意图、维持上下文,并在延迟可控的情况下完成检索、推理和动作执行。对于客服、会议、语音助手等高频场景,速度和稳定性往往比音色更像真人更关键。

肖恩·文还提到,客服场景中的AI代理(AI agents)不应听起来像机器,而应让来电者获得足够信心。这意味着语音AI的企业落地,需要在自然度、响应速度、上下文理解和任务执行之间形成闭环,而不是停留在单点模型能力展示。

从行业层面看,语音AI尚未出现类似ChatGPT的破圈时刻,并不等于技术停滞。相反,资本、模型和工具链的持续投入,正在推动语音交互从实验性产品走向工程化系统。接下来的竞争焦点,可能不再是“谁的声音更像人”,而是“谁能在真实业务中更快、更稳、更完整地听懂并回应”。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com。
来源:驱动中国 · 原文链接:https://www.qudong.com/article/526002.html
本文价值 ★★★★★ 4 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
✎ 我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友