高管称语音AI尚未迎来ChatGPT时刻
据TechCrunch报道,语音AI资本热度上升,但PolyAI首席技术官肖恩·文认为,全双工模型虽已出现,语音AI在推理速度、上下文理解和自然对话上仍未达到ChatGPT时刻。
驱动中国10月12日消息,语音AI(Voice AI)长期被视作下一代人机交互界面,资本与产品迭代持续升温,但企业语音AI平台PolyAI首席技术官肖恩·文(Shawn Wen)表示,尽管全双工(full-duplex)模型已经出现,语音AI仍未迎来属于自己的“ChatGPT时刻”。
据TechCrunch报道,围绕语音交互的创业和投资热度仍在上升。投资者向语音AI初创企业投入数十亿美元,覆盖模型研发、企业客服、会议记录、AI听写等多个方向。几乎每周都有新的模型或工具发布,宣称声音接近真人、对话也像真人。
不过,实际体验与宣传之间仍存在差距。报道提到,语音AI常会遗漏上下文层中的关键信息,进而导致整个处理链路中断。对于需要连续理解、实时回应和稳定执行的企业场景来说,这种问题会直接影响可用性。
肖恩·文在上月举行的HumanX大会现场表示,行业已经达到开发全双工模型的里程碑。所谓全双工模型,可以在“听”的同时继续“说”,更接近人类对话中的实时互动。但他认为,下一步挑战不是单纯模仿声音,而是让推理速度足够快,使模型能够迅速获取答案,让对话显得自然。
这一判断指向语音AI从“拟人化”向“可靠化”推进的关键瓶颈。模型不仅要生成流畅语音,还要在复杂对话中准确识别意图、维持上下文,并在延迟可控的情况下完成检索、推理和动作执行。对于客服、会议、语音助手等高频场景,速度和稳定性往往比音色更像真人更关键。
肖恩·文还提到,客服场景中的AI代理(AI agents)不应听起来像机器,而应让来电者获得足够信心。这意味着语音AI的企业落地,需要在自然度、响应速度、上下文理解和任务执行之间形成闭环,而不是停留在单点模型能力展示。
从行业层面看,语音AI尚未出现类似ChatGPT的破圈时刻,并不等于技术停滞。相反,资本、模型和工具链的持续投入,正在推动语音交互从实验性产品走向工程化系统。接下来的竞争焦点,可能不再是“谁的声音更像人”,而是“谁能在真实业务中更快、更稳、更完整地听懂并回应”。