OpenAI上线GPT-Live-1实时语音API 支持打断与工具调用

AI 驱动中国 苏木 461次阅读
分享 Q
AI摘要
由 AI 生成 · 仅供参考

OpenAI推出GPT-Live-1实时语音模型API,支持打断处理、工具调用及电话语音智能体,为开发者提供低延迟交互能力,推动语音AI应用落地。

驱动中国9月11日消息,OpenAI正式扩大其实时语音模型能力,将GPT-Live-1模型上线至API平台,面向开发者开放。该模型主打低延迟语音交互,支持打断处理、工具调用以及电话语音智能体等场景,被视为OpenAI在语音AI商业化路径上的关键一步。

GPT-Live-1的核心特性在于其“实时”属性。与传统的先录音再转写、或分步处理语音请求的架构不同,该模型能够在对话过程中持续接收音频流,并即时生成响应。这意味着用户可以在AI说话时随时插话打断,模型会迅速调整输出,使交互节奏更接近人与人之间的自然对话,而非机械式的“一问一答”。

在功能层面,GPT-Live-1原生支持工具调用(function calling),允许开发者将语音交互与外部系统对接。例如,语音助手可以通过API直接查询数据库、预订服务、操作物联网设备或调用第三方应用,而不需要额外的文本中转环节。这一设计大幅降低了构建复杂语音应用的技术门槛,也为企业级客户提供了更灵活的集成方案。

针对电话场景,OpenAI特别优化了GPT-Live-1在电话语音智能体中的表现。模型能够处理电话线路中的背景噪声、语音中断和模糊发音,并适应不同语速和口音。开发者可利用该模型快速搭建自动客服、电话预约、语音导航等系统,替代传统的按键式IVR(交互式语音应答)流程,提升用户体验和运营效率。

从行业背景看,OpenAI此次更新正值语音AI竞争加剧之际。谷歌、亚马逊、Meta等科技巨头均在加大实时语音模型的研发投入,而初创公司如ElevenLabs、Cartesia等也在细分领域推出低延迟语音方案。GPT-Live-1的差异化优势在于其与OpenAI现有生态的深度整合——开发者可复用GPT系列模型的知识库和推理能力,同时获得语音输入输出的原生支持,减少了多模型拼接带来的复杂性和延迟。

对于开发者而言,GPT-Live-1的API接口设计延续了OpenAI一贯的简洁风格,支持流式传输和WebSocket连接,便于在移动端、网页端及嵌入式设备中部署。OpenAI还提供了示例代码和文档,帮助开发者快速上手打断处理、工具调用等高级功能。不过,该模型的定价策略尚未完全公开,业界猜测其成本将高于纯文本模型,这可能会影响中小型开发者的采用意愿。

分析人士指出,GPT-Live-1的发布标志着语音交互从“识别+生成”的串联模式向“端到端实时对话”的范式转变。随着模型延迟进一步降低至数百毫秒级别,语音有望成为继键盘和触摸屏之后的下一代人机交互主界面。OpenAI此举不仅巩固了其在生成式AI领域的领先地位,也为智能客服、语音助手、无障碍辅助等应用场景打开了新的想象空间。

目前,GPT-Live-1已向部分开发者开放测试,OpenAI表示将根据反馈持续优化模型性能,并计划在未来数月内逐步扩大访问范围。对于希望构建实时语音产品的团队而言,这一新API提供了从原型验证到规模部署的完整路径,但如何在成本、延迟和准确性之间取得平衡,仍是实际落地中需要面对的关键课题。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 3 1 人已评
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录
我要投稿有独家观点或行业线索?向驱动中国投稿,审核采用后署名发布并获积分奖励。 去投稿 ›

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友