17173 > 游戏资讯 > 科技新闻 > 正文

OpenAI 扩大实时语音模型能力:GPT-Live-1 上线 API,支持打断处理、工具调用和电话语音智能体

2026-09-11 10:04:49 神评论
17173 新闻导语

OpenAI发布GPT-Live-1实时语音模型,支持打断、工具调用及电话智能体,延迟更低、性能提升30%,API每分钟仅0.05美元,开发者必看!

感谢网友 愚公骑马、Domado 的线索投递!

9 月 11 日消息,OpenAI 今日宣布将 GPT-Live-1 引入 API,开发者可据此打造支持实时语音交互的应用和业务流程。该模型支持全双工对话,能够同时听取和输出语音,并在对话过程中处理打断、停顿及背景噪声。

GPT-Live-1 还支持电话场景,可用于预订餐厅、客户服务等全双工语音智能体。OpenAI 表示,开发者可以将其与 Codex 等工具连接,也可以通过 OpenAI Presence 开发能够查询企业系统、执行获批操作并在必要时转交人工的语音工作。

据介绍,GPT-Live-1 将语音理解与语音输出整合在同一模型中,减少传统“语音转文字 — 大语言模型 — 文字转语音”的多次衔接,从而降低延迟。模型还支持将复杂推理和工具调用交由后端文本模型处理。

开发者可以通过系统提示词调整其语气、语速和对话风格,也可以配置后端模型、工具及智能体框架。

OpenAI 表示,GPT-Live-1 支持原生语音识别转写和回复文本,并具备字母数字理解、关键词偏置及轮次检测能力。

在早期评估中,语言学习平台 Speak 使用 GPT-Live-1 后,学习者思考停顿期间的误打断次数较此前基于轮次的系统减少近 80%。医疗服务平台的联合创始人兼首席技术官 Tony Stoyanov 表示,其团队将代码量减少了 80%,删除约 2.3 万行代码。

OpenAI 公布的评测结果显示,GPT-Live-1 在 Full Duplex Bench 测试中的表现比 GPT-Realtime-2.1 高出 30 个百分点,在搭配 GPT-6 Astra 中等推理强度时,Tau3 端到端语音智能体任务测试排名第一。

目前,GPT-Live-1 已在 API 中提供,前端语音层价格为每分钟 0.05 美元。按每小时 60 分钟计算,单纯前端语音层的费用约为 3 美元(注:现汇率约合 20.2 元人民币),后端模型和智能体工具的费用另行计算。

OpenAI 同时扩大了实时语音选项,新增 Quartz、Ripple、Vesper、Willow、Stone、Gleam、Meridian、Bossa、Tempo、Beacon、Delta 和 Cinder 等声音,并计划在未来数月继续增加语音和语言支持。

【来源:IT之家】
关于GPT-Live-1,OpenAI,实时语音,API,电话语音智能体,工具调用,全双工对话,语音转文字,Codex,语音合成的新闻
17173想了解一下大家怎么看17173的,以便提供更好的阅读体验,所以请各位路过的大佬们花一分钟时间看看这个问卷吧 一键参与