OpenAI 引入两种转录模型:低延迟、更好理解上下文
2026-07-29 08:08:11
神评论
17173 新闻导语
OpenAI推出GPT-Live-Transcribe与GPT-Transcribe两种转录模型:低延迟实时转录,更好理解上下文,支持API调用,性能大幅超越Whisper,转录错误率仅19.27%!
感谢网友 华南吴彦祖 的线索投递!
7 月 29 日消息,OpenAI 公司今天(7 月 29 日)在 X 平台发布公告,宣布推出 GPT-Live-Transcribe 和 GPT-Transcribe 两种转录模型,并支持通过 API 方式调用。

调用费用方面
OpenAI 官方表示相比公司此前模型,上述两种转录模型可以更好地理解上下文,并能在各种口音和语言的真实世界音频上提供更准确的转录,包括短语、数字、专业术语以及带有响亮背景噪音的语音。
GPT-Live-Transcribe 是专为低延迟实时转录而构建;而 GPT-Transcribe 可以优化已完成音频文件和批量工作负载的异步转录。

在 Context Aware ASR 基准测试上,GPT-Transcribe 语义准确率从无自由形式上下文的 41.6% 提高到有上下文的 45.2%。

在 Common Voice 的 22 种语言上,GPT-Transcribe 的转录错误率为 19.27%,而 Whisper (whisper-1) 为 40.37%。在真实世界音频录制基准的九种语言上,它实现了 8.98% 的转录错误率,而 Whisper (whisper-1) 为 15.21%。
【来源:IT之家】
今日热点
热门测试游戏

