首页 科技快讯 OpenAI推出两款转录模型,提升语音识别准确率

OpenAI推出两款转录模型,提升语音识别准确率

来源:晰数塔互联网快讯 时间:2026年07月29日 19:52

OpenAI近日宣布推出新的转录模型GPT-Live-Transcribe和GPT-Transcribe,分别面向实时语音转录以及音频文件异步转录场景。对此官方表示,这两款模型相比此前的方案进一步提升了上下文理解能力,并针对真实环境中的多语言、多口音语音识别进行了优化。

据了解,GPT-Live-Transcribe专为低延迟实时转录设计,可用于需要即时语音转换的场景,GPT-Transcribe则针对已完成音频文件的异步转录以及批量工作负载进行优化。两款模型均支持开发者通过提供录音背景信息、人名及领域术语关键词、预期输入语言,以及此前转录内容等方式,为实时音频转录提供更多上下文信息。

性能方面,OpenAI也公布了这两款模型在多项语音识别基准测试中的表现。在新的上下文感知自动语音识别测试中,GPT-Live-Transcribe加入自由形式上下文信息后,语义准确率由38.5%提升至44.6%,GPT-Transcribe的语义准确率则由41.6%提升至45.2%。

在Common Voice的22种语言测试中,GPT-Live-Transcribe的转录错误率为19.70%,GPT-Realtime-Whisper-1为 20.33%。而在真实世界音频录制基准的九种语言测试中,GPT-Live-Transcribe的转录错误率为9.60%,GPT-Realtime-Whisper-1是11.65%。

此外,GPT-Transcribe在多语言语音识别测试中也相比Whisper-1有所提升。在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率为19.27%,Whisper-1则是40.37%;在真实世界音频录制基准测试中,GPT-Transcribe的转录错误率为8.98%,Whisper-1是15.21%。

目前,OpenAI已通过API开放GPT-Live-Transcribe和GPT-Transcribe这两款模型。其中,GPT-Live-Transcribe的调用价格为每分钟0.017美元(约合人民币 0.12 元),GPT-Transcribe则是每分钟0.0045美元(约合人民币 0.03 元)。

【本文图片来自网络】

发布于:湖北

相关推荐

OpenAI推出两款转录模型,提升语音识别准确率
OpenAI语音转录,每10份音频就有8份被“胡编”
OpenAI发布三款实时语音模型,含推理翻译转录功能
OpenAI推出AI图片检测工具,识别准确率高达 98%
OpenAI发布端对端语音模型GPT-Realtime,助力开发者构建语音智能体
OpenAI放大招:即将推出AI语音助手,与苹果达成合作
整合多源植物转录组数据,山东理工大学等构建PlantLncBoost模型,跨物种lncRNA预测准确率最高达96%
腾讯与福佑卡车联手!打造首个数字货运大模型,OCR识别准确率提升超20%
国外创投新闻 | AI语音转录平台「Verbit」获2.5亿美元融资,拥有行业领先的专业化语音服务
最前线 | ​搜狗发布两款AI录音笔:可识别10种方言,实时转写率达98%

网址: OpenAI推出两款转录模型,提升语音识别准确率 https://www.xishuta.cn/newsview152037.html

所属分类:行业热点

推荐科技快讯