OpenAI推出两款转录模型,提升语音识别准确率
OpenAI近日宣布推出新的转录模型GPT-Live-Transcribe和GPT-Transcribe,分别面向实时语音转录以及音频文件异步转录场景。对此官方表示,这两款模型相比此前的方案进一步提升了上下文理解能力,并针对真实环境中的多语言、多口音语音识别进行了优化。

据了解,GPT-Live-Transcribe专为低延迟实时转录设计,可用于需要即时语音转换的场景,GPT-Transcribe则针对已完成音频文件的异步转录以及批量工作负载进行优化。两款模型均支持开发者通过提供录音背景信息、人名及领域术语关键词、预期输入语言,以及此前转录内容等方式,为实时音频转录提供更多上下文信息。
性能方面,OpenAI也公布了这两款模型在多项语音识别基准测试中的表现。在新的上下文感知自动语音识别测试中,GPT-Live-Transcribe加入自由形式上下文信息后,语义准确率由38.5%提升至44.6%,GPT-Transcribe的语义准确率则由41.6%提升至45.2%。

在Common Voice的22种语言测试中,GPT-Live-Transcribe的转录错误率为19.70%,GPT-Realtime-Whisper-1为 20.33%。而在真实世界音频录制基准的九种语言测试中,GPT-Live-Transcribe的转录错误率为9.60%,GPT-Realtime-Whisper-1是11.65%。
此外,GPT-Transcribe在多语言语音识别测试中也相比Whisper-1有所提升。在Common Voice的22种语言测试中,GPT-Transcribe的转录错误率为19.27%,Whisper-1则是40.37%;在真实世界音频录制基准测试中,GPT-Transcribe的转录错误率为8.98%,Whisper-1是15.21%。

目前,OpenAI已通过API开放GPT-Live-Transcribe和GPT-Transcribe这两款模型。其中,GPT-Live-Transcribe的调用价格为每分钟0.017美元(约合人民币 0.12 元),GPT-Transcribe则是每分钟0.0045美元(约合人民币 0.03 元)。
【本文图片来自网络】
发布于:湖北
相关推荐
OpenAI推出两款转录模型,提升语音识别准确率
OpenAI语音转录,每10份音频就有8份被“胡编”
OpenAI发布三款实时语音模型,含推理翻译转录功能
OpenAI推出AI图片检测工具,识别准确率高达 98%
OpenAI发布端对端语音模型GPT-Realtime,助力开发者构建语音智能体
OpenAI放大招:即将推出AI语音助手,与苹果达成合作
整合多源植物转录组数据,山东理工大学等构建PlantLncBoost模型,跨物种lncRNA预测准确率最高达96%
腾讯与福佑卡车联手!打造首个数字货运大模型,OCR识别准确率提升超20%
国外创投新闻 | AI语音转录平台「Verbit」获2.5亿美元融资,拥有行业领先的专业化语音服务
最前线 | 搜狗发布两款AI录音笔:可识别10种方言,实时转写率达98%
网址: OpenAI推出两款转录模型,提升语音识别准确率 https://www.xishuta.cn/newsview152037.html
推荐科技快讯
- 1问界商标转让释放信号:赛力斯 95792
- 2报告:抖音海外版下载量突破1 25736
- 3人类唯一的出路:变成人工智能 25175
- 4人类唯一的出路: 变成人工智 24611
- 5移动办公如何高效?谷歌研究了 24309
- 6华为 nova14深度评测: 13155
- 7滴滴出行被投诉价格操纵,网约 11888
- 82023年起,银行存取款迎来 10774
- 9五一来了,大数据杀熟又想来, 9794
- 10手机中存在一个监听开关,你关 9519
