据explainx.ai报道,OpenAI近日发布新一代语音转录模型系列,将转录任务明确划分为实时与异步两种模式,并分别推出GPT-Live-Transcribe和GPT-Transcribe两种模型。GPT-Live-Transcribe专为低延迟实时转录设计,适合直播字幕、线上会议纪要等场景;GPT-Transcribe则优化异步转录,适用于批量处理已完成音频文件。相比此前模型,新模型能更好理解上下文,在多种口音和语言的真实世界音频上转录更准确,包括短语、数字、专业术语及带背景噪音的语音。在Context Aware ASR基准测试中,GPT-Transcribe语义准确率从无上下文的41.6%提升至有上下文的45.2%;在Common Voice的22种语言上,转录错误率为19.27%,而Whisper为40.37%;在真实世界音频录制基准的九种语言上,错误率进一步降至8.98%,而Whisper为15.21%。
