Meta通过其超级智能实验室推出了实时音频感知模型Muse Voice Transcribe。该模型支持实时流式自动语音识别,能够分割超过20位说话人的语音,并进行端点控制,可处理超过1小时的长音频。它支持多语言及无缝语码切换,通过语言、关键词和上下文偏好提升识别准确率,在相关基准测试中位居榜首。Muse Voice Transcribe已用70多种语言进行训练,其中25种语言经过全面验证。该模型具备自适应延迟功能,可动态平衡速度与准确率,并基于ASR构建了说话人分割和语音端点检测功能。用户可通过Meta Model API、Mac版Meta AI和Muse Code使用该模型,其中API有相应定价。当前,语音转写正从独立工具向AI系统实时感知层转变,未来竞争将聚焦于多维度能力与大模型相关能力的融合。
