阿里巴巴发布了语音识别大模型Qwen-Audio-3.0-ASR-Flash。该模型在上下文一致性、行业词识别及热词定制化方面进行了优化,具备语音润色和结构化文本输出能力。依托多行业高质量词库,该模型提升了专业词汇的识别率,在医疗场景中的听中率高达95.36%。Qwen-Audio-ASR-Flash系列已在会议纪要整理等多个场景中得到验证,并曾以1.7%的错字率在AI评测平台上获得全球第一。目前,Qwen-Audio-3.0-ASR已通过阿里云百炼平台开放调用,提供语音识别、离线文件转写和实时语音识别三个版本。
