阿里发布Qwen-Audio-3.0-ASR-Flash语音识别模型
财闻
2026-07-31 15:32:25
据介绍,该模型主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时具备语音润色能力,可直接输出结构化文本。
7月31日,阿里巴巴-W(09988.HK)正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。据介绍,该模型主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时具备语音润色能力,可直接输出结构化文本。
目前,Qwen-Audio-ASR-Flash系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到广泛验证,曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。对语音识别来说,能否准确识别专业词汇,往往是其真正在行业里用起来的关键。
Qwen-Audio-3.0-ASR现已通过阿里云百炼平台开放调用,提供三个版本:Qwen-Audio-3.0-ASR-Flash(语音识别,最长5分钟)、Qwen-Audio-3.0-ASR-Filetrans(离线文件转写)和Qwen-Audio-3.0-ASR-Streaming(实时语音识别)。

