Qwen发布Audio-3.0-ASR-Flash 医学召回率95%
Qwen推出Qwen-Audio-3.0-ASR-Flash语音识别模型,聚焦术语识别与热词定制,内测医学术语召回率95.36%、工业93.24%。支持流式、文件转录、非实时三种部署,已接入阿里云模型服务。
发生了什么
Qwen 于 7 月 31 日发布了 Qwen-Audio-3.0-ASR-Flash 语音识别模型。根据官方公布,该模型在内部测试中实现了 95.36% 的医学术语召回率和 93.24% 的工业术语召回率。模型已通过阿里云模型服务上线,提供实时流式识别(Streaming)、录制文件转录(Filetrans)和非实时识别三种部署形态。
核心能力
Qwen-Audio-3.0-ASR-Flash 主打上下文一致性及领域术语识别,支持用户自定义热词,并能够将语音润色输出为结构化文本。这些设计面向医疗、工业等对术语准确性要求严格的场景,有助于降低专业词汇的误识率。模型提供灵活的部署选项,既可以接入实时交互系统,也支持离线批量处理。
对开发者意味着什么
借助阿里云模型服务的 API 调用,开发者可快速将上述能力集成到已有的录音质检、电子病历录入、工单语音记录等流程中。高术语召回率有望减少人工校准工作量,自定义热词功能则允许根据业务环境调整识别偏好。但工程落地时仍需关注实时流式模式的实际延迟与吞吐,以及在不同噪声条件下的鲁棒性表现。
当前边界
目前尚未披露模型的参数规模、推理速度及计算资源需求。官方未说明是否支持中文以外的语言,也未给出在公开基准(如 LibriSpeech、AISHELL)上的整体词错率对比。热词自定义的具体方式、词表大小限制及更新机制亦未公开。此外,模型是否开源、服务定价与免费额度等细节均未提及。内部测试数据集的规模和代表性也仍需进一步透明。



