资料摘要:Qwen-Audio-3.0-ASR-Flash
阿里云百炼于 2026-07-30 发布的新一代托管 ASR 服务族:同一产品线分成实时 Streaming、长文件 Filetrans 与短文件同步 Flash 三个端点,覆盖 30 种语言、七大中文方言群及多种地域口音,并以 prompt context 与热词强化专业术语识别。
原始网页快照:🔒 Qwen-Audio-3.0-ASR-Flash 官方模型说明
- 三个服务端点:
qwen-audio-3.0-asr-flash-streaming面向实时字幕/助手;...-filetrans面向最长 12 小时文件和说话人分离;...-flash面向最长 5 分钟的同步识别。 - 专业词增强:三个端点都支持热词与 prompt context;前者提供加权词表,后者按请求注入领域、实体和格式背景。
- 中文覆盖更细:官方列出普通话、粤语、吴语、闽语、客家话、赣语、湘语、晋语及多种区域口音;发布说明概括为七大方言群与 20 多种地域口音。
- 多语种:支持 30 种语言,包括中、英、日、韩、越、泰、印尼、马来、菲律宾、印地、阿拉伯及多种欧洲语言。
- 中文文本优化:发布说明特别强调古诗文识别、标点预测与 inverse text normalization,可把数字、日期和金额整理成标准书写格式。
- 结果能力不完全一致:只有 Filetrans 明确支持 speaker diarization;三个新端点均不支持情感识别,而旧
qwen3-asr-flash*系列支持情感识别。 - 产品文档不是技术报告:官方没有公开参数量、模型架构、训练数据、WER/CER 表格或推理成本,因此不能从“3.0”名称推断它等同于 Qwen3-ASR 开源模型的简单升级。
三个端点如何选
Section titled “三个端点如何选”| 模型 ID | 模式/API | 时长与输入 | 说话人分离 | 典型场景 |
|---|---|---|---|---|
qwen-audio-3.0-asr-flash-streaming |
实时 / WebSocket | 二进制流,时长不限 | 不支持 | 直播字幕、语音助手、会议实时转写 |
qwen-audio-3.0-asr-flash-filetrans |
离线异步 / HTTP | 公网文件 URL,≤2 GB、≤12 小时 | 支持 | 录音归档、播客、访谈、区分发言人 |
qwen-audio-3.0-asr-flash |
离线同步 / HTTP | URL/Base64,≤2 GB、≤5 分钟 | 不支持 | 短语音、接口迁移、单次快速转写 |
Streaming 接受 PCM、WAV、MP3、Opus、Speex、AAC、AMR 等格式且可由服务端处理任意采样率;Filetrans/Flash 接受更广的常见音视频容器。长文件开启 speaker diarization 时,官方建议单文件控制在 2 小时以内。
热词与上下文不是同一机制
Section titled “热词与上下文不是同一机制”- 热词:显式给定带权专业词表,适合稳定、有限的产品名、人名、医学词或工业术语。
- Prompt context:用自然语言描述行业、会议主题、实体和期望文本风格,适合每个请求都不同的开放领域背景。
- 两者可以共同提升专业语料,但官方文档没有给出公开测试集、错误率或相对增益,不能把第三方传播的单点召回率当作已审计的整体 ASR 准确率。
与旧 Qwen3-ASR-Flash 的关系
Section titled “与旧 Qwen3-ASR-Flash 的关系”官方同一模型目录把两代服务分开列出:
| 维度 | Qwen-Audio-3.0-ASR-Flash | Qwen3-ASR-Flash |
|---|---|---|
| 发布时间 | 2026-07-30 | 2025 起,2026-02 有快照 |
| 专业词增强 | 热词 + prompt context | 文档表格标为不支持 accuracy boost |
| 情感识别 | 不支持 | 支持 |
| Filetrans 说话人分离 | 支持 | 不支持 |
| 技术公开 | 仅托管产品文档 | 有 Qwen3-ASR 开源权重、工具链与技术报告 |
因此新名称应被视为一条独立的云服务产品线,而不是 qwen3-asr-flash 的别名。它与 Qwen3-ASR 在底座、训练集或架构上的精确继承关系,官方当前没有披露。
能力边界与批判性判断
Section titled “能力边界与批判性判断”- 部署边界:现有资料描述的是阿里云 Model Studio 托管 API,没有开放权重、本地部署或离线运行说明。
- 评测缺口:发布页只给能力描述,未公开 WER/CER、延迟、价格—精度曲线和对照基线,无法独立判断“3.0”相对旧代的平均提升幅度。
- 接口差异会影响选型:实时流、长文件和短文件不仅时长不同;是否支持 speaker diarization、输入方式及 SDK 也不同,不能只按“Flash 更快”理解。
- 文档易过时:稳定模型 ID、地域可用性、限额和支持格式都可能更新,调用前应回查官方模型目录与 API 文档。
- 官方发布时间:2026-07-30。
- 模型 ID:
qwen-audio-3.0-asr-flash-streaming、qwen-audio-3.0-asr-flash-filetrans、qwen-audio-3.0-asr-flash。 - 语言:30 种;中文覆盖七大方言群与 20 多种地域口音。
- Filetrans:最长 12 小时、2 GB,支持 speaker diarization;开启说话人分离时建议不超过 2 小时。
- Flash:最长 5 分钟、2 GB;Streaming:时长不限。