跳转到内容

输入关键词开始搜索

    资料摘要:Qwen-Audio-3.0-ASR-Flash

    文章摘要更新 2026-08-06置信度 high待阅读原始来源 ↗#音频理解#语音识别#工具#易过时

    阿里云百炼于 2026-07-30 发布的新一代托管 ASR 服务族:同一产品线分成实时 Streaming、长文件 Filetrans 与短文件同步 Flash 三个端点,覆盖 30 种语言、七大中文方言群及多种地域口音,并以 prompt context 与热词强化专业术语识别。

    原始网页快照:🔒 Qwen-Audio-3.0-ASR-Flash 官方模型说明

    • 三个服务端点qwen-audio-3.0-asr-flash-streaming 面向实时字幕/助手;...-filetrans 面向最长 12 小时文件和说话人分离;...-flash 面向最长 5 分钟的同步识别。
    • 专业词增强:三个端点都支持热词与 prompt context;前者提供加权词表,后者按请求注入领域、实体和格式背景。
    • 中文覆盖更细:官方列出普通话、粤语、吴语、闽语、客家话、赣语、湘语、晋语及多种区域口音;发布说明概括为七大方言群与 20 多种地域口音。
    • 多语种:支持 30 种语言,包括中、英、日、韩、越、泰、印尼、马来、菲律宾、印地、阿拉伯及多种欧洲语言。
    • 中文文本优化:发布说明特别强调古诗文识别、标点预测与 inverse text normalization,可把数字、日期和金额整理成标准书写格式。
    • 结果能力不完全一致:只有 Filetrans 明确支持 speaker diarization;三个新端点均不支持情感识别,而旧 qwen3-asr-flash* 系列支持情感识别。
    • 产品文档不是技术报告:官方没有公开参数量、模型架构、训练数据、WER/CER 表格或推理成本,因此不能从“3.0”名称推断它等同于 Qwen3-ASR 开源模型的简单升级。

    模型 ID 模式/API 时长与输入 说话人分离 典型场景
    qwen-audio-3.0-asr-flash-streaming 实时 / WebSocket 二进制流,时长不限 不支持 直播字幕、语音助手、会议实时转写
    qwen-audio-3.0-asr-flash-filetrans 离线异步 / HTTP 公网文件 URL,≤2 GB、≤12 小时 支持 录音归档、播客、访谈、区分发言人
    qwen-audio-3.0-asr-flash 离线同步 / HTTP URL/Base64,≤2 GB、≤5 分钟 不支持 短语音、接口迁移、单次快速转写

    Streaming 接受 PCM、WAV、MP3、Opus、Speex、AAC、AMR 等格式且可由服务端处理任意采样率;Filetrans/Flash 接受更广的常见音视频容器。长文件开启 speaker diarization 时,官方建议单文件控制在 2 小时以内。

    • 热词:显式给定带权专业词表,适合稳定、有限的产品名、人名、医学词或工业术语。
    • Prompt context:用自然语言描述行业、会议主题、实体和期望文本风格,适合每个请求都不同的开放领域背景。
    • 两者可以共同提升专业语料,但官方文档没有给出公开测试集、错误率或相对增益,不能把第三方传播的单点召回率当作已审计的整体 ASR 准确率。

    官方同一模型目录把两代服务分开列出:

    维度 Qwen-Audio-3.0-ASR-Flash Qwen3-ASR-Flash
    发布时间 2026-07-30 2025 起,2026-02 有快照
    专业词增强 热词 + prompt context 文档表格标为不支持 accuracy boost
    情感识别 不支持 支持
    Filetrans 说话人分离 支持 不支持
    技术公开 仅托管产品文档 Qwen3-ASR 开源权重、工具链与技术报告

    因此新名称应被视为一条独立的云服务产品线,而不是 qwen3-asr-flash 的别名。它与 Qwen3-ASR 在底座、训练集或架构上的精确继承关系,官方当前没有披露。

    • 部署边界:现有资料描述的是阿里云 Model Studio 托管 API,没有开放权重、本地部署或离线运行说明。
    • 评测缺口:发布页只给能力描述,未公开 WER/CER、延迟、价格—精度曲线和对照基线,无法独立判断“3.0”相对旧代的平均提升幅度。
    • 接口差异会影响选型:实时流、长文件和短文件不仅时长不同;是否支持 speaker diarization、输入方式及 SDK 也不同,不能只按“Flash 更快”理解。
    • 文档易过时:稳定模型 ID、地域可用性、限额和支持格式都可能更新,调用前应回查官方模型目录与 API 文档。
    • 官方发布时间:2026-07-30。
    • 模型 ID:qwen-audio-3.0-asr-flash-streamingqwen-audio-3.0-asr-flash-filetransqwen-audio-3.0-asr-flash
    • 语言:30 种;中文覆盖七大方言群与 20 多种地域口音。
    • Filetrans:最长 12 小时、2 GB,支持 speaker diarization;开启说话人分离时建议不超过 2 小时。
    • Flash:最长 5 分钟、2 GB;Streaming:时长不限。