自动语音识别(ASR)
将语音波形自动转写为文字,并可附带语言、时间戳、说话人和文本规范化信息的技术。
自动语音识别(Automatic Speech Recognition, ASR)接收连续音频,输出与其中语音内容对应的文本。一个生产系统通常不只做“听写”,还可能包含:
- 语音活动检测(VAD)与切分;
- 语言/方言识别;
- 字词解码与标点恢复;
- 数字、日期、金额等 inverse text normalization;
- 词级/句级时间戳;
- speaker diarization,即“谁在什么时候说了什么”;
- 热词、术语表或上下文提示;
- 流式 partial result 与最终结果修订。
- 人机接口:字幕、会议纪要、语音助手和呼叫中心都以 ASR 把声音转换成可检索、可处理的文本。
- 音频理解入口:长音频先转写后,可以接摘要、搜索、问答、翻译和知识库摄取。
- 无障碍与跨语言:实时字幕、方言识别和翻译能降低听觉与语言障碍。
- 专业场景容错:医学、工业、法律等领域的实体错误往往比普通词错误代价更高,需要热词与上下文增强。
- 生成系统的评测器:TTS/歌曲生成常用 ASR 的 CER/WER 检查内容是否被正确说出或唱出,但这只能衡量可懂度,不能代表音质与自然度。
- 音频前处理:解码文件、重采样、归一化,必要时降噪或回声消除。
- VAD/分段:发现有声区间,减少静音计算并控制上下文长度。
- 声学编码:将波形或 Mel 频谱变成低帧率表示。
- 文本解码:CTC(连接时序分类)、Transducer、encoder-decoder 或 audio LLM 逐步输出字符、subword 或 token。
- 后处理:恢复标点、大小写和规范文本,并合并分段结果。
- 附加任务:语言识别、时间戳、说话人分离、情感/事件标签按系统能力返回。
经典统计链路提供的坐标系
Section titled “经典统计链路提供的坐标系”经典 HMM ASR 将 MAP 目标拆为声学模型 、语言模型 与 Viterbi 搜索。现代 CTC、Transducer、encoder-decoder 或 audio LLM 改变了组件边界,但短时频谱、MFCC/倒谱特征、VAD、噪声鲁棒性和错误率定义仍是定位系统行为的基础。
| 维度 | 流式 ASR | 离线/文件 ASR |
|---|---|---|
| 输入 | 连续音频 chunk | 完整录音或文件 URL |
| 输出 | partial + final,边说边出 | 完成后一次或异步返回 |
| 关键指标 | 首字延迟、稳定性、实时因子 | 准确率、吞吐、长文件能力 |
| 上下文 | 受低延迟和增量状态约束 | 可利用更完整的前后文 |
| 典型场景 | 字幕、助手、通话 | 播客、访谈、档案转写 |
热词与上下文提示
Section titled “热词与上下文提示”- 热词把有限的实体词表及权重显式交给解码器,适合固定产品、人名和专业术语。
- 上下文提示用自然语言说明行业、主题、实体或文本格式,适合每次请求动态变化的场景。
- 二者都不能替代清晰音频、领域覆盖和合理切分;过强热词还可能把相似发音错误吸向目标词。
字错误率(CER)与词错误率(WER)都由替换、删除和插入组成:
其中 是参考文本单元数。中文常用 CER,空格分词稳定的语言常用 WER。评测前必须统一标点、大小写、数字写法和文本规范化规则,否则不同系统的分数不可直接比较。
生产评测还应单独观察:
- 专业实体召回率与完整准确率;
- 方言、口音、远场、噪声和重叠语音;
- 流式延迟、partial 抖动与最终修订次数;
- 长文件丢段、重复、说话人错误与时间戳偏差;
- 每小时音频成本、并发上限和失败重试率。
- 统计模型阶段:HMM-GMM 把声学模型、发音词典和语言模型分开训练,典型链路包括 MFCC/PLP、HMM、N-gram 与 Viterbi。
- 端到端阶段:CTC、RNN-T/Transducer 与 attention encoder-decoder 减少人工流水线。
- 大规模预训练阶段:wav2vec 2.0、Whisper 等利用海量弱标注或自监督数据增强跨域、跨语言鲁棒性。
- 音频语言模型阶段:大型音频模型把 ASR、语言识别、音频问答和生成纳入统一 token/上下文接口,见 LALM(大型音频语言模型)。
- 产品化阶段:实时/长文件端点、热词、prompt context、speaker diarization 与移动 SDK 成为与模型准确率同等重要的能力。资料摘要:Qwen-Audio-3.0-ASR-Flash 是这一方向的托管产品实例。
- “WER 最低就是最好”:还要看测试域、语言、规范化、延迟、成本、长音频、说话人和专业实体。
- “ASR 支持某语言就支持所有口音”:语言覆盖、方言覆盖和母语级准确率是不同层次。
- “实时模型只是离线模型切块”:流式系统必须处理因果上下文、partial 稳定和低首字延迟,训练/解码约束不同。
- “speaker diarization 就是 speaker recognition”:前者区分同一录音中的说话人段落,不一定识别真实身份;后者才回答“这个人是谁”。
- “转写文本等于原始声音信息”:语气、停顿、重音、环境声和大量非语言线索会在纯文本里丢失。
- “ASR 可以直接评价 TTS 好坏”:ASR 只能较好地度量内容可懂度,不能代替 MOS、说话人相似度或韵律评价。
与相邻概念的区别
Section titled “与相邻概念的区别”| 概念 | 输入→输出 | 与 ASR 的区别 |
|---|---|---|
| TTS | 文本→语音 | 方向相反,属于 音频生成 |
| Speech-to-Speech | 语音→语音 | 可包含 ASR,但还需理解、生成与声学输出 |
| Speaker diarization | 音频→说话人区间 | 回答“谁在何时说”,不负责完整文字内容 |
| Forced alignment | 音频+已知文本→时间戳 | 文本已知,只对齐位置;ASR 文本未知 |
| 音频理解 LLM | 音频→文本回答/推理 | ASR 聚焦逐字转写,音频理解还回答非语音事件和语义问题 |
- 资料摘要:Qwen-Audio-3.0-ASR-Flash — Streaming、Filetrans 与短文件 Flash 的产品矩阵
- 资料摘要:Qwen2.5-Omni — 全模态模型中的音频理解与流式输出
- CTC(连接时序分类) — 无帧级边界时对全部单调对齐路径边缘化的经典训练方法
- LALM(大型音频语言模型) — 将 ASR 与其他理解/生成任务统一到音频 token 序列
- 音频生成 — ASR 的反向任务族及其评测关系
- 多模态 LLM — ASR 可作为多模态模型的输入接口或内生能力
- Wiki 目录