跳转到内容

输入关键词开始搜索

    自动语音识别(ASR)

    概念更新 2026-08-11置信度 high#概念#音频理解#语音识别#基础

    将语音波形自动转写为文字,并可附带语言、时间戳、说话人和文本规范化信息的技术。

    自动语音识别(Automatic Speech Recognition, ASR)接收连续音频,输出与其中语音内容对应的文本。一个生产系统通常不只做“听写”,还可能包含:

    • 语音活动检测(VAD)与切分;
    • 语言/方言识别;
    • 字词解码与标点恢复;
    • 数字、日期、金额等 inverse text normalization;
    • 词级/句级时间戳;
    • speaker diarization,即“谁在什么时候说了什么”;
    • 热词、术语表或上下文提示;
    • 流式 partial result 与最终结果修订。
    1. 人机接口:字幕、会议纪要、语音助手和呼叫中心都以 ASR 把声音转换成可检索、可处理的文本。
    2. 音频理解入口:长音频先转写后,可以接摘要、搜索、问答、翻译和知识库摄取。
    3. 无障碍与跨语言:实时字幕、方言识别和翻译能降低听觉与语言障碍。
    4. 专业场景容错:医学、工业、法律等领域的实体错误往往比普通词错误代价更高,需要热词与上下文增强。
    5. 生成系统的评测器:TTS/歌曲生成常用 ASR 的 CER/WER 检查内容是否被正确说出或唱出,但这只能衡量可懂度,不能代表音质与自然度。
    1. 音频前处理:解码文件、重采样、归一化,必要时降噪或回声消除。
    2. VAD/分段:发现有声区间,减少静音计算并控制上下文长度。
    3. 声学编码:将波形或 Mel 频谱变成低帧率表示。
    4. 文本解码CTC(连接时序分类)、Transducer、encoder-decoder 或 audio LLM 逐步输出字符、subword 或 token。
    5. 后处理:恢复标点、大小写和规范文本,并合并分段结果。
    6. 附加任务:语言识别、时间戳、说话人分离、情感/事件标签按系统能力返回。

    经典 HMM ASR 将 MAP 目标拆为声学模型 p(XW)p(X\mid W)、语言模型 P(W)P(W) 与 Viterbi 搜索。现代 CTC、Transducer、encoder-decoder 或 audio LLM 改变了组件边界,但短时频谱、MFCC/倒谱特征、VAD、噪声鲁棒性和错误率定义仍是定位系统行为的基础。

    维度 流式 ASR 离线/文件 ASR
    输入 连续音频 chunk 完整录音或文件 URL
    输出 partial + final,边说边出 完成后一次或异步返回
    关键指标 首字延迟、稳定性、实时因子 准确率、吞吐、长文件能力
    上下文 受低延迟和增量状态约束 可利用更完整的前后文
    典型场景 字幕、助手、通话 播客、访谈、档案转写
    • 热词把有限的实体词表及权重显式交给解码器,适合固定产品、人名和专业术语。
    • 上下文提示用自然语言说明行业、主题、实体或文本格式,适合每次请求动态变化的场景。
    • 二者都不能替代清晰音频、领域覆盖和合理切分;过强热词还可能把相似发音错误吸向目标词。

    字错误率(CER)与词错误率(WER)都由替换、删除和插入组成:

    ErrorRate=S+D+IN\mathrm{ErrorRate}=\frac{S+D+I}{N}

    其中 NN 是参考文本单元数。中文常用 CER,空格分词稳定的语言常用 WER。评测前必须统一标点、大小写、数字写法和文本规范化规则,否则不同系统的分数不可直接比较。

    生产评测还应单独观察:

    • 专业实体召回率与完整准确率;
    • 方言、口音、远场、噪声和重叠语音;
    • 流式延迟、partial 抖动与最终修订次数;
    • 长文件丢段、重复、说话人错误与时间戳偏差;
    • 每小时音频成本、并发上限和失败重试率。
    • 统计模型阶段:HMM-GMM 把声学模型、发音词典和语言模型分开训练,典型链路包括 MFCC/PLP、HMM、N-gram 与 Viterbi。
    • 端到端阶段:CTC、RNN-T/Transducer 与 attention encoder-decoder 减少人工流水线。
    • 大规模预训练阶段:wav2vec 2.0、Whisper 等利用海量弱标注或自监督数据增强跨域、跨语言鲁棒性。
    • 音频语言模型阶段:大型音频模型把 ASR、语言识别、音频问答和生成纳入统一 token/上下文接口,见 LALM(大型音频语言模型)
    • 产品化阶段:实时/长文件端点、热词、prompt context、speaker diarization 与移动 SDK 成为与模型准确率同等重要的能力。资料摘要:Qwen-Audio-3.0-ASR-Flash 是这一方向的托管产品实例。
    • “WER 最低就是最好”:还要看测试域、语言、规范化、延迟、成本、长音频、说话人和专业实体。
    • “ASR 支持某语言就支持所有口音”:语言覆盖、方言覆盖和母语级准确率是不同层次。
    • “实时模型只是离线模型切块”:流式系统必须处理因果上下文、partial 稳定和低首字延迟,训练/解码约束不同。
    • “speaker diarization 就是 speaker recognition”:前者区分同一录音中的说话人段落,不一定识别真实身份;后者才回答“这个人是谁”。
    • “转写文本等于原始声音信息”:语气、停顿、重音、环境声和大量非语言线索会在纯文本里丢失。
    • “ASR 可以直接评价 TTS 好坏”:ASR 只能较好地度量内容可懂度,不能代替 MOS、说话人相似度或韵律评价。
    概念 输入→输出 与 ASR 的区别
    TTS 文本→语音 方向相反,属于 音频生成
    Speech-to-Speech 语音→语音 可包含 ASR,但还需理解、生成与声学输出
    Speaker diarization 音频→说话人区间 回答“谁在何时说”,不负责完整文字内容
    Forced alignment 音频+已知文本→时间戳 文本已知,只对齐位置;ASR 文本未知
    音频理解 LLM 音频→文本回答/推理 ASR 聚焦逐字转写,音频理解还回答非语音事件和语义问题