跳转到内容

输入关键词开始搜索

    SPECIAL TOPIC · SPEECH REPRESENTATION

    语音表征:
    连续、离散与混合路线

    声音究竟应该先变成有限词表,还是保留为连续向量?真正的答案不是二选一,而是同时判断数值空间、信息职责、时序几何和生成接口

    10个代表系统
    3条技术路线
    6张架构图
    2017–26演进时间跨度
    01离散表征2 个代表系统
    02混合表征2 个代表系统
    03连续表征6 个代表系统
    同一段连续波形,可以被压成 code index,也可以保留为 latent vector,或只离散化高层计划。
    00

    BEFORE THE BINARY

    先建立四维坐标系

    最常见的误解,是把“连续 / 离散”直接等同于“声学 / 语义”。两组概念实际互相独立,至少要沿下面四个维度一起比较。

    A

    数值空间

    离散 index ↔ 连续 vector

    这是本专题的主轴,但它只描述表示的数值类型,不直接等价于语义或声学。

    B

    信息职责

    语义内容 ↔ 声学细节

    离散 RVQ 可以偏声学,连续 embedding 也可以偏语义;训练目标决定表示保留什么。

    C

    时序几何

    高帧率 ↔ 低帧率;单层 ↔ 多层

    序列长度、每步信息量和层级排列共同决定 LM 难度,不能只比较总码率。

    D

    生成接口

    Softmax ↔ Regression / Diffusion / Flow

    同一个 tokenizer 可以接不同生成头;现代 TTS 常在离散规划后接连续声学生成器。

    01

    THREE ROUTES

    三条路线,不是两端对决

    01DISCRETE REPRESENTATION

    离散表征

    怎样把声音变成有限词表?

    Encoder → VQ / FSQ / RVQ → code index → softmax next-token prediction
    收益
    序列接口清晰、训练稳定、天然适配自回归 LM 与流式解码。
    代价
    量化会丢失连续细节;多码本还会引入层间纠缠和深层曝光偏差。
    02HYBRID REPRESENTATION

    混合表征

    能否用离散规划稳定性换连续声学保真?

    Discrete semantic plan / LM hidden state → Flow Matching or Diffusion renderer
    收益
    离散接口负责内容与长程结构,连续生成器恢复音色、韵律和声学细节。
    代价
    模块边界、联合训练和流式调度更复杂,token 与声学生成器必须协同设计。
    03CONTINUOUS REPRESENTATION

    连续表征

    能否完全绕开有限码本?

    Waveform / Mel → continuous latent → regression, diffusion or flow-matching head
    收益
    没有码本量化损失,可保留细粒度韵律、音色与高维声学结构。
    代价
    连续 AR 的分布约束更弱,训练—推理漂移和长时误差累积更难控制。
    10个代表系统
    01离散表征

    监督语义 token

    S³ / CosyVoice 1–3

    表示
    单层离散语义 code
    几何
    25 Hz;VQ 4096 → FSQ 625
    监督
    ASR → 多任务语音理解监督
    生成
    LM 规划 token;CFM 恢复声学特征
    02离散表征

    统一声学—语义 codec

    MOSS-Audio-Tokenizer

    表示
    32 层 RVQ 离散 token
    几何
    12.5 Hz;0.125–4 kbps
    监督
    重建、对抗与语义 LLM 联合优化
    生成
    因果 Transformer codec;Temporal + Depth AR
    03混合表征

    帧率、码本与流式延迟取舍

    Qwen3-TTS 双 tokenizer

    表示
    25 Hz 单码本;12.5 Hz 语义 + 15 层 RVQ
    几何
    32,768 单码本 / 16×2,048 多码本
    监督
    Qwen2-Audio ASR / WavLM teacher
    生成
    25 Hz:block-wise DiT;12.5 Hz:因果 ConvNet
    05连续表征

    Tokenizer-Free TTS

    VoxCPM

    表示
    分层连续语义—声学潜变量
    几何
    AudioVAE 潜空间;无外部离散 tokenizer
    监督
    端到端扩散目标
    生成
    TSLM → RALM → LocDiT
    06连续表征

    连续 patch 自回归

    DiTAR

    表示
    无量化连续语音 patch
    几何
    LM 按 block 建模;DiT 恢复 patch 内细节
    监督
    扩散 / 去噪目标
    生成
    LM hidden state → Diffusion Transformer head
    07连续表征

    连续 token 语言建模

    Continuous-valued Token LM

    表示
    未量化连续声学 token
    几何
    连续向量序列
    监督
    Masked next-token prediction
    生成
    连续预测后直接解码音频
    08连续表征

    理解—生成统一表示

    DashengTokenizer

    表示
    冻结语义特征 + 声学残差注入
    几何
    25 Hz × 1,280 维连续向量
    监督
    理解预训练 + 重建、语义保持与对抗损失
    生成
    Vocos;下游可接 Flow-Matching DiT

    优势:同一高维表示兼顾理解、重建和生成

    边界:630M 冻结语义骨干并不轻;纯语义任务会受声学方差干扰

    09连续表征

    通用连续自回归

    AudioCALM

    表示
    冻结 VAE 的连续音频 latent
    几何
    约 10.75 Hz × 64 维;按 1 秒 block 生成
    监督
    Rectified Flow matching
    生成
    因果 LM + AR-Flow head + A-MoME
    10连续表征

    低帧率高维连续 token

    Locodec–MP-ELD

    表示
    球面连续 token + 低维 core manifold
    几何
    8 Hz × 768 维;single-token flow matching
    监督
    重建、双向 commitment、PDD 与随机旋转噪声
    生成
    LC / SC / AC 三路径 MP-ELD + residual CFG
    02

    EVOLUTION

    从码本到连续输出头

    1. 2017
      01

      VQ-VAE

      用最近邻码本把连续潜变量变为可预测的离散索引。

    2. 2021–23
      02

      Neural codec + Audio LM

      SoundStream、EnCodec 与 RVQ 让语音和音乐进入 next-token prediction。

    3. 2024
      03

      监督语义 token

      CosyVoice 用 ASR 监督让离散 token 与文本语义显式对齐。

    4. 2025
      04

      连续输出头

      DiTAR 与连续值 Token LM 开始绕开 codec 量化瓶颈。

    5. 2026 H1
      05

      两端同时扩张

      MOSS 把 RVQ 做大,DashengTokenizer 与 AudioCALM 把连续路线做成统一底座。

    6. 2026 H2
      06

      表示与生成协同设计

      Qwen-Audio-3.0-TTS、Locodec–MP-ELD 显式处理低帧率、信息容量和长时稳定。

    03

    ONE TABLE, SAME QUESTIONS

    统一比较矩阵

    表格只使用各页面已记录的公开规格;“优势”和“边界”是本库基于表示接口做的归纳,不等同于跨论文统一榜单。

    系统路线表示接口帧率 / 几何监督来源生成接口最值得看主要边界
    S³ / CosyVoice 1–32024–2025离散表征单层离散语义 code25 Hz;VQ 4096 → FSQ 625ASR → 多任务语音理解监督LM 规划 token;CFM 恢复声学特征内容一致性、跨语言和说话人解耦清晰单码本容量有限;声学细节依赖后级生成器
    MOSS-Audio-Tokenizer2026.02离散表征32 层 RVQ 离散 token12.5 Hz;0.125–4 kbps重建、对抗与语义 LLM 联合优化因果 Transformer codec;Temporal + Depth AR变比特率、高重建质量、纯 AR 与流式友好多层序列建模复杂,深层 token 容易累积误差
    Qwen3-TTS 双 tokenizer2026.01混合表征25 Hz 单码本;12.5 Hz 语义 + 15 层 RVQ32,768 单码本 / 16×2,048 多码本Qwen2-Audio ASR / WavLM teacher25 Hz:block-wise DiT;12.5 Hz:因果 ConvNet同一家族直接暴露两种表示设计的工程边界两条路径的优势不可互换,不能只按帧率判断优劣
    Qwen-Audio-3.0-TTS2026.07混合表征12.5 Hz FSQ token + LM continuous hidden states10-D FSQ;59,049 状态ASR、情感、语言、事件与说话人多任务chunk Flow Matching → causal BigVGAN保留低帧率规划,同时让声学损失塑造 LM 表征LM / FM 分阶段与联合训练链路较长,系统边界复杂
    VoxCPM2025–2026连续表征分层连续语义—声学潜变量AudioVAE 潜空间;无外部离散 tokenizer端到端扩散目标TSLM → RALM → LocDiT绕开离散瓶颈,语义规划与声学残差联合优化多阶段扩散自回归结构仍有推理成本与稳定性问题
    DiTARICML 2025连续表征无量化连续语音 patchLM 按 block 建模;DiT 恢复 patch 内细节扩散 / 去噪目标LM hidden state → Diffusion Transformer head把 LM 长程建模与连续高保真生成结合previous-block 依赖会把局部推理误差送入后续 block
    Continuous-valued Token LMICML 2025连续表征未量化连续声学 token连续向量序列Masked next-token prediction连续预测后直接解码音频直接挑战“音频 LM 必须先离散化”的前提仍属较早期路线,稳定性和通用性证据少于成熟 codec
    DashengTokenizer2026.03连续表征冻结语义特征 + 声学残差注入25 Hz × 1,280 维连续向量理解预训练 + 重建、语义保持与对抗损失Vocos;下游可接 Flow-Matching DiT同一高维表示兼顾理解、重建和生成630M 冻结语义骨干并不轻;纯语义任务会受声学方差干扰
    AudioCALM2026.06连续表征冻结 VAE 的连续音频 latent约 10.75 Hz × 64 维;按 1 秒 block 生成Rectified Flow matching因果 LM + AR-Flow head + A-MoME统一语音、音乐、音效并保留 KV-cache 与流式能力需专门处理 teacher forcing 与逐块推理间的暴露偏差
    Locodec–MP-ELD2026.07连续表征球面连续 token + 低维 core manifold8 Hz × 768 维;single-token flow matching重建、双向 commitment、PDD 与随机旋转噪声LC / SC / AC 三路径 MP-ELD + residual CFG把 token 几何与长时 AR 稳定性作为同一个系统问题公开复现与通用音频证据仍有限,SIM 边界尚待验证
    04

    VISUAL ATLAS

    六张图看懂表示怎样进入生成系统

    以下均为本库根据资料整理的 Excalidraw 解读图,不是论文作者原图。点击图片可在新标签页打开完整 SVG。

    FIG. 01离散表征
    MOSS-Audio-Tokenizer 从原始波形经过因果 Transformer 编码、32 层 RVQ 量化,再由解码器重建音频的架构图
    离散路线:CAT + 32 层 RVQ本库解释图

    MOSS-Audio-Tokenizer 把离散接口推到纯 Transformer、低帧率和变比特率。

    阅读对应笔记 ↗
    FIG. 02混合表征
    Qwen-Audio-3.0-TTS 的 12.5 Hz FSQ tokenizer、语言模型、Flow Matching 和因果 vocoder 五阶段训练架构图
    混合路线:FSQ 规划 + Flow Matching 声学恢复本库解释图

    离散 token 负责可控规划,连续 hidden states 与 Flow Matching 负责补回声学细节。

    阅读对应笔记 ↗
    FIG. 03连续表征
    DashengTokenizer 将冻结语义编码器特征与轻量声学分支相加,形成统一连续表示并解码波形的架构图
    连续路线:语义骨架 + 声学残差注入本库解释图

    DashengTokenizer 不是把语义蒸馏进 codec,而是向高维语义表示注入声学信息。

    阅读对应笔记 ↗
    FIG. 04连续表征
    AudioCALM 使用连续音频潜变量、因果语言模型、AR-Flow 头和非对称专家混合生成语音音乐音效的架构图
    连续自回归:CALM + AR-Flow本库解释图

    AudioCALM 用 flow-matching head 替代离散 softmax,同时保留 AR 上下文与流式工具链。

    阅读对应笔记 ↗
    FIG. 05连续表征
    Locodec 低帧率高维连续 token 与 MP-ELD 局部连续、自一致、语义对齐三路径生成架构图
    连续 AR 稳定性:Locodec + MP-ELD本库解释图

    低帧率只是起点;token 几何、历史路由和 residual CFG 一起决定长时稳定性。

    阅读对应笔记 ↗
    FIG. 06连续表征
    VoxCPM2 从文本局部编码、语义语言模型、残差声学模型到局部扩散解码器的 Tokenizer-Free TTS 架构图
    Tokenizer-Free:分层语义—声学生成本库解释图

    VoxCPM 取消外部离散 tokenizer,但仍用层次结构拆开语义计划与声学细节。

    阅读对应笔记 ↗
    05

    DECISION GUIDE

    研究或选型时先问目标

    01

    优先稳定与流式

    先看离散路线

    需要成熟 next-token 工具链、可控码率、低延迟解码或纯 AR 扩展时,RVQ / FSQ 接口更直接。

    进入代表页面 ↗
    02

    优先语义与声学协同

    先看混合路线

    需要内容稳定、自然语言控制和高保真声学恢复同时成立时,让离散规划与连续 renderer 分工。

    进入代表页面 ↗
    03

    优先表现力与统一表示

    先看连续路线

    研究高维表示、理解—生成统一、无量化生成或连续 AR 时,重点关注表示几何与暴露偏差。

    进入代表页面 ↗
    06

    READING ROUTE

    一条不会迷路的阅读顺序

    1. 01

      先建立离散化直觉

      理解 codebook、量化误差、RVQ 层级和语义 token 与声学 token 的差别。

    2. 02

      再看离散路线怎样工程化

      用 CosyVoice、Qwen3-TTS 与 MOSS 对比单码本、多码本、帧率和流式解码。

    3. 03

      进入连续表示

      从 Tokenizer-Free、连续 token 到连续输出头,理解为什么不再需要 softmax。

    4. 04

      最后研究统一与稳定性

      比较高维统一表示、通用连续 AR 和低帧率长时稳定三种前沿方向。

    07

    KNOWLEDGE GAPS

    库里还缺的经典拼图

    自监督连续表征

    wav2vec 2.0、HuBERT、WavLM、data2vec 目前只在其他页面中作为 teacher、评测 encoder 或对比基线出现,尚无独立梳理。

    经典语义—声学 codec

    SpeechTokenizer、Mimi、X-Codec、EnCodec、SoundStream 尚缺逐篇页面,现有内容主要集中在 RVQ 总览和新模型对照。

    统一探针与公平评测

    理解、重建、生成和长时稳定常由不同数据集衡量;目前不能把跨论文数字机械合成一个总排名。