数值空间
离散 index ↔ 连续 vector这是本专题的主轴,但它只描述表示的数值类型,不直接等价于语义或声学。
SPECIAL TOPIC · SPEECH REPRESENTATION
声音究竟应该先变成有限词表,还是保留为连续向量?真正的答案不是二选一,而是同时判断数值空间、信息职责、时序几何和生成接口。
BEFORE THE BINARY
最常见的误解,是把“连续 / 离散”直接等同于“声学 / 语义”。两组概念实际互相独立,至少要沿下面四个维度一起比较。
这是本专题的主轴,但它只描述表示的数值类型,不直接等价于语义或声学。
离散 RVQ 可以偏声学,连续 embedding 也可以偏语义;训练目标决定表示保留什么。
序列长度、每步信息量和层级排列共同决定 LM 难度,不能只比较总码率。
同一个 tokenizer 可以接不同生成头;现代 TTS 常在离散规划后接连续声学生成器。
THREE ROUTES
怎样把声音变成有限词表?
Encoder → VQ / FSQ / RVQ → code index → softmax next-token prediction能否用离散规划稳定性换连续声学保真?
Discrete semantic plan / LM hidden state → Flow Matching or Diffusion renderer能否完全绕开有限码本?
Waveform / Mel → continuous latent → regression, diffusion or flow-matching head监督语义 token
统一声学—语义 codec
帧率、码本与流式延迟取舍
离散规划 + 连续隐状态桥接
Tokenizer-Free TTS
连续 patch 自回归
连续 token 语言建模
理解—生成统一表示
通用连续自回归
低帧率高维连续 token
EVOLUTION
用最近邻码本把连续潜变量变为可预测的离散索引。
SoundStream、EnCodec 与 RVQ 让语音和音乐进入 next-token prediction。
CosyVoice 用 ASR 监督让离散 token 与文本语义显式对齐。
DiTAR 与连续值 Token LM 开始绕开 codec 量化瓶颈。
MOSS 把 RVQ 做大,DashengTokenizer 与 AudioCALM 把连续路线做成统一底座。
Qwen-Audio-3.0-TTS、Locodec–MP-ELD 显式处理低帧率、信息容量和长时稳定。
ONE TABLE, SAME QUESTIONS
表格只使用各页面已记录的公开规格;“优势”和“边界”是本库基于表示接口做的归纳,不等同于跨论文统一榜单。
| 系统 | 路线 | 表示接口 | 帧率 / 几何 | 监督来源 | 生成接口 | 最值得看 | 主要边界 |
|---|---|---|---|---|---|---|---|
| S³ / CosyVoice 1–32024–2025 | 离散表征 | 单层离散语义 code | 25 Hz;VQ 4096 → FSQ 625 | ASR → 多任务语音理解监督 | LM 规划 token;CFM 恢复声学特征 | 内容一致性、跨语言和说话人解耦清晰 | 单码本容量有限;声学细节依赖后级生成器 |
| MOSS-Audio-Tokenizer2026.02 | 离散表征 | 32 层 RVQ 离散 token | 12.5 Hz;0.125–4 kbps | 重建、对抗与语义 LLM 联合优化 | 因果 Transformer codec;Temporal + Depth AR | 变比特率、高重建质量、纯 AR 与流式友好 | 多层序列建模复杂,深层 token 容易累积误差 |
| Qwen3-TTS 双 tokenizer2026.01 | 混合表征 | 25 Hz 单码本;12.5 Hz 语义 + 15 层 RVQ | 32,768 单码本 / 16×2,048 多码本 | Qwen2-Audio ASR / WavLM teacher | 25 Hz:block-wise DiT;12.5 Hz:因果 ConvNet | 同一家族直接暴露两种表示设计的工程边界 | 两条路径的优势不可互换,不能只按帧率判断优劣 |
| Qwen-Audio-3.0-TTS2026.07 | 混合表征 | 12.5 Hz FSQ token + LM continuous hidden states | 10-D FSQ;59,049 状态 | ASR、情感、语言、事件与说话人多任务 | chunk Flow Matching → causal BigVGAN | 保留低帧率规划,同时让声学损失塑造 LM 表征 | LM / FM 分阶段与联合训练链路较长,系统边界复杂 |
| VoxCPM2025–2026 | 连续表征 | 分层连续语义—声学潜变量 | AudioVAE 潜空间;无外部离散 tokenizer | 端到端扩散目标 | TSLM → RALM → LocDiT | 绕开离散瓶颈,语义规划与声学残差联合优化 | 多阶段扩散自回归结构仍有推理成本与稳定性问题 |
| DiTARICML 2025 | 连续表征 | 无量化连续语音 patch | LM 按 block 建模;DiT 恢复 patch 内细节 | 扩散 / 去噪目标 | LM hidden state → Diffusion Transformer head | 把 LM 长程建模与连续高保真生成结合 | previous-block 依赖会把局部推理误差送入后续 block |
| Continuous-valued Token LMICML 2025 | 连续表征 | 未量化连续声学 token | 连续向量序列 | Masked next-token prediction | 连续预测后直接解码音频 | 直接挑战“音频 LM 必须先离散化”的前提 | 仍属较早期路线,稳定性和通用性证据少于成熟 codec |
| DashengTokenizer2026.03 | 连续表征 | 冻结语义特征 + 声学残差注入 | 25 Hz × 1,280 维连续向量 | 理解预训练 + 重建、语义保持与对抗损失 | Vocos;下游可接 Flow-Matching DiT | 同一高维表示兼顾理解、重建和生成 | 630M 冻结语义骨干并不轻;纯语义任务会受声学方差干扰 |
| AudioCALM2026.06 | 连续表征 | 冻结 VAE 的连续音频 latent | 约 10.75 Hz × 64 维;按 1 秒 block 生成 | Rectified Flow matching | 因果 LM + AR-Flow head + A-MoME | 统一语音、音乐、音效并保留 KV-cache 与流式能力 | 需专门处理 teacher forcing 与逐块推理间的暴露偏差 |
| Locodec–MP-ELD2026.07 | 连续表征 | 球面连续 token + 低维 core manifold | 8 Hz × 768 维;single-token flow matching | 重建、双向 commitment、PDD 与随机旋转噪声 | LC / SC / AC 三路径 MP-ELD + residual CFG | 把 token 几何与长时 AR 稳定性作为同一个系统问题 | 公开复现与通用音频证据仍有限,SIM 边界尚待验证 |
VISUAL ATLAS
以下均为本库根据资料整理的 Excalidraw 解读图,不是论文作者原图。点击图片可在新标签页打开完整 SVG。
MOSS-Audio-Tokenizer 把离散接口推到纯 Transformer、低帧率和变比特率。
阅读对应笔记 ↗离散 token 负责可控规划,连续 hidden states 与 Flow Matching 负责补回声学细节。
阅读对应笔记 ↗DashengTokenizer 不是把语义蒸馏进 codec,而是向高维语义表示注入声学信息。
阅读对应笔记 ↗AudioCALM 用 flow-matching head 替代离散 softmax,同时保留 AR 上下文与流式工具链。
阅读对应笔记 ↗低帧率只是起点;token 几何、历史路由和 residual CFG 一起决定长时稳定性。
阅读对应笔记 ↗VoxCPM 取消外部离散 tokenizer,但仍用层次结构拆开语义计划与声学细节。
阅读对应笔记 ↗DECISION GUIDE
READING ROUTE
理解 codebook、量化误差、RVQ 层级和语义 token 与声学 token 的差别。
用 CosyVoice、Qwen3-TTS 与 MOSS 对比单码本、多码本、帧率和流式解码。
从 Tokenizer-Free、连续 token 到连续输出头,理解为什么不再需要 softmax。
比较高维统一表示、通用连续 AR 和低帧率长时稳定三种前沿方向。
KNOWLEDGE GAPS
wav2vec 2.0、HuBERT、WavLM、data2vec 目前只在其他页面中作为 teacher、评测 encoder 或对比基线出现,尚无独立梳理。
SpeechTokenizer、Mimi、X-Codec、EnCodec、SoundStream 尚缺逐篇页面,现有内容主要集中在 RVQ 总览和新模型对照。
理解、重建、生成和长时稳定常由不同数据集衡量;目前不能把跨论文数字机械合成一个总排名。