READING NOTES · DIFFUSION TTS

Luna-TTS:
把 RVQ 网格当成网格

这篇报告最重要的不是“又一个更快的 TTS”,而是把 codec LM 的基本生成单位重新定义为二维 RVQ 网格:离线时全局并行细化,实时场景只在 block 边界引入因果性。

01 / 核心判断

AR 的问题不只是慢,而是生成顺序与表示几何不匹配

每个时间 frame 含 8 个 residual codebook token。沿时间展开尚可解释,但沿 codebook depth 强行规定左到右次序没有天然依据。Luna-TTS 让每个网格位置按独立 mask process 受扰动,再并行预测 masked position;跨时间、跨 codebook 依赖由多轮 refinement 解决。

关键转变:从“下一个 token 是什么”改成“在当前可见网格条件下,这些空位分别是什么”。
OFFLINE

Luna-TTS

先由独立 duration predictor 给出总 frame 数,再从全 mask 网格出发做 32 次 confidence-based parallel refinement。整句 bidirectional,可原生 voice cloning、infilling 与 editing。

串行预算
固定 32 次 forward
首段音频
整句完成后
误差修正
全局可反复改写
STREAMING

Luna-TTS Realtime

时间轴切成 32-frame、即 1.28 秒 block;block 之间自回归并用 KV cache,block 内仍并行去噪。完成的 block 立即交付且不可再改。

串行预算
随 block 数增长
首段音频
首块确定后
误差修正
仅限当前 block
02 / 证据

质量领先成立,但要按评测边界理解

Seed-TTS-Eval0.73 CER / 79.7 SIM

普通话;英文为 1.49 WER / 76.8 SIM。报告比较中四列均最佳。

CV3-Eval3.17 zh / 3.18 en

中英文错误率为表中最低;日文、韩文及四语言平均仍由 Qwen-Audio-3.0-TTS 领先。

Offline servingRTF 0.0211

16 步、单 H20、batch size 1、12 次预热运行中位数,不含网络。

Realtime serving41.6 ms first block

8 步、双 H20 parallel CFG;这是 1.28 秒 block 的本地 engine 边界,不是公网首包延迟。

03 / RL

GRPO 对齐的是实际去噪动作,而非虚构的左到右序列

rollout 记录每轮真正被采样并提交的位置与 token,replay 在同一个有效采样 policy(含 CFG、top-k 与 temperature)下计算 per-action ratio。整条语句共享由 WER 与 speaker similarity 形成的 group-relative advantage;token-level clipped surrogate 避免把大量并行 action ratio 连乘成数值不稳的 trajectory ratio。

代价是 credit assignment 很粗:reward 只在波形完成后得到,所有动作共享 utterance-level advantage。论文证明了可用的工程构造,还没有证明它是 masked diffusion 最优的 RL 表述。

04 / 批判性阅读

四个不能从摘要数字里省略的限定

  1. 不是完全公平的全表横比。 只有 † 行按作者的同一 protocol 复评;⋄ 行来自各论文或已发布比较表,evaluation detail 可能不同。
  2. 首块延迟不是用户侧延迟。 41.6 ms 排除网络,且依赖双 H20 parallel CFG 与预热本地 engine。
  3. Realtime 的 hard-case 代价明显。 CV3-Eval hard-zh / hard-en 从离线 6.90 / 6.18 恶化到 12.56 / 13.98,反映 block 提交后不可改与 EOS length control 的共同风险。
  4. 语言与数据仍偏窄。 训练集中普通话、英文各约 43%,日文与韩文合计约 13.6%;韩文 CV3-Eval CER 最弱,系统也只覆盖四种语言。

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭