Luna-TTS
先由独立 duration predictor 给出总 frame 数,再从全 mask 网格出发做 32 次 confidence-based parallel refinement。整句 bidirectional,可原生 voice cloning、infilling 与 editing。
- 串行预算
- 固定 32 次 forward
- 首段音频
- 整句完成后
- 误差修正
- 全局可反复改写
READING NOTES · DIFFUSION TTS
这篇报告最重要的不是“又一个更快的 TTS”,而是把 codec LM 的基本生成单位重新定义为二维 RVQ 网格:离线时全局并行细化,实时场景只在 block 边界引入因果性。
每个时间 frame 含 8 个 residual codebook token。沿时间展开尚可解释,但沿 codebook depth 强行规定左到右次序没有天然依据。Luna-TTS 让每个网格位置按独立 mask process 受扰动,再并行预测 masked position;跨时间、跨 codebook 依赖由多轮 refinement 解决。
关键转变:从“下一个 token 是什么”改成“在当前可见网格条件下,这些空位分别是什么”。
先由独立 duration predictor 给出总 frame 数,再从全 mask 网格出发做 32 次 confidence-based parallel refinement。整句 bidirectional,可原生 voice cloning、infilling 与 editing。
时间轴切成 32-frame、即 1.28 秒 block;block 之间自回归并用 KV cache,block 内仍并行去噪。完成的 block 立即交付且不可再改。
普通话;英文为 1.49 WER / 76.8 SIM。报告比较中四列均最佳。
中英文错误率为表中最低;日文、韩文及四语言平均仍由 Qwen-Audio-3.0-TTS 领先。
16 步、单 H20、batch size 1、12 次预热运行中位数,不含网络。
8 步、双 H20 parallel CFG;这是 1.28 秒 block 的本地 engine 边界,不是公网首包延迟。
rollout 记录每轮真正被采样并提交的位置与 token,replay 在同一个有效采样 policy(含 CFG、top-k 与 temperature)下计算 per-action ratio。整条语句共享由 WER 与 speaker similarity 形成的 group-relative advantage;token-level clipped surrogate 避免把大量并行 action ratio 连乘成数值不稳的 trajectory ratio。
代价是 credit assignment 很粗:reward 只在波形完成后得到,所有动作共享 utterance-level advantage。论文证明了可用的工程构造,还没有证明它是 masked diffusion 最优的 RL 表述。