Self-corrective alignment(自校正对齐)
在 flow time 内用当前 DiT 的一次 detached CFG Euler rollout 构造偏轨状态,再以指向 clean endpoint 的速度做辅助回归。
Self-corrective alignment 是 dots.tts 在 acoustic DiT 上使用的 flow-matching-native 后训练目标,沿用 SOAR 的 reward-free self-correction 思路。
它不先合成完整话语,也不调用 ASR 检测重复或漏读。训练单元仍是一个四帧 VAE latent patch:
- 从噪声端点 与 clean patch 的直线路径上采样 ;
- 用当前 CFG-guided DiT 从 向前做一次 Euler rollout;
- 对 rollout 结果 stop-gradient,得到模型自己诱发的 off-trajectory state;
- 重新向噪声端加噪,并训练同一 DiT 沿 endpoint-consistent velocity 回到 。
“self-corrective”指模型用自身速度场制造训练期偏轨状态,再学习修正这些状态;“alignment”发生在 flow trajectory 与 clean latent endpoint 之间。
标准 rectified-flow 预训练只在解析直线路径
上回归速度 。真实推理却要重复调用模型并用数值积分更新状态;早期速度误差会把后续状态带离这条训练直线。
dots.tts 还在外层逐 patch 自回归:一个 patch 内的 ODE mismatch 不仅影响当前声学细节,还会成为后续 patch 的历史条件。因而小误差可能跨 AR rollout 累积。
Self-corrective alignment 的价值是让 acoustic DiT 在训练时接触“由自身速度场走出来、但不再位于理想直线上的状态”,并学习从那里继续朝 clean endpoint 移动。
1. 保留正常的 on-trajectory 目标
Section titled “1. 保留正常的 on-trajectory 目标”对 minibatch 中第 个样本,采样 flow time ,并计算常规 flow-matching loss:
这里 汇总冻结模块提供的 acoustic prefix、speaker 与 semantic 条件。
2. 用当前模型走出偏轨状态
Section titled “2. 用当前模型走出偏轨状态”从 向更接近数据端的 前进一步:
这一步使用当前模型的 CFG-guided velocity,而非解析真速度,因此 会包含实际推理式误差。 阻止梯度穿过 rollout 路径。
3. 从偏轨状态向噪声端重新采样
Section titled “3. 从偏轨状态向噪声端重新采样”对每个主样本采样多个 :
这会在模型诱发的偏轨状态与原始噪声端点之间产生一组 auxiliary correction states。dots.tts 实验中每个主样本生成 6 个辅助状态。
4. 构造 endpoint-consistent velocity
Section titled “4. 构造 endpoint-consistent velocity”辅助目标不是 ASR 分数,也不是 ground-truth 下一句话,而是从当前辅助状态在剩余时间内到达 clean endpoint 所需的平均速度:
同一 DiT 在 上回归这个速度,形成 。
5. 合并正常与辅助回归
Section titled “5. 合并正常与辅助回归”最终目标把 on-trajectory 与保留下来的 auxiliary loss 按样本数归一化:
dots.tts 只更新 AR-FM head 内的 DiT acoustic generator;LLM、semantic encoder、AudioVAE 与 speaker encoder 全部冻结。
“reward-free”意味着没有 reward model、human preference model、外部 acoustic teacher 或策略梯度,但仍要多做一次 CFG rollout 和多个辅助状态的前向回归。
Self-corrective alignment 直接沿用论文所引用的 SOAR 自校正思想,并把它写成适配 dots.tts noise-to-data 约定、CFG 与 patch-level acoustic DiT 的公式。
它与 exposure bias 有共同动机:训练状态与模型实际 rollout 状态不一致。但此处处理的是 flow-time 数值轨迹偏移,不是 scheduled sampling 式地替换自回归历史 token。
dots.tts 将完成该阶段的 checkpoint 记作 dots.tts(SOAR)。这个命名指模型版本;不应把 SOAR 当作所有 reward-free TTS 后训练的通用名称。
误解一:先合成整句话,再用 ASR 找重复和漏读
Section titled “误解一:先合成整句话,再用 ASR 找重复和漏读”论文没有这一步。辅助状态来自单个 latent patch 的一次 flow-time Euler rollout,不依赖完整语音、转写或错误类型检测。
误解二:它修正自回归文本进度
Section titled “误解二:它修正自回归文本进度”它直接训练的是 acoustic DiT velocity field 与 clean latent endpoint 的对齐。文本覆盖和 rollout 稳定性可能因此改善,但不是通过显式文本进度标签实现。
误解三:它会在推理时回滚已经播放的波形
Section titled “误解三:它会在推理时回滚已经播放的波形”自校正只发生在训练目标中。正常推理仍按 patch 向前生成,不提供波形撤回机制。
误解四:reward-free 就没有额外成本
Section titled “误解四:reward-free 就没有额外成本”虽然不用 reward model 或 RL,但训练仍增加 detached CFG Euler rollout、每个主样本多个 auxiliary state,以及相应的 DiT 前向计算。
误解五:它等价于 scheduled sampling
Section titled “误解五:它等价于 scheduled sampling”scheduled sampling 混合真实和预测的序列历史;这里固定上层条件,扰动的是 flow-time 中的连续状态。
误解六:它就是 MeanFlow
Section titled “误解六:它就是 MeanFlow”Self-corrective alignment 改善 teacher velocity field 在偏轨状态上的恢复能力;下一阶段 CFG-aware MeanFlow 才把这个 teacher 蒸馏为少 NFE student。
与相邻概念的区别
Section titled “与相邻概念的区别”| 方法 | 被改变的训练状态 | 学习信号 | 主要作用 |
|---|---|---|---|
| 标准 flow matching | 解析直线路径 | 解析速度 | 学会理想路径上的 velocity field |
| Self-corrective alignment | 当前 DiT rollout 诱发的 | endpoint-consistent velocity | 学会从 flow-time 偏轨状态回到 clean endpoint |
| scheduled sampling | 真实 / 预测序列历史 | 下一 token 监督 | 缩小序列历史的 train–test gap |
| sequence-level RL | 完整生成轨迹 | 标量或偏好 reward | 优化可懂度、相似度等序列指标 |
| MeanFlow distillation | teacher 的时间区间轨迹 | CFG-guided mean velocity | 用少量 NFE 近似 teacher |
与 CFG(无分类器引导) 的关系:自校正的一步 rollout 使用 CFG-guided predictor,;但辅助回归本身仍是监督式 velocity matching。
与 条件流匹配(CFM) 的关系:Self-corrective alignment 保留 flow-matching 回归形式,只把训练状态从纯解析直线路径扩展到模型诱发的 off-trajectory state。
与 CALM(连续自回归语言建模) 的区别:CALM 是连续自回归建模范式;自校正对齐是只作用于 acoustic DiT 的后训练目标。
- 资料摘要:dots.tts — 概念的主要来源与完整系统上下文。
- 条件流匹配(CFM) — dots.tts 连续帧生成头的基础。
- CFG(无分类器引导) — 与 MeanFlow 蒸馏共同影响少步推理轨迹。
- CALM(连续自回归语言建模) — 连续 AR TTS 的相邻建模路线。
- VAE(变分自编码器) — 将波形压缩为可自回归建模的连续潜变量。
- Wiki 目录