资料摘要:SpeakStream
SpeakStream 通过训练期词级对齐,把文本词块与对应的离散 mel(dMel)语音块交织进一个 decoder-only TTS 序列;推理时无需强制对齐器,并以可调的窗口 与步长 在文本 lookahead、自然度和响应速度间取舍。
- 训练数据先经 A3T/强制对齐得到词级边界,再把字符级文本片段和对应 dMel 片段交织;对齐器只用于数据构造,不进入推理路径。
- 当前语音块可以读取完整文本/语音历史的 KV cache,直到预测音频
<eos>才结束;这比固定时长切块更适应真实词长。 - 窗口 表示当前可见词数,步长 表示每次提交的词数。论文最佳设置为 ,也就是用 4 个词的右上下文换取更稳定韵律。
- VocStream 由因果上采样器和 WaveNet 类 vocoder 组成,只需一帧 mel 即可开始合成;在 M4 Pro 上报告约 40–45 ms 模型计算时间。
- 最佳设置在 LJSpeech 上报告 3.38% WER,接近非流式 RichTTS 的 3.28%;但使用单说话人英语数据,尚不能代表 zero-shot、多说话人或跨语种能力。
- 延迟从“第一个词收到”开始计时,不包含上游 LLM 生成第一个词的时间;此外,系统仍需等待 个词,不能把 40 ms 直接当作完整用户响应时间。
1. 训练期对齐,推理期交织
Section titled “1. 训练期对齐,推理期交织”SpeakStream 的因果序列可概括为:
词窗口 → 对应 dMel 块 BOS → dMel token… → EOS → 下一词窗口 → …字符级文本 embedding 保留原始字形信息;语音被压成 dMel token。强制对齐只决定每个训练块覆盖哪些词及其对应声学范围。推理时,模型直接依赖学到的局部单调性,避免在线调用对齐器。
2. 窗口与步长
Section titled “2. 窗口与步长”方案 1 重复滑动文本窗口:长度为 ,每次向前移动 个词,最前面的 个词对应当前要生成的语音,余下 个词提供 lookahead。论文发现该方案优于不重复上下文的方案 2,原因是语音片段时长变化大,局部重复文本有助于模型明确当前边界。
| 设置 | 右上下文 | 直觉 |
|---|---|---|
| 2 词 | 更快启动,首词规划较弱 | |
| 3 词 | 延迟与韵律折中 | |
| 4 词 | 论文中 WER 最佳,需等待更多文本 |
这说明双流式 TTS 的“延迟”首先是信息等待问题,其次才是 GPU/CPU 计算时间。
3. VocStream
Section titled “3. VocStream”VocStream 将离散 mel token 因果上采样并交给 WaveNet 类 vocoder。它只需要一个 mel 帧即可输出波形,从而避免非因果 vocoder 等完整声学块。论文还与 Parallel WaveGAN 对照:后者总计算约 180 ms,而 VocStream 在 下约为 40/41/45 ms,其中 TTS 约 27–29 ms、vocoder 约 13 ms。
4. 实验结果
Section titled “4. 实验结果”TTS 使用 LJSpeech 单说话人英语数据,在 A100 上以 BF16、相当于 1 小时语音的 batch 训练 10 万步;VocStream 使用 LibriTTS-R。自动评测中, 的 WER 为 3.38%,非流式 RichTTS 为 3.28%。在 unigram 输入下,SpeakStream WER 为 7.47%,而 RichTTS 和 XTTS 分别恶化到 68.18% 与 222.28%,说明训练分布匹配比推理时机械切文本更重要。
真人评测对 100 个片段、每段 7 个评分进行统计,共 284 名独立参与者。SpeakStream 的自然度约 3.7、连贯度约 3.9;非流式 RichTTS 连贯度同为 3.9。该结果支持局部 lookahead 的可用性,但样本与语言范围仍小。
5. 批判性判断
Section titled “5. 批判性判断”- 论文真正解决的是训练序列与在线输入模式不一致,而不仅是换一个更快的 vocoder。
- 看似计算很快,却要先得到 5 个词;对上游 LLM 慢速输出、德语长复合词或中文分词,这个等待可能比模型前向更显著。
- 只在 LJSpeech 上验证,使得说话人切换、参考音色、噪声与多语种分词仍是空白。
- 强制对齐错误会被固化进训练交织,但论文没有系统分析对齐噪声敏感性;这正是 资料摘要:CTC-TTS 的互补问题。
| 项目 | 论文报告 |
|---|---|
| TTS 训练集 | LJSpeech,单说话人英语 |
| Vocoder 训练集 | LibriTTS-R |
| 最佳窗口 | |
| 最佳 WER | 3.38% |
| M4 Pro 计算时间 | 约 40–45 ms(不含上游文本等待) |
| 真人评测 | 100 片段、每段 7 人、284 名独立参与者 |
| 主要限制 | 单说话人、单语、依赖训练期词级对齐 |
- Wiki 目录
- 资料摘要:CTC-TTS — 在线 CTC 对齐与 bi-word block 对照
- 资料摘要:LLMVoX — 字节级增量文本与双队列调度对照
- 流式语音合成 — lookahead、首包和持续吞吐的共同框架
- 自动语音识别(ASR) — 训练期强制对齐背景