跳转到内容

输入关键词开始搜索

    资料摘要:SpeakStream

    论文摘要更新 2026-08-17置信度 high待阅读原始来源 ↗#语音合成#流式#对齐#深度#易过时

    SpeakStream 通过训练期词级对齐,把文本词块与对应的离散 mel(dMel)语音块交织进一个 decoder-only TTS 序列;推理时无需强制对齐器,并以可调的窗口 mm 与步长 nn 在文本 lookahead、自然度和响应速度间取舍。

    • 训练数据先经 A3T/强制对齐得到词级边界,再把字符级文本片段和对应 dMel 片段交织;对齐器只用于数据构造,不进入推理路径
    • 当前语音块可以读取完整文本/语音历史的 KV cache,直到预测音频 <eos> 才结束;这比固定时长切块更适应真实词长。
    • 窗口 mm 表示当前可见词数,步长 nn 表示每次提交的词数。论文最佳设置为 m=5,n=1m=5,n=1,也就是用 4 个词的右上下文换取更稳定韵律。
    • VocStream 由因果上采样器和 WaveNet 类 vocoder 组成,只需一帧 mel 即可开始合成;在 M4 Pro 上报告约 40–45 ms 模型计算时间。
    • 最佳设置在 LJSpeech 上报告 3.38% WER,接近非流式 RichTTS 的 3.28%;但使用单说话人英语数据,尚不能代表 zero-shot、多说话人或跨语种能力。
    • 延迟从“第一个词收到”开始计时,不包含上游 LLM 生成第一个词的时间;此外,系统仍需等待 mm 个词,不能把 40 ms 直接当作完整用户响应时间。
    LLM-based TTS 九篇参考论文系统位置 架构图
    LLM-based TTS 九篇参考论文系统位置 架构图

    SpeakStream 的因果序列可概括为:

    词窗口 → 对应 dMel 块 BOS → dMel token… → EOS → 下一词窗口 → …

    字符级文本 embedding 保留原始字形信息;语音被压成 dMel token。强制对齐只决定每个训练块覆盖哪些词及其对应声学范围。推理时,模型直接依赖学到的局部单调性,避免在线调用对齐器。

    方案 1 重复滑动文本窗口:长度为 mm,每次向前移动 nn 个词,最前面的 nn 个词对应当前要生成的语音,余下 mnm-n 个词提供 lookahead。论文发现该方案优于不重复上下文的方案 2,原因是语音片段时长变化大,局部重复文本有助于模型明确当前边界。

    设置 右上下文 直觉
    m=3,n=1m=3,n=1 2 词 更快启动,首词规划较弱
    m=4,n=1m=4,n=1 3 词 延迟与韵律折中
    m=5,n=1m=5,n=1 4 词 论文中 WER 最佳,需等待更多文本

    这说明双流式 TTS 的“延迟”首先是信息等待问题,其次才是 GPU/CPU 计算时间。

    VocStream 将离散 mel token 因果上采样并交给 WaveNet 类 vocoder。它只需要一个 mel 帧即可输出波形,从而避免非因果 vocoder 等完整声学块。论文还与 Parallel WaveGAN 对照:后者总计算约 180 ms,而 VocStream 在 m=3/4/5m=3/4/5 下约为 40/41/45 ms,其中 TTS 约 27–29 ms、vocoder 约 13 ms。

    TTS 使用 LJSpeech 单说话人英语数据,在 A100 上以 BF16、相当于 1 小时语音的 batch 训练 10 万步;VocStream 使用 LibriTTS-R。自动评测中,m=5,n=1m=5,n=1 的 WER 为 3.38%,非流式 RichTTS 为 3.28%。在 unigram 输入下,SpeakStream WER 为 7.47%,而 RichTTS 和 XTTS 分别恶化到 68.18% 与 222.28%,说明训练分布匹配比推理时机械切文本更重要。

    真人评测对 100 个片段、每段 7 个评分进行统计,共 284 名独立参与者。SpeakStream m=4m=4 的自然度约 3.7、连贯度约 3.9;非流式 RichTTS 连贯度同为 3.9。该结果支持局部 lookahead 的可用性,但样本与语言范围仍小。

    • 论文真正解决的是训练序列与在线输入模式不一致,而不仅是换一个更快的 vocoder。
    • m=5,n=1m=5,n=1 看似计算很快,却要先得到 5 个词;对上游 LLM 慢速输出、德语长复合词或中文分词,这个等待可能比模型前向更显著。
    • 只在 LJSpeech 上验证,使得说话人切换、参考音色、噪声与多语种分词仍是空白。
    • 强制对齐错误会被固化进训练交织,但论文没有系统分析对齐噪声敏感性;这正是 资料摘要:CTC-TTS 的互补问题。
    项目 论文报告
    TTS 训练集 LJSpeech,单说话人英语
    Vocoder 训练集 LibriTTS-R
    最佳窗口 m=5,n=1m=5,n=1
    最佳 WER 3.38%
    M4 Pro 计算时间 约 40–45 ms(不含上游文本等待)
    真人评测 100 片段、每段 7 人、284 名独立参与者
    主要限制 单说话人、单语、依赖训练期词级对齐