跳转到内容

输入关键词开始搜索

    资料摘要:Phoenix TTS

    论文摘要更新 2026-08-16置信度 high待阅读原始来源 ↗#语音合成#语音转换#语音编码#流匹配#深度

    Phoenix TTS 用下游 flow-matching 声学重建目标反向塑造单码本语义 tokenizer:tokenizer 不只追求可识别内容,还必须让同一条件下的声学生成器能恢复高保真细节,从而缩小“语义 token 适合 LM、却不适合波形重建”的目标错位;同一 0.5B 系统还原生支持 zero-shot voice conversion。

    🔒 Phoenix TTS 原始论文

    arXiv

    ASR-TTS 论文周报 015 技术路线图
    ASR-TTS 论文周报 015 技术路线图
    • UniSpeechTokenizer:冻结 w2v-BERT 2.0 第 16 层,经 6 层 Conformer 与单个 8,192 项 VQ 码本得到 25 Hz、8 维 token;语义重建维持内容,flow-matching acoustic reconstruction 提供下游声学梯度。
    • 离散语义、连续声学解码:波形 VAE 把 24 kHz 语音压成 25 Hz、64 维 latent;18 层、768 hidden 的 DiT 从语义 token、文本/LM hidden 和 speaker condition 生成声学 latent。
    • TTS 主干:24 层语言模型从 Qwen2.5-0.5B 初始化,建模文本到语义 token;speaker encoder 用 Perceiver 将 prompt 汇聚成 32 个可学习条件 latent。
    • 联合训练优于分离训练:去掉 tokenizer 与 flow decoder 的 joint acoustic objective,LibriSpeech WER 从 1.94 升至 2.70、SIM 从 0.718 降至 0.682;用 prompt mel 代替专用 speaker condition 也更差。
    • TTS 与 VC 共用表示:无需 VC 专项微调即可把源语音 token 与目标 speaker prompt 组合;LibriSpeech VC 为 WER 2.54、SIM 0.697、UTMOS 4.081。
    • 开源边界:论文未给出官方代码或权重地址,截至 2026-08-16 未确认可复现发布。

    关键矛盾:可预测性与可重建性

    Section titled “关键矛盾:可预测性与可重建性”

    纯 SSL/ASR 语义 token 对文本内容友好,却可能丢失声线、相位和微观韵律;纯声学 codec 可重建,却给 AR LM 带来难预测的细节。Phoenix 的做法不是增加多层残差码本,而是用下游 flow decoder 的重建误差校正语义 tokenizer,让一个低速 token 同时服务内容建模与条件声学生成。

    Phoenix 由下游声学生成器定义“有用 token”,ReLMCodec 则从量化前的音素结构出发定义“可预测 token”。两者都反对只看 codec 重建指标,但监督位置不同:前者强调 downstream reconstruction gradient,后者强调 SSL anchor 与 AR probe。

    • 版本:arXiv:2608.11737v1,2026-08-12;14 页。
    • 数据:约 11 万小时,中英公开数据加专有有声书;tokenizer 用 8 张 A100,TTS LM 用 32 张 A100。
    • TTS:LibriSpeech WER 1.94/SIM 0.718;Seed-EN 1.56/0.720;Seed-ZH CER 1.16/SIM 0.778。
    • 主观结果:英文/中文 SMOS 4.09/4.10,CMOS -0.09/-0.10,接近作者选取的 ground truth 参考。
    • 局限:大量 author-run baseline;含专有数据;“客观 SIM 超过 GT”可能来自验证器偏差,不代表人类判断优于真实语音;无专门 limitations 小节。