现代 text-to-speech(TTS)主要由自回归(AR)codec 语言模型主导,但其从左到右解码具有结构性代价:延迟随语句长度增长、已经确定的前缀会累积误差,并且会给本无天然顺序的 Residual Vector Quantization(RVQ)token 网格强加人为生成顺序。本文提出 Luna-TTS Family——一族基于 diffusion language model 的 TTS 系统,使用中文、英文、日文和韩文共 100 万小时语音进行预训练。该系列由预训练 AR 文本 LLM 逐步改造而来,attention 依次从 causal 变为 bidirectional,再变为 block-causal;两个变体共用同一 tokenizer、数据流水线以及 0.6B backbone 血统。Luna-TTS 是完全非自回归模型:它用固定次数的并行细化步骤生成整段语音的 RVQ token 网格,zero-shot voice cloning 和 speech editing 都自然表现为 infilling。Luna-TTS Realtime 由 Luna-TTS continual training 得到:它在 32 个 codec frame(1.28 秒)组成的 block 之间自回归,而在每个 block 内并行去噪;支持带 KV cache 的分块生成,并在首个 block 确定后增量交付音频。在预热后的本地 serving 协议下,Luna-TTS Realtime 达到 0.0240 的端到端 RTF,首个 1.28 秒解码音频块在 41.6 ms 时确定;在所测 engine 边界内,这相当于超过 实时速度。annealed fine-tuning 阶段加入对 emotion 与 non-verbal vocalization 的显式控制,reinforcement learning 阶段采用 GRPO,并沿实际发生的去噪轨迹计算 policy ratio。在 Seed-TTS-Eval 上,Luna-TTS 在所比较的开源与商业系统中四项指标均为最佳(test-zh:0.73 CER / 79.7 SIM;test-en:1.49 WER / 76.8 SIM);在更困难、来自真实环境的 CV3-Eval 上,它同样取得本文比较中的最低中英文错误率。与领先商业系统进行表现力控制评测时,它在 non-verbal vocalization 与 emotion control 的多数客观、模型评判和人工评分指标上也取得最佳结果。
1 引言
language-modeling 范式重塑了 text-to-speech(TTS)。神经 audio codec [1,2,3] 将语音离散化,再以 next-token prediction 目标训练 decoder-only Transformer,neural codec language model [4,5] 由此把语音合成转化为 sequence modeling 问题,并继承大语言模型(LLM)的 scaling 行为、in-context learning 能力和基础设施。沿数据、参数量与 post-training 扩展这一配方,已经产生一代在自然度上比肩人类、且能凭几秒参考音频稳健完成 zero-shot voice cloning 的系统,包括 Seed-TTS [6]、CosyVoice 系列 [7,8,9]、MiniMax-Speech [10]、Llasa [11]、GLM-TTS [12]、Qwen3-TTS 与 Qwen-Audio-3.0-TTS [13,14]、Fish Audio S2 [15]、MOSS-TTS [16] 等 [17,18,19,20,21]。总体而言,这些系统共享一个计算核心:自回归(AR)语言模型严格从左到右、一次一步地发出 speech token。
然而,AR 核心带有与 speech token 实际组织方式日益冲突的结构性代价。第一,解码是串行的:延迟和计算量随生成步数线性增长,而步数又随音频时长和 token rate 增长。对 Residual Vector Quantization(RVQ)tokenizer 而言,这一矛盾最尖锐:每个 frame 由一叠 codebook 条目表示,AR 模型却必须给 codebook 轴上没有内在左右顺序的 token 网格强加生成次序。领域内因此形成一套 workaround:延迟或交错 codebook stream [22,20,16,23];time–depth 分层自回归,即用大型时间模型搭配轻量 frame 内 decoder [23,16,15];以及从共享时间状态生成 residual-codebook token 的 multi-codebook prediction 模块 [13]。这些都是对同一底层约束越来越复杂的修补。第二,AR 生成易受 exposure bias 和误差累积影响:一次采样错误会冻结在前缀里并继续传播,表现为漏词或重复,TTS 系统往往要专设训练阶段来抑制它们 [13,24]。第三,固定生成顺序排除了双向细化:AR 模型无法利用后文重新审视早期 frame,speech editing 等原生 infilling 操作也必须另造机制。
非自回归(NAR)方案长期位于这一生态的边缘。基于 flow matching 的连续空间模型 [25,26,27,28] 解码很快,但需要显式处理时长 [10],也不在可利用现代 LLM 软件栈的离散 token 空间工作,因此无法继承文本知识和 serving 基础设施。SoundStorm [29]、NaturalSpeech 3 [30]、MaskGCT [31] 等 masked generative discrete 模型早已证明 RVQ token 网格可以通过迭代 unmasking 并行解码,但它们是中等规模、面向特定任务的架构,与通用语言模型的预训练配方、初始化策略和工具链相脱节。
如今,这一断层正在从文本侧闭合。建立在 masked discrete diffusion [32,33,34,35] 之上的 diffusion language model(dLLM)已从概念验证发展为有竞争力的范式:LLaDA [36] 与 Dream [37] 在约 B 规模上可匹敌同尺寸 AR 模型;商业系统展示了数量级的解码加速 [38,39];该范式也已扩展到 100B 参数 [40]。与此同时,block diffusion [41] 在两个极端之间插值:模型在 token block 之间自回归,从而保留 KV caching、变长生成和 streaming,同时并行去噪 block 内全部 token。把预训练 AR LLM 改造成(block-)diffusion decoder 的实用方案 [42,43,44],让整个家族能够继承成熟文本 LLM 的语言知识,而不必从零学习。作者认为 TTS 是这种机制天然、甚至最天然的应用:输出被输入文本强约束,显著压缩了自由文本并行解码面临的语义分支因子 [45];RVQ token 网格也正是 any-order masked prediction 擅长、AR 解码不擅长的无序且局部相关结构。
早期探索支持这一判断,但图景仍不完整。在完全并行一侧,LLaDA-TTS [46] 把紧凑 AR 文本 LLM 转换为 masked-diffusion speech model,DiffuSpeech [47] 则把文本 dLLM 适配到语音,不过两者数据规模都较小;OmniVoice [48] 把 masked-diffusion TTS 扩展到 58.1 万小时,并强调大范围语言覆盖。在 block 一侧,DiSTAR [24] 交错使用 AR drafting 与 masked-diffusion infilling,Chatterbox-Flash [49] 则通过 fine-tuning 把预训练 AR TTS decoder 转成 block-diffusion decoder。仍缺少的是:(i)由大规模 diffusion pretraining 支撑、而非事后转换 AR checkpoint 得到的 streaming block-diffusion TTS;(ii)在 tokenizer、数据和模型容量一致时,对 fully parallel 与 block-autoregressive diffusion 解码进行受控比较,让社区能直接判断架构选择;(iii)证明 diffusion-based TTS 在主要语言上能达到生产级 AR 系统的质量门槛,而不仅是在强调语言广度的设置中有效。
本报告提出 Luna-TTS Family:一族在中文、英文、日文和韩文共 100 万小时语音上预训练的 diffusion-language-model-based TTS 系统。系列包含两个变体,它们共用 speech tokenizer、数据流水线与 0.6B 参数 backbone 血统,但生成范式不同:
- Luna-TTS 是完全非自回归的 masked-diffusion 模型,在完整 RVQ token 网格上采用不受限的随机 masking [48],并用基于置信度的迭代并行采样解码。它以固定次数的细化步骤生成整段语音网格;另一个基于独立文本 LLM(Qwen3-0.6B)的 token-level duration predictor 为多语言输入给出目标长度。由于模型把生成表述为 any-order infilling,zero-shot voice cloning 与 speech editing 可在统一框架中自然实现,不需要任务专用辅助机制。
- Luna-TTS Realtime 是建立在 block-diffusion 目标 [41] 上的 block-autoregressive 模型,由 Luna-TTS 通过面向 block-causal streaming 的 continual training 得到。它在 block 之间 causal,支持 KV caching,并以 1.28 秒音频包增量合成;与此同时,block 内全部 frame 和 codebook 都并行解码。
该系列通过预训练 AR 文本 LLM(Qwen3-0.6B)的逐步适配构建:先得到 Luna-TTS,再得到 Luna-TTS Realtime(§2.4)。因此两个变体都继承了强大的多语言文本能力,这对处理日文和韩文的形态复杂性与独特书写系统尤其重要。模型直接在声学 RVQ token 上工作,无须中间 flow-matching 阶段即可驱动 codec decoder;frame 内 codebook stack 也自然纳入并行去噪。预训练最后以高质量且带表现力标注的语音做 annealed fine-tuning,加入可控情感和 non-verbal vocalization;随后 RL post-training [50] 沿去噪轨迹直接优化内容正确性与说话人相似度等 utterance-level reward(§4)。
本文主要贡献如下:
- 生产规模的 diffusion-LLM TTS 家族。 据作者所知,Luna-TTS Family 是迄今规模最大的 diffusion-based TTS 预训练(100 万小时语音),也是首个以中文、英文、日文和韩文为目标的工作。Luna-TTS 在 Seed-TTS-Eval 的四项指标上均优于所比较的开源和商业系统,并在真实环境 CV3-Eval 的本文比较中取得最低中英文错误率(§6)。
- 逐步适配配方与两个面向部署的变体。 整个家族完全由 continual training 构建(causal bidirectional block-causal),每次转换都继承已有文本与语音知识,同一配方也可用于现有 codec language model。Luna-TTS Realtime 据称是首个由大规模 diffusion pretraining 支撑、而非从 AR checkpoint 转换的 streaming block-diffusion TTS [49]。两个变体因 tokenizer、数据流水线和 backbone 相同,构成 AR–diffusion 插值 [41] 的受控实现:离线吞吐使用 fully parallel,增量交付使用 block-autoregressive。选择它们是部署决策而非系统迁移;预热本地 serving 下,Realtime 的端到端 RTF 为 0.0240,1.28 秒 block 的本地首块延迟为 41.6 ms(§5.2)。
- 可控表现力语音生成。 Luna-TTS 加入 utterance-level emotion 和行内 non-verbal vocalization(NVV)的显式控制,把整句话塑造成连贯的声音表演:指定情感引导整体表达,符合上下文的 NVV 在标定位置实现。与领先商业系统相比,它在 NVV 与 emotion control 的多数客观、模型和人工指标上最佳(§6.2)。
- 面向 masked speech-token diffusion 的 RL post-training。 GRPO 风格 RL [50] 此前用于 AR TTS [12,15];本文通过在迭代去噪轨迹中实际发生的 token 决策上定义 policy ratio,并让 rollout 与 replay 在同一有效采样 policy 下评估,将其迁移到 masked-diffusion。ratio 用 group-relative、按字典序排序的 reward 优化:优先保证内容正确,再用说话人相似度打破平局(§4)。
后续章节安排如下:§2 介绍架构,包括 Luna-Codec tokenizer、token 网格上的统一 masked-diffusion 表述以及两种解码方式;§3 介绍数据、多阶段预训练日程、diffusion 到 block-diffusion 的适配和 token-level duration predictor;§4 介绍基于实际去噪轨迹的 RL post-training;§5 定义两个变体的执行路径、streaming contract 与测量协议;§6 评测 zero-shot synthesis、表现力控制与 dedicated voice 质量;§7 总结全文。
2 架构
2.1 概览
Luna-TTS Family 采用两组件设计:Residual Vector Quantization(RVQ)speech tokenizer——Luna-Codec,把波形映射为紧凑离散 token 网格并重建回来(§2.2);以及 0.6B 参数的 diffusion language model,在文本和可选 reference prompt 条件下生成该网格(§2.3–§2.6)。Figure 1 展示整体流水线。
设计由三项原则驱动:
单一生成阶段中的信息完整声学建模
主流 LLM-based TTS 流水线预测低码率 semantic token,再把声学渲染交给独立的 flow-matching 或 diffusion detokenizer [7,12,6,14]。这种拆分稳定了 AR 解码,却制造了 semantic–acoustic 鸿沟:语言模型看不到、也无法直接优化决定说话人保真度与表现力的声学细节 [51]。Luna-TTS Family 改为直接建模完整 multi-codebook token 网格,让一个生成阶段拥有全部信息,codec decoder 只负责确定且轻量的音频映射。
Any-order generation 与 token 网格几何相匹配
RVQ 编码的语句是二维网格:一轴为时间,另一轴为 codebook depth;条目在局部强相关,但 depth 轴不存在天然全序。AR 系统仍不得不给它强加次序,例如 delay pattern [22]、per-frame depth Transformer [23] 或 multi-token-prediction head [13]。masked diffusion 消解了这一问题:所有网格位置在同一 any-order denoising 目标下对称建模,跨 codebook 依赖通过多次细化解决,而非由架构武断规定。
一种表述,两个工作点
masked-diffusion 目标允许一条由 block size 索引的解码谱系 [41]:从整句完全并行生成一直到逐 token AR 解码。Luna-TTS Family 取两个面向部署的工作点:Luna-TTS 用于 full-grid 离线合成与原生编辑,Luna-TTS Realtime 用于 block-causal 增量交付。Realtime 由 Luna-TTS 在 block-causal attention pattern 下 continual training 得到(§2.6),其余设计全部共享;两者选择取决于 workload 所需工作点。
2.2 Speech Tokenizer:Luna-Codec
Luna-Codec 是 causal neural codec:把 24 kHz 语音编码为 25 Hz token 网格,包含 个 residual codebook、每个 2048 个条目,即每秒 200 个 token,有效码率 2.2 kbps。encoder 由 strided causal convolutional network 与轻量 causal Transformer bottleneck 构成;decoder 镜像这一结构并按 frame 同步重建波形,因此 streaming 时可以 frame 粒度发出合成音频。
语义锚定的第一层 codebook
纯声学 RVQ token 会把细致频谱信息集中到前几层 codebook,导致 token 序列无谓地难以从文本预测 [52]。沿 semantic distillation 路线 [53,23],作者从预训练 WavLM encoder [54] 蒸馏 frame-level 表示,使第一层 codebook 偏向语言内容,同时让 residual codebook 自由捕获音色、细微韵律和通道特征。所得网格的 depth 轴大致从语言信息排到声学信息,既保持可由文本预测,也保留完整声学细节。
训练
Luna-Codec 在中、英、日、韩 40 万小时语音上按标准 codec 配方训练:时域和 multi-scale mel 域重建损失、VQ commitment loss、多周期与 multi-resolution STFT discriminator 的 adversarial training [55,56],再加第一层 codebook distillation loss。Quantizer dropout 提供可变码率能力。无论设计还是重建质量,所得 tokenizer 与 Higgs Audio [57]、Qwen3-TTS [13] 等近期 LLM-TTS 系统处于同一水平。
2.3 统一表述:token 网格上的 Masked Diffusion
符号
令 表示目标语句的 token 网格(即 声学 code 矩阵),其中 为 frame 数、 为 codebook 数;令 表示条件信息:输入文本 (沿用 Qwen3-0.6B BPE 词表分词)与可选 acoustic prompt 。后者本身是干净 token 网格,用于指定目标声音。所有条件 token 与 个目标 frame 排成一个序列,由共享 Transformer backbone 处理。每个目标 frame 占一个 sequence position,其 个 codebook embedding 从不同表查出后相加,形成单个 frame-level 表示。
Forward process
作者采用简化的 absorbing-state masked diffusion 过程 [34,35,36]。给定 noise level ,每个目标位置 都以概率 独立替换为特殊 mask token:
其中 表示 point mass,m 表示 mask token。条件 token 永不 masking。模型 训练为并行恢复全部 masked position,由此得到对 negative log-likelihood 构成上界的加权 denoising cross-entropy [34]:
Frame-wise multi-codebook 建模
backbone 每个 frame 只接收一个 embedding:按 multi-stream audio LM 的标准做法 [23,16],从不同表查询该 frame 的 个 codebook embedding 并相加,使 Transformer sequence length 保持为 而非 ,LM 侧 rate 保持 25 Hz。对称地,每个 frame 的 output hidden state 输入 个并行 classification head,每个 codebook 一个。masked position 通过 learned per-codebook mask embedding 参与求和,因此 frame 可沿 depth 轴局部 masking。text embedding、positional encoding 与 text head 原封不动继承 Qwen3-0.6B;audio embedding table 与 head 为新参数。训练损失在全部 个 codebook head 上累加 per-position cross-entropy。
基于文本的表现力控制
表现力控制使用文本侧条件通路。instruction context 中的 utterance-level emotion token 指定整体情感表达;合成文本中的行内 non-verbal vocalization(NVV)token 指示笑声、咳嗽等局部声音事件。这些特殊控制 token 无须专门 style encoder 或 control head [15,45,14],也不会作为词汇内容被念出。行内 NVV token 指定相对文本的事件位置,而非精确声学时间戳。说话人身份则由 acoustic prompt 独立指定。表现力标注与 continual pretraining 分别见 §3.1 和 §3.2。
2.4 从 AR 文本 LLM 到 Speech Diffusion LM
Luna-TTS Family 并非从零预训练,而是跨三种 attention regime 逐步适配:AR 文本模型的 causal attention、Luna-TTS 的 fully bidirectional attention、Luna-TTS Realtime 的 block-causal attention。每一阶段都从前一阶段初始化,以保留已获得的表示和能力。
起点是预训练自回归文本 LLM Qwen3-0.6B。动机有二:第一,仅凭 speech-paired data 获得 grapheme-to-phoneme 规律、命名实体、code-switching 以及日文韩文书写复杂性等文本能力代价很高;第二,已有工作表明,AR 初始化的 diffusion 模型比从零训练显著更快 [42,37,43]。
第一次转换直接把 Qwen3-0.6B 改为 Luna-TTS:backbone 用 Qwen3-0.6B 权重初始化,把 causal attention mask 改为覆盖整个序列——包括文本、acoustic prompt 和目标 token 网格——的 full bidirectional attention,再按 Equation (2) 的 masked-diffusion 目标在 speech–text data 上继续训练。AR 预训练表示可有效迁移到 any-order denoising,这与 AR checkpoint 是 masked-diffusion decoder 强初始化的已有结论一致 [42,37,46]。模型在全部 100 万小时语料上训练至收敛,得到 Luna-TTS(§2.5);Luna-TTS 到 Realtime 的后续转换见 §2.6。
2.5 Luna-TTS:完全并行的 Masked-Diffusion 生成
Luna-TTS 在整段语句上应用 Equation (2),conditioning 与目标网格之间均使用 full bidirectional attention。训练遵循 Zhu 等(2026),对完整 网格做不受限随机 masking:每个语句采样一个 noise level ,随后每个网格位置独立 masking,不沿时间轴或 codebook 轴施加结构约束。模型必须学会补全任意局部网格,而迭代并行解码、prompt-conditioned cloning 与 editing 都恰好是这种能力的特例。生成从 个 frame 的全 mask 网格开始,以 次细化步骤得到完整语句。
通过 infilling 完成 voice cloning 与 speech editing
输入序列为 :文本、干净 prompt 网格和局部 masked 目标网格。prompt 只是同一网格中未 masking 的区域,因此 zero-shot voice cloning 不是特殊机制,而是模型的原生 infilling 行为:补全目标区域,使其与可见声学上下文最大程度一致。该性质自然扩展到 speech editing:masking 现有语句任意片段,再以原始或修改后的文本去噪,可在保持前后音频一致的同时重生成 masked 区域;AR 模型若无专门机制并不原生具备该能力 [46,31]。
Token-level duration prediction
完全并行生成必须预先知道 frame 数 。基于字符/phone 数并按语言语速缩放的 rule-based 长度启发式,在 Luna-TTS 的四种语言上尤其脆弱:中文字符通常表示有意义的音节;日文混合汉字与音节假名;韩文使用 Hangul 字母;英文使用拉丁字母;文本长度到语音时长的映射也各不相同。因此作者训练独立 token-level duration predictor:另一个文本 LLM(Qwen3-0.6B)经过 fine-tuning,在完整句子上下文下为输入文本每个 token 预测时长(§3.2)。对 per-token prediction 求和得到 ;这种 token-level 表述还暴露 sub-utterance 粒度的时长,可支持精细语速操纵与局部编辑。推理时用户也能直接设置或缩放 ,免费获得连续语速控制 [31]。
迭代并行解码
解码采用 MaskGIT 系列的 confidence-based unmasking [58,29,36]:每一步并行预测全部 masked position;由 cosine schedule 给出一部分待确定位置,按预测置信度与退火 Gumbel noise 选择,其余位置为下一轮重新 masking。由于训练使用不受限随机 masking,decoder 可按置信度决定顺序,在时间与 codebook depth 上任意确定位置,而非遵守架构预设次序。作者还在文本条件上使用 classifier-free guidance(训练时以 概率丢弃文本条件),以在较少步数下增强文本遵循 [48]。这种 guided、truncated sampling family(top- truncation、temperature、CFG)也是 RL post-training 计算 importance ratio 时采用的 effective policy family(§4)。因此细化步数 是请求级、无须重训练即可调节的质量—速度旋钮。
优势与局限
优点是串行细化预算固定、网格上完全并行,Luna-TTS 因此适合离线配音、短叙事和数据合成。每次 forward pass 的计算仍随目标网格扩展;full-sequence 表述也无法 streaming,并要求合成前给出全局时长。这些约束引出 Luna-TTS Realtime。
2.6 Luna-TTS Realtime:Block-Causal Streaming 生成
Luna-TTS Realtime 只在 block 边界引入因果性,把 masked-diffusion 语音生成扩展到 streaming synthesis。它不退回 token-level AR,而是依次生成短 acoustic block,同时在每个 block 内保留并行细化。block 一旦确定便不可再改,可立即解码并交付。该设计在提供 streaming 所需增量可用性的同时,保留 Luna-TTS 的大部分并行性。
2.6.1 Block-Causal 设计
沿时间把目标 acoustic-token 网格切成 个 block,。模型将序列写为:
其中 表示语言与声学条件上下文。该分解只规定 block 之间的次序,不规定 block 内 frame 或 codebook 的次序。因此,active block 作为联合声学结构整体细化,而非作为 token 序列逐个发出。
Luna-TTS Realtime 由 Luna-TTS 初始化,并用 Arriola 等(2025)的 block-diffusion 表述适配。训练时,模型在 streaming 执行中届时已可用的信息条件下预测受扰动的当前 block。这使学到的条件分布与 block-causal 生成过程一致,同时保留 NAR 模型的 masked acoustic-token 目标。因此 block causality 是学到的生成行为,而不只是推理时改变 attention mask。
2.6.2 Streaming 执行
streaming generation 保持一个简单状态不变量:已完成 block 构成不可变上下文,只有当前 block 仍可继续细化。conditioning context 只建立一次,随后模型反复初始化、细化并提交一个 acoustic block。每个已提交 block 都传给 causal codec 重建波形,并可在生成下一 block 的同时输出。
将 committed state 与 mutable state 分开有两个结果。第一,只处理一个 block 后即可得到首段音频,无须构造完整语句。第二,后续 block 可利用累积声学历史,而不改写已经交付的内容。该方法因此把 streaming interface 的因果推进与每个生成单元内的并行预测结合起来。
生成通过 learned end-of-speech decision 终止,同时保留显式最大时长作为 serving constraint。主要工作参数是 block 的时间跨度和投入细化的计算量:更小 block 提升交付粒度,更多细化则可能在提交前提高 block 质量。§5.2 通过 serving protocol 描述这些 latency–quality 工作点。
2.7 设计取舍一览
Table 1 总结 Luna-TTS Family 明确呈现的三方比较。作者不认为两个变体有绝对优劣:它们是同一家族的两个工作点;之所以都暴露,是因为生产 workload 确实分为受吞吐约束的离线合成与受延迟约束的交互合成。
| AR codec LM | Luna-TTS | Luna-TTS Realtime | |
|---|---|---|---|
| 生成顺序 | 固定,从左到右 | 全局 any-order | block 内 any-order,block 间从左到右 |
| 串行 NFE | – | (const.) | |
| KV cache | ✓ | — | ✓ |
| Streaming | ✓ | — | ✓(1.28s blocks) |
| 长度处理 | stop token | duration predictor | stop token |
| Frame 内 codebook | delay / depth-AR / MTP | 原生并行 | 原生并行 |
| Infilling 与 editing | 专用机制 | 原生 | 受 prefix 约束 |
| 误差传播 | 无界前缀 | 迭代细化 | block 内细化;提交后不可撤销 |
| 适用 workload | — | 离线 / batch | streaming / 交互 |
3 数据与预训练
本节介绍多语言训练语料的构建——包括带表现力标注的子集——以及依次得到 Luna-TTS 和 Luna-TTS Realtime 的渐进式训练日程。
3.1 数据构建
训练语料分为两部分:覆盖广泛的多语言预训练 mixture,以及带 utterance-level emotion label 和行内 non-verbal vocalization(NVV)tag 的表现力标注子集。
预训练数据构建
数据生产在概念上分四个阶段(Figure 2):
首先统一 source recording 的格式、识别语言,并依据 speech activity 与 speaker boundary 切分。主 ASR 系统生成 transcript,forced alignment 把文本单元映射到波形。随后由 acoustic-quality filter 和第二个独立训练的 ASR 系统验证每个边界明确、说话人一致的切片;英文在 word level 衡量两套 ASR 的一致性,中、日、韩文在 character level 衡量。通过检查的 speaker-consistent 切片由 Luna-Codec 编码成 RVQ token 网格。
该流水线得到约 100 万小时中、英、日、韩精选语音。语料在训练流水线中承担三种角色(§3.2):foundation pretraining 使用的广泛多语言 mixture、annealing 使用的高质量子集,以及下文的表现力子集。这些子集在 source recording 层面可能重叠,但用途不同:广泛覆盖建立语言与说话人多样性,高质量和表现力数据改善保真度与可控性。Table 2 给出语言组成:普通话与英文基本均衡,日文和韩文合计占 13.6%。
| 语言 | 占比 |
|---|---|
| 普通话 | 43.4% |
| English | 43.1% |
| 日文 | 6.7% |
| 韩文 | 6.9% |
表现力数据构建
数据来源。 表现力子集来自内部录音与公开 expressive corpus,覆盖角色与角色扮演、脚本化旁白与故事讲述、情感对话以及自发自然语音等多种风格。进入表现力标注前,所有录音都经过上述标准 normalization、segmentation、transcription、alignment 与 quality-control 流水线。
Emotion 与 NVV 标注。 作者把各来源专属 label 合并为共享 control inventory,只保留感知上可区分、样本充足、可一致标注且有利于合成控制的类别。inventory 包含 utterance-level emotion label 和 inline NVV event label;Table 3 以非穷举样例说明格式。同义或高度相关的 source label 映射到 canonical category,含糊、标注不一致或样本不足的类别则排除。
| 标注类型 | 范围 | 标签 |
|---|---|---|
| Emotion | Utterance-level | e.g., [happy], [sad], [angry], [fearful] |
| NVV | Event-level | e.g., [laughs], [sighs], [gasps], [coughs] |
多模型标注。 作者把已有 source label、录音 metadata 与生成条件,与包含 Gemini 3.1 Pro Preview 和其他大型 audio-language model 的标注流水线结合。给定音频和 transcript,多个模型提出并交叉核验 utterance-level emotion label 与行内 NVV event。模型意见不一致、预测置信度低或 event boundary 复杂的样本交由人工复核。之后再按音频与 transcript 质量、label 可靠性和重复情况过滤标注数据,并用人工 spot check 校准、审计整个过程。
最终标注格式。 标注保存为统一 schema:一个 utterance-level emotion 字段,加一列与文本对齐的 NVV event。所得 corpus 同时包含只有 emotion、只有 NVV、两者均有以及 neutral 的语音样本。§2.3 说明如何把这些标注用于模型训练。
3.2 训练阶段
训练遵循渐进日程:每个阶段继承前一 checkpoint,但改变数据分布或 attention pattern。Table 4 分别列出各阶段的数据、训练量与目的。
| 阶段 | 数据 | 训练量 | 目的 |
|---|---|---|---|
| Foundation pretraining | 完整多语言 mixture | 100 万小时; 加权 epoch; B 个 packed speech–text token | 从 Qwen3-0.6B 学习多语言语音生成 |
| High-quality annealing | 精选高质量语音 | K-hour pool; 约一个 epoch | 改善保真度、稳健性与自然韵律 |
| Expressive continual pretraining | 带 emotion / NVV 标注的语音,并混入 neutral speech | 紧凑的精细标注数据池 | 加入独立与联合表现力控制 |
| Block adaptation | 多语言 mixture | 约 2 万个 optimization step | 学习 block-causal streaming 与终止 |
Foundation pretraining 与 high-quality annealing
foundation pretraining 从 §2.4 所述的 Qwen3-0.6B 直接转换开始,采用 Equation (2) 的 masked-diffusion loss。learning rate 按 cosine schedule 从峰值 降至峰值的 。随后,从完整语料中选约 10 万小时高质量语音,对 foundation 后期 checkpoint 继续训练。该阶段开始时不重启 learning rate,而沿用现有 schedule 的数值,确保切换数据集平滑;之后约用一个 epoch 将 learning rate anneal 到峰值的 。在相同推理设置下,这一阶段相对分支点 checkpoint 持续改善 CV3-Eval 四语言平均 WER。
Expressive continual pretraining
从 high-quality annealing 后的 checkpoint 出发,在上述 expressive mixture 上继续训练。mixture 中保留少量 neutral speech,以帮助维持内容准确性、说话人身份和自然韵律。backbone 与 masked-diffusion 目标不变。所得 checkpoint 支持 emotion control、行内 NVV 生成及二者组合,也为后续模型适配和 RL post-training(§4)提供初始化。
Token-level duration predictor
Luna-TTS 的 duration predictor 由 Qwen3-0.6B 在 full bidirectional attention 下 fine-tuning 得到。它读取完整输入文本,并行预测每个 text token 的 quantized duration 分布。forced alignment 提供监督;推理时解码每个预测分布的期望,再把 per-token duration 求和,得到目标 frame 数 。
Block adaptation
收敛的 Luna-TTS checkpoint 初始化 Luna-TTS Realtime。全局 target bidirectionality 改成 two-stream block-causal mask,sequence-level corruption 改成每个 block 独立采样 noise level;tokenizer、acoustic embedding space、Transformer 权重和 prediction head 全部保留。训练与推理采用相同的 conditional / unconditional block geometry;即使有效语音恰好在 block 边界结束,terminal target 也仍然存在。
4 面向 Masked Speech-Token TTS 的 Reinforcement Learning
作者对 Luna-TTS 做 reinforcement learning(RL)post-training,以优化 token-level supervision 无法直接捕获的 utterance-level 属性,尤其强调语言保真度和说话人一致性。不同于自回归模型,masked diffusion model 不做严格从左到右分解,而是并行细化多个 speech-token position [34]。因此,其采样过程必须表示为迭代去噪轨迹,而非一串传统 next-token 决策。
已有 masked discrete diffusion language model(dLLM)的 RL 工作,用 one-step mean-field surrogate 近似难以计算的输出 likelihood [59]。本文遵循 diffusion policy optimization 的 trajectory-level 视角 [60],围绕去噪轨迹中实际发生的 token 决策组织 policy update。这一构造既保留原生 masked-generation 过程,又允许使用不可微 speech-level feedback 优化。下文给出 RL post-training 的系统级表述。
4.1 轨迹感知的 Policy Optimization
沿用 §2.3 的符号,令 表示条件信息:text input 包含参考 transcript 和目标文本, 为参考 acoustic prompt;为简洁起见省略其他语言或风格条件。给定目标长度 ,模型生成:
其中 是 codebook 数, 是有效 audio-token 词表。生成会产生一列局部完成的状态。在第 个 denoising step,原生推理过程识别 masked position 集合 ,并采样对应 token value ,得到轨迹:
其中 是原生 decoder 的细化步数(§2.5)。RL update 作用在以实际 position sequence 为条件的 token 决策上。这一分离与模型原生 unmasking 过程兼容,也不引入额外 learned position policy;若要联合优化 unmasking 顺序,则需显式 stochastic position policy [61]。
令 表示参数 下的 effective token distribution,即应用 decoder 使用的同一组 validity constraint 与 sampling transformation 后的分布;启用时也包括 classifier-free guidance [62]。以实际集合 为条件,token distribution 分解为:
rollout 与 replay 都在这一 effective policy family 中评估 token probability。保持一致很重要,因为从未变换 model distribution 计算的 ratio 未必对应真正生成 speech token 的分布。
用 索引 prompt group,用 索引 candidate trajectory,用 索引已提交 token action。在 rollout 与 replay distribution 共同有效的 action domain 上,per-action log-ratio 与 importance ratio 为:
其中 汇集对应的 conditioning、denoising state 与 position。因此,policy update 定义在 masked generation 中实际发生的决策上,而不是独立重建的 terminal sequence 上。
对每个 prompt ,behavior policy 采样 个 candidate utterance,并为每个候选分配 scalar utterance-level reward 。依照 group-relative policy optimization(GRPO)[50],计算:
其中 与 分别是 prompt group 内 reward 的均值和 sample standard deviation。同一轨迹中的全部 token 决策共享由此得到的 utterance-level advantage。
对 mini-batch ,token-level surrogate objective 写成:
其中 是 PPO-style clipped surrogate [63], 是 replay 的 token decision 数。在 token level 应用 surrogate,避免对并行决策的 ratio 构造覆盖整条轨迹的乘积。per-utterance normalization 也可防止长语句获得不成比例的权重。由于目标在 recorded action 上可加,replay 能按 denoising state 分解以控制显存,而不改变该归一化。
4.2 Utterance-Level 多目标反馈
每条生成波形由冻结的 automatic speech recognition 和 speaker verification 模型评测。令 表示相对目标文本的 word error rate, 表示相对参考音频的 speaker similarity。 越低,语言保真度越高; 越高,说话人一致性越强。
两个信号转换为 prompt-local ordinal reward:
其中 优先考虑内容保真度,并以 speaker similarity 细化语言质量相近候选之间的偏好。policy update 仅用于能提供有意义相对偏好信号的 group。
这种 group-local 构造避开了直接聚合 raw reward 的两个问题。第一,speech metric 的尺度和可靠性会随语言、transcript 长度、prompt 难度和参考条件变化;prompt 内比较可降低对这些异质来源的敏感度。第二,ordinal composition 不需要用全局加权和对异构 reward model 做数值校准。因此,所得 reward 既表达了目标任务优先级,又能抵御 prompt 之间绝对指标值的变化。
只有生成 token 序列解码成波形后才能观测 reward。因此,共享 trajectory advantage 提供的是粗粒度而非 token-specific credit assignment。该设计牺牲精细 credit assignment,换取与 black-box speech metric 及原生 masked-decoding 过程的稳定集成。
5 推理与 Serving
Luna-TTS Family 在同一 0.6B backbone 上提供两种 serving profile。Luna-TTS 面向高吞吐离线合成,Luna-TTS Realtime 面向低延迟 streaming synthesis。两者使用相同 speech representation 与 codec interface,并通过作者的 vLLM-Omni serving stack [64] 部署。
5.1 Serving Profile
Luna-TTS:整句生成。 Luna-TTS 预测目标时长、初始化完整 acoustic token canvas,再通过 full-grid refinement 完成生成。全部细化步骤与 codec decoding 结束后,生成波形才可用。这一 profile 为离线和 batch synthesis 优化。
Luna-TTS Realtime:streaming generation。 Realtime 一次性 prefill 文本、行内控制与参考条件,随后以自回归方式生成 32-frame acoustic block。每个已完成 block 立即解码并提交到 KV cache,因此其余语句仍在生成时 engine 已能返回音频。
Classifier-free guidance 可在单 GPU 上串行执行,也可拆到两张 GPU,让 conditional 与 unconditional branch 并行评估。并行实现保持完全相同的 acoustic token 与 waveform byte。
engine 使用 learned EOS decision 终止生成;可配置的最大长度边界作为 serving 安全限制。
5.2 H20 Serving 性能
两个 profile 均以 BF16、batch size 1,在同一个 Seed-TTS-Eval 中文请求上 benchmark。local first-block latency 从 engine invocation 开始,直到首个 32-frame(1.28 秒)acoustic block 完成并解码;full-response latency 包含 acoustic generation、codec decoding 与 WAV serialization。所有数值都是 12 次预热运行的中位数,不含网络传输。
| Profile | 步数 | 执行方式 | 本地首块(ms) | 完整响应(ms) | 端到端 RTF |
|---|---|---|---|---|---|
| Luna-TTS | 32 | H20, full-grid | 419.6 | 419.6 | 0.0410 |
| Luna-TTS | 16 | H20, full-grid | 216.0 | 216.0 | 0.0211 |
| Luna-TTS Realtime | 16 | H20, 串行 CFG | 98.9 | 837.7 | 0.0790 |
| Luna-TTS Realtime | 16 | H20, 并行 CFG | 63.8 | 451.4 | 0.0426 |
| Luna-TTS Realtime | 8 | H20, 串行 CFG | 59.6 | 457.6 | 0.0432 |
| Luna-TTS Realtime | 8 | H20, 并行 CFG | 41.6 | 254.0 | 0.0240 |
两种 serving profile 优化不同延迟目标。16 步时,Luna-TTS 用 216.0 ms 合成完整波形,端到端 RTF 为 0.0211。对 streaming workload,Luna-TTS Realtime 在 41.6 ms 返回首个已解码的 1.28 秒音频块,并在 254.0 ms 内完成 10.6 秒波形。
Parallel CFG 显著加速两个工作点:16 步时 full-response latency 降低 46.1%,8 步时降低 44.5%;local first-block latency 在 16 步时从 98.9 ms 降至 63.8 ms,在 8 步时从 59.6 ms 降至 41.6 ms。作者采用 8 步、双 H20 配置作为默认 latency-optimized deployment。
5.3 已公开延迟对照
Table 6 把本文测得的 serving 结果与代表性开源 TTS 系统公布的 inference 结果并列。configuration 与 hardware 列保留各来源报告的工作点。
| 系统 | 配置 | 硬件 | RTF |
|---|---|---|---|
| Luna-TTS | 16 步,full-grid | H20 | 0.0211 |
| Luna-TTS Realtime | 8 步,parallel CFG | H20 | 0.0240 |
| Fast F5-TTS [65] | 7-step EPSS | RTX 3090 | 0.0300 |
| OmniVoice [48] | 16-step, batch 1 | H20 | 0.0319 |
| ZipVoice [66] | 16 NFE | H20 | 0.0557 |
| VoxCPM2 [67] | 加速 serving | RTX 4090 | 0.13 |
| Spark-TTS [68] | 0.5B, 并发数 1 | L20 | 0.1362 |
| F5-TTS [28] | 原始模型 | — | 0.15 |
| Fish Audio S2 [15] | SGLang-Omni [69] | H200 | 0.195 |
| Qwen3-TTS-25Hz [13] | 0.6B, 并发数 1 | — | 0.234 |
Table 6 所列工作点中,Luna-TTS 的 RTF 最低,为 0.0211。streaming 的 Luna-TTS Realtime 以 0.0240 排第二;在逐 block 交付音频的同时,它相对 Fast F5-TTS 将 RTF 降低 20.0%,相对 OmniVoice 降低 24.8%。
Table 7 比较领先商业与开源 TTS 系统公布的 first-output latency。
在 Table 7 汇总的测量中,Luna-TTS Realtime 的 first-output latency 最低,为 41.6 ms。
6 评测
评测覆盖系统三个方面:相对公开 benchmark 与强基线的 zero-shot TTS 质量(§6.1)、表现力与副语言控制的有效性(§6.2),以及相对商业系统 preset voice library 的 dedicated voice 质量(§6.3)。
6.1 Zero-Shot TTS
Protocol
作者完整评测两个公开 zero-shot benchmark:Seed-TTS-Eval [6](2020 条普通话 / 1088 条英文语句;普通话 CER 由 Paraformer-zh 计算,英文 WER 由 Whisper-large-v3 计算;SIM 是 WavLM-large speaker-verification embedding 的 cosine similarity);以及用官方 toolkit 评分的 CV3-Eval [9](Whisper-large-v3 / Paraformer-zh;SIM 由 ERes2Net 计算,量纲为 0–100,不能与 Seed-TTS-Eval SIM 比较)。所有 WER/CER 均遵循官方 toolkit 的聚合方式:per-utterance error rate 的非加权平均。作为强基线,作者在 CV3-Eval 上按与 Luna-TTS Family 相同的 protocol 与官方 scoring toolkit,重新评测开源 Qwen3-TTS-12Hz-1.7B-Base [13] 和 OmniVoice [48](使用其官方 duration estimator),以 † 标记;其余系统数值摘自各自报告或已发表比较表,以 ⋄ 标记,评测细节可能不同。Luna-TTS Family 行均为 §4 的 RL post-training 结果。Luna-TTS 的目标长度由 §3.2 的 token-level duration predictor 给出,不使用参考时长信息;解码采用 个细化步骤和 classifier-free guidance。Luna-TTS Realtime 则在 streaming execution mode 下评测,并通过 learned end-of-speech decision 终止。
| 系统 | 参数量 | zh CER | zh SIM | en WER | en SIM |
|---|---|---|---|---|---|
| Seed-TTS⋄ [6] | — | 1.12 | 79.6 | 2.25 | 76.2 |
| MaskGCT⋄ [31] | 1B | 2.27 | 77.4 | 2.62 | 71.7 |
| F5-TTS⋄ [28] | 0.3B | 1.56 | 76.0 | 1.83 | 67.0 |
| CosyVoice 3⋄ [9] | 1.5B | 1.12 | 78.1 | 2.21 | 72.0 |
| MiniMax-Speech⋄ [10] | — | 0.83 | 78.3 | 1.65 | 69.2 |
| GLM-TTS⋄ [12] | 1.5B | 1.03 | 76.1 | 2.23 | 67.2 |
| Qwen3-TTS-12Hz-1.7B-Base† [13] | 1.7B | 0.98 | 76.9 | 1.68 | 71.7 |
| Qwen-Audio-3.0-TTS⋄ [14] | — | 0.84 | 79.2 | 1.54 | 76.2 |
| MOSS-TTS-Local-Transformer⋄ [16] | 1.7B | 1.33 | 77.2 | 1.87 | 71.7 |
| VoxCPM2⋄ [76] | 2B | 0.97 | 79.5 | 1.84 | 75.3 |
| OmniVoice⋄ [48] | 0.6B | 0.84 | 77.7 | 1.60 | 74.1 |
| Luna-TTS | 0.6B | 0.73 | 79.7 | 1.49 | 76.8 |
| Luna-TTS Realtime | 0.6B | 1.08 | 76.9 | 1.81 | 73.4 |
| 系统 | zh | en | ja | ko | 平均 | hard-zh | hard-en |
|---|---|---|---|---|---|---|---|
| CosyVoice 3⋄ [9] | 3.91 | 4.99 | 7.57 | 5.69 | 5.54 | 9.77 | 10.55 |
| VoxCPM2⋄ [76] | 3.55 | 6.21 | 5.88 | 9.95 | 6.40 | 8.10 | 7.48 |
| MOSS-TTS-Local-Transformer⋄ [16] | 3.95 | 4.35 | 10.10 | 5.95 | 6.09 | — | — |
| Qwen-Audio-3.0-TTS⋄ [14] | 3.35 | 4.25 | 4.78 | 4.30 | 4.17 | 7.44 | 6.71 |
| Qwen3-TTS-12Hz-1.7B-Base† [13] | 3.19 | 3.92 | 5.00 | 4.63 | 4.18 | 9.36 | 7.47 |
| OmniVoice† [48] | 3.89 | 4.57 | 7.24 | 11.80 | 6.88 | 11.98 | 19.69 |
| Luna-TTS | 3.17 | 3.18 | 5.00 | 5.93 | 4.32 | 6.90 | 6.18 |
| Luna-TTS Realtime | 3.62 | 4.06 | 6.36 | 5.76 | 4.95 | 12.56 | 13.98 |
Seed-TTS-Eval 结果
Table 8 中 Luna-TTS 四列均居首。普通话 CER 0.73,优于 MiniMax-Speech 的 0.83、Qwen-Audio-3.0-TTS 与 OmniVoice 的 0.84,以及同协议 Qwen3-TTS 基线的 0.98;英文 WER 1.49 同样最低,优于 Qwen-Audio-3.0-TTS 的 1.54、OmniVoice 的 1.60 和同协议基线的 1.68。两种语言的 speaker similarity 也最高:英文 76.8,比次优 Seed-TTS 与 Qwen-Audio-3.0-TTS 的 76.2 高 0.6;普通话 79.7 略高于 Seed-TTS 的 79.6。
CV3-Eval 结果
CV3-Eval 用更长、更不规则且风格多样的困难文本考验真实环境 zero-shot synthesis;它也不同于 Seed-TTS-Eval,覆盖全部四种支持语言。Luna-TTS 的英文 WER 为表中最低的 3.18(同协议 Qwen3-TTS 基线为 3.92);普通话与该基线相当(3.17 对 3.19);真实环境 hard subset 错误率也最低(hard-zh 6.90、hard-en 6.18,优于 Qwen-Audio-3.0-TTS 的 7.44 与 6.71);韩文是最困难子集(5.93)。Qwen-Audio-3.0-TTS 仍保持日文、韩文和四语言平均最佳,分别为 4.78、4.30 和 4.17;Luna-TTS 为 5.00、5.93 和 4.32,平均值距最佳不到 0.2。六个 evaluation subset 的 speaker similarity(ERes2Net)平均为 73.5。
Streaming 变体结果
Luna-TTS Realtime 表明 streaming synthesis 保留了大部分 zero-shot 质量:Seed-TTS-Eval test-zh 为 1.08 CER / 76.9 SIM,test-en 为 1.81 WER / 73.4 SIM;相对 Luna-TTS 约付出 0.3 CER/WER 与 3 个 SIM 点,CV3-Eval language subset 也较接近(平均 4.95 对 4.32)。即使受 streaming 约束,Realtime 仍超过若干离线评测系统:其 CV3-Eval 四语言平均优于 CosyVoice 3(5.54)、MOSS-TTS-Local-Transformer(6.09)和 VoxCPM2(6.40);Seed-TTS-Eval 普通话 CER 1.08 也低于 Seed-TTS 与 CosyVoice 3 的 1.12。最明显差距来自 CV3-Eval hard subset(hard-zh:12.56 对 6.90;hard-en:13.98 对 6.18),因为文本长且不规则,prompt audio 质量也明显低于普通子集。block-causal decoding 的两项性质可能放大这一困难。其一是 error recovery:困难文本和劣化 prompt 都会增加早期声学决策出错概率;Luna-TTS 能在 global refinement 中修正,而 Realtime 每个 block 一旦提交便不可撤销,早期错误会保留并继续影响后续 block。其二是 length control:Luna-TTS 由 text-aware duration predictor 提供 frame 数;Realtime 必须用 learned end-of-speech 决定何时停止,不规则文本与 noisy acoustic context 可能诱发截断或拖长。结合 §5 的 serving 结果,这量化了 streaming 取舍:普通内容上质量小幅下降,困难真实内容上下降更大,换来 blockwise delivery 与 41.6 ms 首块延迟。
6.2 表现力语音控制
表现力语音生成评测聚焦两个互补方面:emotion control 与 NVV generation。两者都从控制准确性和感知质量出发,将 Luna-TTS 与三个商业系统比较:MiniMax Speech 2.8 HD [77]、ElevenLabs Eleven v3 [78]、Fish Audio S2.1 Pro [79]。
6.2.1 Non-Verbal Vocalization 控制
NVV control 使用 NV-Bench [80] 的 Multilingual-NVASR protocol 与 NVV-SuperBench [81] 的 LALM-based perceptual evaluation protocol。客观评测同时使用两套 benchmark 的样本,但只保留 Multilingual-NVASR 能识别且全部系统都支持的四类:breath、cough、laughter、sigh。感知评测覆盖每个系统支持的全部 NVV-SuperBench 类别。
客观可控性。 计算 PCER(在抽取出的 NV symbol 上计算 CER),并报告 micro-averaged event precision、recall 与 F1,以描述预测正确性和目标事件覆盖度。全部指标均为百分比。
| 模型 | PCER | Precision | Recall | F1 |
|---|---|---|---|---|
| MiniMax Speech 2.8 HD | 41.29% | 78.00% | 60.50% | 68.14% |
| ElevenLabs Eleven v3 | 41.73% | 87.45% | 59.79% | 71.02% |
| Fish Audio S2.1 Pro | 47.36% | 77.36% | 55.59% | 64.69% |
| Luna-TTS | 39.95% | 79.38% | 66.76% | 72.52% |
LALM-based 感知评测。 Gemini 3.1 Pro Preview [82] 对 NVV Accuracy、NVV Perceptual Effect(NVV PE)以及整体 naturalness、quality、expression 评分。NVV Accuracy 衡量事件是否实现及位置是否正确,NVV PE 衡量生成 NVV 的感知效果。整体指标使用 1–5 分,NVV 专属指标使用 0–5 分(0 表示缺失或几乎听不见)。
| 模型 | NVV Accuracy | NVV PE | 整体自然度 | 整体质量 | 整体表现力 |
|---|---|---|---|---|---|
| MiniMax Speech 2.8 HD | 3.95 | 3.62 | 3.50 | 4.12 | 3.54 |
| ElevenLabs Eleven v3 | 3.65 | 3.75 | 3.40 | 4.15 | 3.30 |
| Fish Audio S2.1 Pro | 3.56 | 2.66 | 2.83 | 3.73 | 3.00 |
| Luna-TTS | 3.60 | 3.63 | 3.65 | 4.18 | 3.75 |
6.2.2 Emotion Control
emotion control 使用 E-Sim、LALM-based rating 与人工 MOS 评测。E-Sim 使用 ESD test set [83],其中包含测试文本及对应真人参考录音。LALM 与人工评测则用 LLM-assisted generation 构造 held-out 双语 emotion test set;所得自然对话语句覆盖多种场景,并经过质量检查与人工复核。E-Sim 在五个共同 emotion——Angry、Happy、Sad、Surprise、Neutral——上评测;LALM 与人工评测则覆盖每个系统明确支持的全部 emotion category。
Emotion similarity。 使用 emotion2vec_plus_large [84],将 E-Sim 计算为生成语音与配对真人录音的 utterance-level embedding cosine similarity。由于 E-Sim 也可能捕获非情感声学因素,作者把它视为补充指标。
| 模型 | 愤怒 | 高兴 | 悲伤 | 惊讶 | 中性 | 整体 |
|---|---|---|---|---|---|---|
| MiniMax Speech 2.8 HD | 0.530 | 0.603 | 0.460 | 0.357 | 0.715 | 0.533 |
| ElevenLabs Eleven v3 | 0.544 | 0.513 | 0.481 | 0.406 | 0.814 | 0.552 |
| Fish Audio S2.1 Pro | 0.473 | 0.416 | 0.402 | 0.279 | 0.867 | 0.487 |
| Luna-TTS | 0.608 | 0.497 | 0.543 | 0.403 | 0.741 | 0.558 |
LALM-based evaluation。 遵循 EmergentTTS-Eval [85] 的 model-as-a-judge 范式,以及 MINT-Bench [86] 对 instruction following 与 perceptual quality 的区分,Gemini 3.1 Pro Preview [82] 用 1–5 分评价 Emotion Match 与 Expression Quality,分别衡量目标情感对齐和情感表达质量。
人工听测。 在随机、盲测的 listening test 中,听者分别用 1–5 分评价每个样本的自然度与类人程度(N-MOS),以及目标情感传达得多准确、多有说服力(E-MOS)。
| LALM-based 评测 | 人工听测 | |||
|---|---|---|---|---|
| 模型 | Emotion Match | Expression Quality | N-MOS | E-MOS |
| MiniMax Speech 2.8 HD | 2.70 | 4.40 | 4.10 | 3.70 |
| ElevenLabs Eleven v3 | 2.67 | 4.49 | 4.18 | 3.82 |
| Fish Audio S2.1 Pro | 1.93 | 3.94 | 3.95 | 3.55 |
| Luna-TTS | 2.63 | 4.54 | 4.14 | 3.90 |
6.2.3 整体表现力控制性能
综合 NVV 与 emotion 评测,Luna-TTS 在所测系统中呈现最强的可控性、感知质量和表现力覆盖平衡。NVV control 方面,它的 PCER 最低,recall 与 F1 最高,LALM 评分的整体 naturalness、quality、expression 也最佳。emotion control 方面,它的 overall E-Sim 最高、LALM Expression Quality 最佳、人工 E-MOS 最高;在完整支持的 emotion inventory 上,Emotion Match 仍有竞争力,N-MOS 接近最佳。这些结果说明 Luna-TTS 在不牺牲感知质量或语音自然度的前提下提供了广泛、有效的表现力控制。
6.3 内部 TTS Arena 的 Dedicated-Voice 评测
除 zero-shot voice cloning 外,生产 TTS 系统也常使用固定的 dedicated voice 名单。作者用内部英文 TTS Arena 评测该设置,将 Luna-TTS 与 Gemini 3.1 Flash TTS、MiniMax Speech 2.8 HD、ElevenLabs Eleven v3、StepAudio 2.5 TTS 和 Inworld TTS 2 比较。为控制 voice-library 大小差异,每个系统纳入三个声音:Luna-TTS 使用内部录音进一步 fine-tuning 得到的三个 dedicated voice;每个商业系统则从其官网正式推荐的 preset voice 中随机采样三个。分析覆盖 100 条英文 prompt 上 1319 次 pairwise comparison,prompt 涵盖客服、助手、知识分享和娱乐。
每次 trial 都以随机左右顺序呈现两个匿名样本,评价 naturalness、expressiveness、prosody 与 delivery 在内的整体语音质量。评测时隐藏 system identity、model name 与 voice identity。Arena ranking 用拟合 pairwise outcome 的 Bradley–Terry model 估计,strength 以均值锚定在 1500 的 Elo-like scale 报告。为评估 sampling uncertainty,作者做 300 次 bootstrap resample,每次重算排名,最终报告 Elo estimate 中位数与第 5–95 百分位区间。
Table 14 显示,Luna-TTS 在六个系统中 Elo estimate 最高,bootstrap median Elo 为 1548.47。它取得 495 胜、368 负,总胜率 57.36%。Gemini 紧随其后,且 bootstrap interval 与 Luna-TTS 重叠。因此 Luna-TTS 在这次 Arena 评测中名义排名最高,但现有证据不足以证明它与 Gemini 3.1 Flash TTS 的差异具有统计显著性。
| 排名 | 系统 | Elo | 90% bootstrap 区间 | 胜 | 负 | 胜率 |
|---|---|---|---|---|---|---|
| 1 | Luna-TTS | 1548.47 | 1531.98–1566.59 | 495 | 368 | 57.36% |
| 2 | Gemini 3.1 Flash TTS | 1546.13 | 1517.81–1572.46 | 221 | 196 | 53.00% |
| 3 | Inworld TTS 2 | 1495.67 | 1474.79–1519.24 | 283 | 317 | 47.17% |
| 4 | ElevenLabs Eleven v3 | 1484.37 | 1436.10–1529.14 | 50 | 69 | 42.02% |
| 5 | StepAudio 2.5 TTS | 1480.39 | 1458.27–1506.09 | 229 | 298 | 43.45% |
| 6 | MiniMax Speech 2.8 HD | 1445.53 | 1391.82–1495.23 | 41 | 71 | 36.61% |
Table 15 报告 Luna-TTS 对各竞争系统的直接结果。它在五组 head-to-head comparison 中胜率均为正;对 Inworld TTS 2 的优势最大,与 Gemini 的对比则接近均衡。
| 对手 | Luna-TTS 胜–负 | 胜率 |
|---|---|---|
| Inworld TTS 2 | 92–52 | 63.89% |
| MiniMax Speech 2.8 HD | 54–34 | 61.36% |
| ElevenLabs Eleven v3 | 56–38 | 59.57% |
| StepAudio 2.5 TTS | 176–131 | 57.33% |
| Gemini 3.1 Flash TTS | 117–113 | 50.87% |
| 整体 | 495–368 | 57.36% |
7 结论
本报告介绍了 Luna-TTS Family——一族通过逐步适配开发的 diffusion-LLM-based TTS 系统。预训练 AR 文本 LLM 先转换成完全并行的 Luna-TTS,再适配成 block-causal Luna-TTS Realtime。所得两个变体共享同一模型血统,分别面向互补部署场景:高吞吐离线合成与低延迟 streaming。
质量与可控性方面,Luna-TTS 在 Seed-TTS-Eval 四项指标上均居首,在本文 CV3-Eval 比较中取得最低普通话和英文错误率,并在所评系统中取得最强整体 expressive-control 结果。系统层面,Luna-TTS 端到端 RTF 为 0.0211;预热 serving 协议下,Luna-TTS Realtime 将 0.0240 RTF 与 1.28 秒 block 的 41.6 ms 本地首块延迟结合起来。综合而言,这些结果同时推进了 speech generation 性能与 serving 效率,表明 masked acoustic-token diffusion 能在统一模型家族中支撑高质量离线与实时合成,而不只是传统从左到右 acoustic decoding 的替代方案。
局限
四种支持语言中,韩文在 CV3-Eval 上最弱,CER 为 5.93。这一差距可能部分源于训练 mixture 中韩文比例较小(6.9%)。语言覆盖也只有四种,明显窄于大规模多语言 TTS 系统。此外,Luna-TTS 依赖外部 duration predictor 在合成前确定目标 frame 数;Luna-TTS Realtime 使用固定 1.28 秒 block size,该数值为 streaming 效率选择,并未随输入内容动态调整;它在 CV3-Eval hard subset 上落后 Luna-TTS 最明显。
未来工作
值得探索的方向包括:扩大语言和方言覆盖;根据输入内容动态调整 block size;通过 reinforcement learning 联合优化 unmasking-position policy 与 token policy;以及把 duration prediction 集成进 backbone。
8 作者
参考文献
参考文献保留原始书目信息与顺序;正文编号可悬浮、键盘聚焦或轻触查看引用卡。
- Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi. SoundStream: An end-to-end neural audio codec. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2022.
- Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi. High fidelity neural audio compression. arXiv preprint arXiv:2210.13438, 2022.
- Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar. High-fidelity audio compression with improved RVQGAN. In Advances in Neural Information Processing Systems, 2023.
- James Betker. Better speech synthesis through scaling. arXiv preprint arXiv:2305.07243, 2023.
- Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, and Furu Wei. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111, 2023.
- Philip Anastassiou, Jiawei Chen, Jitong Chen, Yuanzhe Chen, Zhuo Chen, Ziyi Chen, et al. Seed-TTS: A family of high-quality versatile speech generation models. arXiv preprint arXiv:2406.02430, 2024.
- Zhihao Du, Qian Chen, Shiliang Zhang, Kai Hu, Heng Lu, Yexin Yang, Hangrui Hu, Siqi Zheng, Yue Gu, Ziyang Ma, Zhifu Gao, and Zhijie Yan. CosyVoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens. arXiv preprint arXiv:2407.05407, 2024a.
- Zhihao Du, Yuxuan Wang, Qian Chen, Xian Shi, Xiang Lv, Tianyu Zhao, Zhifu Gao, Yexin Yang, et al. CosyVoice 2: Scalable streaming speech synthesis with large language models. arXiv preprint arXiv:2412.10117, 2024b.
- Zhihao Du, Changfeng Gao, Yuxuan Wang, Fan Yu, Tianyu Zhao, Hao Wang, Xiang Lv, Hui Wang, et al. CosyVoice 3: Towards in-the-wild speech generation via scaling-up and post-training. arXiv preprint arXiv:2505.17589, 2025.
- Bowen Zhang, Congchao Guo, Geng Yang, Hang Yu, Haozhe Zhang, et al. MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder. arXiv preprint arXiv:2505.07916, 2025.
- Zhen Ye, Xinfa Zhu, Chi-Min Chan, Xinsheng Wang, Xu Tan, Jiahe Lei, Yi Peng, et al. Llasa: Scaling train-time and inference-time compute for Llama-based speech synthesis. arXiv preprint arXiv:2502.04128, 2025a.
- Jiayan Cui, Zhihan Yang, Naihan Li, Jiankun Tian, Xingyu Ma, Yi Zhang, Guangyu Chen, Runxuan Yang, Zijian Huang, Yuqing Cheng, Yizhi Zhou, Guochen Yu, Xiaotao Gu, and Jie Tang. GLM-TTS technical report. arXiv preprint arXiv:2512.14291, 2025.
- Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, et al. Qwen3-TTS technical report. arXiv preprint arXiv:2601.15621, 2026.
- Bajian Xiang, Cheng Wen, Han Zhao, Hao Wang, Haoxu Wang, et al. Qwen-Audio-3.0-TTS: Freely controllable and highly robust speech synthesis with multi-stage training paradigm. arXiv preprint arXiv:2607.23938, 2026.
- Shijia Liao, Yuxuan Wang, Songting Liu, Yifan Cheng, et al. Fish audio S2 technical report. arXiv preprint arXiv:2603.08823, 2026.
- SII-OpenMOSS Team. MOSS-TTS technical report. arXiv preprint arXiv:2603.18090, 2026.
- Xinsheng Wang, Mingqi Jiang, Ziyang Ma, Ziyu Zhang, Songxiang Liu, Linqin Li, et al. Spark-TTS: An efficient LLM-based text-to-speech model with single-stream decoupled speech tokens. arXiv preprint arXiv:2503.01710, 2025a.
- Siyi Zhou, Yiquan Zhou, Yi He, Xun Zhou, Jinchao Wang, Wei Deng, and Jingchen Shu. IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech. arXiv preprint arXiv:2506.21619, 2025a.
- Hao-Han Guo, Kun Liu, Fei-Yu Shen, Yi-Chen Wu, Feng-Long Xie, Kun Xie, and Kai-Tuo Xu. FireRedTTS: A foundation text-to-speech framework for industry-level generative speech applications. arXiv preprint arXiv:2409.03283, 2024.
- LLM-Core Xiaomi. MiMo-Audio: Audio language models are few-shot learners. arXiv preprint arXiv:2512.23808, 2025.
- StepFun Audio Team. Step-Audio 2 technical report. arXiv preprint arXiv:2507.16632, 2025.
- Jade Copet, Felix Kreuk, Itai Gat, Tal Remez, David Kant, Gabriel Synnaeve, Yossi Adi, and Alexandre Défossez. Simple and controllable music generation. In Advances in Neural Information Processing Systems, 2023.
- Alexandre Défossez, Laurent Mazaré, Manu Orsini, Amélie Royer, Patrick Pérez, Hervé Jégou, Edouard Grave, and Neil Zeghidour. Moshi: A speech-text foundation model for real-time dialogue. arXiv preprint arXiv:2410.00037, 2024.
- Yakun Song, Xiaobin Zhuang, Jiawei Chen, et al. DiSTAR: Diffusion over a scalable token autoregressive representation for speech generation. arXiv preprint arXiv:2510.12210, 2025a.
- Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, and Matt Le. Flow matching for generative modeling. In International Conference on Learning Representations, 2023.
- Matthew Le, Apoorv Vyas, Bowen Shi, Brian Karrer, Leda Sari, Rashel Moritz, Mary Williamson, Vimal Manohar, Yossi Adi, Jay Mahadeokar, and Wei-Ning Hsu. Voicebox: Text-guided multilingual universal speech generation at scale. In Advances in Neural Information Processing Systems, 2023.
- Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, Yanqing Liu, Sheng Zhao, and Naoyuki Kanda. E2 TTS: Embarrassingly easy fully non-autoregressive zero-shot TTS. In IEEE Spoken Language Technology Workshop (SLT), 2024.
- Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, and Xie Chen. F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching. arXiv preprint arXiv:2410.06885, 2024.
- Zalán Borsos, Matt Sharifi, Damien Vincent, Eugene Kharitonov, Neil Zeghidour, and Marco Tagliasacchi. SoundStorm: Efficient parallel audio generation. arXiv preprint arXiv:2305.09636, 2023.
- Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Yanqing Liu, et al. NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models. In International Conference on Machine Learning, 2024.
- Yuancheng Wang, Haoyue Zhan, Liwei Liu, Ruihong Zeng, Haotian Guo, Jiachen Zheng, Qiang Zhang, Xueyao Zhang, Shunsi Zhang, and Zhizheng Wu. MaskGCT: Zero-shot text-to-speech with masked generative codec transformer. In International Conference on Learning Representations, 2025b.
- Jacob Austin, Daniel D. Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg. Structured denoising diffusion models in discrete state-spaces. In Advances in Neural Information Processing Systems, 2021.
- Aaron Lou, Chenlin Meng, and Stefano Ermon. Discrete diffusion modeling by estimating the ratios of the data distribution. In International Conference on Machine Learning, 2024.
- Subham Sekhar Sahoo, Marianne Arriola, Yair Schiff, Aaron Gokaslan, Edgar Marroquin, Justin T. Chiu, Alexander Rush, and Volodymyr Kuleshov. Simple and effective masked diffusion language models. In Advances in Neural Information Processing Systems, volume 37, pages 130136–130184, 2024.
- Jiaxin Shi, Kehang Han, Zhe Wang, Arnaud Doucet, and Michalis K. Titsias. Simplified and generalized masked diffusion for discrete data. In Advances in Neural Information Processing Systems, 2024.
- Shen Nie, Fengqi Zhu, Zebin You, Xiaolu Zhang, Jingyang Ou, Jun Hu, Jun Zhou, Yankai Lin, Ji-Rong Wen, and Chongxuan Li. Large language diffusion models. arXiv preprint arXiv:2502.09992, 2025.
- Jiacheng Ye, Zhihui Xie, Lin Zheng, Jiahui Gao, Zirui Wu, Xin Jiang, Zhenguo Li, and Lingpeng Kong. Dream 7B: Diffusion large language models. arXiv preprint arXiv:2508.15487, 2025b.
- Inception Labs, Samar Khanna, Siddhant Kharbanda, Shufan Li, et al. Mercury: Ultra-fast language models based on diffusion. arXiv preprint arXiv:2506.17298, 2025.
- Yuxuan Song, Zheng Zhang, Cheng Luo, Pengyang Gao, Fan Xia, et al. Seed diffusion: A large-scale diffusion language model with high-speed inference. arXiv preprint arXiv:2508.02193, 2025b.
- Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, et al. LLaDA2.0: Scaling up diffusion language models to 100B. arXiv preprint arXiv:2512.15745, 2025.
- Marianne Arriola, Aaron Gokaslan, Justin T. Chiu, Zhihan Yang, Zhixuan Qi, Jiaqi Han, Subham Sekhar Sahoo, and Volodymyr Kuleshov. Block diffusion: Interpolating between autoregressive and diffusion language models. In International Conference on Learning Representations, 2025.
- Shansan Gong, Shivam Agarwal, Yizhe Zhang, Jiacheng Ye, Lin Zheng, Mukai Li, Chenxin An, et al. Scaling diffusion language models via adaptation from autoregressive models. In International Conference on Learning Representations, 2025.
- Chengyue Wu, Hao Zhang, Shuchen Xue, Shizhe Diao, et al. Fast-dLLM v2: Efficient block-diffusion LLM. arXiv preprint arXiv:2509.26328, 2025.
- Yangzhou Liu, Yue Cao, Hao Li, Gen Luo, Zhe Chen, et al. Sequential diffusion language models. arXiv preprint arXiv:2509.24007, 2025.
- StepFun-Audio Team. StepAudio 2.5 technical report. arXiv preprint arXiv:2605.23463, 2026.
- Xiaoyu Fan, Huizhi Xie, Wei Zou, and Yunzhang Chen. LLaDA-TTS: Unifying speech synthesis and zero-shot editing via masked diffusion modeling. arXiv preprint arXiv:2603.26364, 2026.
- Yuxuan Lou, Ziming Wu, Yaochen Wang, et al. DiffuSpeech: Silent thought, spoken answer via unified speech-text diffusion. arXiv preprint arXiv:2601.22889, 2026.
- Han Zhu, Lingxuan Ye, Wei Kang, et al. OmniVoice: Towards omnilingual zero-shot text-to-speech with diffusion language models. arXiv preprint arXiv:2604.00688, 2026.
- Deokjin Seo, Gangin Park, and Kihyun Nam. Chatterbox-flash: Prior-calibrated block diffusion for streaming zero-shot TTS. arXiv preprint arXiv:2605.30748, 2026.
- Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, Y. K. Li, Y. Wu, and Daya Guo. DeepSeekMath: Pushing the limits of mathematical reasoning in open language models, 2024. URL https://arxiv.org/abs/2402.03300. arXiv preprint arXiv:2402.03300.
- Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Ziyang Wang, Runchuan Ye, Weiyue Sun, Jiancheng Gui, Kehan Li, Zhiyong Wu, and Zhiyuan Liu. VoxCPM: Tokenizer-free TTS for context-aware speech generation and true-to-life voice cloning. arXiv preprint arXiv:2509.24650, 2025b.
- Zhen Ye, Peiwen Sun, Jiahe Lei, Hongzhan Lin, Xu Tan, Zheqi Dai, Qiuqiang Kong, Jianyi Chen, Jiahao Pan, Qifeng Liu, Yike Guo, and Wei Xue. Codec does matter: Exploring the semantic shortcoming of codec for audio language model. arXiv preprint arXiv:2408.17175, 2024.
- Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu. SpeechTokenizer: Unified speech tokenizer for speech large language models. In International Conference on Learning Representations, 2024.
- Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, Jian Wu, Long Zhou, Shuo Ren, Yanmin Qian, Yao Qian, Jian Wu, Michael Zeng, Xiangzhan Yu, and Furu Wei. WavLM: Large-scale self-supervised pre-training for full stack speech processing. IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022.
- Jungil Kong, Jaehyeon Kim, and Jaekyoung Bae. HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis. In Advances in Neural Information Processing Systems, 2020.
- Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, and Sungroh Yoon. BigVGAN: A universal neural vocoder with large-scale training. In International Conference on Learning Representations, 2023.
- Boson AI. Higgs audio v2: Text-audio foundation model. https://github.com/boson-ai/higgs-audio, 2025. Open release with a unified semantic–acoustic audio tokenizer; no accompanying arXiv report.
- Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, and William T. Freeman. MaskGIT: Masked generative image transformer. In IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022.
- Siyan Zhao, Devaansh Gupta, Qinqing Zheng, and Aditya Grover. d1: Scaling reasoning in diffusion large language models via reinforcement learning. In Advances in Neural Information Processing Systems, volume 38, pages 56729–56762, 2025. URL https://proceedings.neurips.cc/paper_files/paper/2025/file/52190a0362148d179f1cbd9080956872-Paper-Conference.pdf.
- Kevin Black, Michael Janner, Yilun Du, Ilya Kostrikov, and Sergey Levine. Training diffusion models with reinforcement learning. In International Conference on Learning Representations, 2024. URL https://proceedings.iclr.cc/paper_files/paper/2024/file/14f75513f0f1ca01de1e826b52e6b840-Paper-Conference.pdf.
- Haran Raajesh, Kulin Shah, Adam Klivans, and Philipp Krähenbühl. Mask-aware policy gradients for diffusion language models. arXiv preprint arXiv:2607.15200, 2026. doi: 10.48550/arXiv.2607.15200. Accepted at COLM 2026.
- Jonathan Ho and Tim Salimans. Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598, 2022. doi: 10.48550/arXiv.2207.12598.
- John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347, 2017. doi: 10.48550/arXiv.1707.06347.
- Peiqi Yin, Jiangyun Zhu, Han Gao, Chenguang Zheng, Yongxiang Huang, Taichang Zhou, Ruirui Yang, Weizhi Liu, Weiqing Chen, Canlin Guo, Didan Deng, Zifeng Mo, Cong Wang, James Cheng, Roger Wang, and Hongsheng Liu. vLLM-Omni: Fully disaggregated serving for any-to-any multimodal models. arXiv preprint arXiv:2602.02204, 2026. doi: 10.48550/arXiv.2602.02204.
- Qixi Zheng, Yushen Chen, Zhikang Niu, Ziyang Ma, Xiaofei Wang, Kai Yu, and Xie Chen. Accelerating flow-matching-based text-to-speech via empirically pruned step sampling. arXiv preprint arXiv:2505.19931, 2025. doi: 10.48550/arXiv.2505.19931.
- Han Zhu, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhaoqing Li, Weiji Zhuang, Long Lin, and Daniel Povey. Zipvoice: Fast and high-quality zero-shot text-to-speech with flow matching. arXiv preprint arXiv:2506.13053, 2025. doi: 10.48550/arXiv.2506.13053.
- OpenBMB. VoxCPM2: Production deployment and inference performance. https://github.com/OpenBMB/VoxCPM, 2026. Accessed: 2026-08-10.
- SparkAudio. Spark-TTS: Nvidia triton inference serving. https://github.com/SparkAudio/Spark-TTS, 2025. Accessed: 2026-08-10.
- SGLang Team. SGLang-Omni: High-performance multi-stage pipeline framework for omni models. https://github.com/sgl-project/sglang-omni, 2026. Accessed: 2026-08-10.
- Cartesia. Sonic 3.5 self-hosted hardware selection and latency. https://docs.cartesia.ai/self-hosted/hardware-selection, 2026. Accessed: 2026-08-10.
- ElevenLabs. Models: Eleven flash v2.5. https://elevenlabs.io/docs/overview/models, 2026a. Accessed: 2026-08-10.
- Hume AI. Text-to-speech: Octave 2. https://dev.hume.ai/docs/text-to-speech-tts/overview, 2026. Accessed: 2026-08-10.
- PlayHT. Text-to-speech models: Play 3.0 mini. https://docs.play.ht/reference/models, 2026. Accessed: 2026-08-10.
- Deepgram. Aura-2 text-to-speech performance. https://developers.deepgram.com/changelog/2025/5/14, 2025. Accessed: 2026-08-10.
- Microsoft. Vibevoice-realtime: Real-time streaming text-to-speech. https://github.com/microsoft/VibeVoice, 2025. Accessed: 2026-08-10.
- Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Jiancheng Gui, Jiaheng Wu, Ziyang Wang, Xudong Shen, Runchuan Ye, Zhisheng Zhang, Jiuyang Zhou, Bingsong Bai, Weiyue Sun, Mengyuan Deng, Qundong Shi, Zhiyong Wu, and Zhiyuan Liu. VoxCPM2 technical report. arXiv preprint arXiv:2606.06928, 2026.
- MiniMax. MiniMax Speech-2.8. https://www.minimax-speech.com/, 2026. Accessed: 2026-07-30.
- ElevenLabs. Eleven v3. https://elevenlabs.io/v3, 2026b. Accessed: 2026-07-30.
- Fish Audio. Introducing S2.1 Pro: Our most expressive TTS model yet. https://fish.audio/blog/s2-1-pro-free-api/, 2026. Accessed: 2026-07-30.
- Qinke Ni, Huan Liao, Dekun Chen, Yuxiang Wang, and Zhizheng Wu. NV-Bench: Benchmark of nonverbal vocalization synthesis for expressive text-to-speech generation. arXiv preprint arXiv:2603.15352, 2026. doi: 10.48550/arXiv.2603.15352.
- Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, et al. NVV-SuperBench: Beyond words, beyond quality—benchmarking nonverbal vocalizations in speech generation. arXiv preprint arXiv:2604.16211, 2026. doi: 10.48550/arXiv.2604.16211.
- Google DeepMind. Gemini 3.1 Pro model card. https://deepmind.google/models/model-cards/gemini-3-1-pro/, 2026. Accessed: 2026-07-30.
- Kun Zhou, Berrak Sisman, Rui Liu, and Haizhou Li. Emotional voice conversion: Theory, databases and ESD. Speech Communication, 137:1–18, 2022. doi: 10.1016/j.specom.2021.11.006.
- Ziyang Ma, Zhisheng Zheng, Jiaxin Ye, Jinchao Li, Zhifu Gao, Shiliang Zhang, and Xie Chen. emotion2vec: Self-supervised pre-training for speech emotion representation. In Findings of the Association for Computational Linguistics: ACL 2024, pages 15747–15760, 2024. doi: 10.18653/v1/2024.findings-acl.931.
- Ruskin Raj Manku, Yuzhi Tang, Xingjian Shi, Mu Li, and Alexander J. Smola. Emergenttts-eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge. In Advances in Neural Information Processing Systems, volume 38, 2025.
- Huakang Chen, Jingbin Hu, Liumeng Xue, Qirui Zhan, Wenhao Li, Guobin Ma, Hanke Xie, Dake Guo, Linhan Ma, Yuepeng Jiang, Bengu Wu, Pengyuan Xie, Chuan Xie, Qiang Zhang, and Lei Xie. Mint-bench: A comprehensive multilingual benchmark for instruction-following text-to-speech. arXiv preprint arXiv:2604.17958, 2026.