TECHNICAL REPORT · ARXIV 2026 · 中文全文译稿

Qwen3-TTS
Technical Report

Qwen TeamQwen · Text-to-Speech ResearchHugging FaceModelScopeGitHub ↗
25 Hzsingle-codebook · Semantic-richBlock-wise DiT → BigVGAN
TEXTDUAL-TRACK LMSPEECH
12.5 Hz16 层 RVQ · CausalMTP → lightweight ConvNet
PDF
14 页
Figures
3
Tables
10
Models
10
References
43

本报告介绍 Qwen3-TTS 系列——一族先进的多语言、可控、稳健且支持 streaming generation 的 text-to-speech 模型。Qwen3-TTS 支持业界领先的 3 秒 voice cloning 与基于描述的控制,既能创造全新声音,也能细粒度操控输出语音。Qwen3-TTS 在覆盖 10 种语言、超过 500 万小时的语音数据上训练,采用 dual-track LM 架构实现实时合成,并配套两种 speech tokenizer:1)Qwen-TTS-Tokenizer-25Hz 是强调语义内容的 single-codebook codec,可与 Qwen-Audio 无缝集成,并通过 block-wise DiT 实现流式波形重建;2)Qwen-TTS-Tokenizer-12Hz 采用 12.5 Hz、16 层 multi-codebook design 和轻量级因果 ConvNet,实现极低码率与超低延迟 streaming generation,可在首包 97ms97\,\mathrm{ms} 时立即输出。大量实验表明,该系列在多项客观与主观 benchmark(例如 TTS multilingual test set、InstructTTSEval 和长语音测试集)上达到业界领先水平。为促进社区研究与开发,我们以 Apache 2.0 许可证发布两种 tokenizer 和全部模型。

1 引言

Figure 1:Qwen3-TTS 是一种多语言、可控、稳健且支持 streaming generation 的 text-to-speech 模型。基于这些能力,它可执行广泛任务,包括但不限于 voice cloning、创造与控制,以及轻松处理各种复杂文本。

稳定、可控且类人的 speech synthesis,被广泛视为迈向 AGI 的关键能力。现代神经 text-to-speech(TTS)模型依托大规模数据训练,已经能够仅凭几秒参考音频生成高质量语音(Wang et al., 2023;Shen et al., 2023;Ju et al., 2024;Yang et al., 2023;Eskimez et al., 2024;Chen et al., 2024;Du et al., 2024a;Wang et al., 2025;2024;Ye et al., 2025b)。其中,离散 speech tokenization(Défossez et al., 2022;Zeghidour et al., 2022;Kumar et al., 2023)与离散单元自回归语言建模的组合日益受到关注:它在保持高自然度和类人感的同时提高了稳定性(Du et al., 2025;Liao et al., 2024;Défossez et al., 2024;Xu et al., 2025;Zhang et al., 2025a)。以声音特征或文本指令作为条件,可以更细致地控制韵律和风格,使输出更加丰富多样(Du et al., 2024b;Lyth and King, 2024;Zhou et al., 2024;Ji et al., 2025;Leng et al.)。这些突破正在为虚拟助手、自动内容创作等领域的多样化应用铺路。

表 1:Qwen3-TTS 模型家族概览。
模型名称流式多语言voice cloning指令遵循
Qwen3-TTS-12Hz-1.7B-Base\checkmark\checkmark\checkmark
Qwen3-TTS-12Hz-1.7B-VoiceDesign\checkmark\checkmark\checkmark
Qwen3-TTS-12Hz-1.7B-CustomVoice\checkmark\checkmark\checkmark
Qwen3-TTS-12Hz-0.6B-Base\checkmark\checkmark\checkmark
Qwen3-TTS-12Hz-0.6B-CustomVoice\checkmark\checkmark
Qwen3-TTS-25Hz-1.7B-Base\checkmark\checkmark\checkmark
Qwen3-TTS-25Hz-1.7B-VoiceEditing\checkmark\checkmark\checkmark\checkmark
Qwen3-TTS-25Hz-1.7B-CustomVoice\checkmark\checkmark\checkmark
Qwen3-TTS-25Hz-0.6B-Base\checkmark\checkmark\checkmark
Qwen3-TTS-25Hz-0.6B-CustomVoice\checkmark\checkmark

本报告朝稳定、可控且类人的 speech synthesis 迈进一步,提出 Qwen 系列首个 text-to-speech 模型 Qwen3-TTS。它具备以下特性:1)可控性:用户可用自然语言描述创造新声音,或操控生成语音的细粒度属性;创建声音后,也能稳定生成任意内容。2)voice cloning 与预定义声音档案:支持 3 秒 voice cloning,并可使用一组 x 个经过筛选的高质量预设声音进行生成。3)自然度:除稳定合成外,Qwen3-TTS 还能生成高度自然、富有表现力的语音;其中 1.7B 模型达到业界领先的类人质量,说明该方法能在不过拟合 ASR 指标的情况下最大化感知质量。4)多语言:模型在 10 种以上语言上训练,支持保持 speaker consistency 的多语言生成。5)流式能力:面向流式文本输入和流式音频输出设计,first-packet latency 最低为 97 ms(0.6B)和 101 ms(1.7B)。

除上述能力外,从实际应用角度看,模型还必须能与 Large Language Model(LLM)无缝集成,并实现极低 first-packet latency。为此,我们以离散语音表示作为架构基石,为 Qwen3-TTS 引入两种 tokenizer:1)Qwen-TTS-Tokenizer-25Hz 使用 25 Hz single-codebook representation,并通过 block-wise Flow Matching 重建波形以支持 streaming synthesis(Xu et al., 2025)。经验上,我们发现语义 tokenizer 的表现力不足,而纯声学 tokenizer 会注入过多底层细节,使基于 LLM 的建模更困难,并导致长时间范围内的误差累积。为平衡两者,Qwen-TTS-Tokenizer-25Hz 融合语义与声学线索,并借助 Qwen2-Audio encoder 兼顾表现力和可建模性。它虽能通过分块 diffusion decoder 流式解码,但 single-codebook 设计限制了它在超低延迟应用和通用 speech synthesis 中的适用性。因此,我们又开发了 2)Qwen-TTS-Tokenizer-12Hz:它采用受 Zhang et al.(2023b)启发的 12.5 Hz multi-codebook 方案,第一层码本编码语义内容,后续层捕获声学细节。更高容量使其只需轻量级因果 ConvNet 即可重建波形,无须提取 speaker vector 或使用复杂 diffusion 模型(Du et al., 2024b;Zhang et al., 2025a)。为进一步支持超低延迟 streaming generation,我们设计了面向流式文本输入和音频输出的 dual-track autoregressive architecture,并加入 Multi-Token Prediction(MTP)模块建模 multi-codebook sequence,使第一帧 codec 到达后即可立即解码语音。

Qwen3-TTS 在超过 500 万小时语音数据上训练,在多项 benchmark 中取得出色表现。具体而言,它在 zero-shot voice cloning 上建立了新的业界领先水平:在 Seed-TTS benchmark 上取得最低 Word Error Rate(WER),并在全部 10 种评测语言上,相较 MiniMax 和 ElevenLabs 等商业基线获得更高的 speaker similarity。在跨语言场景中,Qwen3-TTS 表现出很强的适应性,在中文到韩文等困难语言对上大幅降低错误率。在可控性方面,它善于遵循复杂自然语言指令完成 voice design 与控制,在 target speaker 操控上超过 GPT-4o-mini-tts。此外,模型在长文本生成中也十分稳定,可合成超过 10 分钟的自然、流畅语音。为促进社区研究与开发,我们发布完整的 Qwen3-TTS 模型与 tokenizer 家族。

2 Qwen-TTS-Tokenizer

2.1 Qwen-TTS-Tokenizer-25Hz

Figure 2:Qwen-TTS tokenizer 概览。

Qwen-TTS-Tokenizer-25Hz 是构建在 Qwen2-Audio 上的 25 Hz single-codebook tokenizer,采用两阶段训练框架。Stage 1 继续以 automatic speech recognition(ASR)任务预训练 Qwen2-Audio,并在 audio encoder 的中间位置加入额外的重采样层和 vector quantization(VQ)层。Stage 2 加入基于卷积的 Mel spectrogram decoder,对整个模型进行微调;该 decoder 从 audio token 重建 Mel spectrogram。这个重建目标会显式地把关键声学信息注入学到的 audio token 表示。

为支持流式音频生成,特别是长序列生成,我们提出 sliding-window block attention,将每个 token 的上下文限制在有限范围内。具体来说,我们使用以 Flow Matching 训练的 Diffusion Transformer(DiT)(Lipman et al.)。输入 code 序列先通过 Flow Matching 映射为 Mel spectrogram,再由改造后的 BigVGAN(Lee et al.)把 Mel spectrogram 还原为波形。

为了流式解码,我们将相邻 code 组成定长 block,并构造相应的 attention mask(Guo et al., 2025)。DiT 的感受野限制为 4 个 block:当前 block、向前回看 3 个 block,以及向后预看 1 个 block。解码时,Flow Matching 按 chunk 生成 Mel spectrogram,确保每个 code chunk 都能访问所需上下文 block。这一设计通过保留必要上下文提升流式质量。对于感受野固定的 BigVGAN,我们也采用同样的逐 chunk 流程,以支持流式波形合成。

2.2 Qwen-TTS-Tokenizer-12Hz

Qwen-TTS-Tokenizer-12Hz 是一种 12.5 Hz multi-codebook tokenizer,联合优化语义流与声学流。它建立在 Mimi 架构的语义—声学解耦量化策略之上(Défossez et al., 2024),将语音分解为两组离散 code 序列:semantic codebook 捕获高层语义内容,acoustic codebook 建模声学细节、韵律等信息。训练采用 GAN 框架:generator 直接处理原始波形,提取并量化两种表示;discriminator 则提升重建语音的自然度和保真度。多尺度 Mel spectrogram 重建损失进一步约束时频一致性。在语义路径中,WavLM(Chen et al., 2022)作为 teacher,引导第一层 semantic codebook 学习与语义对齐的特征。声学路径使用 15 层 residual vector quantization(RVQ),逐级补充 semantic codebook 未捕获的细节。为实现流式处理,我们使用完全因果的特征 encoder 与 decoder:encoder 按顺序处理 frame,在无 look-ahead 的情况下以 12.5 Hz 输出语义和声学 token;decoder 则从这些 token 增量重建音频。端到端因果设计支持低延迟 streaming inference,适合实时在线服务。

3 方法

Figure 3:Qwen3-TTS 架构概览。虚线表示可选路径。

3.1 架构

Qwen3-TTS 借助 Qwen3 LM 家族实现高并发、低延迟推理。文本使用标准 Qwen tokenizer 处理,语音使用 Qwen-TTS-Tokenizer 编码。为精确控制说话人身份,我们将可学习的 speaker encoder 与 backbone 联合训练。实时合成采用双轨表示:沿 channel 轴拼接文本 token 与声学 token。每收到一个文本 token,模型便立即预测对应声学 token,随后由 Code2Wav 模块将其转换为波形。

Qwen3-TTS-25Hz 使用 Qwen-TTS-Tokenizer-25Hz 提取单层 speech token。backbone 融合文本特征与之前的 speech token,通过 linear head 预测当前 speech token;所得序列再送入 chunk-wise DiT 模块,重建高保真波形。

Qwen3-TTS-12Hz 在架构上与 25Hz 版本不同,它处理 Qwen-TTS-Tokenizer-12Hz 产生的 RVQ token,并采用分层预测方案:backbone 读取聚合后的码本特征以预测第 0 层码本,MTP(Multi-Token Prediction)模块随后生成全部 residual codebook。该策略能捕获复杂声学细节,显著提升声音一致性和表现力,同时通过单 frame 即时生成把延迟降到最低。

3.2 训练

训练流程由预训练和后训练构成。全部数据统一格式化为 ChatML,以标准化输入并支持 Controllable Speech Generation。

Qwen3-TTS 的预训练分为三个阶段:

  • 通用阶段(S1):初始预训练使用超过 500 万小时的多语言语音数据训练 Qwen3-TTS。该阶段建立从多语言文本表示到语音的单调映射,并构建通用能力。
  • 高质量阶段(S2):通过专用流程对数据质量分层,再以高质量数据进行 continual pre-training(CPT)。该阶段缓解初始阶段噪声数据导致的幻觉,并显著提升生成语音质量。
  • 长上下文阶段(S3):最终预训练阶段将最大 token 长度从 8,192 提升到 32,768,并上采样训练数据中的长语音。实验结果表明,这些调整增强了模型处理长而复杂的输入、生成符合上下文的语音响应的能力。

后训练也包含三个阶段,使 Qwen3-TTS 能生成类人语音,并在各类任务上保持稳定。第一阶段引入 Direct Preference Optimization(DPO)(Rafailov et al., 2023),使模型输出与人类偏好对齐;具体做法是依据人工反馈为多语言语音样本构造偏好对,再对 Qwen3-TTS 执行 DPO。第二阶段使用基于规则的 reward,并借助 GSPO 全面提升模型在各任务上的能力与稳定性。最后,在 base model 上进行轻量级 speaker fine-tuning,使 Qwen3-TTS 能采用特定声音,并进一步提升语音响应的自然度、表现力与可控性。

3.3 功能

Qwen3-TTS 支持流式 voice cloning、voice design 和细粒度控制。为此,我们把用户提供、包含细粒度控制信号的指令置于输入序列前部。

voice cloning 有两条路径:(i)通过 speaker embedding 从参考语音克隆目标声音,支持实时克隆;(ii)通过 text–speech pair 做 in-context learning,更好地保留韵律。voice design 建立在 Qwen3 文本模型基础之上,因此继承了强健的文本理解能力。此外,训练时会以一定概率激活 thinking pattern,以提升指令遵循能力,特别是对复杂描述的遵循能力。基于这项能力,Qwen3-TTS 还能按目标风格控制预定义声音。

3.4 效率

低 first-packet latency 与并发下稳定流式输出共同取决于两部分:(i)language model(LM)为首个语音包生成第一组 token 的耗时;(ii)把生成 token 转成波形的 tokenizer 解码流水线。如表 2 所示,我们在不同并发量下评测不同 LM 规模和 tokenizer 变体的 Qwen3-TTS。所有数字均为端到端实测延迟;稳态开销按 streaming generation 中的每个语音包测量。延迟测试使用内部 vLLM engine(vLLM V0 backend),运行在单个典型计算资源上,并对 tokenizer 解码阶段应用 torch.compile 与 CUDA Graph 加速。报告中的 First-Packet Latency 等于 LM 生成首包 token 的 TTFP 与 tokenizer 单包解码时间 TPP 之和;LM 单包时间 TPP 则表示稳态 streaming generation 中,LM 产生一个语音包所需 token 的时间。

表 2:不同 tokenizer 与并发量下 Qwen3-TTS 的流式效率。
模型并发数LM TTFPTokenizer 解码 TPPfirst-packet latencyLM TPPRTF
Qwen3-TTS-25Hz-1.7B1125 ms25 ms150 ms56 ms0.253
Qwen3-TTS-25Hz-1.7B3222 ms62 ms284 ms64 ms0.394
Qwen3-TTS-25Hz-1.7B6376 ms147 ms523 ms85 ms0.725
Qwen3-TTS-25Hz-0.6B1113 ms25 ms138 ms50 ms0.234
Qwen3-TTS-25Hz-0.6B3198 ms62 ms260 ms59 ms0.378
Qwen3-TTS-25Hz-0.6B6334 ms147 ms481 ms80 ms0.709
Qwen3-TTS-12Hz-1.7B197 ms4 ms101 ms21 ms0.313
Qwen3-TTS-12Hz-1.7B3190 ms5 ms195 ms24 ms0.363
Qwen3-TTS-12Hz-1.7B6328 ms5 ms333 ms32 ms0.463
Qwen3-TTS-12Hz-0.6B193 ms4 ms97 ms19 ms0.288
Qwen3-TTS-12Hz-0.6B3174 ms5 ms179 ms22 ms0.338
Qwen3-TTS-12Hz-0.6B6294 ms5 ms299 ms30 ms0.434

Qwen-TTS-Tokenizer-25Hz 通过逐 chunk 推理完成 code-to-waveform 合成。由于 DiT 需要 look-ahead,只有获得足够的未来 token 后才能开始合成第一 chunk 波形。Qwen3-TTS 的 chunk size 设为 8,因此 LM 必须先生成 16 个 token,DiT 才能生成首个 8-token Mel chunk。25 Hz token rate 下每个 token 对应 40 ms,因而每个语音包对应 320 ms Mel 内容。BigVGAN vocoder 还引入额外 130 ms 的右上下文 look-ahead。因此对 Tokenizer-25Hz 而言,首包最终包含约 190 ms 音频,且 LM 必须先生成 16 个 token 才能启动合成。稳态 streaming generation 时,LM 每生成 8 个 token,DiT 与 BigVGAN 就能合成一个 320 ms 音频包。表中的 first-packet latency 和 RTF 均基于这一设置计算。

Qwen-TTS-Tokenizer-12Hz 使用纯左上下文的流式 codec decoder;所需 token 一旦就绪即可输出波形,无须等待未来上下文。12.5 Hz token rate 下,每个 token 对应 80 ms 音频,理论上单个 token 就能直接解码为音频。为避免过小语音包造成过多调度开销,我们把 4 个 token 定义为一个语音包,即每包 320 ms 语音。该设计显著减少解码时间、降低 first-packet latency;轻量且适合 batch 的 codec decoder 也使高并发下的 RTF 保持较低。

4 实验

我们对 Qwen3-TTS 进行全面评测,分为两大类:speech tokenizer 与 speech generation。

4.1 Speech Tokenizer 评估

4.1.1 Qwen-TTS-Tokenizer-25Hz

如表 3 所示,我们在 CommonVoice(C.V.)和 Fleurs 的英文、中文子集 ASR 任务上,将同属监督式语义 speech tokenizer 的 S3 Tokenizer 系列(Du et al., 2024a;b)与 Qwen-TTS-Tokenizer-25Hz 对比。Qwen 的两个变体均表现出竞争力。S1 阶段以 ASR 监督训练,在多个 dataset 上取得最低或接近最低的 WER,与 S3 Tokenizer 系列相当或更好。S2 阶段为增强 token 的声学表现力进一步微调,ASR 性能按预期略有下降。原因是 token 纳入了额外声学细节:这虽削弱纯语义可分性,却有利于高质量 TTS、波形重建等下游 speech generation 任务,体现了语义保真度与声学丰富度之间有意做出的权衡。

表 3:不同监督式语义 speech tokenizer 的 ASR 任务对比。粗体为最高分。
模型码本大小FPSC.V. ENC.V. CNFluers ENFluers CN
S3 Tokenizer(VQ) (Du et al. , 2024a )40965012.0615.38--
S3 Tokenizer(VQ) (Du et al. , 2024a )40962511.5618.267.655.03
S3 Tokenizer(FSQ) (Du et al. , 2024a )65612510.677.296.584.43
Qwen-TTS-Tokenizer-25Hz (Stage 1)32768257.5110.733.074.23
Qwen-TTS-Tokenizer-25Hz (Stage 2)327682510.4014.994.144.67

4.1.2 Qwen-TTS-Tokenizer-12Hz

我们在包含 2,620 条语句的 LibriSpeech test-clean 集上评估语音重建。为公平比较,报告各模型的 quantizer 数量(NQ)、码本大小和 frames per second(FPS)。声学质量使用 Short-Time Objective Intelligibility(STOI)、Perceptual Evaluation of Speech Quality(PESQ)和 UTMOS 评估,speaker similarity(SIM)则由基于 WavLM 的 speaker verification 模型测量。比较方法包括 SpeechTokenizer(Zhang et al., 2023a)、XCodec 系列(Ye et al., 2025a;b)、XY-Tokenizer(Gong et al., 2025)、Mimi(Défossez et al., 2024)与 FireredTTS 2(Xie et al., 2025)。如表 4 所示,Qwen-TTS-Tokenizer-12Hz 不仅在所有关键语音重建指标上达到新的业界领先水平,还具备很高的编码效率;质量与效率的双重提升体现了该方法在语音表示学习和语义信息融合方面的能力。

表 4:不同语义相关 speech tokenizer 的对比。粗体为最高分。
模型NQ码本大小FPSPESQ_WBPESQ_NBSTOIUTMOSSIM
SpeechTokenizer (Zhang et al. , 2023a )81024502.603.050.923.900.85
X-codec (Ye et al. , 2025a )21024502.683.270.864.110.84
X-codec 2 (Ye et al. , 2025b )165536502.433.040.924.130.82
XY-Tokenizer (Gong et al. , 2025 )8102412.52.413.000.913.980.83
Mimi (Défossez et al. , 2024 )16204812.52.883.420.943.870.87
FireredTTS 2 Tokenizer (Xie et al. , 2025 )16204812.52.733.280.943.880.87
Qwen-TTS-Tokenizer-12Hz16204812.53.213.680.964.160.95

4.2 speech generation

本节全面评估 Qwen3-TTS 的 speech generation 能力。为覆盖多种场景,我们把实验分为以下几类:

  • Zero-Shot Speech Generation:在公开 Seed-TTS test set 上用 Word Error Rate(WER)衡量内容一致性,以评估模型克隆未见声音的能力(Anastassiou et al., 2024)。
  • Multilingual Speech Generation:在 Zhang et al.(2025a)的 multilingual test set 上,以 zero-shot 多语言设置同时考察内容可懂度和 speaker similarity。
  • Cross-Lingual Speech Generation:在 CV3-Eval benchmark 上评估内容一致性,研究跨语言声音迁移(例如跨越语言障碍仍保持音色)的能力(Du et al., 2025)。
  • Controllable Speech Generation:在 InstructTTSEval benchmark 上验证模型的指令遵循能力(Huang et al., 2025)。
  • Target-Speaker Speech Generation:在 multilingual test set 上分析 speaker fine-tuned(SFT)模型变体对特定说话人适配的泛化性能(Zhang et al., 2025a)。
  • Long Speech Generation:在内部数据集上评估超过 10 分钟的生成语音样本,以验证自回归架构的稳健性和稳定性。

4.2.1 Zero-Shot speech generation 评估

我们将 Qwen3-TTS 与领先的 zero-shot TTS 系统对比。表 5 以 WER 作为内容一致性的主要指标,结果体现三点:1)Qwen3-TTS 在不同语言上表现稳定,这得益于预训练和 continual pre-training 所见的多样声学数据。2)12Hz 变体在内容准确度(WER)上持续优于 25Hz 变体,说明 Qwen-TTS-Tokenizer-12Hz 较粗的时间分辨率使自回归模型更容易建模长期依赖,从而稳定生成语音。3)模型规模从 0.6B 扩大到 1.7B 会带来一致收益。后训练后,Qwen3-TTS-12Hz-1.7B 在 test-en 上取得 1.24 的 WER,超过 CosyVoice 3、Seed-TTS 等强基线,达到业界领先水平。

表 5:Seed-TTS test set 上的 zero-shot speech generation。指标为 Word Error Rate(WER,\downarrow),越低越好;粗体为最佳结果。
数据集模型性能
内容一致性
SEED test-zh | test-enSeed-TTS (Anastassiou et al. , 2024 )1.12 | 2.25
MaskGCT (Wang et al. , 2024 )2.27 | 2.62
E2 TTS (Eskimez et al. , 2024 )1.97 | 2.19
F5-TTS (Chen et al. , 2024 )1.56 | 1.83
Spark TTS (Wang et al. , 2025 )1.20 | 1.98
Llasa-8B (Ye et al. , 2025b )1.59 | 2.97
KALL-E (Xia et al. , 2024 )0.96 | 1.94
FireRedTTS 2 (Xie et al. , 2025 )1.14 | 1.95
CosyVoice 3 (Du et al. , 2025 )0.71 | 1.45
MiniMax-Speech (Zhang et al. , 2025a )0.83 | 1.65
Qwen3-TTS-25Hz-0.6B-Base1.18 | 1.64
Qwen3-TTS-25Hz-1.7B-Base1.10 | 1.49
Qwen3-TTS-12Hz-0.6B-Base0.92 | 1.32
Qwen3-TTS-12Hz-1.7B-Base0.77 | 1.24

4.2.2 Multilingual Speech Generation 评估

Qwen3-TTS 支持 10 种语言的高保真 speech generation。我们将其与 MiniMax-Speech、ElevenLabs Multilingual v2 等领先商业基线对比。如表 6 所示,Qwen3-TTS 在中文、英文、意大利语、法语、韩语和俄语 6 种语言上取得最低 WER,即最佳可懂度,并以明显优势超过基线;在德语、葡萄牙语、西班牙语和日语上也保持接近业界领先的竞争力。在 voice cloning 保真度上,Qwen3-TTS 的优势更加明显:全部 10 种语言的 speaker similarity 均为最高,持续超过 MiniMax-Speech 与 ElevenLabs。这说明它在保持稳健多语言内容生成的同时,也擅长捕获音色、韵律等说话人内在特征。

表 6:TTS multilingual test set 上的 Multilingual Speech Generation。内容一致性使用 WER(\downarrow),speaker similarity 使用 Cosine Similarity(SIM,\uparrow);粗体为最佳结果。
语言Qwen3-TTS-25HzQwen3-TTS-12HzMiniMaxElevenLabs
0.6B-Base1.7B-Base0.6B-Base1.7B-Base
内容一致性
Chinese1.1080.7771.1450.9282.25216.026
English1.0481.0140.8360.9342.1642.339
German1.5010.9601.0891.2351.9060.572
Italian1.1691.1051.5340.9481.5431.743
Portuguese2.0461.7782.2541.5261.8771.331
Spanish2.0311.4911.4911.1261.0291.084
Japanese4.1895.1216.4043.8233.51910.646
Korean2.4582.6951.7411.7551.7471.865
French2.8522.6312.9312.8584.0995.216
Russian5.9574.5354.4583.2124.2813.878
speaker similarity
Chinese0.7970.7960.8110.7990.7800.677
English0.8110.8150.8290.7750.7560.613
German0.7490.7370.7690.7750.7330.614
Italian0.7220.7180.7920.8170.6990.579
Portuguese0.7900.7830.7940.8170.8050.711
Spanish0.7320.7310.8120.8140.7620.615
Japanese0.8100.8070.7980.7880.7760.738
Korean0.8240.8140.8120.7990.7760.700
French0.6980.7030.7000.7140.6280.535
Russian0.7340.7440.7810.7920.7610.676

4.2.3 Cross-Lingual Speech Generation 评估

我们评估 Qwen3-TTS 跨越语言边界保持说话人身份的能力,即跨语言 voice cloning,并以 CosyVoice 系列为基线。表 7 报告不同源语言—目标语言组合的错误率(WER/CER)。Qwen3-TTS 在目标为英文和韩文的场景中达到新的业界领先水平。尤其是 zh-to-ko,其错误率相较 CosyVoice3 约降低 66%(4.82 对 14.4),显示出很强的跨语言泛化能力。在 zh-to-enen-to-zh 等常用语言对上,Qwen3-TTS 也优于基线,意味着内容一致性更好、口音漂移更少。CosyVoice2 在若干语言对上不稳定,而 Qwen3-TTS 在全部评测方向上保持较低错误率,验证了训练策略的稳健性。

表 7:Cross-Lingual benchmark 上的 Cross-Lingual Speech Generation。指标为 Mixed Error Rate(英文使用 WER,其他语言使用 CER,\downarrow);粗体为最佳结果。
TaskQwen3-TTS-25Hz-1.7B-BaseQwen3-TTS-12Hz-1.7B-BaseCosyVoice3CosyVoice2
en-to-zh5.664.775.0913.5
ja-to-zh3.923.433.0548.1
ko-to-zh1.141.081.067.70
zh-to-en2.912.772.986.47
ja-to-en3.953.044.2017.1
ko-to-en3.483.094.1911.2
zh-to-ja9.298.407.0813.1
en-to-ja7.747.216.8014.9
ko-to-ja4.173.673.935.86
zh-to-ko8.124.8214.424.8
en-to-ko6.835.145.8721.9
ja-to-ko6.865.597.9221.5

4.2.4 Controllable Speech Generation 评估

我们使用 InstructTTSEval benchmark 评估 Qwen3-TTS 的指令遵循能力。借助 ChatML 格式,Qwen3-TTS 把声音控制视为语言建模任务,从而细致操控语音属性。评测包含两种场景:Voice Design(创造):模型根据文本描述生成新声音。表 8 显示,Qwen3-TTS-12Hz-1.7B-VD 在开源模型中达到新的业界领先水平;它在 Description–Speech Consistency(DSD)和 Response Precision(RP)上超过 Hume 等商业系统和 VoiceSculptor 等专用模型,表明语义输入与声学输出对齐得更好。Target Speaker(编辑):修改参考说话人的属性。Qwen3-TTS 在所有指标上大幅超过 GPT-4o-mini-tts,例如中文 APS 提升 28%。Gemini 系列仍是强劲上界,但 Qwen3-TTS 在保持说话人身份、同时遵循风格修改指令方面已具备竞争力。

表 8:InstructTTSEval 上的 Controllable Speech Generation。指标为 Attribute Perception and Synthesis accuracy(APS)、Description–Speech Consistency(DSD)与 Response Precision(RP);粗体为最高分。
类型模型InstructTTSEval-ZHInstructTTSEval-EN
APS (↑)DSD (↑)RP (↑)APS (↑)DSD (↑)RP (↑)
target speakerGemini-flash88.290.977.392.393.880.1
Gemini-pro89.090.175.587.686.067.2
Qwen3TTS-25Hz-1.7B-CustomVoice83.175.063.079.082.869.3
Qwen3TTS-12Hz-1.7B-CustomVoice83.077.861.277.377.163.7
GPT-4o-mini-tts54.952.346.076.474.354.8
voice designQwen3TTS-12Hz-1.7B-VD85.281.165.182.982.468.4
Mimo-Audio-7B-Instruct (Zhang et al. , 2025b )75.774.361.580.677.659.5
VoiceSculptor (Hu et al. , 2026 )75.764.761.5---
Hume---83.075.354.3
VoxInstruct (Zhou et al. , 2024 )47.552.342.654.957.039.3
Parler-tts-mini (Lyth and King, 2024 )---63.448.728.6
Parler-tts-large (Lyth and King, 2024 )---60.045.931.2
PromptTTS (Guo et al. , 2023 )---64.347.231.4
PromptStyle (Liu et al. , 2023 )---57.446.430.9

4.2.5 Target-Speaker Speech Generation 评估

我们评估 speaker fine-tuning 对高保真说话人适配的效果:针对特定 target speaker Aiden Voice 微调 Qwen3-TTS,并在 multilingual test set 上与 GPT-4o-Audio-Preview 的 Ballad Voice 对比。如表 9 所示,Qwen3-TTS 虽只在单语言数据上微调,却展现出很强的跨语言泛化能力,能把 target speaker 的音色和韵律稳定迁移到全部 10 种评测语言。它在其中 7 种语言上优于 GPT-4o-Audio-Preview:中文、英文、德语、西班牙语、日语、韩语和俄语的 WER 更低。GPT-4o 在意大利语、葡萄牙语和法语上略占优势,但 Qwen3-TTS 在日语(3.88 对 5.00)和韩语(1.74 对 2.76)等困难语言上的可懂度明显更好,体现了 speaker fine-tuning 策略的稳健性。

表 9:TTS multilingual test set 上的 target speakerMultilingual Speech Generation。指标为 WER(\downarrow);粗体为最佳结果。
语言Qwen3-TTS-25HzQwen3-TTS-12HzGPT-4o-Audio Preview
0.6B-CustomVoice1.7B-CustomVoice0.6B-CustomVoice1.7B-CustomVoice
Chinese0.8740.7080.9440.9033.519
English1.3320.9361.1880.8992.197
German0.9900.6342.7221.0571.161
Italian1.8611.2712.5451.3621.194
Portuguese1.7281.8543.2192.6811.504
Spanish1.3091.2841.1541.3304.000
Japanese3.8754.5186.8774.9245.001
Korean2.2022.2743.0531.7412.763
French3.8653.0803.8413.7813.605
Russian6.5294.4445.8094.7345.250

4.2.6 Long-Form Speech Generation 评估

长 speech synthesis 具有独特难点,容易出现重复、遗漏或韵律不连续。我们在一个内部精选数据集上评估该能力:数据集包含 100 段中英文文本,长度从 200 到 2,000 词不等。参考 Seed-TTS Eval 的方法(Anastassiou et al., 2024),我们使用长语音识别准确度较高的 Qwen3-ASR 进行转写,并将 fine-tuned Qwen3-TTS(Aiden Voice)与 Higgs-Audio-v2、VibeVoice、VoxCPM 等开源基线比较。表 10 显示,Qwen3-TTS-25Hz-1.7B 在两种语言上取得最低 WER(正文报告 long-zh 为 1.533、long-en 为 1.571)。相比 VibeVoice 在中文生成上明显退化(WER>22\mathrm{WER} > 22),Qwen3-TTS 表现出很强的一致性。Higgs-Audio-v2 等分 chunk 系统会出现边界 artifact,而 Qwen3-TTS 能在整段时长内生成无缝、韵律一致的音频。值得注意的是,本任务中 25Hz 版本优于 12Hz 版本,说明语义 token 可能更有利于长序列稳定性。

表 10:Long-Form Speech Generation 结果。指标为 WER(\downarrow);粗体为最佳结果。
数据集模型性能
内容一致性
long-zh | long-enHiggs-Audio-v2 (chunk) (Boson AI, 2025 )5.505 | 6.917
VibeVoice (Peng et al. , 2025 )22.619 | 1.780
VoxCPM (Zhou et al. , 2025 )4.835 | 7.474
Qwen3-TTS-25Hz-1.7B-CustomVoice1.517 | 1.225
Qwen3-TTS-12Hz-1.7B-CustomVoice2.356 | 2.812

5 结论

本报告提出 Qwen3-TTS:一族面向实时 speech synthesis 的大规模、多语言、稳健 text-to-speech 模型。通过新颖的 dual-track design,以及语义信息丰富的 Qwen-TTS-Tokenizer-25Hz 与低延迟 Qwen-TTS-Tokenizer-12Hz 两类 speech tokenizer,Qwen3-TTS 能以流式效率合成高保真语音。大量评测确认,该系列在广泛任务上达到业界领先水平:它在 zero-shot voice cloning 与跨语言合成上建立新 benchmark,尤其在中文到韩文等困难场景中显著超过既有基线;借助按概率激活的 thinking pattern,它还在 voice design 场景中达到新的业界领先水平。专门的训练策略进一步解决了自回归模型的稳定性问题,使模型能无缝生成超过 10 分钟的流畅语音,避免分 chunk 系统常见的 artifact。

Qwen3-TTS 在一个自回归框架内统一了 zero-shot 克隆、跨语言迁移和细粒度指令控制等多类 speech generation 任务,为下一代全能音频系统铺路。未来,我们计划把架构扩展到更丰富的音频生成,将多语言覆盖扩大到现有 10 种语言之外,并探索更细粒度的风格控制。通过开放模型与 tokenizer,我们希望加速社区研究,推动更自然、更富表现力、更易用的人机交互界面。

6 作者

核心贡献者: Hangrui Hu、Xinfa Zhu、Ting He、Dake Guo、Bin Zhang、Xiong Wang、Zhifang Guo、Ziyue Jiang、Hongkun Hao、Zishan Guo、Xinyu Zhang、Pei Zhang、Baosong Yang、Jin Xu†、Jingren Zhou、Junyang Lin†

贡献者: Yunfei Chu、Daren Chen、Jiayi Leng、Zheng Li、Yuanjun Lv、Linhan Ma、Ziyang Ma、Xian Shi、Hao Su、Xuechun Wang、Yongqi Wang、Yuezhang Wang、Yuxuan Wang、Zhenglin Wang、Lei Xie、Kangxiang Xia、Qize Yang、Xian Yang、Jianwei Zhang、Guangdong Zhou、Jialong Zuo

参考文献

参考文献保留原始书目信息与顺序。

  1. Philip Anastassiou, Jiawei Chen, Jitong Chen, Yuanzhe Chen, Zhuo Chen, Ziyi Chen, Jian Cong, Lelai Deng, Chuang Ding, Lu Gao, et al. Seed-tts: A family of high-quality versatile speech generation models. arXiv preprint arXiv:2406.02430, 2024.
  2. Boson AI. Higgs Audio V2: Redefining Expressiveness in Audio Generation. https://github.com/boson-ai/higgs-audio, 2025. GitHub repository. Release blog available at https://www.boson.ai/blog/higgs-audio-v2.
  3. Sanyuan Chen, Chengyi Wang, Zhengyang Chen, Yu Wu, Shujie Liu, Zhuo Chen, Jinyu Li, Naoyuki Kanda, Takuya Yoshioka, Xiong Xiao, Jian Wu, Long Zhou, Shuo Ren, Yanmin Qian, Yao Qian, Jian Wu, Michael Zeng, Xiangzhan Yu, and Furu Wei. Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE J. Sel. Top. Signal Process., 2022.
  4. Yushen Chen, Zhikang Niu, Ziyang Ma, Keqi Deng, Chunhui Wang, Jian Zhao, Kai Yu, and Xie Chen. F5tts: A fairytaler that fakes fluent and faithful speech with flow matching. arXiv preprint arXiv:2410.06885, 2024.
  5. Alexandre Défossez, Jade Copet, Gabriel Synnaeve, and Yossi Adi. High fidelity neural audio compression. arXiv:2210.13438, 2022.
  6. Alexandre Défossez, Laurent Mazaré, Manu Orsini, Amélie Royer, Patrick Pérez, Hervé Jégou, Edouard Grave, and Neil Zeghidour. Moshi: a speech-text foundation model for real-time dialogue. arXiv preprint arXiv:2410.00037, 2024.
  7. Zhihao Du, Qian Chen, Shiliang Zhang, Kai Hu, Heng Lu, Yexin Yang, Hangrui Hu, Siqi Zheng, Yue Gu, Ziyang Ma, et al. Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens. arXiv preprint arXiv:2407.05407, 2024a.
  8. Zhihao Du, Yuxuan Wang, Qian Chen, Xian Shi, Xiang Lv, Tianyu Zhao, Zhifu Gao, Yexin Yang, Changfeng Gao, Hui Wang, et al. Cosyvoice 2: Scalable streaming speech synthesis with large language models. arXiv preprint arXiv:2412.10117, 2024b.
  9. Zhihao Du, Changfeng Gao, Yuxuan Wang, Fan Yu, Tianyu Zhao, Hao Wang, Xiang Lv, Hui Wang, Chongjia Ni, Xian Shi, et al. Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training. arXiv preprint arXiv:2505.17589, 2025.
  10. Sefik Emre Eskimez, Xiaofei Wang, Manthan Thakker, Canrun Li, Chung-Hsien Tsai, Zhen Xiao, Hemin Yang, Zirun Zhu, Min Tang, Xu Tan, et al. E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts. In 2024 IEEE Spoken Language Technology Workshop (SLT), pp. 682–689. IEEE, 2024.
  11. Yitian Gong, Luozhijie Jin, Ruifan Deng, Dong Zhang, Xin Zhang, Qinyuan Cheng, Zhaoye Fei, Shimin Li, and Xipeng Qiu. Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs. CoRR, abs/2506.23325, 2025.
  12. Dake Guo, Jixun Yao, Linhan Ma, He Wang, and Lei Xie. Streamflow: Streaming flow matching with block-wise guided attention mask for speech token decoding. CoRR, abs/2506.23986, 2025.
  13. Zhifang Guo, Yichong Leng, Yihan Wu, Sheng Zhao, and Xu Tan. Prompttts: Controllable text-to-speech with text descriptions. In IEEE International Conference on Acoustics, Speech and Signal Processing ICASSP 2023, Rhodes Island, Greece, June 4-10, 2023, pp. 1–5. IEEE, 2023.
  14. Jingbin Hu, Huakang Chen, Linhan Ma, Dake Guo, Qirui Zhan, Wenhao Li, Haoyu Zhang, Kangxiang Xia, Ziyu Zhang, Wenjie Tian, et al. Voicesculptor: Your voice, designed by you. arXiv preprint arXiv:2601.10629, 2026.
  15. Kexin Huang, Qian Tu, Liwei Fan, Chenchen Yang, Dong Zhang, Shimin Li, Zhaoye Fei, Qinyuan Cheng, and Xipeng Qiu. Instructttseval: Benchmarking complex natural-language instruction following in text-to-speech systems. CoRR, abs/2506.16381, 2025.
  16. Shengpeng Ji, Qian Chen, Wen Wang, Jialong Zuo, Minghui Fang, Ziyue Jiang, Hai Huang, Zehan Wang, Xize Cheng, Siqi Zheng, et al. Controlspeech: Towards simultaneous and independent zero-shot speaker cloning and zero-shot language style control. In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 6966–6981, 2025.
  17. Zeqian Ju, Yuancheng Wang, Kai Shen, Xu Tan, Detai Xin, Dongchao Yang, Yanqing Liu, Yichong Leng, Kaitao Song, Siliang Tang, et al. Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models. arXiv preprint arXiv:2403.03100, 2024.
  18. Rithesh Kumar, Prem Seetharaman, Alejandro Luebs, Ishaan Kumar, and Kundan Kumar. High-fidelity audio compression with improved rvqgan. Advances in Neural Information Processing Systems, 36: 27980–27993, 2023.
  19. Sang-gil Lee, Wei Ping, Boris Ginsburg, Bryan Catanzaro, and Sungroh Yoon. Bigvgan: A universal neural vocoder with large-scale training. In ICLR 2023.
  20. Yichong Leng, Zhifang Guo, Kai Shen, Zeqian Ju, Xu Tan, Eric Liu, Yufei Liu, Dongchao Yang, Kaitao Song, Lei He, et al. Prompttts 2: Describing and generating voices with text prompt. In The Twelfth International Conference on Learning Representations.
  21. Shijia Liao, Yuxuan Wang, Tianyu Li, Yifan Cheng, Ruoyi Zhang, Rongzhi Zhou, and Yijin Xing. Fishspeech: Leveraging large language models for advanced multilingual text-to-speech synthesis, 2024. URL https://arxiv.org/abs/2411.01156.
  22. Yaron Lipman, Ricky T. Q. Chen, Heli Ben-Hamu, Maximilian Nickel, and Matthew Le. Flow matching for generative modeling. In ICLR 2023.
  23. Guanghou Liu, Yongmao Zhang, Yi Lei, Yunlin Chen, Rui Wang, Lei Xie, and Zhifei Li. Promptstyle: Controllable style transfer for text-to-speech with natural language descriptions. In Naomi Harte, Julie Carson-Berndsen, and Gareth Jones (eds.), 24th Annual Conference of the International Speech Communication Association, Interspeech 2023, Dublin, Ireland, August 20-24, 2023, pp. 4888–4892. ISCA, 2023.
  24. Dan Lyth and Simon King. Natural language guidance of high-fidelity text-to-speech with synthetic annotations. arXiv preprint arXiv:2402.01912, 2024.
  25. Zhiliang Peng, Jianwei Yu, Wenhui Wang, Yaoyao Chang, Yutao Sun, Li Dong, Yi Zhu, Weijiang Xu, Hangbo Bao, Zehua Wang, Shaohan Huang, Yan Xia, and Furu Wei. Vibevoice technical report. CoRR, abs/2508.19205, 2025.
  26. Rafael Rafailov, Archit Sharma, Eric Mitchell, Christopher D. Manning, Stefano Ermon, and Chelsea Finn. Direct preference optimization: Your language model is secretly a reward model. In NeurIPS, 2023.
  27. Kai Shen, Zeqian Ju, Xu Tan, Yanqing Liu, Yichong Leng, Lei He, Tao Qin, Sheng Zhao, and Jiang Bian. Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers. arXiv preprint arXiv:2304.09116, 2023.
  28. Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, et al. Neural codec language models are zero-shot text to speech synthesizers. arXiv preprint arXiv:2301.02111, 2023.
  29. Xinsheng Wang, Mingqi Jiang, Ziyang Ma, Ziyu Zhang, Songxiang Liu, Linqin Li, Zheng Liang, Qixi Zheng, Rui Wang, Xiaoqin Feng, et al. Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens. arXiv preprint arXiv:2503.01710, 2025.
  30. Yuancheng Wang, Haoyue Zhan, Liwei Liu, Ruihong Zeng, Haotian Guo, Jiachen Zheng, Qiang Zhang, Xueyao Zhang, Shunsi Zhang, and Zhizheng Wu. Maskgct: Zero-shot text-to-speech with masked generative codec transformer. arXiv preprint arXiv:2409.00750, 2024.
  31. Kangxiang Xia, Xinfa Zhu, Jixun Yao, Wenjie Tian, Wenhao Li, and Lei Xie. Kall-e: Autoregressive speech synthesis with next-distribution prediction. CoRR, abs/2412.16846, 2024.
  32. Kun Xie, Feiyu Shen, Junjie Li, Fenglong Xie, Xu Tang, and Yao Hu. Fireredtts-2: Towards long conversational speech generation for podcast and chatbot. CoRR, abs/2509.02020, 2025.
  33. Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, Kai Dang, et al. Qwen2. 5-omni technical report. arXiv preprint arXiv:2503.20215, 2025.
  34. Dongchao Yang, Jinchuan Tian, Xu Tan, Rongjie Huang, Songxiang Liu, Xuankai Chang, Jiatong Shi, Sheng Zhao, Jiang Bian, Xixin Wu, et al. Uniaudio: An audio foundation model toward universal audio generation. arXiv preprint arXiv:2310.00704, 2023.
  35. Zhen Ye, Peiwen Sun, Jiahe Lei, Hongzhan Lin, Xu Tan, Zheqi Dai, Qiuqiang Kong, Jianyi Chen, Jiahao Pan, Qifeng Liu, Yike Guo, and Wei Xue. Codec does matter: Exploring the semantic shortcoming of codec for audio language model. In AAAI-25, Sponsored by the Association for the Advancement of Artificial Intelligence, February 25 - March 4, 2025, Philadelphia, PA, USA, pp. 25697–25705. AAAI Press, 2025a.
  36. Zhen Ye, Xinfa Zhu, Chi-Min Chan, Xinsheng Wang, Xu Tan, Jiahe Lei, Yi Peng, Haohe Liu, Yizhu Jin, Zheqi Dai, Hongzhan Lin, Jianyi Chen, Xingjian Du, Liumeng Xue, Yunlin Chen, Zhifei Li, Lei Xie, Qiuqiang Kong, Yike Guo, and Wei Xue. Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis. CoRR, abs/2502.04128, 2025b.
  37. Neil Zeghidour, Alejandro Luebs, Ahmed Omran, Jan Skoglund, and Marco Tagliasacchi. Soundstream: An end-to-end neural audio codec. IEEE ACM Trans. Audio Speech Lang. Process., 2022.
  38. Bowen Zhang, Congchao Guo, Geng Yang, Hang Yu, Haozhe Zhang, Heidi Lei, Jialong Mai, Junjie Yan, Kaiyue Yang, Mingqi Yang, et al. Minimax-speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder. arXiv preprint arXiv:2505.07916, 2025a.
  39. Dong Zhang, Gang Wang, Jinlong Xue, Kai Fang, Liang Zhao, Rui Ma, Shuhuai Ren, Shuo Liu, Tao Guo, Weiji Zhuang, et al. Mimo-audio: Audio language models are few-shot learners. arXiv preprint arXiv:2512.23808, 2025b.
  40. Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu. Speechtokenizer: Unified speech tokenizer for speech large language models. CoRR, abs/2308.16692, 2023a.
  41. Xin Zhang, Dong Zhang, Shimin Li, Yaqian Zhou, and Xipeng Qiu. Speechtokenizer: Unified speech tokenizer for speech large language models. arXiv preprint arXiv:2308.16692, 2023b.
  42. Yixuan Zhou, Xiaoyu Qin, Zeyu Jin, Shuoyi Zhou, Shun Lei, Songtao Zhou, Zhiyong Wu, and Jia Jia. Voxinstruct: Expressive human instruction-to-speech generation with unified multilingual codec language modelling. In Jianfei Cai, Mohan S. Kankanhalli, Balakrishnan Prabhakaran, Susanne Boll, Ramanathan Subramanian, Liang Zheng, Vivek K. Singh, Pablo César, Lexing Xie, and Dong Xu (eds.), Proceedings of the 32nd ACM International Conference on Multimedia, MM 2024, Melbourne, VIC, Australia, 28 October 2024 - 1 November 2024, pp. 554–563. ACM, 2024.
  43. Yixuan Zhou, Guoyang Zeng, Xin Liu, Xiang Li, Renjie Yu, Ziyang Wang, Runchuan Ye, Weiyue Sun, Jiancheng Gui, Kehan Li, Zhiyong Wu, and Zhiyuan Liu. Voxcpm: Tokenizer-free TTS for context-aware speech generation and true-to-life voice cloning. CoRR, abs/2509.24650, 2025.

LLM WIKI · CONTEXT READER

AI 论文解读

DeepSeek V4 Flash

Enter 发送 · Shift + Enter 换行 · Esc 关闭