资料摘要:Moshi
Moshi 是 Kyutai 的 7B 级 speech-text foundation model:它以 Helium 文本 LLM 为 Temporal Transformer,用 Mimi 把双路 24 kHz 音频压成 12.5 Hz 的语义—声学 token,再由 Depth Transformer 在每个时间步展开多码本,配合 Inner Monologue 同步生成文本与语音,实现约 160 ms 理论、200 ms 实际的实时全双工对话。
- 全双工来自显式双音频流:用户与 Moshi 的语音流在同一时间轴联合建模,不必先判定 turn,再切换 ASR/TTS;重叠、插话和 backchannel 可自然出现在训练序列中。
- Mimi 是因果 24 kHz codec,12.5 frame/s、8 个 2048 大小 codebook,约 1.1 kbps;split RVQ 把 WavLM 蒸馏的 semantic token 与独立 acoustic residual 分开。
- Temporal Transformer 负责跨时间的长程建模,Depth Transformer 负责同一帧内的 codebook 层级生成,避免把 16 路音频 token 全部铺成长序列。
- Inner Monologue 先生成与语音对齐的文本 token,再把它作为同一时刻音频 token 的前缀;它保留 Helium 的文本知识,同时保持流式 speech-to-speech。
- 训练使用 700 万小时以英语语音为主的未监督音频、Fisher 2000 小时双通道通话,以及超过 2 万小时合成 instruction speech;规模是能力的重要组成,不可把结果只归因于架构。
- 论文的 streaming TTS/ASR 是框架能力演示:2 秒 lookahead 下 TTS WER 4.7%、ASR WER 5.7%,作者明确说并非专门挑战 SOTA。
1. 四个组件
Section titled “1. 四个组件”Helium 采用 32 层、4096 维、32 heads 的 decoder-only Transformer,文本词表 32k、上下文 4096。Moshi 保留这条 7B 级 Temporal Transformer,再增加 6 层、1024 维、16 heads 的 Depth Transformer;时间上下文为 3000 步,约 4 分钟。
2. Mimi:低帧率但保留语义与声学
Section titled “2. Mimi:低帧率但保留语义与声学”Mimi 的因果 SeaNet 编解码器把 24 kHz 波形下采样到 12.5 Hz、512 维 latent。量化前后各有 8 层因果 Transformer bottleneck;8 个 2048 codebook 在 12.5 Hz 下约为 1.1 kbps,第一帧粒度为 80 ms。
普通 RVQ 中,若第一层同时承担语义蒸馏和重建,后续 residual 会被其取舍牵制。Mimi 的 split RVQ 让第一支独立接收 WavLM 蒸馏,另一支保留 acoustic residual,再合并解码。蒸馏教师可非因果,因为只在训练时使用;实际 Mimi encoder/decoder 仍因果。
3. Temporal × Depth 与 delay pattern
Section titled “3. Temporal × Depth 与 delay pattern”如果把两路音频、每路 8 个 codebook 与文本全部按普通序列展开,每 80 ms 要产生大量 token。Moshi 用 RQ-Transformer 思路分层:Temporal Transformer 每帧推进一次,Depth Transformer 在帧内按 codebook 次序生成细节。
声学 codebook 相对 semantic token 延迟若干帧,使粗内容先确定、细节后补。这个 delay pattern 提供短 lookahead 并保持因果播放。实际延迟由 codec 80 ms 帧、声学延迟与计算共同组成,论文报告 160 ms 理论、约 200 ms 实际。
4. Inner Monologue
Section titled “4. Inner Monologue”Inner Monologue 在每个时间步先产生对齐文本,再生成 semantic/acoustic token。它不同于先完整生成答案文本、再调用 TTS 的 Chain-of-Modality:文本与语音共同推进,因此仍能实时输出。
消融显示 spoken QA 上收益显著:Moshi 去掉 Inner Monologue 在 WebQuestions/LlaMA Questions/Audio TriviaQA 上为 9.2/21.0/7.3,完整 Moshi 为 26.6/62.3/22.8。代价很小:每个多流时间步从 16 个 token 增到 17 个。与此同时,Moshi 的 MMLU 从 Helium 的 54.3 降到 49.7,说明音频和对话微调仍会侵蚀部分文本知识。
5. 数据与四阶段训练
Section titled “5. 数据与四阶段训练”- Helium:50 万步文本预训练,每 batch 约 420 万 token;
- Moshi 单流预训练:700 万小时未监督音频,100 万步;一半 batch 继续用纯文本以减轻遗忘;
- 多流 post-training:以 diarization 把主说话人与残余音频分流,10 万步;
- Fisher 2000 小时双通道通话训练 1 万步,再用超过 2 万小时合成口语 instruction 数据训练 3 万步。
另外采集的 170 小时自然/脚本双通道对话用于训练多流 TTS 与调优 Helium,而不是直接作为 Moshi 主训练集。instruction TTS 固定使用一名演员的系统音色,覆盖 70 多种说话风格;用户流则随机换说话人并加入噪声、增益、回声和静音增强。
6. 对话、ASR/TTS 与安全结果
Section titled “6. 对话、ASR/TTS 与安全结果”在 Fisher 提示续写中,Moshi 的生成对话能产生 gap、overlap 与 pause;温度 1.0 时 overlap 4.1 s,接近 ground truth 的 3.3 s。该指标说明模型学到对话动力学,但 DialoGPT perplexity 和时长统计仍不能替代真实人机交互评测。
通过改变文本/音频 delay,Inner Monologue 还能派生 streaming TTS/ASR:2 秒 lookahead 下,LibriSpeech test-clean TTS WER 4.7%、ASR WER 5.7%,时间对齐精度为 80 ms。专用 NaturalSpeech 3 与 Streaming FastConformer 在对应 WER 上更强,印证它更像统一框架示范。
安全章节报告系统音色在生成对话中 98.7% 更接近目标音色;数据去重能把最频繁 16 秒片段的复现率降到 0。AudioSeal 在无攻击时检测接近 1,但经过低码率 codec 重编码后几乎失效;论文诚实给出了信号水印在该场景的负结果。
7. 批判性判断
Section titled “7. 批判性判断”- Moshi 的核心突破是把语音对话的时间结构直接建模,而非把 ASR→LLM→TTS 仅做低延迟工程拼接。
- 700 万小时语音、7B 基座与多阶段合成数据使复现门槛极高;架构消融不能完全分离规模收益。
- Inner Monologue 仍引入文本通道,只是把它变成同步隐式计划;“speech-to-speech”不等于“完全没有文本中间变量”。
- 200 ms 是模型链路的作者口径,设备、音频 I/O、网络与服务调度仍会改变真实交互延迟。
- 系统以英语为主、固定 Moshi 音色;跨语种、自由音色克隆和开放域长期安全仍非论文主要覆盖。
| 项目 | 论文报告 |
|---|---|
| Helium / Moshi 主干 | 7B 级,32 层,4096 维 |
| Mimi | 24 kHz,12.5 Hz,8×2048 codebooks,约 1.1 kbps |
| 未监督音频 | 700 万小时,以英语语音为主 |
| 双通道对话 | Fisher 2000 小时 |
| 合成 instruction speech | 超过 2 万小时 |
| 理论 / 实际延迟 | 160 ms / 约 200 ms |
| 官方实现 | kyutai-labs/moshi |
- Wiki 目录
- 资料摘要:离散音频 Token 综述与基准 — Mimi 的统一 benchmark 背景
- 资料摘要:WavTokenizer — 另一种低帧率单码本 tokenizer
- 资料摘要:LLMVoX · 资料摘要:SpeakStream · 资料摘要:CTC-TTS — 级联/专用流式 TTS 对照
- LALM(大型音频语言模型) — speech-text foundation model 边界
- 流式语音合成 — 延迟与在线生成分析
- 资料摘要:Qwen2.5-Omni · 资料摘要:GPT-4o System Card — 统一多模态语音系统对照