富时间线音频生成(Rich-Timeline Audio)
在同一条长时间轴上联合生成并混合多角色对白、持续声景、音乐和局部音效,同时控制身份、起止、重叠、顺序与跨段一致性。
富时间线音频生成是复杂音频场景生成的一种严格任务定义。目标不只是“模型既会 TTS、又会音乐、又会音效”,而是让这些异质声源成为同一个场景中相互作用的组成部分,由模型一次输出最终 mixed waveform。
一个典型请求可能同时包含:
- 角色 A 与 B 的多轮对白,且每个角色跨轮保持同一音色;
- 持续的室内混响、街道底噪或风声;
- 在指定秒数出现的开门、脚步、碰撞或警报;
- 跨几十秒持续并渐变的背景音乐;
- 事件之间的先后、重叠、打断和前景/背景音量关系。
资料摘要:Qwen-Audio-3.0-Gen-Preview 将该问题称为 rich-timeline audio,并用结构化记录、角色绑定、合成 recipe 和共享 DiT+VAE 做系统化建模。
统一任务不等于统一场景
Section titled “统一任务不等于统一场景”多任务模型可以在不同请求下分别生成 speech、music、sound effect,却未必学会让它们在同一段音频里自然共存。若仍需:
- TTS 生成对白;
- music model 生成配乐;
- TTA model 生成音效;
- 外部编辑器对齐时间、调音量并混音;
那么跨声源一致性仍由人工或 agent pipeline 承担。富时间线生成把这一步纳入模型,使其学习遮蔽、能量平衡、空间一致和事件交互。
真实内容创作天然是场景级
Section titled “真实内容创作天然是场景级”电影、游戏、广播剧、播客和短视频需要的是完整声场,而不是孤立音频素材。一次生成 mixed track 可降低多模型编排成本,也为“用自然语言编辑时间线”提供统一接口。
1. 结构化场景记录
Section titled “1. 结构化场景记录”Qwen-Audio-3.0-Gen-Preview 使用:
其中:
| 字段 | 含义 | 典型内容 |
|---|---|---|
| Global scene/soundscape | 场所、持续环境、room tone、空间/制作属性 | |
| Profiles | 角色/声源身份、声类、年龄、口音、音色锚点 | |
| Events | 带起止/时间锚点的局部声音事件 | |
| Primary audible content | 需逐字保真的对白、歌词或主要内容 |
关键不是字段数量,而是给每个属性明确 owner 和 temporal scope。无法可靠归属的信息应删除,而不是挂到整段 caption 上。
2. 共享时间轴与重叠标注
Section titled “2. 共享时间轴与重叠标注”对白 turn、持续 ambience、背景源和局部事件独立标注,因此区间可以重叠。Speaker diarization 先切 utterance,再把同一来源的轨道跨 turn 合并成稳定 role ID。
这避免两个常见错误:
- 每轮独立预测说话人属性,导致角色音色漂移;
- 把和对白重叠的音效吸收到一句全局 caption 中,失去时间定位。
3. Prompt Enhancement
Section titled “3. Prompt Enhancement”用户通常不会手写完整 JSON 时间线。LLM prompt enhancer 可从自由描述抽取 ,估计起止、顺序和重叠,但必须:
- 原样保留用户提供的对白/歌词;
- 不新增未请求的角色、台词或事件;
- 校验角色引用、时间顺序和持续时长;
- 失败时按 validation error 定向修复。
随后 deterministic renderer 把 序列化为稳定条件语法。超 token budget 时按优先级删字段,而非随意截断尾部。
4. 真实数据与合成 recipe 互补
Section titled “4. 真实数据与合成 recipe 互补”真实录音提供自然声学互动,但缺乏精确、可独立操纵的强标签。合成 recipe 则显式控制 source、onset、duration、level、SNR、重复、重叠、空间方向、距离、房间响应、失真和 codec。
通过只改一个因素、冻结其余因素,可生成 counterfactual 条件对,用于学习:
- 事件数变化;
- 顺序交换;
- 目标缺失/新增;
- 材质、方向、距离或通道变化。
但 recipe 给出的边界不一定等于听觉上真正可闻边界,仿真声学也不能替代真实场景。
5. 语义条件视图与 CFG
Section titled “5. 语义条件视图与 CFG”富时间线不能随意逐字段 dropout。合理的条件视图应保持语义可解释:
- full:对白+角色+声景+事件;
- dialogue:只保留对白及角色锚点;
- scene:只保留持续声景与独立事件;
- empty:CFG 无条件分支。
被对白引用的 role bundle 必须原子保留或整体删除;事件关系也不能指向已被删掉的事件。这种“结构化 dropout”比普通随机字段 mask 更符合场景逻辑。
6. 单模型直接生成 mixed waveform
Section titled “6. 单模型直接生成 mixed waveform”以 Qwen-Audio-3.0-Gen-Preview 为例,结构化文字条件进入 DiT,生成共享 25 Hz 连续 VAE latent,再由同一 decoder 输出 48 kHz stereo waveform。所有域共享路径,不设独立 TTS/music/SFX branch。
只用 CLAP/FAD 不足以判断时间线是否正确。至少需要四类指标:
- Event recall:请求的声音是否都出现。
- Temporal localization:预测区间与目标区间的 mIoU、IoU@0.3/0.5。
- Role consistency:同一角色跨 turn 的 speaker embedding consistency。
- Scene quality:整体音质、前景/背景平衡、可懂度和语义满足度。
Qwen 论文显示一个重要权衡:Gen-Preview 的事件 mIoU 更高,但 recall 比 Seed-Audio 低约 10 个百分点。定位更准不代表覆盖更全,应同时报告。
- 早期 WavJourney/Audio-Oscar:LLM/agent 写脚本,调用多个专模并外部混音。
- AudioX/UniSonate/UniAudio:一个模型覆盖更多音频生成任务,但重点仍是 task breadth。
- 资料摘要:Dasheng AudioGen:用结构化多视图字幕与统一语义-声学 latent 直接生成短 mixed scene。
- 资料摘要:ControlAudio:显式强化多事件起止控制和可懂语音。
- Qwen-Audio-3.0-Gen-Preview:把长对话角色、持续声景、局部事件、合成反事实和 rich-timeline benchmark 统一起来。
与相邻概念的区别
Section titled “与相邻概念的区别”| 概念 | 输出组织 | 是否直接混音 | 核心难点 |
|---|---|---|---|
| 多任务音频生成 | 每次做一个任务 | 不一定 | 任务覆盖 |
| Agent 音频流水线 | 多专模分轨生成 | 后处理混音 | 编排与工具调用 |
| 短混合场景生成 | 同段多种声音 | 是 | 成分交互与能量平衡 |
| 富时间线音频生成 | 长段、多角色、多事件、持续背景 | 是 | 时间、角色和跨段一致性 |
| 音频编辑 | 修改已有 waveform | 视方法而定 | 保留未编辑区域 |
- “General 模型就是富时间线模型”:通用模型可能只覆盖任务集合,未必显式学习长场景关系。
- “有时间戳就足够”:还需角色 owner、持续声景、重叠、relative level 和跨轮一致性。
- “一次出完整波形一定更可控”:外部多轨流水线更易局部重做;端到端 mixed waveform 的单组件编辑反而更难。
- “LLM-as-judge 可以替代所有音频指标”:时间判断、事件可闻性和音质应由多种裁判与人评交叉验证。
- “合成强标签是真实边界”:recipe 时间只保证文件级放置,源的实际可闻 onset/offset 可能不同。
- 资料摘要:Qwen-Audio-3.0-Gen-Preview — 概念的完整系统实现
- Qwen 音频四模型对比
- 资料摘要:Dasheng AudioGen — 统一混合场景生成
- 资料摘要:ControlAudio — 时间控制与可懂语音
- 资料摘要:Bagpiper — AR 音频基础模型的混合音频路线
- 音频生成
- DiT(Diffusion Transformer)
- CFG(无分类器引导)
- VAE(变分自编码器)
- Wiki 目录