跳转到内容

输入关键词开始搜索

    AI

    大模型、生成模型、语音与音频智能、训练方法和 AI 基础设施。

    220个知识页面
    69核心概念
    140资料摘要
    7综合分析
    2主题与教程
    16已读资料

    主题入口

    核心概念

    全部概念 ↗
    01概念 · 2026-09-11音频理解基准用带 audio evidence 的任务,分层测量模型能否感知声音、提取信息、调用知识并完成可靠推理。02概念 · 2026-09-11GRPO(组相对策略优化)一种去掉 Critic(价值网络)的 PPO 变体:对同一提示采样一组输出,用组内奖励的相对分数(归一化)作为优势估计,省去与策略同等大小的价值模型,大幅降低 RL 对齐成本。03概念 · 2026-09-11LALM(大型音频语言模型)把音频(语音/声音/音乐)离散化或表示为 token 序列、用自回归语言模型统一建模理解与生成的大模型;将「文本 tokenizer + LLM」范式迁移到音频,使压缩、理解、生成、上下文学习在单一序列建模框架内涌现。04概念 · 2026-09-08MoE(混合专家)一种神经网络架构模式,将模型参数划分为多个"专家"子网络,每个输入 token 仅激活其中少数几个专家,从而以较低的推理计算量获得巨大的总参数量。05概念 · 2026-08-17流式语音合成在文本尚未全部到达时增量生成并播放语音,使输入、模型推理与音频输出形成连续流水线的 TTS 技术。06概念 · 2026-08-17CTC(连接时序分类)一种对所有合法单调对齐路径求和、无需帧级边界即可训练序列标注模型的最大似然方法。07概念 · 2026-08-17Zipformer一种面向语音序列的高效 encoder:用多尺度 U-Net-like 时间分辨率、卷积局部建模、跨模块 attention weight reuse 与 bypass 连接,兼顾长程依赖、局部声学结构和计算效率。08概念 · 2026-08-15条件流匹配(CFM)一种连续归一化流生成模型,通过匹配最优传输路径的向量场来学习从简单先验(高斯噪声)到数据分布(梅尔频谱)的连续变换,比扩散模型训练更快、生成步数更少。09概念 · 2026-08-15音频生成利用深度学习模型从文本、图像、视频等条件输入自动合成音频内容(语音、音乐、音效、环境声等)的技术,2025-2026 年正从任务专用模型走向统一基础模型。10概念 · 2026-08-15CFG(无分类器引导)一种无需额外分类器的条件生成引导技术:同一模型联合学习条件与无条件两种预测,推理时把二者之差外推放大,用一个引导强度 $w$ 在「文本贴合度」与「多样性」之间换挡。11概念 · 2026-08-15DiffusionNFT(前向过程在线扩散强化学习)一种在 flow-matching 前向训练目标中注入在线奖励的扩散模型后训练方法:用同一条件下的正负候选构造隐式改进方向,只依赖最终干净样本,不计算采样轨迹似然。12概念 · 2026-08-15DiT(Diffusion Transformer)用 Transformer 架构替代传统 U-Net 作为扩散模型骨干的生成式架构,在图像和音频生成中展现出更强的可扩展性和多模态条件处理能力。

    综合分析

    01综合判断 · 2026-08-17无音素级时长 TTS 的文本—语音对齐机制对比七篇工作真正的分水岭不是“用不用 duration”,而是如何先决定长语音序列的总长度,再把短文本序列放到这条时间轴上:前缀 filler、均匀展开、句级长度 + attention、固定窗口,或从 forced alignment 稀疏化出锚点。02综合判断 · 2026-08-16ASR-TTS 论文周报第 015 期:连续语音生成、实时交互与长上下文[ASR/TTS 论文周报第 015 期](https://mp.weixin.qq.com/s/3f66uIFZGXt-C7UWxz7MiQ) 的 10 篇主榜论文与趋势段落中的 Never Stop Speaking 指向同一变化:语音系统不再只优化单句离线指标,而是在表示层、交互时序和长上下文资源三处同时追求“可预测、可控、可部署”。连续 latent03综合判断 · 2026-08-12Qwen 音频四模型对比Qwen 2026 年 7 月的音频产品线不是“一个模型的四种模式”:Music、TTS 与 General 是三套生成系统,ASR Flash 则是输入音频、输出文字的托管识别服务族;四者的任务方向、架构公开度和部署边界都不同。04综合判断 · 2026-08-06DiT 论文全景DiT(Diffusion Transformer)自 2022 年底提出以来,已从图像生成扩散至视频、音频、语音合成等领域,并在 2024-2026 年经历了效率优化(MoE/量化/动态计算)和架构进化(MMDiT/RAE/PixelDiT)两轮浪潮,正成为扩散/流匹配模型的主流骨干。05综合判断 · 2026-08-05AI Agent 入门学习路线先用两篇工程文章建立“什么时候不该做 Agent”的判断,再手写最小 tool loop;之后只选一个框架做项目,并从第一天加入评估、权限和人工检查点。八份资料承担不同角色,不需要全部顺序刷完。06综合判断 · 2026-05-17LLM架构演进:Transformer已死?基于 2019-2026 年 67 个核心开源模型的架构演进回顾,论证 Transformer Decoder-Only 架构五大组件的创新空间已基本枯竭。这里的"死"并非技术消失,而是创新的低垂果实被摘完,进入边际效益递减的微调阶段。07综合判断 · 2026-05-03CosyVoice 系列对比梳理阿里通义语音团队 CosyVoice 三代演进:从零样本 TTS 基础架构到流式合成再到百万小时多语言野外场景。

    论文摘要

    全部论文 ↗
    01待阅读 · 论文 · 2026-09-14资料摘要:Audio-ZeroAudio-Zero 把无标注对比音频改造成“多数人听参考音频、一人听细微变体”的找卧底游戏,让同一个大型音频语言模型交替生成听觉线索和判断异常听者,再以程序预先知道的角色身份构造可验证奖励,用 GRPO 联合提升细粒度感知与推理。02待阅读 · 论文 · 2026-09-08资料摘要:SonicWeave快手 Kling、香港中文大学与清华大学提出的 2B 统一音频场景生成模型。SonicWeave 用同一组权重生成语音、歌声、音乐、音效及其混合场景;核心 CPE-MoE 不再逐 token 独立选专家,而让连续声学 chunk 共享路由,并用门控在“结构化文本 + diffusion phase”的全局 prior 与当前声学状态的局部 evidence 03待阅读 · 论文 · 2026-08-17资料摘要:可控语音合成系统综述这篇 EMNLP 2025 系统综述从控制属性、模型架构、控制条件、声学表示、数据与评测六个维度梳理 LLM 时代的可控语音合成。它最有价值的结论不是列模型,而是把“控制什么、条件如何进入、表示能否解耦、评测能否验证”串成一条设计链。04待阅读 · 论文 · 2026-08-17资料摘要:离散音频 Token 综述与基准这篇 TMLR 2025 工作同时是 taxonomy、统一实验与设计诊断:它把离散音频 tokenizer 按量化、encoder/decoder、训练目标、streamability 和数据域拆解,并在重建、下游任务、spoken LM、TTS 与 text-to-audio 上复核“重建最好不等于最适合语言建模”。05待阅读 · 论文 · 2026-08-17资料摘要:CTC-TTSCTC-TTS 不以扩大基座模型为主,而是把双流式 TTS 的关键问题定位为“如何得到轻量、单调、可复用的文本—语音结构对齐”。它用 CTC Viterbi 路径替换传统 MFA,再以 bi-word 单元交织音素与单码本语音 token,并提供质量优先的 L 版与延迟优先的 F 版。06待阅读 · 论文 · 2026-08-17资料摘要:DiTTo-TTSDiTTo-TTS 用冻结的预训练文本 encoder、10.76 Hz Mel-VAE latent 和带 cross-attention 的 Diffusion Transformer 做 zero-shot TTS;它取消音素与音素级时长,但保留一个独立的句级 Speech Length Predictor 来决定要生成多少语音 latent。07待阅读 · 论文 · 2026-08-17资料摘要:E2 TTSE2 TTS 把 zero-shot TTS 写成 mel-spectrogram infilling:文本保留字符序列,末尾追加 filler token 直到与 mel 帧数相同,再让一个带 U-Net 式长跳连的 Transformer 在条件流匹配中同时学习内容、对齐与声学生成。08待阅读 · 论文 · 2026-08-17资料摘要:E3 TTSE3 TTS 是早期的端到端 waveform diffusion TTS:English BERT 提供 subword 条件,1D U-Net 在降采样后的低分辨率层通过 cross-attention 动态学习文本—语音对齐,然后用 1000 步 DDPM 直接生成 24 kHz waveform。

    文章摘要

    全部文章 ↗
    01待阅读 · 文章 · 2026-08-17资料摘要:LLM-based TTS 四年全景(2023–2026)瑶光守护者以 CTC-TTS 为切入点,把 2023–2026 年 LLM-based TTS 整理为 Codec LM、非自回归生成、统一语音 LLM、流式/双流式四条路线,并横向讨论对齐、tokenizer、交织序列、低延迟、评测、开放问题与合规风险。它最适合作为“技术地图”,不适合作为跨论文数字的最终证据表。02待阅读 · 文章 · 2026-08-11资料摘要:低帧率高维 Token 的长时稳定 AR 音频生成探索Yi Luo 以失败实验和设计迭代为主线,解释如何把高保真音频 codec、8 Hz × 768 维连续 token、Locodec 表征塑形与 MP-ELD 多路径流匹配组合起来,在不借助外部 SSL/ASR 模型或预训练文本 LM 的前提下缓解长时自回归误差累积。03待阅读 · 文章 · 2026-08-06资料摘要:Qwen-Audio-3.0-ASR-Flash阿里云百炼于 2026-07-30 发布的新一代托管 ASR 服务族:同一产品线分成实时 Streaming、长文件 Filetrans 与短文件同步 Flash 三个端点,覆盖 30 种语言、七大中文方言群及多种地域口音,并以 prompt context 与热词强化专业术语识别。04待阅读 · 文章 · 2026-08-06资料摘要:MOSS-SoundEffect v2复旦 OpenMOSS 团队(MOSI.AI)开源的文本到音效(TTA)模型,是 MOSS-TTS 家族的"声音设计层"。v2.0 用 DiT 扩散骨干 + Flow Matching 目标(搭配 DAC VAE 与 Qwen3 文本编码器)重构了 v1 的离散 token 自回归(MossTTSDelay)架构,面向更高保真和更自然的长音频环境声,支持中/05待阅读 · 文章 · 2026-08-05资料摘要:A Practical Guide to Building AgentsOpenAI 面向产品与工程团队的实用指南,从“什么时候值得构建 Agent”进入 model、tools、instructions、single/multi-agent orchestration、guardrails 和 human intervention。06待阅读 · 文章 · 2026-08-05资料摘要:AI Agents for BeginnersMicrosoft 的 18 课双语课程,从 Agent 用例和设计原则延伸到 Tool Use、Agentic RAG、安全、Planning、多 Agent、生产评估、协议、Memory、Computer Use、部署和加密审计。07待阅读 · 文章 · 2026-08-05资料摘要:Building Effective AgentsAnthropic 基于实际项目总结的 Agent 设计文章:先区分 Workflow 与 Agent,再从 augmented LLM 推进到五种可组合 workflow,最后才进入开放式 Agent 循环。08待阅读 · 文章 · 2026-08-05资料摘要:Hello-AgentsDatawhale 的中英文系统教程,从智能体定义和 LLM 基础一路推进到 ReAct、自研框架、记忆、上下文、协议、评估、Agentic RL 与综合项目,是本资料库最完整的中文主线。

    视频与其他资料

    全部视频 ↗
    01待阅读 · 视频 · 2026-08-05资料摘要:Agentic AI(DeepLearning.AI)Andrew Ng 主讲的中级 Agentic AI 课程,以 Reflection、Tool Use、Planning 和 Multi-Agent 四种模式为主轴,并把评估、错误分析、成本与生产优化放入开发流程。02待阅读 · 视频 · 2026-08-05资料摘要:LangGraph EssentialsLangChain Academy 的一小时 Python 快速课,用 Node、Edge、Conditional Edge、Memory 和 Interrupt 构造一个可控、可暂停、可人工介入的 LangGraph 应用。03待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 01 — llama、alpaca、vicuna 整体介绍及 llama 推理过程本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。04待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 02 — LoRA(Low Rank Adaption)基本原理与基本概念,fine-tune 大语言模型本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。05待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 03 — LoRA fine-tune 大语言模型(peft、bloom 7b)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。06待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 04 — PEFT/LoRA 源码分析本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。07待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 05 — float16 与 bf16 表示和计算细节本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。08待阅读 · 视频 · 2026-08-02资料摘要:personal chatgpt 06 — LLaMA,Alpaca LoRA 7B 推理本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。

    最近更新

    01source · 2026-09-14资料摘要:Audio-ZeroAudio-Zero 把无标注对比音频改造成“多数人听参考音频、一人听细微变体”的找卧底游戏,让同一个大型音频语言模型交替生成听觉线索和判断异常听者,再以程序预先知道的角色身份构造可验证奖励,用 GRPO 联合提升细粒度感知与推理。02concept · 2026-09-11音频理解基准用带 audio evidence 的任务,分层测量模型能否感知声音、提取信息、调用知识并完成可靠推理。03concept · 2026-09-11GRPO(组相对策略优化)一种去掉 Critic(价值网络)的 PPO 变体:对同一提示采样一组输出,用组内奖励的相对分数(归一化)作为优势估计,省去与策略同等大小的价值模型,大幅降低 RL 对齐成本。04concept · 2026-09-11LALM(大型音频语言模型)把音频(语音/声音/音乐)离散化或表示为 token 序列、用自回归语言模型统一建模理解与生成的大模型;将「文本 tokenizer + LLM」范式迁移到音频,使压缩、理解、生成、上下文学习在单一序列建模框架内涌现。05concept · 2026-09-08MoE(混合专家)一种神经网络架构模式,将模型参数划分为多个"专家"子网络,每个输入 token 仅激活其中少数几个专家,从而以较低的推理计算量获得巨大的总参数量。06topic · 2026-09-08音频生成通用音频生成领域 31 篇有影响力论文与 1 篇作者深度解读的汇总导航,覆盖 2023–2026 奠基性工作到最新进展。