跳转到内容

输入关键词开始搜索

    Wiki 目录

    主题更新 2026-08-10置信度 medium#目录#导航

    本页面由 LLM 在每次操作后自动维护。知识库采用领域优先结构:顶层按学习领域组织,每个领域自带 概念/资料摘要/综合分析/领域页

    AI Agent 入门:

    课程合集:

    大模型(按时间线,覆盖关键论文):

    AI Infra / GPU 系统:

    扩散 / 视觉生成:

    语音合成 / TTS:

    音频生成(2025-2026):

    音频生成 — 奠基性工作(2023–2024):

    • 资料摘要:MusicGen — Meta 单阶段 Transformer LM 音乐生成,codebook 交错(Delay Pattern)去级联 + 文本/旋律双条件,NeurIPS 2023
    • 资料摘要:AudioLDM — CLAP 潜空间扩散 TTA,首次零样本音频操作,ICML 2023
    • 资料摘要:Tango — Flan-T5 + LDM,以 1/63 数据量超越 AudioLDM,ACL 2024
    • 资料摘要:Tango 2 — Tango + diffusion-DPO 偏好对齐(Audio-alpaca),架构不变,ACM MM 2024
    • 资料摘要:TangoFlux — Tango 三代:Rectified Flow + MMDiT/DiT + 在线偏好优化 CRPO,515M 3.7s 生成 30s,2024.12
    • 资料摘要:DiffRhythm — 潜空间扩散全曲生成(人声+伴奏),10 秒 4m45s (2025.03)
    • 资料摘要:GenAU — FIT+1D-VAE 环境音频生成,47M 数据管道+AutoCap 标注 (2024.06)
    • 资料摘要:ControlAudio — 渐进扩散建模统一时间控制+可懂语音 TTA;已发布覆盖 20 页、5 图、11 表、6 式、2 个算法和 Appendix A–G 的中文全文译稿与精读网页,另有 Notion 全文版(ACL 2026 Main)

    音频理解 / LALM(大型音频语言模型):

    连续值自回归三篇(视觉→音频「连续预测头替代离散 softmax」技术路线):资料摘要:GIVT / 资料摘要:MAR / 资料摘要:DiTAR

    • 亚伯拉罕诸教 — 犹太教/基督教/伊斯兰教三大一神教的“三本书”框架
    • 古兰经 — 伊斯兰教圣书,114章,神逐字启示的终极经典
    • 穆罕默德 — 伊斯兰教的封印先知,七世纪阿拉伯社会改革家
    • 伊斯兰五功 — 正信/礼拜/斋戒/天课/朝觐,以信仰替代血缘的社会机制
    • 希吉拉 — 622年迁徙麦地那,伊斯兰历元年,从精神运动到政权实体
    • 乌玛 — 超越民族的穆斯林共同体,伊斯兰“综合体”的终极蓝图

    以下领域已建占位索引,等待首次 ingest 填充:

    • 2026-08-10: schema — 新增 📡 电子信息 顶层领域、领域索引与网站导航,为后续精选整理 Goodnotes 中的 EE 课程笔记建立承载位置;本次未导入课程正文或原始文件。
    • 2026-08-06: lint — 完成 274 个内容页、4,157 个 wikilink 与 2,628 份 raw 文件的静态巡检;修复旧股票笔记 frontmatter、历史软断链与「音频生成」同名链接歧义。复核后真实死链、孤页、过时页、缺标签页与未覆盖 PDF 均为 0。
    • 2026-08-06: query — 详解 DDPM 前向 Markov 加噪、任意 tt 的一步重参数化与反向多步采样;澄清模型预测的是总等效噪声的条件估计,从纯噪声出发并不存在可一步精确恢复的唯一原图。
    • 2026-08-06: query — 从直线 Flow 过渡到 Diffusion 的 noise / score 参数化:对 xt=αtx0+σtεx_t=\alpha_t x_0+\sigma_t\varepsilon,有 sθ=εθ/σts_\theta=-\varepsilon_\theta/\sigma_tg(t)g(t) 是 SDE 的局部噪声强度,单步标准差为 g(t)Δtg(t)\sqrt{\Delta t}
    • 2026-08-06: query — 解释 Flow Matching / Rectified Flow 的命名,以及 Euler–Maruyama 对 SDE 的离散化:dWtdW_t 是 Brownian motion 增量,有 ΔWN(0,ΔtI)\Delta W\sim\mathcal N(0,\Delta t I),数值上等价为 Δtε\sqrt{\Delta t}\,\varepsilon
    • 2026-08-06: query — 澄清 Flow 与 Diffusion 的 ODE / SDE 关系:SDE 的随机性来自 Brownian 增量,不是网络预测的速度场本身随机;高斯路径下 score 与速度场可互换,Diffusion 也可以 probability-flow ODE 采样。
    • 2026-08-05: ingest — 归档 8 组 AI Agent 中英文入门资料,固定 3 个课程仓库版本并保留 5 份公开网页/PDF 快照;新增 8 份资料摘要、5 个基础概念页、AI Agent 入门学习路线核心循环图
    • 2026-08-05: query — 筛选 AI Agent 中英文入门资料:中文主线推荐 Datawhale《Hello-Agents》与 Hugging Face Agents Course 中文版;英文先读 Anthropic《Building Effective Agents》和 OpenAI《A Practical Guide to Building Agents》,再按实践需要进入 Hugging Face、DeepLearning.AI 或 LangGraph 课程。库内尚无专门的 Agent 入门页面,记录为知识空白。
    • 2026-08-05: paper-web maintenance — 统一四篇论文译页的术语策略:正文保留中文叙述,作者名、方法名、架构、task、benchmark、metric 与 eponym 使用原始英文;同步更新 coverage manifest、精读笔记与译库元数据,并新增术语回归测试。
    • 2026-08-04: ingest — 归档并校验 8 组 Neovim/LazyVim 中英文资料,新增 8 份资料摘要与 Neovim 与 LazyVim 学习路线;明确中文镜像、部分译文、已归档项目和付费教程配套仓库的范围边界。
    • 2026-08-04: ingest / paper-web — 下载并校验 arXiv:2601.15621《Qwen3-TTS Technical Report》,新增 资料摘要:Qwen3-TTS,并发布覆盖 14 页、118 个源块、Figure 1–3、Table 1–10、作者脚注及 43 条参考文献的中文全文译稿与精读网页。
    • 2026-08-04: query — 核对 arXiv:2601.15621《Qwen3-TTS Technical Report》:库内尚无该论文的 raw PDF、独立资料摘要或中文全文网页;现有内容仅把 Qwen3-TTS 作为旧系列/比较基线提及,已入库的 资料摘要:Qwen-Audio-3.0-TTS 是另一篇 2026.07 报告。
    • 2026-08-03: ingest — 完整摄取 Qwen 2026.07 音频产品矩阵:下载并校验 Qwen-Music、Qwen-Audio-3.0-TTS、Qwen-Audio-3.0-Gen-Preview 三篇技术报告 PDF;归档 Qwen-Audio-3.0-ASR-Flash 官方产品文档;新增 4 份资料摘要、Qwen 音频四模型对比Melody-CoT(旋律链式规划)富时间线音频生成(Rich-Timeline Audio)自动语音识别(ASR) 与 3 张架构图。
    • 2026-08-03: query — 重新核对 Qwen-Audio-3.0-Gen-Preview:技术报告 PDF、独立资料摘要、富时间线概念页、架构图及 Qwen 音频三模型对比页现均已入库。
    • 2026-08-03: query — 核对 Qwen 音频生成新系列覆盖情况:库内尚无 Qwen-Music、Qwen-Audio-3.0-TTS、Qwen-Audio-3.0-Gen-Preview 的 raw 原文或独立资料摘要;现有页面仅把 Qwen3-TTS 当作基线零散提及,确认形成待摄取知识空白。
    • 2026-08-02: schema — 在 AGENTS.md 新增交互端公式渲染规则:先依据当前 app context 区分客户端;Codex 桌面端使用 \(...\) / \[...\],Claudian 回复与 Wiki Markdown 使用 $...$ / $$...$$,未知客户端回退为 Unicode 或纯文本。
    • 2026-08-02: query — 解释 Sigmoid 与 LogSigmoid:σ(x)\sigma(x) 输出 (0,1)(0,1) 内的概率;logσ(x)=softplus(x)\log\sigma(x)=-\operatorname{softplus}(-x) 输出该概率的自然对数,常以 -F.logsigmoid(z) 构造数值稳定的二分类、奖励模型和 DPO 损失。训练常保留 raw logits,推理时才按需使用 Sigmoid 转为概率。
    • 2026-08-02: query — 澄清 SiLU/Swish 与 SwiGLU:SiLU 是逐元素激活函数;SwiGLU 是使用 SiLU 门控分支、线性内容分支和逐元素乘法构成的完整 FFN。仅在普通单分支 MLP 中使用 SiLU,并不能称为 SwiGLU。
    • 2026-08-02: query — 对比传统 Transformer FFN 与 Llama 3 的 MLP:Llama 3 使用 SwiGLU,让输入并行经过 gate_projup_proj,以 SiLU 门控后逐元素相乘,再由 down_proj 返回残差流;Llama 3 8B 与 Llama 2 7B 拓扑相同,但中间宽度由 11,008 增至 14,336。
    • 2026-08-02: query — 解释 Transformer MLP 为何先升维再降维:升维为每个 token 提供更多非线性特征通道,降维则把这些特征重新组合为对固定宽度残差流的更新;临时加宽把模型容量集中在逐 token 计算中,避免让 attention 与层间状态全程维持高维。
    • 2026-08-02:摄取股票基础知识教程 P29–P33:完成本机 Whisper 真实时间戳转录,新增 5 份 raw 原文、5 份资料摘要与 涨跌幅通达信软件移动平均线盘口数据分时均价线 5 个概念页,并增补 大盘分时图个股分时图
    • 2026-08-01: feature — 从近期 Codex 会话提炼并创建 6 篇通用知识正文:Web 服务请求链路SSH 与 Linux 服务器基础VQ-VAE(向量量化变分自编码器)证券市场、券商与交易账户终端与 Neovim 高效编辑Raycast 效率工作流;已用 RFC、官方文档与原始论文复核,并排除实验专属方向、Bug 和项目实现语义。
    • 2026-08-01: maintenance — 知识库发布链路由 Cloudflare Pages 切换为云服务器直连:DNSPod A 记录指向 124.220.149.155,GitHub Actions 产出短期 artifact,服务器经 7897 代理拉取并原子切换;用户级静态后端仅监听本机端口,Caddy 负责反向代理和自动 HTTPS,并保留现有 api 服务入口。
    • 2026-08-01: query — 只读盘点除当前任务外的 18 条近期 Codex 任务并深读 12 条高信号会话,形成网络/Linux、VQ-VAE 通用机制、证券市场结构和效率工具候选;经用户复核,已排除实验专属方向、项目流程、Bug 修复与 Lab-VPN/macOS 项目语义,尚未写入知识正文。
    • 2026-08-01: query — 调研跨项目 Codex 会话自动沉淀工具:最匹配的是 Ar9av/obsidian-wiki 的 codex-history-ingest 与 wiki-agent,可增量扫描全部 Codex 历史并按主题蒸馏;但其目录/frontmatter 与本库 Schema 不兼容,建议只适配历史扫描与去噪逻辑,由 llm-wiki 继续作为唯一知识源。
    • 2026-08-01: feature — 将 资料摘要:SD3(MMDiT) 的独立 /papers/sd3-mmdit/ 页面升级为中文精校译本:采用极简 zine 纸刊风格,保留 Flow Matching、Transformer 等英文术语,按论文结构呈现主文与附录,并完整收录原论文 Figure 1–17、Table 1–7;删除无信息增益的路径滑块动画,仅保留原图放大、章节定位与引用复制。
    • 2026-08-01: query — 复盘中文论文精读原型的表现力边界:当前发布层已是 Astro Starlight,并非 Quartz;后续建议让论文页面退出文档型 Starlight 页面壳,由构建阶段把 wiki Markdown 编译为结构化 Paper Story 数据,再交给自定义 Astro 页面、React Islands、滚动叙事和交互可视化组件渲染。Markdown 保留为知识源,但不再决定网页结构。
    • 2026-08-01: feature — 新增中文「论文精读」网页模板原型;资料摘要:SD3(MMDiT) 率先启用,提供论文元信息、原文入口、精读状态、30 秒速览 / 10 分钟理解 / 完整精读三级导航、独立判断和论文友好的长文排版。其余论文页面保持原样,待确认视觉方向后再批量迁移。
    • 2026-08-01: query — 调研逐篇论文的精读网页模板;建议在现有 Astro Starlight 发布层内新增原生「论文精读」页面样式,视觉与交互借鉴 Hugging Face Research Article Template / Distill,内容结构融合 Keshav 三遍阅读法、审稿式批判问题和 C/M/E/L 理解度,而不另建一套内容源。
    • 2026-08-01: query — 统计知识库论文数量:按资料摘要页 frontmatter type: sourcemedia: paper 的口径,共 54 篇;独立核对 `私有原始资料层。其余视频、网页文章和未标为 paper 的课程资料不计入。
    • 2026-07-30: ingest — 基于滴答清单实际完成状态和 Bilibili 原音频,增量摄取 资料摘要:股票基础知识教程-014-经典K线形态“单针探底”与“双针探底”资料摘要:股票基础知识教程-028-重要盘口数据解读:换手率;新增 15 份带时间戳 raw、15 份摘要及对应概念页,并将 股票基础知识教程 更新为 P1–P28 连续完成、28/68 已摄取。共同边界是位置、量价、后续确认和明确失效条件;盘口数据还需防范挂撤单、对倒与流通盘口径。
    • 2026-07-26: maintenance — 沉淀本轮 GQA/MQA、KV Cache、HBM 与 FlashAttention 对话:新建 FlashAttention,补齐 GQA 的头映射/实现边界,并与 KV CacheGPU 节点互联与分层带宽 建立交叉链接。
    • 2026-07-26: query — 解释 HBM(High Bandwidth Memory):GPU 封装附近的堆叠式高带宽显存,是模型权重、激活与 KV Cache 的主要存放处;FlashAttention 的收益来自减少对 HBM 的中间矩阵读写。
    • 2026-07-26: query — 详解 FlashAttention:保持精确 attention 结果,但通过分块和 online softmax 避免物化完整 T×TT\times T 注意力矩阵,主要降低 GPU 高带宽显存 I/O;可与 GQA/MQA 叠加。
    • 2026-07-26: query — 澄清 GQA 头映射:例如 32 个 Q 头和 8 个 KV 头时,Q 头 1–4 使用 KV 头 1、5–8 使用 KV 头 2,以此类推;这是共享同一组 K/V,不是对它们做平均。
    • 2026-07-26: query — 说明 GQA/MQA 的共享 KV 在代码中就是缩小 k_proj/v_proj 的输出头数;朴素实现可在计算前按组展开 KV,而生产实现由 SDPA/FlashAttention 内核按组读取,避免物化重复张量。
    • 2026-07-26: query — 解释 GQA(分组查询注意力) 与 MQA:二者都通过减少 KV 头压缩 KV Cache;MQA 共享 1 组 KV,GQA 则按组共享,在 MHA 的表达能力与 MQA 的推理效率之间折中,并给出 PyTorch 实现要点。
    • 2026-07-19: query — 解释 SwiGLU 与用户所说的“swlu”(通常是对 Swish/SiLU 的误拼):SiLU/Swish 是平滑激活函数;SwiGLU 用它作门控的 FFN 变体,让一条分支筛选另一条分支的信息,常见于 LLaMA 等现代 LLM。
    • 2026-07-19: query — 澄清 RMSNorm 与 LayerNorm 虽都会做除法,但 LayerNorm 先减均值、再除标准差,目标是零均值单位方差;RMSNorm 直接除 RMS,只控制整体幅度,保留原始均值偏移。
    • 2026-07-19: query — 解释 RMSNorm 中的 RMS(Root Mean Square,均方根)与 MSE(Mean Squared Error,均方误差):RMS 衡量一组数的典型幅度;MSE 衡量预测误差的平均平方,二者的 square / mean 顺序相同但对象与用途不同。
    • 2026-07-19: maintenance — 将 wiki/ 中 14 个页面的 17 个数学表达统一为 Obsidian 可渲染的 $$...$$ LaTeX(其中 16 个原为无语言公式代码块,另含 RMSNorm 的行列对比式;正文与表格中的数学变量/运算符也改用行内 $...$);流程图、伪代码和文字示例保持原格式。
    • 2026-07-19: query — 解释 RMSNorm 与 LayerNorm:二者都按单个 token 的隐藏特征维做归一化;LayerNorm 同时去均值、调方差,RMSNorm 仅按均方根缩放,因此更简洁高效,常与 Pre-Norm 一起用于现代 LLM。
    • 2026-07-14: query — 调研将本库发布为网页 Wiki 的 GitHub 方案;推荐采用 Quartz 作为独立静态站点层,保留 wiki/ 为唯一内容源并通过 GitHub Actions 部署。尚未创建或修改站点代码。
    • 2026-07-14: ingest — 资料摘要:股票基础知识教程-002-个股分时图的看盘技巧资料摘要:股票基础知识教程-013-长下影K线的实操技巧(B站 P2–P13 本地 Whisper 带时间戳转录);新建 个股分时图大盘分时图成交量大阳线出水芙蓉大阴线乌云盖顶十字星早晨之星黄昏之星T形与倒T形K线长下影K线,并更新 股票基础知识教程 为 13/68 已摄取。课程形态以位置、量能、确认与风险控制为共同边界,不作为单一交易指令。
    • 2026-07-13: ingest — 资料摘要:A100 SXM GPU 节点认识、配置与带宽测试(B站本地 Whisper 转录 + 已授权 GitHub 课件/代码)+ 新建 GPU 节点互联与分层带宽 概念页 + 节点互联与验机图;归档并解读 pinned-memory PCIe 与 HBM copy/stream-add 微基准,覆盖 SXM/PCIe/HGX/DGX、NVLink/NVSwitch 拓扑、GPU Burn 与 PCIe/NVLink/HBM 分层基准。
    • 2026-07-13: ingest — 资料摘要:An Introduction to Flow Matching and Diffusion Models(MIT 6.S184)(MIT 官方讲义,84 页)+ 新建 得分匹配(Score Matching)离散扩散模型(CTMC)VAE(变分自编码器) 三个概念页 + 统一框架图;更新 条件流匹配(CFM)DDPM 前向与反向扩散公式推导CFG(无分类器引导) 交叉引用(补齐理论根页)
    • 2026-07-10: ingest — 资料摘要:GSRM(生成式语音奖励模型) + 新建 生成式奖励模型(Generative Reward Model) 概念页 + 两阶段架构图;Meta 生成式语音奖励模型(可解释声学特征 + CoT 推理,作 Speech RLHF verifier)
    • 2026-07-09: refactor — 知识库层级重构为领域优先:`私有原始资料层,机能文件夹(概念/资料摘要/综合分析/领域页/assets)内嵌到各领域;补齐 sortspec、重写 AGENTS.md schema、预建 6 个占位领域
    • 2026-07-07: ingest — 资料摘要:Qwen2.5-Omni(阿里全模态 Thinker-Talker + TMRoPE)+ 资料摘要:Audio Flamingo 3(NVIDIA 完全开源 LALM,AF-Whisper + 按需思考);新建「音频理解」主题分组(`私有原始资料层;更新 LALM(大型音频语言模型)(sources + 理解分支两条路线)
    • 2026-07-07: ingest — 资料摘要:DashengTokenizer(小米 MiLM Plus 连续统一 tokenizer,冻结语义+声学注入)+ Excalidraw 架构图;按主题归组 Dasheng 家族(私有原始资料层;更新 神经音频编解码(RVQ)(连续统一 tokenizer 对照路线)、音频生成条件流匹配(CFM)🤖 AI/领域页/音频生成资料摘要:Dasheng AudioGen(互链潜空间基座)
    • 2026-07-07: ingest — 资料摘要:Bagpiper + Excalidraw 架构图(双向映射 + Caption-then-Process);更新 LALM(大型音频语言模型)(理解-生成一体化/语义层统一)、🤖 AI/领域页/音频生成(统一基础模型一节)
    • 2026-07-03: ingest — 资料摘要:股票基础知识教程-001-K线的构成及市场意义 + 新建 K线(蜡烛图) 概念页 + Mermaid 结构图;新增「金融/投资」领域
    • 2026-07-01: query/ingest — 从 Codex 会话整理 RL/蒸馏知识:新建 Knowledge Distillation(知识蒸馏)Policy Gradient(策略梯度)verl 三个概念页;更新 On-Policy Distillation(在策略蒸馏) 交叉引用
    • 2026-07-01: ingest — 资料摘要:On-Policy Distillation + 新建 On-Policy Distillation(在策略蒸馏) 概念页 + Excalidraw 对比图;更新 SFT(监督微调)分布匹配蒸馏(DMD)DiffRO(可微奖励优化)GRPO(组相对策略优化) 交叉引用
    • 2026-07-01: query — 基于 MAR 论文讨论,新建 DDPM 前向与反向扩散公式推导 概念页(前向重参数化 + 反向贝叶斯推导 + 与流匹配对比);更新 资料摘要:MAR(新增相关链接)
    • 2026-06-30: ingest — 资料摘要:ControlAudio + 架构图,首个统一时间控制+可懂语音 TTA,ACL 2026 Main;更新 DiT(Diffusion Transformer)音频生成🤖 AI/领域页/音频生成
    • 2026-06-29: ingest — 资料摘要:GIVT + 资料摘要:MAR + 资料摘要:DiTAR,连续值自回归三条技术路线(GMM/扩散/流匹配)从视觉到音频;更新 CALM(连续自回归语言建模)(history+sources+交叉引用)、Diffusion Autoregressive 架构(修复 DiTAR 混同,补 CALM 列对比)
    • 2026-06-29: ingest — 资料摘要:UniMoE-Audio + 架构图(Dynamic-Capacity MoE)+ 更新 MoE(混合专家) + 更新 音频生成(统一框架趋势)
    • 2026-06-29: ingest — 资料摘要:AudioCALM + 新建 CALM(连续自回归语言建模) 概念页 + 架构图 + 更新音频生成领域页/概念页
    • 2026-06-16: query — 判断 MusicGen / AudioGen 架构归类
    • 2026-06-15: 摄取 AudioX-Turbo + 新建 分布匹配蒸馏(DMD) 概念页 + 架构图;按主题归组 AudioX 资料
    • 2026-06-05: 摄取 MOSS-Audio-Tokenizer + MOSS-TTS + 新建 LALM(大型音频语言模型) 概念页 + 2 张架构图
    • 2026-06-05: 摄取 Dasheng AudioGen + MCLP + 新建 GRPO(组相对策略优化) 概念页 + 2 张架构图
    • 2026-06-05: 摄取 Stable Audio 3 + 新建 对抗后训练(Adversarial Post-Training) 概念页 + 架构图
    • 2026-06-04: 摄取 MOSS-SoundEffect v2 + 架构图
    • 2026-05-26: 摄取 GenAU + 架构图;全库巡检修复 3 处死链 + 统一 TTS→语音合成标签
    • 2026-05-25: 批量摄取奠基性音频生成论文(MusicGen/AudioLDM/Tango/DiffRhythm)
    • 2026-05-21: 从 Maxwell-Mou-wiki 迁移 VoxCPM 全套资料
    • 2026-05-17: 摄取 B 站视频《上帝视角拆解三年 LLM 架构演进》+ 新建 RoPE/RMSNorm 概念页 + 综合分析页
    • 2026-05-09: 新增 DiT 论文全景 + 原始 DiT 论文摄取;巡检修复 + 新建 DiT/PPO/SFT 概念页
    • 2026-05-08: 通用音频生成 10 篇论文批量摄取(AudioX/Fugatto/Siren 等)
    • 2026-05-04: CosyVoice 1/2/3 三篇论文批量摄取;批量导入 11 篇大模型关键论文(LLaMA → GPT-4o)
    • 2026-05-03: ingest InstructGPT 论文