跳转到内容

输入关键词开始搜索

    知识库

    论文与非论文文章分开浏览,再按领域、标签和阅读状态定位下一条学习线索。

    365个可搜索页面

    显示 365 个页面

    001🤖 AI · 论文摘要 · 2026-09-14资料摘要:Audio-ZeroAudio-Zero 把无标注对比音频改造成“多数人听参考音频、一人听细微变体”的找卧底游戏,让同一个大型音频语言模型交替生成听觉线索和判断异常听者,再以程序预先知道的角色身份构造可验证奖励,用 GRPO 联合提升细粒度感知与推理。002🤖 AI · concept · 2026-09-11音频理解基准用带 audio evidence 的任务,分层测量模型能否感知声音、提取信息、调用知识并完成可靠推理。003🤖 AI · concept · 2026-09-11GRPO(组相对策略优化)一种去掉 Critic(价值网络)的 PPO 变体:对同一提示采样一组输出,用组内奖励的相对分数(归一化)作为优势估计,省去与策略同等大小的价值模型,大幅降低 RL 对齐成本。004🤖 AI · concept · 2026-09-11LALM(大型音频语言模型)把音频(语音/声音/音乐)离散化或表示为 token 序列、用自回归语言模型统一建模理解与生成的大模型;将「文本 tokenizer + LLM」范式迁移到音频,使压缩、理解、生成、上下文学习在单一序列建模框架内涌现。005🤖 AI · concept · 2026-09-08MoE(混合专家)一种神经网络架构模式,将模型参数划分为多个"专家"子网络,每个输入 token 仅激活其中少数几个专家,从而以较低的推理计算量获得巨大的总参数量。006🤖 AI · topic · 2026-09-08音频生成通用音频生成领域 31 篇有影响力论文与 1 篇作者深度解读的汇总导航,覆盖 2023–2026 奠基性工作到最新进展。007🤖 AI · 论文摘要 · 2026-09-08资料摘要:SonicWeave快手 Kling、香港中文大学与清华大学提出的 2B 统一音频场景生成模型。SonicWeave 用同一组权重生成语音、歌声、音乐、音效及其混合场景;核心 CPE-MoE 不再逐 token 独立选专家,而让连续声学 chunk 共享路由,并用门控在“结构化文本 + diffusion phase”的全局 prior 与当前声学状态的局部 evidence 008🤖 AI · concept · 2026-08-17流式语音合成在文本尚未全部到达时增量生成并播放语音,使输入、模型推理与音频输出形成连续流水线的 TTS 技术。009🤖 AI · concept · 2026-08-17CTC(连接时序分类)一种对所有合法单调对齐路径求和、无需帧级边界即可训练序列标注模型的最大似然方法。010🤖 AI · concept · 2026-08-17Zipformer一种面向语音序列的高效 encoder:用多尺度 U-Net-like 时间分辨率、卷积局部建模、跨模块 attention weight reuse 与 bypass 连接,兼顾长程依赖、局部声学结构和计算效率。011🤖 AI · 论文摘要 · 2026-08-17资料摘要:可控语音合成系统综述这篇 EMNLP 2025 系统综述从控制属性、模型架构、控制条件、声学表示、数据与评测六个维度梳理 LLM 时代的可控语音合成。它最有价值的结论不是列模型,而是把“控制什么、条件如何进入、表示能否解耦、评测能否验证”串成一条设计链。012🤖 AI · 论文摘要 · 2026-08-17资料摘要:离散音频 Token 综述与基准这篇 TMLR 2025 工作同时是 taxonomy、统一实验与设计诊断:它把离散音频 tokenizer 按量化、encoder/decoder、训练目标、streamability 和数据域拆解,并在重建、下游任务、spoken LM、TTS 与 text-to-audio 上复核“重建最好不等于最适合语言建模”。013🤖 AI · 论文摘要 · 2026-08-17资料摘要:CTC-TTSCTC-TTS 不以扩大基座模型为主,而是把双流式 TTS 的关键问题定位为“如何得到轻量、单调、可复用的文本—语音结构对齐”。它用 CTC Viterbi 路径替换传统 MFA,再以 bi-word 单元交织音素与单码本语音 token,并提供质量优先的 L 版与延迟优先的 F 版。014🤖 AI · 论文摘要 · 2026-08-17资料摘要:DiTTo-TTSDiTTo-TTS 用冻结的预训练文本 encoder、10.76 Hz Mel-VAE latent 和带 cross-attention 的 Diffusion Transformer 做 zero-shot TTS;它取消音素与音素级时长,但保留一个独立的句级 Speech Length Predictor 来决定要生成多少语音 latent。015🤖 AI · 论文摘要 · 2026-08-17资料摘要:E2 TTSE2 TTS 把 zero-shot TTS 写成 mel-spectrogram infilling:文本保留字符序列,末尾追加 filler token 直到与 mel 帧数相同,再让一个带 U-Net 式长跳连的 Transformer 在条件流匹配中同时学习内容、对齐与声学生成。016🤖 AI · 论文摘要 · 2026-08-17资料摘要:E3 TTSE3 TTS 是早期的端到端 waveform diffusion TTS:English BERT 提供 subword 条件,1D U-Net 在降采样后的低分辨率层通过 cross-attention 动态学习文本—语音对齐,然后用 1000 步 DDPM 直接生成 24 kHz waveform。017🤖 AI · 论文摘要 · 2026-08-17资料摘要:EmiliaEmilia 是一套从互联网视频、播客等 in-the-wild 音频自动构建多语语音生成数据的管线与约 10.2 万小时数据集。其价值不仅是规模,还在于把人声分离、说话人切分、VAD、Whisper 转写与质量过滤组合成可复用流水线,并用 AR/NAR TTS 对比验证数据效用。018🤖 AI · 论文摘要 · 2026-08-17资料摘要:F5-TTSF5-TTS 是一个基于条件流匹配与 Diffusion Transformer 的非自回归、无显式音素时长预测 TTS。它把参考语音区域作为已知上下文、目标区域作为待补全 mel,以字符/拼音序列加 filler token 提供文本条件,并用 Sway Sampling 在不重训的情况下改善少步 ODE 采样。019🤖 AI · 论文摘要 · 2026-08-17资料摘要:LLMVoXLLMVoX 是一个约 30M 参数、与上游文本 LLM 解耦的自回归流式 TTS 模块。它把任意 LLM 的增量文本通过 ByT5 字节 embedding 与 WavTokenizer 单码本语音 token 接到轻量 Transformer,并用双队列、双 TTS 副本的调度掩盖长文本生成等待。020🤖 AI · 论文摘要 · 2026-08-17资料摘要:MegaTTS 3(S-DiT)这篇工作早期以 S-DiT 称呼骨干,最新 arXiv v4 已将系统正式命名为 MegaTTS 3:它先从 forced alignment 中为每个音素只保留一个稀疏时间锚点,再让 LLaMA-style latent DiT 用 attention 补出细粒度对齐,以此折中显式时长的稳定性与隐式对齐的韵律自由度。021🤖 AI · 论文摘要 · 2026-08-17资料摘要:MoshiMoshi 是 Kyutai 的 7B 级 speech-text foundation model:它以 Helium 文本 LLM 为 Temporal Transformer,用 Mimi 把双路 24 kHz 音频压成 12.5 Hz 的语义—声学 token,再由 Depth Transformer 在每个时间步展开多码本,配合 Inner Mon022🤖 AI · 论文摘要 · 2026-08-17资料摘要:SimpleSpeechSimpleSpeech 用 Whisper 为无标注语音生成伪转写,ByT5 与 XLSR-53 提供内容/音色条件,SQ-Codec 把 waveform 压成有限标量 latent;再以句级总时长决定噪声序列长度,把全部条件当作 GPT-like diffusion Transformer 的 prefix,隐式学习字词到语音 latent 的对齐。023🤖 AI · 论文摘要 · 2026-08-17资料摘要:SpeakStreamSpeakStream 通过训练期词级对齐,把文本词块与对应的离散 mel(dMel)语音块交织进一个 decoder-only TTS 序列;推理时无需强制对齐器,并以可调的窗口 $m$ 与步长 $n$ 在文本 lookahead、自然度和响应速度间取舍。024🤖 AI · 论文摘要 · 2026-08-17资料摘要:WavTokenizerWavTokenizer 是面向 audio language modeling 的低帧率单码本神经 codec:在 24 kHz 音频上以 40 或 75 token/s、4096 大小码本编码语音/音乐/通用音频,并用更强 decoder 与判别器把极低码率下的感知质量推高。它强调“少 token、单序列”,但后续统一基准表明重建感知分、内容可辨性和下游025🤖 AI · 论文摘要 · 2026-08-17资料摘要:AlignDiTAlignDiT 是一个 multimodal-to-speech 框架:文本约束内容,静音视频约束唇动时序,参考语音约束说话人音色;它保留 audio-video 的逐帧对齐,用 cross-attention 注入只具单调对齐关系的文本,并以 CFM、CTC 和模态独立 CFG scale 分别承担声学生成、语言对齐与推理期条件平衡。026🤖 AI · 论文摘要 · 2026-08-17资料摘要:Connectionist Temporal ClassificationGraves 等人在 ICML 2006 提出 CTC:不要求输入帧与目标标签的逐帧对齐,而是在“标签 + blank”构成的全部单调路径上边缘化,用 forward-backward 动态规划直接最大化正确标签序列的概率。027🤖 AI · 文章摘要 · 2026-08-17资料摘要:LLM-based TTS 四年全景(2023–2026)瑶光守护者以 CTC-TTS 为切入点,把 2023–2026 年 LLM-based TTS 整理为 Codec LM、非自回归生成、统一语音 LLM、流式/双流式四条路线,并横向讨论对齐、tokenizer、交织序列、低延迟、评测、开放问题与合规风险。它最适合作为“技术地图”,不适合作为跨论文数字的最终证据表。028🤖 AI · 论文摘要 · 2026-08-17资料摘要:ZipVoice小米提出的 123M 参数零样本 TTS:用两个 分别编码文本、估计 向量场,以无参数 Average Upsampling 给出粗帧级文本条件,再把带 的教师轨迹蒸馏为 4 NFE、单分支推理的 ZipVoice-Distill。029🤖 AI · comparison · 2026-08-17无音素级时长 TTS 的文本—语音对齐机制对比七篇工作真正的分水岭不是“用不用 duration”,而是如何先决定长语音序列的总长度,再把短文本序列放到这条时间轴上:前缀 filler、均匀展开、句级长度 + attention、固定窗口,或从 forced alignment 稀疏化出锚点。030🤖 AI · 论文摘要 · 2026-08-16资料摘要:Confucius4-TTSConfucius4-TTS 是面向 14 种语言的跨语 zero-shot TTS。核心工程选择是把参考音频的音色压成可学习 speaker embedding,使 reference mode 不需要参考转写;同时保留带转写和语义前缀的 continuation mode,以更高输入成本换更强音色相似度。031🤖 AI · 论文摘要 · 2026-08-16资料摘要:CtrlSpeechCtrlSpeech 在 DiTAR 连续 latent AR 主干上加入两级控制:说话人 embedding 与 prompt audio 提供粗粒度音色,phone-aligned 的基频、响度和时长 token 提供局部韵律;用户可在一次生成后修改特定词或音素的韵律再重合成。032🤖 AI · 论文摘要 · 2026-08-16资料摘要:CuteTTSCuteTTS 是约 2.3 亿参数的流式连续潜变量自回归 TTS:它把 24 kHz 语音压成 12.5 Hz、64 维连续 latent,再把相邻两帧组成 patch,由因果 LM 负责跨 patch 历史、局部 flow-matching diffusion head 负责 patch 内生成;guidance-step distillation 将双033🤖 AI · 论文摘要 · 2026-08-16资料摘要:Never Stop Speaking这篇安全论文展示一种针对端到端 speech LLM 的白盒拒绝服务攻击:在原语音的有声区加入受限微扰,联合压低 EOS、鼓励达到最大输出长度并保持语义相近,使模型在正常回答后生成大量低能量静音片段,持续占用自回归解码与 GPU 资源。034🤖 AI · 论文摘要 · 2026-08-16资料摘要:On-Policy Self-Distillation for Multi-Dialect ASR这篇论文以 Qwen3-ASR-1.7B 为底座,用 CPT→方言 SFT→On-Policy Self-Distillation 三阶段适配中文多方言:学生在自己解码出的 prefix 上训练,冻结教师额外看到参考转写作为 privileged context 并给出软目标,从而减少 teacher forcing 的训练—推理错位,并抑制方言微调覆盖普通035🤖 AI · 论文摘要 · 2026-08-16资料摘要:Phoenix TTSPhoenix TTS 用下游 flow-matching 声学重建目标反向塑造单码本语义 tokenizer:tokenizer 不只追求可识别内容,还必须让同一条件下的声学生成器能恢复高保真细节,从而缩小“语义 token 适合 LM、却不适合波形重建”的目标错位;同一 0.5B 系统还原生支持 zero-shot voice conversion。036🤖 AI · 论文摘要 · 2026-08-16资料摘要:ReLMCodecReLMCodec 把语音 token 设计目标从“量化后能否重建”前移到“量化前表征是否具有稳定音素结构”。它先用统一 P-VQ/语言模型 probe 比较 24 种 codec 与 SSL 表征,再以冻结 SSL anchor、可学习声学残差和训练期结构蒸馏构造单码本 50 TPS token。037🤖 AI · 论文摘要 · 2026-08-16资料摘要:SemBridgeSemBridge 用“训练时离散、推理时连续”的方式补足连续潜变量 AR 语音生成的语义监督:同一冻结语义 tokenizer 一方面约束声学 VAE 的 latent 几何,另一方面在 LM 中间层增加下一语义 token 的辅助预测;推理历史仍完全由连续 latent 组成。038🤖 AI · 论文摘要 · 2026-08-16资料摘要:SLT 2026 SmartGlasses ChallengeIEEE SLT 2026 SmartGlasses Challenge 建立了中文第一视角多说话人语音基准:同一四通道眼镜录音同时评估带时间戳、说话人归属的 ASR(TSA-ASR)与长音频问答(SLU),覆盖双人日常对话和 3–8 人会议;结果显示转写、说话人跟踪与声学证据推理是三个不能互相替代的能力。039🤖 AI · 论文摘要 · 2026-08-16资料摘要:VoxZipVoxZip 是面向长音频大模型的 training-free 压缩方法:先用带时间戳 ASR 文本作为语义锚点,将同一时间区间内的音频表示压成少量语义对齐 token;再用时间衰减的累计 attention 分数淘汰低价值 KV cache,分别处理输入冗余和解码期缓存增长。040🤖 AI · 论文摘要 · 2026-08-16资料摘要:X2-TurnX2-Turn 在同一 80 ms 流式帧上并行输出 ASR token 与话轮状态,把“识别内容”和“现在是否该接话”放进共享隐状态、独立 head;turn head 不回灌 ASR 解码历史,因此话轮误判不会直接污染文字生成。041🤖 AI · synthesis · 2026-08-16ASR-TTS 论文周报第 015 期:连续语音生成、实时交互与长上下文[ASR/TTS 论文周报第 015 期](https://mp.weixin.qq.com/s/3f66uIFZGXt-C7UWxz7MiQ) 的 10 篇主榜论文与趋势段落中的 Never Stop Speaking 指向同一变化:语音系统不再只优化单句离线指标,而是在表示层、交互时序和长上下文资源三处同时追求“可预测、可控、可部署”。连续 latent042🤖 AI · concept · 2026-08-15条件流匹配(CFM)一种连续归一化流生成模型,通过匹配最优传输路径的向量场来学习从简单先验(高斯噪声)到数据分布(梅尔频谱)的连续变换,比扩散模型训练更快、生成步数更少。043🤖 AI · concept · 2026-08-15音频生成利用深度学习模型从文本、图像、视频等条件输入自动合成音频内容(语音、音乐、音效、环境声等)的技术,2025-2026 年正从任务专用模型走向统一基础模型。044🤖 AI · concept · 2026-08-15CFG(无分类器引导)一种无需额外分类器的条件生成引导技术:同一模型联合学习条件与无条件两种预测,推理时把二者之差外推放大,用一个引导强度 $w$ 在「文本贴合度」与「多样性」之间换挡。045🤖 AI · concept · 2026-08-15DiffusionNFT(前向过程在线扩散强化学习)一种在 flow-matching 前向训练目标中注入在线奖励的扩散模型后训练方法:用同一条件下的正负候选构造隐式改进方向,只依赖最终干净样本,不计算采样轨迹似然。046🤖 AI · concept · 2026-08-15DiT(Diffusion Transformer)用 Transformer 架构替代传统 U-Net 作为扩散模型骨干的生成式架构,在图像和音频生成中展现出更强的可扩展性和多模态条件处理能力。047🤖 AI · concept · 2026-08-15VAE(变分自编码器)用概率化编码器 $q\phi(z\mid x)$ + 解码器 $p\theta(x\mid z)$ + KL 正则把数据压进一个"好采样"的低维潜空间。它是潜空间扩散(latent diffusion)的基础——让扩散/流模型在低维潜空间训练,从而支撑高分辨率图像/视频生成。048🤖 AI · 论文摘要 · 2026-08-15资料摘要:SwanTaleByteDance 与浙江大学提出的统一多说话人语音—音频生成系统:它不仅能用参考音频做 zero-shot 声音复用,还能只凭自然语言设计说话人、表演方式、环境声场与局部音效,并在同一段波形中联合生成。技术主线是 7000 万细粒度字幕记录、48 kHz/25 Hz 连续 SwanVAE、非自回归 flow-DiT、任务级 + 帧级 Unified MoE049🤖 AI · 论文摘要 · 2026-08-15资料摘要:SwanVoiceByteDance 与浙江大学提出的 1–4 说话人长篇 zero-shot TTS 系统:它把整段对话作为一次非自回归生成任务,以 25 Hz 波形 VAE、raw-text tokenizer、speaker-turn 条件和 2B flow-matching DiT 联合建模,再用音素准确率与说话人相似度奖励做 DiffusionNFT 后训练。优势集050🤖 AI · concept · 2026-08-14离散扩散模型(CTMC)把流/扩散模型从连续空间 $\mathbb{R}^d$ 搬到离散状态空间(文本、DNA)的方法:用连续时间马尔可夫链(CTMC)替代 ODE/SDE、用速率矩阵 $Qt$ 替代向量场。训练退化为逐位置分类(交叉熵),掩码扩散语言模型(MDLM)是其代表。051🤖 AI · concept · 2026-08-14神经音频编解码(RVQ)用残差矢量量化(RVQ)把连续音频波形压成多层离散 token 的神经编解码器,是「音频语言模型」范式的前置组件——让 Transformer 能像处理文字一样自回归地生成声音。052🤖 AI · concept · 2026-08-14CALM(连续自回归语言建模)一种将自回归 next-token prediction 从离散 token 扩展到连续潜变量的生成范式:在因果 LM 的每个位置用流匹配头(flow-matching head)替代 softmax 预测 rectified-flow 速度,消除离散 codec 的量化瓶颈,保留全部 LM 工具链(流式推理、上下文条件、高效训练)。053🤖 AI · concept · 2026-08-14Self-corrective alignment(自校正对齐)在 flow time 内用当前 DiT 的一次 detached CFG Euler rollout 构造偏轨状态,再以指向 clean endpoint 的速度做辅助回归。054🤖 AI · 论文摘要 · 2026-08-14资料摘要:AudioLDM萨里大学与帝国理工学院提出的文本到音频(TTA)生成模型:用 CLAP 对齐条件模态,在 VAE 的连续 mel latent 中训练扩散模型,并首次在 TTA 系统中统一展示多种零样本文本引导音频操作,ICML 2023。055🤖 AI · 论文摘要 · 2026-08-14资料摘要:DeepSeek-V2DeepSeek 推出的 236B MoE 模型(激活 21B),引入 Multi-head Latent Attention (MLA) 和 DeepSeekMoE 两大架构创新,KV 缓存减少 93.3%,训练成本降低 42.5%,引发中国大模型价格战。056🤖 AI · 论文摘要 · 2026-08-14资料摘要:DiTPeebles & Xie (UC Berkeley/NYU) 提出 Diffusion Transformer —— 用 ViT 架构替代 U-Net 作为扩散模型骨干,在 ImageNet 上实现 SOTA,并确立了 DiT 作为后续 Sora、SD3、FLUX 等工作的基石。ICCV 2023。057🤖 AI · 论文摘要 · 2026-08-14资料摘要:DiTAR首个将扩散 Transformer 头附着在语言模型隐状态上做自回归语音生成的工作——LM 负责序列建模,每个位置用扩散去噪从隐状态恢复连续语音 patch。ICML 2025,字节跳动。058🤖 AI · 论文摘要 · 2026-08-14资料摘要:DPOStanford 提出的 Direct Preference Optimization,将 RLHF 的复杂两步流程(训练 RM + PPO)简化为单一分类损失,仅需几行 PyTorch 代码即可实现对齐训练。059🤖 AI · 论文摘要 · 2026-08-14资料摘要:GIVT首次将自回归 Transformer 的输出从离散 softmax 替换为高斯混合模型(GMM)参数,直接在连续潜空间预测像素值,无需向量量化。ECCV 2024,Google Research。060🤖 AI · 论文摘要 · 2026-08-14资料摘要:InstructGPTOpenAI 提出 RLHF(Reinforcement Learning from Human Feedback)方法的开创性论文,证明了用人类反馈微调可以让 1.3B 模型在指令遵循上超越 175B 的 GPT-3。061🤖 AI · 论文摘要 · 2026-08-14资料摘要:LLaMAMeta AI 推出的开源基础语言模型系列(7B-65B),证明仅用公开数据就能训练出超越 GPT-3 175B 的模型,彻底改变了开源 LLM 生态。062🤖 AI · 论文摘要 · 2026-08-14资料摘要:MAR用扩散过程(Diffusion Loss)建模每个 token 的连续概率分布,证明自回归图像生成不需要向量量化。NeurIPS 2024 Spotlight,MIT/FAIR(Kaiming He 组)。063🤖 AI · 论文摘要 · 2026-08-14资料摘要:dots.ttsdots.tts 是一套约 20 亿参数的 continuous autoregressive TTS 系统:它直接在 AudioVAE 连续潜变量上逐 patch 生成,以 full-history AR-Flow 保留完整语音历史,并用 reward-free Self-corrective alignment 与 CFG-aware MeanFlow 064🤖 AI · 论文摘要 · 2026-08-14资料摘要:Luna-TTSVUI Labs Research 提出的 diffusion-LLM TTS 家族:从 Qwen3-0.6B 逐步转换出完全并行的 Luna-TTS 与 block-causal streaming 的 Luna-TTS Realtime,直接在 $T\times Q$ RVQ 声学 token 网格上做 masked diffusion;两者共用 25H065🤖 AI · 论文摘要 · 2026-08-12资料摘要:Qwen-Audio-3.0-Gen-PreviewAlibaba Token Foundry 的统一非自回归音频生成预览模型:把语音、音乐、音效、环境声、多角色对话及其混合场景全部映射到共享的 48 kHz stereo、25 Hz 连续 VAE 潜空间,再由单一 DiT 直接生成完整混合波形。核心不是“多任务模型会分别做很多任务”,而是用结构化时间线、角色绑定和语义条件视图,让异质声音在一条长时间轴上共同066🤖 AI · 论文摘要 · 2026-08-12资料摘要:Qwen-Audio-VAEQwen 团队为通用音频生成单独训练的连续波形 VAE:把 24 kHz mono 音频压缩成 12.5 Hz、128 维的对角高斯潜序列,在约 500 万小时跨语音、音乐和音效数据上联合优化重建、频谱、对抗、特征匹配与 KL 损失。报告的关键贡献不是提出新的 VAE 数学形式,而是在低帧率、高保真与在线编码吞吐之间做系统平衡。067🤖 AI · comparison · 2026-08-12Qwen 音频四模型对比Qwen 2026 年 7 月的音频产品线不是“一个模型的四种模式”:Music、TTS 与 General 是三套生成系统,ASR Flash 则是输入音频、输出文字的托管识别服务族;四者的任务方向、架构公开度和部署边界都不同。068📡 电子信息 · topic · 2026-08-11电子信息电子信息领域的学习入口,以信号表示、分析、传输与处理为主线,承载课程级笔记和可跨项目复用的工程基础。069🤖 AI · concept · 2026-08-11自动语音识别(ASR)将语音波形自动转写为文字,并可附带语言、时间戳、说话人和文本规范化信息的技术。070🤖 AI · 论文摘要 · 2026-08-11资料摘要:Audio Flamingo 3NVIDIA + 马里兰大学的完全开源 SOTA 大型音频语言模型(LALM):统一语音/声音/音乐三模态的理解与推理。核心创新为 AF-Whisper 统一音频编码器、按需思考(on-demand thinking)、多轮多音频对话、长音频理解(≤10 分钟)与语音-语音交互。仅用开源音频数据即在 20+ 基准上超越 Qwen2.5-Omni、Gemini071🤖 AI · 论文摘要 · 2026-08-11资料摘要:Qwen2.5-Omni阿里 Qwen 团队的端到端全模态模型(7B):单一模型同时感知文本/图像/音频/视频,并以流式方式同时生成文本与自然语音。核心创新为 Thinker-Talker 双脑架构 与 TMRoPE 时间对齐多模态位置编码,语音指令跟随能力逼近纯文本输入,2025.03。072🤖 AI · 论文摘要 · 2026-08-11资料摘要:MMAUICLR 2025 的大规模多任务音频理解与推理基准:用 10,000 个多选 AudioQA 样本,把 speech、environmental sound 与 music 放进同一套 27-skill 评测,明确区分“听见了什么、能否提取知识、能否完成推理”,并用噪声替换、caption 级联和人工错误分类检验 LALM 到底有没有在听。073🤖 AI · 文章摘要 · 2026-08-11资料摘要:低帧率高维 Token 的长时稳定 AR 音频生成探索Yi Luo 以失败实验和设计迭代为主线,解释如何把高保真音频 codec、8 Hz × 768 维连续 token、Locodec 表征塑形与 MP-ELD 多路径流匹配组合起来,在不借助外部 SSL/ASR 模型或预训练文本 LM 的前提下缓解长时自回归误差累积。074💰 金融投资 · concept · 2026-08-10成交量成交量是单位时间内已成交证券的数量,用于观察交易活跃度和多空分歧;它必须相对比较,并结合价格位置和走势解释。075💰 金融投资 · concept · 2026-08-10筹码分布图筹码分布图是课程用于估计流通盘在不同价格区间上的持仓分布、成本结构及其随时间迁移的图形工具。076💰 金融投资 · concept · 2026-08-10葛兰碧均线八大法则课程用价格与移动平均线的相对位置、均线方向和偏离程度,整理出四类买入候选与四类卖出候选。077💰 金融投资 · concept · 2026-08-10均线多头排列与空头排列股价与不同周期均线按趋势方向依次排序并向外发散的状态;课程把股价所处位置也列为定义的一部分。078💰 金融投资 · concept · 2026-08-10均线金叉与死叉短周期均线上穿较长周期均线称为金叉,下穿称为死叉;“短”和“长”取决于正在比较的两条均线。079💰 金融投资 · concept · 2026-08-10均线金三角、银三角与死三角课程用 5、10、20 日均线连续交叉后围出的不规则区域,描述底部或顶部的均线三角形态。080💰 金融投资 · concept · 2026-08-10量价关系量价关系是课程用成交量变化与价格方向的组合来解释市场参与、资金行为和趋势风险的框架;同一组合在低位、中位和高位可能有不同甚至相反的含义。081💰 金融投资 · concept · 2026-08-10双重顶双重顶是课程讲解的顶部反转突破形态:上涨后出现两个大致相近的高点,并在跌破中间低点所形成的颈线后获得确认,外形近似字母 M。082💰 金融投资 · concept · 2026-08-10通达信软件股票行情与分析软件;课程重点演示其行情、资讯、数据、公式、选股、监控、预警和定制版面入口。083💰 金融投资 · concept · 2026-08-10头肩顶与头肩底头肩顶与头肩底是课程讲解的一对反转突破形态:前者在上涨后形成并以跌破颈线确认,后者在下跌后形成并以突破颈线确认。084💰 金融投资 · concept · 2026-08-10形态理论形态理论是课程用于描述价格在一段运行后形成的几何结构,并根据结构完成后的突破方向区分反转突破形态与持续整理形态。085💰 金融投资 · concept · 2026-08-10移动平均线对最近若干交易日收盘价做滚动平均后连接形成的曲线。086💰 金融投资 · concept · 2026-08-10支撑线与压力线按本课程口径,支撑线和压力线是经过前期相对低点或相对高点画出的水平线,用来观察价格再次接近该区域时的买卖力量与角色转换。087💰 金融投资 · concept · 2026-08-10BOLL线BOLL 线(布林线)是课程用于观察价格常态波动范围、趋势强弱和波动率扩张/收缩的三轨通道;同一个触轨或突破信号必须先区分常态、趋势和开口方向。088💰 金融投资 · concept · 2026-08-10EXPMA指标EXPMA 是课程介绍的一种指数平均类趋势指标:相较简单移动平均,它提高近期价格的权重,并用两条指数平均线观察趋势、支撑压力和交叉。089💰 金融投资 · concept · 2026-08-10KDJ与SKDJ指标KDJ 与 SKDJ 都是课程讲解的随机指标:前者由 K、D、J 三条线构成,后者为较慢的两线版本;课程用它们观察超买超卖、交叉、背离、钝化和多周期位置。090💰 金融投资 · concept · 2026-08-10MACD指标MACD 是课程用于观察趋势方向、快慢线交叉、零轴位置、柱体变化和价格背离的指标;所有信号都必须结合出现位置和价格结构理解。091💰 金融投资 · topic · 2026-08-10股票基础知识教程B站 UP主「爱学习的小刚子」出品的股票基础知识系列教程。Bilibili 接口实际返回 68 个分 P,虽然标题称“全 70 讲”,但不存在可摄取的 P69/P70;从实际 P58 起,视频标题内部讲次编号比官方分页 part 大 1,知识库始终以实际 part 编号为准。本页将学习状态与知识库摄取状态分开:当前已学习 P1–P40,知识库已依据真实音频覆092💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-034-均线的分类及实操技巧(二)本讲承接 P33,在复习 5、10、20 日线后,重点展开 30、60、120、250 日均线的课程称谓与案例用法;其中“生命线”“牛熊分界线”等均为讲师的经验框架,不是数学保证。093💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-035-如何设置自己喜欢的个性化看盘软件的盘面本讲不讲新的交易形态,而是演示如何在通达信“定制版面”中,把异动监控、板块指数、沪深 A 股、自选股、K 线和分时图组合成个人看盘盘面,并保存为可再次调出的版面。094💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-036-均线金叉与死叉的含义及三金叉选股法本讲先定义均线金叉、死叉,再用中长期均线方向、重要支撑/阻力过滤“假金叉/假死叉”,最后介绍均线、均量线和 MACD 在两到三天内先后金叉的课程内“三金叉见底”框架。095💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-037-均线的多头排列与空头排列本讲把均线排列定义为“股价位置+不同周期均线顺序+发散方向”,并区分仅有短期均线多头排列的反弹,与短、中、长期均线共同多头排列的完整趋势结构。096💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-038-均线的金三角、银三角与死三角形态解析本讲用 5、10、20 日均线连续交叉形成的三角区域,区分下跌后第一次反弹形成的银三角、再次探底后形成的金三角,以及高位反向交叉形成的死三角;中长期均线方向是课程给出的关键过滤条件。097💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-039-葛兰碧均线八大法则之买入法则本讲按课程版本讲解葛兰碧均线法则的四类买入候选:趋势初转、顺势回踩、跌破后再转强和超跌反弹;讲者最终更偏向前两类,并明确提示后两类风险更高。098💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-040-葛兰碧均线八大法则之卖出法则本讲给出课程版葛兰碧四类卖出候选:均线走坏后的首次跌破、跌破后的反抽失败、超跌反弹结束,以及主升浪后价格远离均线并出现看跌组合;讲者强调最高点通常无法事先确认。099💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-041-MACD指标的含义及一般用法本讲把 MACD 拆为零轴、DIF/DEA 双线和柱体三部分,并用“先判断零轴上下与中长期趋势,再看金叉或死叉”的课程框架解释信号差异;核心提醒是,不能脱离趋势背景把每一次金叉、死叉都当作确定买卖点。100💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-042-MACD指标的顶背离与底背离用法详解本讲按课程口径用 MACD 柱体与价格方向相反来识别顶背离和底背离,并明确把红绿柱作为 DIF/DEA 双线与柱体判断不一致时的优先标准;讲师更重视顶背离的风险提示,同时反复警告底背离可能连续出现,不能把第一次底背离直接当成确定底部。101💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-043-MACD指标的经典战法(一)本讲先补充“拒绝死叉”和“拒绝金叉”两种未完成交叉,再讲两类位于零轴上方的多头延续形态:一种在即将死叉时重新张口向上,另一种先死叉调整、再在零轴附近或上方金叉;课程同时要求用零轴位置和顶背离过滤信号。102💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-044-MACD指标经典战法(二)本讲在复习零轴上方两类多头延续形态后,介绍“天鹅展翅”和“海底捞月”两种形成于零轴下方的课程战法;两者都不能只凭形态名称介入,讲师反复要求等待 DIF 上穿零轴,并把这一步作为课程所称买点出现的条件。103💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-045-成交量的含义及相关术语本讲先把成交量定义为单位时间内成交的股票数量,再依次解释成交额、换手率、放量与缩量、量比、倍量、天量与地量、堆量和均量线;课程的重点是建立后续量价关系所需词汇,并强调这些术语都要结合比较基准和所处位置理解。104💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-046-葛兰碧量价关系理论本讲先用古典量价循环图说明成交量与价格的配合,再按课程所称“葛兰碧量价关系理论”讲解九条法则;核心内容涵盖量价齐升、量价背离、急涨急跌、W 底、恐慌放量、放量破位和高位放量滞涨,同时讲师明确承认九条法则并不能完整反映市场、部分表述较片面且翻译生硬。105💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-047-量价关系详解(1):低位量价关系本讲明确把内容定位为讲师个人经验的总结,并建立“价格位置 × 价格涨平跌 × 成交量放平缩”的 27 格分析框架;本讲只处理相对低位的九种组合,重点不是给出单一信号,而是说明同一涨跌表现可能对应吸筹、反弹、利好、观望、洗盘或利空等不同解释。106💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-048-量价关系详解(2):中间位置的量价关系本讲沿用“价格涨平跌 × 成交量放平缩”的九格框架分析中间位置:温和放量上涨被课程视为较健康,平量或缩量上涨可能被解释为控盘或利好;横盘与下跌则可能对应洗盘、出货、资金撤退或踩踏,因此讲师反复强调同一量价组合存在多种原因,必须结合此前走势而不能只看一根量柱。107💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-049-量价关系详解(3):较高位置量价关系本讲把较高位置的量价变化拆成“股价上涨、走平、下跌”与“放量、平量、缩量”的九种组合,并用图例解释讲师所理解的拉高、控盘、诱多与出货过程;同一种表面组合可能对应不同动机,不能脱离位置和后续走势直接套用。108💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-050-量价关系的运用:量价背离本讲把课程中的“量价背离”收窄为较高位置股价继续上涨、成交量却逐步下降,并强调背离本身只是谨慎或预警信号;课程把后续放量跌破趋势线、形态颈线或重要支撑位作为卖出判断,但这些“破位”画法与确认规则留待后续课程。109💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-051-涨跌停制度下的量价关系本讲总结涨跌停板场景中的四组课程经验:缩量涨停或跌停的延续概率、涨跌停板反复打开时的量价含义、封板时间早晚,以及封单数量;讲师反复加入“可能”“概率较大”等限定,并专门说明无量封板、跌停开板自救等反例。110💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-052-KDJ指标的含义及运用技巧本讲介绍 KDJ 的 K、D、J 三线、超买超卖区、金叉死叉、W 底与 M 头、背离和钝化;课程一方面给出 J 值越过 100/0 的经验战法,另一方面明确说背离只是警戒信号、金叉死叉可能滞后,指标钝化时应改看其他周期或结合其他指标。111💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-053-SKDJ指标的含义及运用技巧本讲把 SKDJ 作为较慢、仅含 K/D 两线的随机指标,重点讲 20/80 区域的金叉死叉、短线高抛低吸、多周期共振和筑底识别;讲师认为其信号比 KDJ 提前一到两天,但关于“历史大顶/大底”和短线准确性的强判断没有回测支持。112💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-054-BOLL线技术指标的含义及运用技巧本讲把 BOLL 线介绍为由上轨、中轨、下轨组成的价格通道,并以课程默认参数 20 将中轨对应到 20 日均线;讲师主要从股价相对轨道的位置、三轨方向和带宽变化解释强弱、趋势、支撑压力与极端波动,但这些均是课程中的图表判读框架,不构成无条件买卖规则。113💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-055-BOLL线指标的两种特殊状态:开口与缩口本讲用布林带由窄变宽和由宽变窄分别定义“开口”与“缩口”:开口对应波动加剧,方向可能向上也可能向下;缩口对应波动收敛与整理,之后仍需等待再次开口来观察方向。讲师以低位、高位案例说明可能的机会与风险,但没有给出带宽阈值、确认周期或可复现统计结果。114💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-056-BOLL线指标重要的买卖信号本讲把 BOLL 线信号按“常态”与“非常态”分开:带宽大体稳定时,课程讨论触及或越过上下轨以及穿越中轨的含义;带宽由窄转宽时,则要求结合开口方向、中轨斜率和其他条件重新解释突破。核心限定是,同样的上轨突破或中轨跌破,在不同带宽状态和中轨方向下可能得到相反的课程判断。115💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-057-EXPMA指标的含义及运用技巧本讲把 EXPMA 介绍为提高近期价格权重的双线移动平均指标,并以课程软件中的白线、黄线及其金叉死叉讲解多空排列、超跌后的突破、主升阶段回调和下跌反弹。讲师给出的突破、低吸和高抛方法均是图例化经验:超买超跌、有效突破、回踩幅度和线条方向没有量化,突破次数与后续走势也没有统计验证。116💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-058-筹码分布图的含义及两维度选股策略本讲先把筹码分布图解释为流通股票在不同价格区间的持仓分布,再讲解特定行情软件中的时间分层、获利比例、获利盘、平均成本、90%/70%区间和成本集中度。课程随后把“价格区间是否集中”与“持有人是否集中”分成两个维度进行选股;重要边界是,图形上的单峰密集只说明成本区间较窄,不能单独证明筹码集中在少数人或所谓庄家手中。117💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-059-筹码分布图中筹码的移动规律(1)本讲通过同一只股票在不同时间点的筹码图,归纳课程所称的移动循环:低位吸筹时筹码集中,拉升时逐渐发散,高位出货时再次形成价格区间集中,破位下跌后又在多个价位发散。讲师用“庄家—散户”的叙事解释这些图形,但筹码图本身不能验证资金身份和交易动机;本讲最后只列出单峰、双峰、多峰密集与筹码发散四种状态,具体用法留到后续课程。118💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-060-筹码分布图的四种特殊状态详解(1)本讲在四种筹码状态中只展开单峰密集,把它按相对低位、较高位置和中间整理情形分别讨论。课程将低位单峰上沿视为压力,讲解放量或重大利好下的跳空突破及缩量回踩;对涨幅较大后的高位单峰,则提示出货、假突破和跌破下沿风险。同时讲师承认高位或中间位置的单峰也可能是调仓、换手或整理,单靠峰形不能唯一判断后续方向。119💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-061-筹码分布图的四种特殊状态详解(2)本讲先回顾低位与高位单峰密集,再把双峰密集、多峰密集和筹码分散解释为向单峰密集演变的过渡状态。课程分别用上下筹码峰的形成先后、峰谷填充和筹码在不同价位的迁移,讨论压力、支撑及后续突破;其中“主力出货”“筹码清理”等属于讲师对图例的经验归因,不能仅凭筹码图验证资金身份或动机。120💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-062-筹码分布图在实操中的运用本讲先用筹码分布图推测持仓结构、主力成本、支撑压力、坐庄阶段及顶部底部,再集中讲三种课程实操:低位单峰突破或回踩、所谓“下峰锁定,行情未尽”及其例外、高位密集区下沿的放量跌破。课程多次把筹码变化归因于主力吸筹、洗盘、拉升和出货,这些属于讲师的图例经验,不能仅凭筹码图确认真实资金身份和交易动机。121💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-063-支撑线与压力线的画法及有效性确认方法本讲采用课程自己的命名口径:压力线是从前一相对高点画出的水平线,支撑线是从前一相对低点画出的水平线;趋势线、均线、布林线和黄金分割位虽然可能产生支撑或压力作用,但不被本讲归入这种水平线画法。课程再用停留时间、成交量、触及次数和时间远近判断线的作用强弱,所有判断均为经验标准,未给出量化阈值。122💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-064-支撑线与压力线的运用技巧本讲把支撑线与压力线用于条件式买卖:先以停留时间、成交量、形态和重复触及判断线是否有效,再在有效支撑附近考虑低吸、有效压力附近考虑锁定收益;若支撑被跌破则考虑止损,若压力被放量突破则转为突破买入候选。课程最后强调支撑与压力可能相互转换,但没有给出任何持续时间、量能、突破幅度或止损比例的量化标准。123💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-065-形态理论的概述本讲用“形态完成前后,价格运动方向是否改变”作为课程的总分类抓手:方向由涨转跌或由跌转涨的归入反转突破形态,原上涨或下跌方向在整理后延续的归入持续整理形态。讲师以头肩、双重顶底、圆弧、喇叭、V 形、矩形、旗形、三角形和楔形作方向示意,但没有在本讲展开各形态的确认条件或交易规则。124💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-066-反转突破形态之一:头肩顶形态本讲把头肩顶作为由上涨转为下跌的反转突破形态,讲解头部、左右肩和颈线的构成、颈线的支撑压力转换、常见成交量差异、失败形态与课程版测量跌幅。讲师同时给出较强的操作口径:雏形伴随背离且仓位较重时可考虑减仓,跌破颈线且反抽未能站回后则主张离场;这些属于课程经验策略,并非经本讲统计验证的普遍规律。125💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-067-反转突破形态之二:头肩底形态本讲把头肩底视为头肩顶倒置后的由跌转涨形态,讲解头部、左右肩、颈线、成交量、突破与回踩,并区分激进和稳健两类课程入场方案:前者考虑在放量突破颈线时进场,后者等待缩量回踩不破颈线。若价格重新回到颈线下方,讲师把它视为失败形态并建议止损;这些是课程策略,所需阈值、胜率和适用范围并未量化。126💰 金融投资 · 视频摘要 · 2026-08-10资料摘要:股票基础知识教程-068-反转突破形态之三:双重顶形态本讲把双重顶(M 头)定义为由上涨转为下跌的反转突破形态,讲解左右峰、颈线、支撑压力转换、成交量差异和课程版测量跌幅。重点难点是形态确立前仍可能演变成多重顶或向上突破后的矩形整理,因此讲师要求先等待颈线破位,并把跌破颈线、尤其以中大阴线破位视为考虑离场的信号;这些属于课程经验判断,未提供量化确认或回测。127🤖 AI · 论文摘要 · 2026-08-10资料摘要:ControlAudio清华+生数科技提出渐进扩散建模方法,首次在统一框架内实现文本引导 + 精确时间控制 + 可懂语音的音频生成,ACL 2026 Main。128基础设施 · topic · 2026-08-10Wiki 目录本页面由 LLM 在每次操作后自动维护。知识库采用领域优先结构:顶层按学习领域组织,每个领域自带 概念/资料摘要/综合分析/领域页。129💰 金融投资 · concept · 2026-08-06单针探底与双针探底单针探底和双针探底都强调下跌后长下影线对下方承接的体现;双针两次下探的低点越接近,课程认为支撑参考意义越强,但二者都只是概率信号。130💰 金融投资 · concept · 2026-08-06个股分时图展示单只股票日内价格、分时均价和分钟成交量的图表。131💰 金融投资 · concept · 2026-08-06换手率换手率以成交量占流通股数的比例衡量交易活跃度,其含义受流通盘、筹码集中度和股价位置影响:低位高换手可能提示资金介入,高位连续高换手且滞涨则要警惕派发。132💰 金融投资 · concept · 2026-08-06假阴线与假阳线假阴线和假阳线揭示“K线颜色”与相对前收盘的真实涨跌可能相反,实操必须比较前收盘、缺口、位置、量能及次日确认。133💰 金融投资 · concept · 2026-08-06看跌抱线看跌抱线是在高位或下跌整理末端,由放量中大阴线高开低走并完全包住左侧小K线的空方反攻形态,但仍需辨别出货与洗盘。134💰 金融投资 · concept · 2026-08-06看跌孕线看跌孕线是高位中大阳线之后出现被其孕育的小K线的潜在转弱形态,信号弱于看跌抱线,需结合后续走势判断洗盘还是隐蔽出货。135💰 金融投资 · concept · 2026-08-06看涨抱线看涨抱线是在下跌末端或整理末端,由右侧放量中大阳线低开高走并完全包住左侧小K线的多方反攻形态。136💰 金融投资 · concept · 2026-08-06看涨孕线看涨孕线是在下跌过程中由中大阴线和其范围内的小K线构成的潜在止跌形态,信号弱于看涨抱线,需第三或第四根K线确认。137💰 金融投资 · concept · 2026-08-06量比量比把当日开盘后平均每分钟成交量与过去五个交易日平均每分钟成交量比较,用于观察相对活跃度,但不能与放量缩量画等号,也可能被高位对倒放大。138💰 金融投资 · concept · 2026-08-06平头底平头底是两根K线最低价几乎相同的潜在底部形态;普通版本信号较弱,前阴后阳、两线高低点近似且位于重要支撑附近时更有参考意义。139💰 金融投资 · concept · 2026-08-06射击之星射击之星是高位、上涨趋势后出现的跳空长上影小实体形态,需由次日继续下跌确认;低位相似形态更可能是洗盘而非标准射击之星。140💰 金融投资 · concept · 2026-08-06外盘与内盘外盘记录主动买入、内盘记录主动卖出,但涨跌停机制和主力对倒会让常规大小关系失真,必须结合位置、量价和分时判断。141💰 金融投资 · concept · 2026-08-06委托买卖档、委差与委比委托买卖档、委差和委比描述尚未成交的挂单力量,但极易被大单挂撤操纵,课程最终把它们定位为低权重参考而非交易依据。142💰 金融投资 · concept · 2026-08-06旭日东升旭日东升是在连续下跌后,中大阴线次日由跳空高开的中大阳线强势反包,且阳线收盘高于前阴开盘的底部反转组合。143💰 金融投资 · concept · 2026-08-06一字板一字板是开高收低四价相同的极端封板状态,实操重点不是封板时追买,而是开板后结合空间、题材、筹码、板块与市场环境判断。144💰 金融投资 · concept · 2026-08-06长上影K线长上影K线记录了多方冲高后被空方压回的过程,其意义由位置、成交量和后续能否突破上影高点共同决定。145💰 金融投资 · concept · 2026-08-06涨跌幅当前价格相对前一交易日收盘价的百分比变化,是描述当日价格变动的盘口数据。146💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-005-大阳线的实操价值本讲以实体涨幅超过 7% 作为课程内大阳线定义,讨论其在起涨、高位和深跌后出现时的不同含义。147💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-007-大阴线出现后的应对策略本讲以实体跌幅超过 7% 的阴线为大阴线,强调高位大阴线与深跌后的大阴线要在不同风险框架下处理。148💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-014-经典K线形态“单针探底”与“双针探底”本页依据 P14 的真实音频转录整理;自动转录中的“单针探紧/双针探理/骨架/看长/多发/空发”等音近错词,已按语境校正为“单针探底/双针探底/股价/看涨/多方/空方”。149💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-015-长上影K线的形成原因及对后市操作的指示意义本页依据 P15 的真实音频转录整理;自动转录中的“股价/庄家/射击之星/假阴假阳”等明显音近错词已按上下文校正。150💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-016-经典K线形态“射击之星”本页依据 P16 的真实音频转录整理;自动转录中的“股价/庄家/射击之星/假阴假阳”等明显音近错词已按上下文校正。151💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-017-“一字板”K线的形成原因及操作策略本页依据 P17 的真实音频转录整理;自动转录中的“股价/庄家/射击之星/假阴假阳”等明显音近错词已按上下文校正。152💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-018-“假阴线”与“假阳线”的操作策略本页依据 P18 的真实音频转录整理;自动转录中的“股价/庄家/射击之星/假阴假阳”等明显音近错词已按上下文校正。153💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-019-经典的底部看涨K线组合:平头底形态本页依据 P19 的真实音频转录整理;“平度底/频道底/看长/低停板/长停板/阳线尸体”等音近错词,已按语境校正为“平头底/看涨/跌停板/涨停板/阳线实体”。154💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-020-经典的底部看涨K线组合:旭日东升本页依据 P20 的真实音频转录整理;“虚日东升/高开高阻/蚝油反攻/蜀光出现”等音近错词,已按语境校正为“旭日东升/高开高走/好友反攻/曙光初现”。155💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-021-经典K线组合:看涨抱线本页依据 P21 的真实音频转录整理;“报线/暴线/十字心/低开高阻/越K线”等音近错词,已按语境校正为“抱线/十字星/低开高走/月K线”。156💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-022-经典K线组合“看跌抱线”的实操技巧本页依据 P22 的真实音频转录整理;“孕线、抱线、股价、庄家、成交量”等自动转录音近错词已按上下文校正。157💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-023-看涨孕线的实操技巧本页依据 P23 的真实音频转录整理;“孕线、抱线、股价、庄家、成交量”等自动转录音近错词已按上下文校正。158💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-024-看跌孕线往往是庄家出货的一种手法本页依据 P24 的真实音频转录整理;“运线/抱现/阳运阴/阳运星/顶背铃/死差”等音近错词,已按语境校正为“孕线/抱线/阳孕阴/阳孕星/顶背离/死叉”。159💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-025-重要的盘口数据解读:委托买卖档、委差、委比本页依据 P25 的真实音频转录整理;“委托买卖党/买卖五打/伪差/伪比/分尸图/拉伸/下退”等音近错词,已按语境校正为“委托买卖档/买卖五档/委差/委比/分时图/拉升/吓退”。160💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-026-重要盘口数据解读:外盘与内盘本页依据 P26 的真实音频转录整理;“盘购语言/委托买卖党/端架/充满/对导/分支出走势”等音近错词,已按语境校正为“盘口语言/委托买卖档/庄家/筹码/对倒/分时图走势”。涨跌停段落中的口误按同段定义及前后文校正。161💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-027-重要的盘口数据解读:量比本页依据 P27 的真实音频转录整理;“算量/发量/攀购语言/尾比尾差/分成组走势/对导”等音近错词,已按语境校正为“缩量/放量/盘口语言/委比委差/分时图走势/对倒”。162💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-028-重要盘口数据解读:换手率本页依据 P28 的真实音频转录整理;“各位估计/失踪/流通板/牛通盘/次性股/强光股/强装股/专家/底部发展的股票/关键性/发量”等音近错词,已按语境校正为“各位股民/实战/流通盘/流通盘/次新股/强庄股/强庄股/庄家/底部放量的股票/关联性/放量”。163💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-029-重要盘口数据解读:涨幅本讲先解释涨跌幅的计算与显示,再用案例说明价格最小变动单位造成的非整数涨停幅度,最后讨论讲师所称的无量封板、尾盘急拉和尾盘急跌等“盘口陷阱”。这些形态判断均带有位置与概率限定,不能仅凭涨跌幅下结论。164💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-030-通达信软件的运用技巧本讲是一节通达信功能导览:先展示行情、市场、资讯、数据和发现等入口,再介绍快捷键、个性化界面、公式与选股、画线、监控和条件预警。它说明“功能在哪里”,不等于这些功能或筛选条件本身具有交易有效性。165💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-031-大盘分时图的看盘技巧本讲用白线、黄线、中部红绿柱和下方成交量柱解释大盘分时图,并重点借白黄线相对位置观察权重股与中小盘股谁在主导指数。后半段的开盘形态判断是讲师的概率性经验,课程反复强调“仅供参考”。166💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-032-个股分时图的看盘技巧本讲解释个股分时白线为何可能看不到一分钟内的最高/最低成交,并重点讲黄线均价所代表的日内平均成本,以及讲师对支撑、阻力和交易者心理的经验性解读。167💰 金融投资 · 视频摘要 · 2026-08-06资料摘要:股票基础知识教程-033-均线的分类及实操技巧(一)本讲从移动平均线的计算与“移动”机制出发,介绍常见周期及短中长期分类,随后只展开 5 日、10 日和 20 日均线。30、60、120、250 日均线在本讲仅出现名称,没有讲具体实操。168🤖 AI · concept · 2026-08-06分布匹配蒸馏(DMD)用教师 score 与学生诱导分布 score 的差异来训练少步生成器,使学生分布直接匹配目标数据分布。169🤖 AI · concept · 2026-08-06富时间线音频生成(Rich-Timeline Audio)在同一条长时间轴上联合生成并混合多角色对白、持续声景、音乐和局部音效,同时控制身份、起止、重叠、顺序与跨段一致性。170🤖 AI · concept · 2026-08-06生成式奖励模型(Generative Reward Model)用「生成推理文本再给分」替代「直接回归标量」的奖励模型——先产出思维链/评判理由,再输出可解释的评分。171🤖 AI · concept · 2026-08-06CLAP(对比语言-音频预训练)音频领域的 CLIP:联合训练文本编码器与音频编码器,用对比学习把配对的音频-文本拉近到同一潜空间。在本库中它身兼三职——生成空间、训练损失与评测指标。172🤖 AI · concept · 2026-08-06LLM-as-a-Judge直接调用具有语言或多模态理解能力的大模型,按显式 rubric 对其他系统的输出做分类、打分、排序或质性评语的自动评估范式。173🤖 AI · entity · 2026-08-06Locodec–MP-ELD 语音生成系统Locodec–MP-ELD 是一套把 8 Hz × 768 维高带宽连续 token 与多路径单 token 自回归流匹配联合设计的语音生成系统:前者塑造可预测的 token 几何,后者把短时声学、长时声学和语义进度分路建模,以降低长时误差累积。174🤖 AI · 文章摘要 · 2026-08-06资料摘要:Qwen-Audio-3.0-ASR-Flash阿里云百炼于 2026-07-30 发布的新一代托管 ASR 服务族:同一产品线分成实时 Streaming、长文件 Filetrans 与短文件同步 Flash 三个端点,覆盖 30 种语言、七大中文方言群及多种地域口音,并以 prompt context 与热词强化专业术语识别。175🤖 AI · 论文摘要 · 2026-08-06资料摘要:连续值 Token 音频语言模型用连续值 token + 掩码下一 token 预测替代离散 RVQ 的量化损失,为音频语言模型提供新范式,ICML 2025。176🤖 AI · 论文摘要 · 2026-08-06资料摘要:通用听觉智能综述综述 LLM 与音频融合的最新进展:理解、生成、口语对话和视听联合,提出"通用听觉智能"路线图,2025 年 11 月。177🤖 AI · 论文摘要 · 2026-08-06资料摘要:An Introduction to Flow Matching and Diffusion Models(MIT 6.S184)MIT 6.S184《Generative AI With Stochastic Differential Equations》(2026) 官方讲义,Peter Holderrieth & Ezra Erives 著,84 页。以微分方程为统一语言,从零推导流匹配(Flow Matching)与扩散模型(Diffusion Models):把"生成"形式化178🤖 AI · 论文摘要 · 2026-08-06资料摘要:AudioCALMHKUST + 阿里通义 Fun Team 提出 CALM(Continuous Autoregressive Language Modeling) 范式——将自回归 next-token prediction 从离散 token 扩展到连续音频潜变量,以单一模型统一语音、音效和音乐生成,并在三类基准上均达到 SOTA。179🤖 AI · 论文摘要 · 2026-08-06资料摘要:BagpiperCMU + LY Corporation + NVIDIA 提出 Bagpiper——一个 8B 音频基础模型,用丰富字幕(rich caption)作为「人类认知概念」的通用语义代理,通过 600B token 预训练在物理音频信号 ⇄ 丰富字幕之间建立稳健的双向映射;微调阶段采用 caption-then-process(先字幕后处理) 工作流,将开放式180🤖 AI · 论文摘要 · 2026-08-06资料摘要:DiffRhythm西北工业大学 & 港中深提出的首个潜空间扩散全曲生成模型,10秒内生成长达 4 分 45 秒的完整歌曲(人声+伴奏),彻底绕开级联架构。181🤖 AI · 论文摘要 · 2026-08-06资料摘要:DreamAudio定制化文本到音频生成(CTTA),从少量参考样本学习个性化音频概念,同时保持通用 T2A 性能,IEEE/ACM TASLP 2026 已接收。182🤖 AI · 论文摘要 · 2026-08-06资料摘要:FugattoNVIDIA 的首个基础音频生成 Transformer 模型,支持自由文本指令和 ComposableART 组合控制,可合成前所未有的声音,ICLR 2025。183🤖 AI · 论文摘要 · 2026-08-06资料摘要:GenAU卡内基梅隆大学等提出的环境声音生成全栈方案,从数据管道(AutoReCap-XL,4700 万片段)到自动标注模型(AutoCap,CIDEr 83.2)再到 FIT-based 生成架构(GenAu,1.25B 参数),系统性地解决了环境音频生成的数据稀缺、标注质量和模型缩放三大瓶颈,arXiv 2024.06(v4 更新至 2025.04)。184🤖 AI · 论文摘要 · 2026-08-06资料摘要:Khala探索将声学 Token 语言模型扩展到高保真音乐生成的极限,使用 64 层 RVQ 和两阶段 coarse-to-fine 生成策略,2026 年 5 月。185🤖 AI · 论文摘要 · 2026-08-06资料摘要:LongCat-AudioDiT非自回归扩散 TTS,直接在波形潜空间(Wav-VAE)上建模,绕过 mel-spectrogram 实现高保真零样本语音克隆,2026 年 3 月。186🤖 AI · 论文摘要 · 2026-08-06资料摘要:MCLP(角色扮演 TTS)ICML 2026(StepFun + 中科院自动化所)针对角色扮演 TTS(RP-TTS)的「风格一致性」这一缺乏客观度量的痛点,提出 MCLP(Mean Continuation Log-Probability,平均续接对数概率)——借助预训练 大型音频语言模型(LALM)的上下文学习能力,用「以生成语音为上下文、预测真值语音 token 的平均对数概率187🤖 AI · 论文摘要 · 2026-08-06资料摘要:MOSS-Audio-Tokenizer复旦 OpenMOSS / MOSI.AI 提出的纯 Transformer、全端到端离散音频分词器,主张「音频 tokenizer 应像文本 tokenizer 一样,用同质可扩展架构从零端到端学习」。核心是 CAT(Causal Audio Tokenizer with Transformer)——CNN-free 的因果 Transformer 编码器188🤖 AI · 文章摘要 · 2026-08-06资料摘要:MOSS-SoundEffect v2复旦 OpenMOSS 团队(MOSI.AI)开源的文本到音效(TTA)模型,是 MOSS-TTS 家族的"声音设计层"。v2.0 用 DiT 扩散骨干 + Flow Matching 目标(搭配 DAC VAE 与 Qwen3 文本编码器)重构了 v1 的离散 token 自回归(MossTTSDelay)架构,面向更高保真和更自然的长音频环境声,支持中/189🤖 AI · 论文摘要 · 2026-08-06资料摘要:MusicGenMeta AI(FAIR)提出的单阶段 Transformer 语言模型音乐生成框架(NeurIPS 2023)。核心贡献是一套通用的 codebook 交错模式(interleaving patterns),把 EnCodec 产出的 $K4$ 路并行离散 token 用单个 Transformer 一次建模,彻底消除以往方法的多模型级联(分层 / 上采样190🤖 AI · 论文摘要 · 2026-08-06资料摘要:Plan-Critic发现 AR 音频生成模型中前缀 token 隐式编码全局语义,用 GAE 训练的 Plan-Critic 在推理时引导并剪枝低质量轨迹,CLAP 分数提升最高 +10 分,EACL 2026。191🤖 AI · 论文摘要 · 2026-08-06资料摘要:Qwen3-TTSQwen 团队首个成系列公开的流式 text-to-speech 模型报告:用 25Hz 单码本与 12.5Hz 多码本两种 speech tokenizer 覆盖语义容量、重建质量和首包延迟的不同取舍,再以双轨自回归 LM 统一声音克隆、Voice Design、预定义声音与细粒度指令控制。192🤖 AI · 论文摘要 · 2026-08-06资料摘要:Score-Based 音频生成综述Ge Zhu 等人全面综述扩散/Score-Based 模型在音频生成中的应用,附带开源代码库 AudioDiffuser,本领域必读综述,2025 年发表在 Foundations and Trends in Signal Processing。193🤖 AI · 论文摘要 · 2026-08-06资料摘要:SirenLM-based 文本到音频生成方法,通过反因果对齐和强化学习首次超越 Diffusion 模型,EMNLP 2025。194🤖 AI · 论文摘要 · 2026-08-06资料摘要:Stable Audio 3Stability AI 的旗舰潜空间扩散音频生成模型家族(small / medium / large),面向乐器音乐与音效的变长生成与编辑。核心由三部分构成:一个 4096× 超高压缩比的语义-声学自编码器(SAME)、一个用 + 蒸馏 + 三阶段训练的 、以及推理端 8 步 Ping-Pong 采样(无需 CFG)。在 H200 上195🤖 AI · 论文摘要 · 2026-08-06资料摘要:UniSonate首个统一语音(TTS)、音乐(TTM)、音效(TTA)三模态的 flow-matching 框架,提出 Instruction-Content Alignment 范式和 Dynamic Token Injection 机制,通过多阶段课程学习实现正迁移——联合训练反而让 WER 从 2.24% 降到 1.47%。论文来自天津大学 + 快手可灵团队 + 中科196🤖 AI · 论文摘要 · 2026-08-06资料摘要:VoxCPMVoxCPM 是清华大学 OpenBMB 推出的 Tokenizer-Free TTS 系统,通过端到端扩散自回归架构直接生成连续语音表示,绕过了离散 tokenization 的限制。VoxCPM-0.5B 发表于 ICLR 2026,后续 VoxCPM2 升级至 2B 参数、30 语言、48kHz 输出。197🤖 AI · 论文摘要 · 2026-08-06资料摘要:AudioX香港科技大学郭毅可团队提出的统一音频生成模型,单一 Diffusion Transformer 处理文本/视频/图像到音频等全部任务,ICLR 2026 接收。198🤖 AI · 论文摘要 · 2026-08-06资料摘要:Dasheng AudioGen小米 MiLM Plus + 上海交大 X-LANCE 提出的统一文本到音频框架,号称首个非自回归、专为「连贯混合音频场景」设计并评测的模型——能在同一段音频里同时生成可懂语音、音乐、音效与环境声。两大设计:① 结构化多视图字幕(把复杂声学场景拆成 6 个互补描述视图,各配专用特殊 token),提供细粒度分层监督;② 以 DashengTokenizer 199🤖 AI · 论文摘要 · 2026-08-06资料摘要:DashengTokenizer小米 MiLM Plus 提出的统一连续音频 tokenizer,一套表示同时服务理解与生成。核心是范式反转:以往做法是训练声学 tokenizer 再蒸馏冻结的语义知识(把高维语义压进低维声学模型);本文反过来——冻结一个强语义编码器,往其高维语义特征里"注入"声学信息。方法极简:语义特征 zsem 由冻结的 MiDashengLM 编码器给出,声学特征 200🤖 AI · 论文摘要 · 2026-08-06资料摘要:InstructTTSEval复旦大学 OpenMOSS 提出的中英双语表现力 TTS 基准:它不再只问“念对了吗”或“像同一个人吗”,而是用 Acoustic-Parameter Specification、Descriptive-Style Directive 和 Role-Play 三层任务,测量模型能否把具体声学属性、自然风格描述与抽象情境指令落到真实可听的音高、语速、音量、音色201🤖 AI · 论文摘要 · 2026-08-06资料摘要:Qwen-MusicQwen Team 的完整歌曲生成系统,将语义作曲与声学生成拆开:Qwen-Music-Tokenizer 把歌曲压成 25 Hz 单码本语义 token,3B Qwen-Music-LLM 用 Melody-CoT 先规划人声旋律再生成整曲 token,1.3B Qwen-Music-Render 通过 Flow-Matching DiT、Spec-VAE202🤖 AI · 论文摘要 · 2026-08-06资料摘要:Tango 2Tango 的直系升级:架构不变(仍是 Flan-T5 + LDM),在合成偏好数据集 Audio-alpaca 上用 DPO-diffusion 微调,让模型从"好/坏音频对比"中学习,显著提升与文本提示的语义对齐和多事件时序正确性。ACM MM 2024。203🤖 AI · 论文摘要 · 2026-08-06资料摘要:Tango新加坡科技设计大学等提出的 TTA 模型,首次以指令微调 LLM(Flan-T5)作文本编码器,用 AudioLDM 63 分之 1 的数据量实现反超。204🤖 AI · 论文摘要 · 2026-08-06资料摘要:TangoFluxTango 系列的第三代,换掉扩散生成范式:改用 Rectified Flow(Flow Matching)+ MMDiT/DiT 主干,仅 515M 参数即可在 A40 上 3.7s 生成 30s/44.1kHz 音频。提出在线偏好优化 CRPO(CLAP-Ranked Preference Optimization),迭代生成偏好数据对齐 rectifi205🤖 AI · 论文摘要 · 2026-08-06资料摘要:UniMoE-Audio哈工大 + 微信 AI 提出 Dynamic-Capacity MoE 框架——通过 Top-P 动态路由、三类专家(路由/共享/空专家)和三阶段课程训练,首次在单一 7.1B 模型中统一语音合成与音乐生成,避免了联合训练的性能退化,在多项基准上达到 SOTA。206🤖 AI · synthesis · 2026-08-06DiT 论文全景DiT(Diffusion Transformer)自 2022 年底提出以来,已从图像生成扩散至视频、音频、语音合成等领域,并在 2024-2026 年经历了效率优化(MoE/量化/动态计算)和架构进化(MMDiT/RAE/PixelDiT)两轮浪潮,正成为扩散/流匹配模型的主流骨干。207🤖 AI · concept · 2026-08-05Agent 评估与可观测性用任务结果、执行轨迹、工具行为、安全边界、成本和人工判断,持续判断 Agent 是否可靠完成目标的工程体系。208🤖 AI · concept · 2026-08-05Agentic Workflow(智能体工作流)由代码预先规定总体路径、在局部让 LLM 做生成、判断或工具选择的多步骤系统。209🤖 AI · concept · 2026-08-05AI Agent(智能体)由模型围绕目标动态选择步骤和工具,并依据环境反馈持续行动直至完成、停止或交还人类的系统。210🤖 AI · concept · 2026-08-05LLM 工具调用(Tool Use)让模型选择并生成结构化调用,由受控运行时执行外部函数,再把结果作为观察返回模型的机制。211🤖 AI · concept · 2026-08-05ReAct(推理与行动)让语言模型交替进行任务判断、环境动作和结果观察,并用观察结果修正后续行动的 Agent 范式。212🤖 AI · 文章摘要 · 2026-08-05资料摘要:A Practical Guide to Building AgentsOpenAI 面向产品与工程团队的实用指南,从“什么时候值得构建 Agent”进入 model、tools、instructions、single/multi-agent orchestration、guardrails 和 human intervention。213🤖 AI · 视频摘要 · 2026-08-05资料摘要:Agentic AI(DeepLearning.AI)Andrew Ng 主讲的中级 Agentic AI 课程,以 Reflection、Tool Use、Planning 和 Multi-Agent 四种模式为主轴,并把评估、错误分析、成本与生产优化放入开发流程。214🤖 AI · 文章摘要 · 2026-08-05资料摘要:AI Agents for BeginnersMicrosoft 的 18 课双语课程,从 Agent 用例和设计原则延伸到 Tool Use、Agentic RAG、安全、Planning、多 Agent、生产评估、协议、Memory、Computer Use、部署和加密审计。215🤖 AI · 文章摘要 · 2026-08-05资料摘要:Building Effective AgentsAnthropic 基于实际项目总结的 Agent 设计文章:先区分 Workflow 与 Agent,再从 augmented LLM 推进到五种可组合 workflow,最后才进入开放式 Agent 循环。216🤖 AI · 文章摘要 · 2026-08-05资料摘要:Hello-AgentsDatawhale 的中英文系统教程,从智能体定义和 LLM 基础一路推进到 ReAct、自研框架、记忆、上下文、协议、评估、Agentic RL 与综合项目,是本资料库最完整的中文主线。217🤖 AI · 文章摘要 · 2026-08-05资料摘要:Hugging Face Agents CourseHugging Face 官方免费双语课程,以 Thought、Action、Observation 和 Tools 建立 Agent 循环,再分别用 smolagents、LlamaIndex、LangGraph 完成框架实践、Agentic RAG 和 GAIA 项目。218🤖 AI · 视频摘要 · 2026-08-05资料摘要:LangGraph EssentialsLangChain Academy 的一小时 Python 快速课,用 Node、Edge、Conditional Edge、Memory 和 Interrupt 构造一个可控、可暂停、可人工介入的 LangGraph 应用。219🤖 AI · 文章摘要 · 2026-08-05资料摘要:LLM Powered Autonomous AgentsLilian Weng 的经典长文,以 Planning、Memory、Tool Use 三部分建立 LLM Agent 概念地图,并串联 ReAct、Reflexion、MRKL、Toolformer、HuggingGPT、API-Bank 与 Generative Agents。220🤖 AI · synthesis · 2026-08-05AI Agent 入门学习路线先用两篇工程文章建立“什么时候不该做 Agent”的判断,再手写最小 tool loop;之后只选一个框架做项目,并从第一天加入评估、权限和人工检查点。八份资料承担不同角色,不需要全部顺序刷完。221🛎️ 技能 · topic · 2026-08-04技能通用技能领域索引页,记录能够反复迁移的工具心智模型、快捷操作和个人效率系统。222🛎️ 技能 · topic · 2026-08-04终端与 Neovim 高效编辑终端输入依靠 Readline 风格的行编辑,Neovim 依靠“模式 + 操作符 + 移动/文本对象”的组合语法;理解模型比逐条死记快捷键更有效。223🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:kickstart.nvim一份可运行、注释充分的最小 Neovim 配置起点;它不是发行版,也不是 LazyVim 替代品,最适合用来理解配置内部结构。224🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:LazyVim 官方文档LazyVim 当前安装要求、配置接口、默认插件、Extras 与快捷键的权威参考;查询性强,但不是最佳的零基础线性教材。225🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:LazyVim for Ambitious Developers一部由浅入深、围绕真实开发任务组织的 LazyVim 在线书;适合作为主线课程,不适合替代随版本更新的官方参考文档。226🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:Learn Vim the Smart Way一部强调“先理解 Vim 语法,再扩展到定制”的系统教程;英文原版完整,现存中文译本并不完整。227🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:Neovim 官方用户手册Neovim 内置 :help 的上游原文快照,是命令语义和 Lua 配置接口的最终依据;适合按问题查阅,也包含可顺序学习的用户手册。228🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:Neovim 配置实战nshen/learn-neovim-lua 的中文配套配置仓库,适合观察 Lua 配置如何拆分;它不是付费教程正文,而且仓库明确提醒插件配置容易过时。229🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:Neovim 中文帮助镜像neovim.cn 的中文用户文档镜像,适合降低阅读门槛;页面快照停留在 2024 年,涉及当前 API 和配置时不能替代英文上游。230🛎️ 技能 · 文章摘要 · 2026-08-04资料摘要:Vim 从入门到精通Vim Galore 的中文版本,像一本高密度百科:覆盖面广、适合查漏补缺,但已归档,不宜作为当前 Neovim 插件配置指南。231🛎️ 技能 · synthesis · 2026-08-04Neovim 与 LazyVim 学习路线先练稳定的 Vim 编辑语法,再用一本连续教程掌握 LazyVim 日常工作流;官方文档负责当前事实,配置仓库负责理解内部结构。八份资料不是八门都要从头读完的课程。232🤖 AI · concept · 2026-08-03DiffRO(可微奖励优化)CosyVoice 3 提出的在离散语音 token 级别直接优化奖励的后训练方法,通过 Token2Text 模型将 ASR 后验概率作为可微奖励信号,避免完整波形合成的计算开销。233🤖 AI · concept · 2026-08-03DPO(直接偏好优化)一种无需显式奖励模型和强化学习的偏好对齐方法,通过重参数化将 RLHF 目标转化为简单的二元交叉熵损失,仅需几行 PyTorch 代码即可实现。234🤖 AI · concept · 2026-08-03Melody-CoT(旋律链式规划)在完整歌曲 token 生成前,先由语言模型生成一条低帧率离散旋律计划,使“作曲结构”与“整曲声学实现”分阶段完成。235🤖 AI · 论文摘要 · 2026-08-03资料摘要:Qwen-Audio-3.0-TTSAlibaba Token Foundry 面向生产部署的 TTS 系统:以 12.5 Hz 监督语义 tokenizer 降低自回归成本,让 LM 的连续隐状态直接条件化 Flow-Matching 声学生成器,再用因果 BigVGAN 输出波形;通过 LM/FM 分阶段训练与两类强化学习,同时覆盖 16 种语言、20 个中文方言区域、自然语言指令、86 236💰 金融投资 · concept · 2026-08-02大盘分时图以指数为对象展示市场日内变化,可比较加权与非加权口径,避免把指数涨跌直接等同于多数股票表现。237💰 金融投资 · concept · 2026-08-02分时均价线个股分时图中反映当日截至当前累计成交均价的曲线。238💰 金融投资 · concept · 2026-08-02盘口数据行情终端在盘中展示的价格、委托、成交和相对活跃度等数据集合。239🤖 AI · concept · 2026-08-02低精度浮点格式(FP16 与 BF16)FP16 与 BF16 都用 16 bit 存数,但 FP16 把更多位给尾数、BF16 把更多位给指数;前者相对精细,后者动态范围更接近 FP32。240🤖 AI · concept · 2026-08-02奖励模型与 Bradley–Terry 偏好模型奖励模型把 prompt-response 映射为标量;Bradley–Terry 模型用两个标量之差表示成对偏好概率,并以 pairwise logistic loss 训练。241🤖 AI · concept · 2026-08-02梯度累积与梯度检查点两种常见显存优化手段:梯度累积用多个 micro-batch 合成一次参数更新;梯度检查点少保存激活、反向时重新计算。前者换更新频率,后者换计算时间。242🤖 AI · concept · 2026-08-02文本 Tokenizer 与 Byte-level BPE文本 tokenizer 把字符串变成模型词表中的 token ID;Byte-level BPE 先以 UTF-8 byte 为完整基础字母表,再学习高频 byte 序列的 merge,从而兼顾无未知字符与常见片段压缩。243🤖 AI · concept · 2026-08-02自动混合精度(AMP)AMP 根据算子数值特性在低精度与高精度之间自动选择,并用梯度缩放降低 FP16 梯度下溢风险,以节省显存和提高吞吐。244🤖 AI · concept · 2026-08-02自回归解码与采样自回归生成先处理 prompt,再逐 token 预测下一个 token;temperature/top-p 决定如何从 logits 取样,KV Cache 避免每一步重复计算整个前缀。245🤖 AI · concept · 2026-08-02CoPE(上下文位置编码)CoPE 不只按 token 的物理索引计数,而是根据当前 query 与历史 token 的内容关系学习“软位置”,再从位置 embedding 中插值取值。246🤖 AI · concept · 2026-08-02GQA(分组查询注意力)一种多头注意力的变体,将多个查询头分组共享同一个键值头,大幅减少 KV 缓存大小,是 MHA 和 MQA 的中间方案,已成为 2023-2024 年大模型的标准配置。247🤖 AI · concept · 2026-08-02Hugging Face Datasets 数据管线Hugging Face Datasets 用 Apache Arrow、memory mapping 和 streaming 统一处理本地与远程大规模语料;核心选择是“可随机索引的 map-style 数据集”还是“顺序迭代的 streaming 数据集”。248🤖 AI · concept · 2026-08-02KV Cache自回归 Transformer 推理时缓存历史 token 的 Key 和 Value 张量,避免每一步重复计算,以内存换速度的核心推理优化技术。249🤖 AI · concept · 2026-08-02LLM 参数量分解把词表、attention、MLP 与层数的张量 shape 相乘,可以解释“7B/8B 从哪里来”,也能看出 GQA、大词表和 SwiGLU 如何重新分配参数预算。250🤖 AI · concept · 2026-08-02LLM.int8 量化面向大语言模型线性层的 8-bit 推理/加载方法:主体矩阵乘使用 int8,并把少量幅值异常的特征维留在较高精度路径,以兼顾内存与数值质量。251🤖 AI · concept · 2026-08-02LoRA(低秩适配)冻结原模型权重,只训练低秩增量矩阵,以较少可训练参数完成大模型适配;LoRA 是 PEFT(参数高效微调)家族中最常用的方法之一。252🤖 AI · concept · 2026-08-02PPO(近端策略优化)OpenAI 提出的强化学习算法,通过裁剪目标函数约束策略更新幅度,避免策略崩溃;是 RLHF 第三步(PPO 优化阶段)的核心算法。253🤖 AI · concept · 2026-08-02RLHF(人类反馈强化学习)一种将人类偏好作为训练信号,通过强化学习使语言模型输出更符合人类意图的对齐方法。254🤖 AI · concept · 2026-08-02RMSNormLayerNorm 的简化变体,仅使用均方根(RMS)统计量做归一化,去除了均值中心化步骤,计算更快且效果相当,已成为大模型的事实标准。255🤖 AI · concept · 2026-08-02RoPE(旋转位置编码)一种通过旋转矩阵在注意力计算中编码相对位置信息的方法,已成为 2023 年后大模型的事实标准(LLaMA、DeepSeek、Qwen 等均采用)。256🤖 AI · concept · 2026-08-02SFT(监督微调)在高质量人工标注的 prompt-回答对上进行标准的语言建模训练,使基座模型获得基础的指令遵循能力;是 RLHF 对齐流程的第一步。257🤖 AI · concept · 2026-08-02SwiGLU用 SiLU/Swish 激活一条投影作为门,逐元素调制另一条投影,再映射回模型维度的门控前馈网络;Llama 系列 Transformer block 使用这一结构。258🤖 AI · topic · 2026-08-02personal chatgpt — LLMs 实践系列B站 @chunhuizhang(五道口纳什)的 30 讲大模型实践课程。知识库将视频、带时间戳转录和固定提交的 Notebook 保存在原始资料层,再把内容编译为逐讲摘要与跨讲次概念页。259🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 01 — llama、alpaca、vicuna 整体介绍及 llama 推理过程本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。260🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 02 — LoRA(Low Rank Adaption)基本原理与基本概念,fine-tune 大语言模型本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。261🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 03 — LoRA fine-tune 大语言模型(peft、bloom 7b)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。262🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 04 — PEFT/LoRA 源码分析本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。263🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 05 — float16 与 bf16 表示和计算细节本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。264🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 06 — LLaMA,Alpaca LoRA 7B 推理本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。265🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 07 — fp16 与自动混合精度训练(amp)显著提升 batch size本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。266🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 08 — LLM.int8 量化细节 (load_in_8bit)以及 bitsandbytes 库本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。267🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 09 — BPE gpt2 tokenizer 与 train tokenizer本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。268🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 10 — 预训练语料,mapping & streaming(load_dataset)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。269🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 11 — gradient accumulation 显存优化 trick本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。270🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 12 — LLM SFT training (trl SFTTrainer、alpaca dataset)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。271🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 13 — gradient checkpointing 显存优化 trick本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。272🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 14 — llama2 introduction 及 fine tune llama2(guanaco dataset)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。273🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 15 — llama2 源码初步(text completion & chat completion)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。274🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 16 — trl 基础介绍:reward model,ppotrainer本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。275🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 17 — llama2 源码分析(RMSNorm 与 SwiGLU)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。276🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 18 — llama2 源码分析 RoPE 相对位置编码的复数形式本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。277🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 19 — llama2 源码分析 RoPE apply_rotary_emb 从绝对位置编码到相对位置编码本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。278🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 20 — llama2 源码分析 cache KV(keys、values cache)加速推理本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。279🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 21 — llama2 源码分析 GQA:Grouped Query Attention本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。280🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 22 — llama2 源码分析 generate 的完整过程本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。281🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 23 — trl reward model 与 RewardTrainer(奖励模型,分类模型)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。282🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 24 — peft LoRA merge pipeline(lora inject,svd)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。283🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 25 — LLAMA 3 整体介绍(与 LLama 2 的不同?)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。284🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 26 — gpt-4o tokenizer 及特殊中文tokens(压缩词表),o200k_base本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。285🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 27 — trl rlhf PPOTrainer,原理分析与代码走读(OpenRLHF framework)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。286🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 28 — 从 RoPE 到 CoPE(绝对位置编码,相对位置编码,Contextual Position Encoding)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。287🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 29 — Llama2 7B vs. Llama3 8B (词表、attention 及 mlp)本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。288🤖 AI · 视频摘要 · 2026-08-02资料摘要:personal chatgpt 30 — instructGPT 中的 reward modeling,概率建模与损失函数性质本讲由真实视频转录与作者 notebook/代码交叉整理。原始层: ;课程总览: 。289💰 金融投资 · topic · 2026-08-01证券市场、券商与交易账户股票软件是操作入口,券商接受并执行委托,交易所组织交易,登记结算机构记录持有与完成交收;能买什么取决于市场、账户和具体交易权限。290💻 CS · concept · 2026-08-01Web 服务请求链路浏览器访问域名时,DNS、端口、TLS、HTTP 和反向代理依次解决“去哪台机器、连哪个入口、如何安全通信、请求什么资源、由哪个后端处理”。291💻 CS · topic · 2026-08-01CS计算机科学领域索引页,当前从 Web 服务请求链路和 Linux 服务器管理切入,逐步沉淀网络、系统与工程基础。292💻 CS · topic · 2026-08-01SSH 与 Linux 服务器基础SSH 把远程连接、身份认证和加密传输组合为一条安全管理通道;可靠的服务器初始化则围绕密钥、普通管理员账户、最小权限和可恢复验证展开。293🤖 AI · concept · 2026-08-01FSQ(有限标量量化)将中间表示投影到低维空间后对每个维度独立做有界舍入取整,替代向量量化(VQ),实现码本 100% 利用率且无需学习码本。294🤖 AI · concept · 2026-08-01S³ Tokenizer(监督语义语音分词器)通过在 ASR 模型的编码器中插入量化层,利用 ASR 损失显式监督学习离散语音 token,使 token 天然与文本语义对齐,区别于无监督 tokenizer(EnCodec、HuBERT 等)。295🤖 AI · concept · 2026-08-01VQ-VAE(向量量化变分自编码器)VQ-VAE 用最近邻码本把连续 Encoder 表示变成离散索引,并通过重建、码本与 commitment 目标共同训练可生成的离散潜变量。296🛎️ 技能 · topic · 2026-08-01Raycast 效率工作流Raycast 的核心价值不是“替代 Spotlight”,而是把启动、查找、粘贴、跳转和自动化统一成可搜索、可绑定快捷键的命令入口。297🤖 AI · concept · 2026-07-26FlashAttention一种保持标准 attention 精确结果、却通过分块和在线 softmax 大幅减少 GPU 显存 I/O 的实现算法。298🤖 AI · concept · 2026-07-26GPU 节点互联与分层带宽GPU 性能不是一个 FLOPS 数字,而是 HBM、GPU 间 NVLink/NVSwitch、CPU–GPU PCIe、节点间网络 四层数据通路的共同结果。299🤖 AI · concept · 2026-07-19MLA(多头潜在注意力)DeepSeek-V2 提出的一种注意力机制创新,对 Key 和 Value 做低秩联合压缩到潜空间,将 KV 缓存减少 93.3% 的同时性能优于标准多头注意力(MHA)。300💰 金融投资 · concept · 2026-07-14出水芙蓉低位长期缩量整理、均线粘合后,以放量大阳线突破多条均线的课程内形态。301💰 金融投资 · concept · 2026-07-14大阳线实体显著为正的阳线;本课程以实体涨幅超过 7% 作为教学阈值。302💰 金融投资 · concept · 2026-07-14大阴线实体显著为负的阴线;本课程以实体跌幅超过 7% 作为教学阈值。303💰 金融投资 · concept · 2026-07-14黄昏之星中大阳线、十字星(或小实体)、中大阴线组成的三 K 线反转候选结构。304💰 金融投资 · concept · 2026-07-14十字星开盘与收盘非常接近、实体极小且通常带影线的 K 线。305💰 金融投资 · concept · 2026-07-14乌云盖顶阳线后高开深跌阴线构成的两 K 线看跌反转候选形态。306💰 金融投资 · concept · 2026-07-14早晨之星大阴线、十字星(或小实体)、中大阳线组成的三 K 线反转候选结构。307💰 金融投资 · concept · 2026-07-14长下影K线下影线明显长于实体和上影线的 K 线,记录盘中深跌后回收。308💰 金融投资 · concept · 2026-07-14K线(蜡烛图)由开盘价、收盘价、最高价、最低价四个价格构成的可视化价格柱,是技术分析的最基本单元,每根 K 线即时反映该时段多空双方博弈的结果。309💰 金融投资 · concept · 2026-07-14T形与倒T形K线开收盘与某一极值重合的特殊十字类 K 线。310💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-002-个股分时图的看盘技巧本讲把个股分时图视为单根 K 线在盘中的展开:实时价格、分时均价线和分钟成交量共同呈现日内交易过程。311💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-003-大盘分时图的看盘技巧本讲区分大盘与个股分时图:以加权指数和不加权指数的相对位置,辅助观察权重股和中小盘股的相对表现。312💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-004-成交量、放量与缩量本讲定义成交量、成交额和换手率,强调放量与缩量都必须有比较基准,并应与价格方向和位置一同解读。313💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-006-经典K线形态“出水芙蓉”本讲将出水芙蓉描述为低位长期缩量整理、均线粘合后,以放量大阳线突破多条均线的课程内形态。314💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-008-经典K线形态“乌云盖顶”本讲介绍两根 K 线组成的乌云盖顶:阳线后高开深跌的阴线收盘深度进入前日阳线实体,在上升末端常被视为看跌反转警示。315💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-009-“十字星”K线的实操价值本讲强调十字星本身只表示当日多空暂时均衡;缩量/放量和后续中大阳线或中大阴线,才为反转叙事提供更多信息。316💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-010-经典K线组合形态“早晨之星”本讲以“大阴线—十字星—中大阳线”描述早晨之星,强调第三根中大阳线才是多方转强的关键确认。317💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-011-经典K线形态“黄昏之星”本讲将黄昏之星视为早晨之星镜像:中大阳线、十字星、中大阴线;第三根阴线是空方转强的确认。318💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-012-“T形”与“倒T形”K线的实操技巧本讲用 OHLC 位置定义 T 形和倒 T 形:前者开收高相同、留长下影,后者开收低相同、留长上影;操作解释高度依赖位置和背景。319💰 金融投资 · 视频摘要 · 2026-07-14资料摘要:股票基础知识教程-013-长下影K线的实操技巧本讲将长下影 K 线解释为盘中深跌后被拉回;同样的外观在低位、上涨初期、高位和下跌途中可能对应完全不同的情境。320🤖 AI · concept · 2026-07-13得分匹配(Score Matching)训练扩散模型的核心方法:让神经网络回归得分函数 $\nabla\log pt(x)$(对数似然的梯度)。因边缘得分不可算,改回归可解析的条件得分(去噪得分匹配),二者梯度相同。321🤖 AI · 视频摘要 · 2026-07-13资料摘要:A100 SXM GPU 节点认识、配置与带宽测试五道口纳什的 32 分钟 A100 节点实操入门。以一台 8× A100 80GB SXM4 + 6× NVSwitch 节点为例,建立从 GPU 封装、节点内拓扑到算力/PCIe/NVLink/HBM 分层测试的最小心智模型。AI Infra 的关键不是背某个跑分,而是先判断数据正在跨越哪条硬件边界。322🤖 AI · 论文摘要 · 2026-07-10资料摘要:GSRM(生成式语音奖励模型)Meta Superintelligence Labs 等提出 GSRM(Generative Speech Reward Model)——一个面向语音自然度评测、以「推理为中心」的生成式奖励模型。针对现有自然度评测器「把原始音频直接回归成一个标量分数」导致不可解释、跨领域难泛化的痛点,GSRM 把评测拆成两阶段:先做可解释的声学特征提取(音高/强度/时长等323🎃 外语 · topic · 2026-07-09外语外语领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。324🎨 画画 · topic · 2026-07-09画画绘画领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。325🎹 音乐 · topic · 2026-07-09音乐音乐领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。326🔢 数学 · topic · 2026-07-09数学数学领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。327🤖 AI · 论文摘要 · 2026-07-09资料摘要:SD3(MMDiT)Stability AI 的 Stable Diffusion 3 技术报告。两大贡献:① 系统化改进 Rectified Flow 训练的噪声采样(提出偏向感知相关尺度的 logit-normal / mode / CosMap 时间步采样器);② 提出 MM-DiT(多模态扩散 Transformer)——文本流与图像流各持一套权重、在注意力处联合,实现328🤖 AI · concept · 2026-07-08MMDiT(多模态扩散 Transformer)DiT 的多模态变体:文本流与图像流各持一套权重,仅在注意力处拼接做联合自注意力,实现两模态双向信息流动。出自 Stable Diffusion 3。329💰 金融投资 · 视频摘要 · 2026-07-03资料摘要:股票基础知识教程-001-K线的构成及市场意义B站 UP主「爱学习的小刚子」股票基础知识全 70 讲系列的第 1 讲:从 K 线的四个构成要素(开盘价/收盘价/最高价/最低价)出发,讲解阳线、阴线、特殊 K 线形态的结构,以及 K 线实体与影线反映的多空博弈市场含义。330📙 人文社科 · concept · 2026-07-02古兰经伊斯兰教的圣书,据信是神(安拉)通过天使吉布利勒在 23 年间(610–632)向先知穆罕默德逐字启示的话语。全书 114 章,是伊斯兰教法、神学和社会规范的终极权威来源。331📙 人文社科 · concept · 2026-07-02穆罕默德伊斯兰教的创始先知(570–632),被穆斯林尊为"封印的先知"(最后一位接受神启示的人)。从非宗教视角看,他也是七世纪阿拉伯半岛的一位社会改革家、思想家和战略家。332📙 人文社科 · concept · 2026-07-02乌玛伊斯兰教构想中的超民族、超部落的穆斯林共同体——所有"顺从神的人"在信仰纽带下和谐共处的理想公社。古兰经 5:3:"今天我已为你们完美了你们的宗教……这个宗教就叫伊斯兰。"333📙 人文社科 · concept · 2026-07-02希吉拉公元 622 年穆罕默德率信徒从麦加迁徙到麦地那的历史事件。被定为伊斯兰历元年(1 AH),标志着伊斯兰从地下精神运动转变为地上政权实体的转折点。334📙 人文社科 · concept · 2026-07-02亚伯拉罕诸教以亚伯拉罕(易卜拉欣)为共同祖先的三大一神教:犹太教、基督教、伊斯兰教。335📙 人文社科 · concept · 2026-07-02伊斯兰五功伊斯兰教的五大核心实践(正信、礼拜、斋戒、天课、朝觐),先知时代确立,所有穆斯林必须遵守。五功将部落血缘纽带替换为超越血缘的信仰纽带,是伊斯兰从部落社会走向统一社群的核心机制。336📙 人文社科 · 视频摘要 · 2026-07-02资料摘要:伊斯兰简史(1)-伊斯兰的起源B 站 UP 主"青蛙刀圣1993"的 YouTube 视频,用"三本书"框架(犹太教/基督教/伊斯兰教)串联伊斯兰起源,分"穆斯林信仰视角"和"世俗历史视角"两种讲法,覆盖从亚伯拉罕到穆罕默德去世的完整脉络。337🤖 AI · concept · 2026-07-01DDPM 前向与反向扩散公式推导前向加噪用重参数化一步直达,反向去噪用贝叶斯公式 + 神经网络近似——两者都是确定性推导,没有"玄学"。338🤖 AI · concept · 2026-07-01Knowledge Distillation(知识蒸馏)用一个更强的"教师模型"去训练一个较小/较弱的"学生模型",让学生模仿教师的行为——不仅是最终答案,更是教师对输出的概率判断。339🤖 AI · concept · 2026-07-01On-Policy Distillation(在策略蒸馏)让学生模型自己采样轨迹,教师模型对每一步的每个 token 给出密集监督信号(reverse KL),结合了 on-policy 训练的相关性与蒸馏的密集梯度。340🤖 AI · concept · 2026-07-01Policy Gradient(策略梯度)根据 reward / advantage,直接调整模型生成某个 token / action 的概率——如果好就提高概率,如果差就降低概率。341🤖 AI · concept · 2026-07-01verl字节跳动(Volcengine)开源的大模型 RL 后训练框架——不是模型,也不是单个算法,而是一套把大模型强化学习训练跑起来的工程基础设施。342🤖 AI · 文章摘要 · 2026-07-01资料摘要:On-Policy DistillationThinking Machines Lab 提出 on-policy distillation:让学生模型自己采样轨迹,教师模型对每个 token 打分(dense reward),结合了 RL 的 on-policy 相关性与蒸馏的密集监督信号,在数学推理上达到 9–30× 成本降低,并可恢复领域微调后丢失的指令遵循能力。343🤖 AI · concept · 2026-06-29Diffusion Autoregressive 架构Diffusion Autoregressive 架构是一种将自回归语言模型与扩散解码器结合的生成框架:自回归部分负责生成高层语义计划,扩散部分负责从语义计划恢复细粒度连续细节。344🤖 AI · concept · 2026-06-15对抗后训练(Adversarial Post-Training)在已训练好的扩散/流匹配模型之上,用对抗损失在真实数据上微调,把多步迭代采样压缩到极少步(甚至单步)生成,同时恢复蒸馏会抹平的感知细节。345🤖 AI · 论文摘要 · 2026-06-15资料摘要:AudioX-TurboHKUST + 清华 + Noiz AI 等提出的 efficient anything-to-audio 框架:在 统一多模态生成路线之上,引入 AudioX-Base 教师 → AudioX-Turbo 4-step 学生的少步蒸馏,核心是把 适配到 ,并叠加 diffusion-based discriminator。论文同时构建 IF-caps-Pr346🤖 AI · concept · 2026-06-05多模态 LLM能够同时理解和生成多种模态(文本、图像、音频、视频)信息的大语言模型,从 2023 年的"视觉适配"演进到 2024 年的"原生全模态统一模型"。347🤖 AI · 论文摘要 · 2026-06-05资料摘要:MOSS-TTS复旦 OpenMOSS(SII-OpenMOSS)的语音生成基础模型,主张回归语音合成的核心配方:离散音频 token + 自回归建模 + 大规模预训练。构建在 (CAT,24kHz→12.5fps 变比特率 RVQ)之上,发布两个互补生成器:MOSS-TTS(Delay-Pattern 单骨干,结构简单、可扩展、长上下文/控制导向)与 MOSS-TTS-L348🤖 AI · concept · 2026-05-19Tokenizer-Free TTSTokenizer-Free TTS 是一种直接生成连续语音表示(而非离散 token 序列)的语音合成范式,通过可微分的端到端架构绕过传统语音 tokenizer 的语义-声学鸿沟。349🤖 AI · entity · 2026-05-19VoxCPMVoxCPM 是清华大学 OpenBMB 和 THUHCSI 联合推出的 Tokenizer-Free TTS 系统,采用扩散自回归架构直接生成连续语音表示。最新版 VoxCPM2 拥有 2B 参数、支持 30 种语言、48kHz 音频输出和语音设计能力。350🤖 AI · 视频摘要 · 2026-05-17资料摘要:LLM架构演进三年回顾B站视频:上帝视角拆解三年 LLM 架构演进(2019 GPT-2 → 2026 DeepSeek V4),梳理 67 个核心开源模型的架构变化,核心结论:Transformer 五大组件的架构创新空间已基本枯竭。351🤖 AI · synthesis · 2026-05-17LLM架构演进:Transformer已死?基于 2019-2026 年 67 个核心开源模型的架构演进回顾,论证 Transformer Decoder-Only 架构五大组件的创新空间已基本枯竭。这里的"死"并非技术消失,而是创新的低垂果实被摘完,进入边际效益递减的微调阶段。352🤖 AI · concept · 2026-05-04对齐税在对语言模型进行安全/有用性对齐训练时,模型在部分下游任务上的能力出现退化的现象。降低对齐税是对齐研究的核心工程目标之一。353🤖 AI · concept · 2026-05-04Constitutional AIAnthropic 提出的对齐训练方法,基于显式书写的伦理原则宪章(Constitution)指导模型行为,通过 AI 自我批评和自我改进减少对人类标注的依赖。354🤖 AI · 论文摘要 · 2026-05-04资料摘要:Claude 3Anthropic 推出的 Claude 3 模型家族(Opus/Sonnet/Haiku),通过 Constitutional AI 训练,Opus 在 GPQA/MMLU/MMMU 等基准上达到 SOTA,200K 上下文窗口(生产环境)。355🤖 AI · 论文摘要 · 2026-05-04资料摘要:GeminiGoogle DeepMind 推出的原生多模态模型家族(Ultra/Pro/Nano),联合训练于图像、音频、视频和文本数据。Ultra 是首个在 MMLU 上超越人类专家的模型(90.04%),在 32 项基准中的 30 项达到 SOTA。356🤖 AI · 论文摘要 · 2026-05-04资料摘要:GPT-4 Technical ReportOpenAI 发布的 GPT-4 技术报告,展示了多模态 Transformer 在专业基准上的人类水平表现(律师考试前 10%)。以安全性为由有意省略架构细节和模型规模。357🤖 AI · 论文摘要 · 2026-05-04资料摘要:GPT-4o System CardOpenAI 发布的 GPT-4o 安全系统卡,首个"全模态"模型(文本+视觉+音频统一网络),音频响应时间 320ms 接近人类对话速度。358🤖 AI · 论文摘要 · 2026-05-04资料摘要:Llama 2Meta 推出的开源大模型系列(7B/13B/70B),首次对 RLHF 对齐方法论进行全面透明披露,对话模型在人类评估中与 ChatGPT 相近。359🤖 AI · 论文摘要 · 2026-05-04资料摘要:Llama 3Meta 推出的 Llama 3.1 模型系列(8B/70B/405B),405B 旗舰首次实现开源模型与 GPT-4 水平相当的性能。92 页技术报告详尽记录训练基础设施、数据管线、缩放法则和后训练方法。360🤖 AI · 论文摘要 · 2026-05-04资料摘要:MixtralMistral AI 推出的稀疏混合专家 (SMoE) 模型,47B 总参数仅激活 13B/token,在多数基准上超越 Llama 2 70B,Instruct 版本在人类评估中优于 GPT-3.5、Gemini Pro 和 Claude 2.1。Apache 2.0 许可。361🤖 AI · 论文摘要 · 2026-05-04资料摘要:Qwen2阿里通义千问团队推出的全面开源模型系列(0.5B-72B 密集模型 + 57B MoE),72B 在多项基准上超越 Llama-3-70B,72B-Instruct 在 MT-Bench 达 9.12、Arena-Hard 48.1。362🤖 AI · 论文摘要 · 2026-05-03资料摘要:CosyVoice 2在 CosyVoice 基础上引入有限标量量化(FSQ)替代 VQ、以预训练 LLM(Qwen2.5-0.5B)为骨干、设计分块感知因果流匹配统一流式/非流式合成,首次实现流式零样本 TTS 的人类水平自然度。363🤖 AI · 论文摘要 · 2026-05-03资料摘要:CosyVoice 3CosyVoice 3 通过百万小时数据 + 1.5B 参数规模化、基于 MinMo 多任务监督的语音 tokenizer 和可微奖励优化(DiffRO)后训练,实现 9 语言 × 18 方言的野外零样本语音合成,内容一致性相对前代提升超 50%。364🤖 AI · 论文摘要 · 2026-05-03资料摘要:CosyVoice首个将监督语义语音 token 引入 TTS 的工作,提出 LLM + 条件流匹配的两阶段零样本语音合成架构,在内容一致性和说话人相似度上超越无监督 token 方案。365🤖 AI · comparison · 2026-05-03CosyVoice 系列对比梳理阿里通义语音团队 CosyVoice 三代演进:从零样本 TTS 基础架构到流式合成再到百万小时多语言野外场景。