开源大模型技术演进时间线:预训练、后训练与强化学习 置顶 | 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 3.3k | 14 分钟基于 36 篇技术报告梳理 2025 下半年到 2026 上半年的开源大模型技术演进:注意力从全局走向混合稀疏、DSA 成为事实标杆、线性注意力在旗舰模型落地、滑动窗口回归与 Mamba 路线,以及 MoE、训练精度与 MTP 的演进趋势。阅读全文 »
DeepSeek-V4 高效长上下文注意力:FP4 混合精度与稀疏注意力解析 置顶 | 发表于 2026-06-08 | 分类于 大模型全栈知识 , 模型认知与生态 | 2.1k | 7 分钟解析 DeepSeek-V4 在百万 token 长上下文下的注意力设计:专家权重 FP4 与其他参数 FP8 的混合精度存储、DeepSeek 稀疏注意力(DSA)降低注意力计算成本,以及 vLLM 保持 KV 缓存紧凑与 GPU 满载的实现手段。阅读全文 »
Agent 设计模式—Agentic RAG:从传统 RAG 到智能体检索增强 置顶 | 发表于 2025-07-10 | 分类于 Agent 与 Workflow , Agent 设计模式 | 1.6k | 5 分钟梳理 LLM 与 RAG 的最新进展(增强检索、语义缓存、多模态集成),解析 Agentic RAG 的定义、核心能力及其与传统 RAG 的差异,并详解路由、查询规划、工具使用、ReAct、动态规划与执行五类智能体的工作方式。阅读全文 »
从 MHA、MQA、GQA 到 MLA:注意力机制的 KV Cache 演进 置顶 | 发表于 2025-02-20 | 分类于 大模型推理优化 , 注意力与 KV Cache 优化 | 6k | 28 分钟系统梳理注意力机制为压缩 KV 缓存所做的演进:从多头注意力 MHA 出发分析其显存瓶颈,依次推导多查询注意力 MQA、分组查询注意力 GQA,直至用低秩键值联合压缩的多头潜在注意力 MLA 及其数学形式。阅读全文 »
DeepSeek-V3.2 技术报告解读:稀疏注意力与专家蒸馏 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 1.2k | 5 分钟DeepSeek-V3.2 在 V3.1-Terminus 的 128K 上下文 checkpoint 上继续预训练,核心是引入 DeepSeek 稀疏注意力(DSA):用轻量索引器为每个 query token 挑选关键上下文。本文梳理其预训练与后训练配方、专家蒸馏与基础设施设计。阅读全文 »
Seed2.0 Model Card 解读:面向真实世界复杂性的三档模型 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 500 | 2 分钟梳理字节跳动 Seed2.0 的 Model Card 内容:面向不同延迟场景的 Pro、Lite、Mini 三档规模划分、设计优先级与评测重点,并说明该报告以能力展示与部署模式为主、未披露训练配方这一性质。阅读全文 »
Seed1.5-VL 技术报告解读:原生分辨率视觉与混合可验证奖励强化学习 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 688 | 2 分钟解读字节跳动 Seed1.5-VL:原生动态分辨率的 SeedViT 视觉编码器、只监督最终输出而不约束思维链的监督策略,以及联合 RLHF 与 RLVF 并用视觉语言模型自身充当奖励模型的混合强化学习方案。阅读全文 »
Seed1.5-Thinking 技术报告解读:VAPO 与 DAPO 强化学习训练推理模型 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 666 | 2 分钟解读字节跳动 Seed1.5-Thinking 的强化学习方案:VAPO 与 DAPO 两类算法提升推理模型的训练稳定性、带推理路径的验证器把准确率推到 99.3% 以消除奖励作弊,以及 Decoupled-GAE 与长度自适应优化。阅读全文 »
Qwen3 技术报告解读:三阶段预训练与思考模式统一 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 1.3k | 5 分钟解读 Qwen3 的技术报告:通用、质量提升与长上下文三阶段预训练共约 36T token 的数据配比与学习率策略,以及长思维链冷启动、推理强化学习、思考模式融合与通用强化学习组成的四阶段后训练管线。阅读全文 »
Qwen3.5 技术报告解读:397B 稀疏 MoE 与原生多模态融合 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 729 | 2 分钟梳理 Qwen3.5 旗舰模型 397B-A17B 的关键设计:线性注意力 GDN 替代 75% 标准注意力让 256K 上下文效率提升 19 倍、从预训练第一步就统一视觉语言的 Early Fusion、仅激活 4.3% 参数的极端稀疏 MoE,以及覆盖 201 种语言的 250K 词表。阅读全文 »
Qwen3.5-Omni 技术报告解读:ARIA 单流生成与在线策略蒸馏 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 937 | 3 分钟解读 Qwen3.5-Omni 的全模态架构:Thinker 与 Talker 均采用混合 MoE 加 GDN 提升长音视频推理效率、用 ARIA 统一文本与语音交错的单流生成以消除双轨同步开销,并通过在线策略蒸馏缩小语音回复的质量差距。阅读全文 »
Qwen3-VL 技术报告解读:交错 MRoPE 与 DeepStack 视觉特征融合 发表于 2026-08-04 | 分类于 大模型全栈知识 , 模型认知与生态 | 1.2k | 4 分钟解读 Qwen3-VL 的四阶段预训练设计与三项关键创新:交错式多模态 RoPE、把视觉特征分层注入语言模型的 DeepStack、以文本形式表达视频时间戳,以及平衡多模态 token 损失的平方根重加权策略。阅读全文 »