跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

Agent 设计模式—设计范式与常见框架:从 Reflection 到多智能体协作

Posted on 2025-04-22 | In Agent 与 Workflow , Agent 设计模式 | 1.5k | 5 分钟
系统讲解 Agent 的四种经典设计范式(Reflection、Tool use、Planning、Multi-agent collaboration)与 ReAct、Plan-and-Execute 等高阶范式,并梳理 LangGraph、AutoGen 中的多智能体协作模式与框架实现。
Read more »

模型压缩三剑客:量化、蒸馏与剪枝的原理对比

Posted on 2025-04-22 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 1.3k | 4 分钟
梳理大语言模型的三类压缩方法:通过降低权重精度减小体积的量化(含训练后量化 PTQ 与量化感知训练 QAT)、用大模型教小模型的知识蒸馏,以及裁剪冗余连接的剪枝,并比较各自的效果与代价。
Read more »

手算 LLM 参数量:以 Qwen2.5-32B 为例逐层拆解

Posted on 2025-04-22 | In 大模型全栈知识 , 模型认知与生态 | 1.7k | 7 分钟
以 Qwen2.5-32B-Instruct 的 config 为例,按嵌入层、多头注意力、前馈网络与归一化层逐项推导 Transformer 模型的参数量计算公式,并给出各层参数占比的完整推导过程。
Read more »

思维链与推理编排:从 CoT、自我一致性到 ToT 与 GoT

Posted on 2025-04-22 | In Agent 与 Workflow , 编排与调度机制 | 977 | 3 分钟
梳理生产落地中常用的提示编排策略:通过少样本或零样本思维链引导模型逐步推理、用自我一致性做多路投票降低幻觉,再到支持搜索与回溯的树状思维 ToT 和图状思维 GoT。
Read more »

探秘 Transformer 之(24):KV Cache 优化的原理与方法分类

Posted on 2025-04-21 | In 大模型全栈知识 , 注意力与 KV Cache 优化 | 21.7k | 79 分钟
分析大语言模型服务中 KV Cache 带来的显存压力:多请求、长序列与束搜索等场景都会放大缓存占用,并系统地按公式角度与特性角度梳理 KV Cache 的优化思路与代表性方案。
Read more »

SnapKV 详解:基于注意力一致性的 KV Cache 稀疏化

Posted on 2025-04-21 | In 大模型推理优化 , 注意力与 KV Cache 优化 | 734 | 2 分钟
讲解 SnapKV 这一 KV Cache 稀疏化方法:利用生成过程中注意力模式的稳定性,在 prefill 阶段把 prompt 拆成 prefix 与窗口两部分,用窗口内 token 的注意力分数筛选需保留的 KV,从而大幅压缩缓存尺寸。
Read more »

FlashMLA 详解:面向 Hopper 架构的 MLA 高效解码内核

Posted on 2025-04-21 | In 大模型推理优化 , 注意力与 KV Cache 优化 | 440 | 1 分钟
介绍 DeepSeek 开源周首个项目 FlashMLA:针对 Hopper GPU 优化的多头潜注意力解码内核,专为可变长度序列设计,在 H800 上可达 3000GB/s 带宽与 580 TFLOPS 算力,适用于长文档处理与实时对话等场景。
Read more »

Prefix-Tuning 与 Prompt Tuning 详解:软提示类参数高效微调

Posted on 2025-04-16 | In 大模型训练与微调 , 模型微调与参数高效适配 | 3.3k | 11 分钟
对比两种在输入前添加可训练连续向量的参数高效微调方法:Prefix-Tuning 在自回归与编码器-解码器结构中的不同注入方式,以及 Prompt Tuning 的简化思路,并分别给出它们的优点与局限。
Read more »

GLU 与 SwiGLU 激活函数详解:从门控线性单元到大模型 FFN 标配

Posted on 2025-04-15 | In 大模型全栈知识 , 预训练激活函数 | 2.7k | 10 分钟
从 GLU 门控线性单元的公式推导出发,讲解 Swish 的平滑非单调特性,再推出 PaLM 与 LLaMA 采用的 SwiGLU,并系统列出 Bilinear、ReGLU、GEGLU、SwiGLU 等变体替换 FFN 后对应的前馈网络公式。
Read more »

ALiBi 详解:用线性偏置实现长度外推的注意力机制

Posted on 2025-04-15 | In 大模型全栈知识 , 预训练注意力机制 | 1.3k | 4 分钟
讲解 ALiBi(Attention with Linear Biases):在注意力分数上按 query 与 key 的距离施加线性惩罚偏置,无需额外位置嵌入即可让模型在远超训练长度的序列上保持良好的外推能力,并分析其偏置矩阵与优点。
Read more »

预训练优化器—神经网络优化器全景:从 SGD 到 Adam

Posted on 2025-04-14 | In 大模型全栈知识 , 预训练优化器 | 2.9k | 11 分钟
按时间线系统讲解神经网络优化器:SGD 的随机近似原理、Momentum 的动量加速、ASGD 与 Rprop、AdaGrad 与 AdaDelta 的自适应学习率、RMSProp 与 Adam 的二阶矩估计,并给出各算法的更新公式与适用场景。
Read more »

神经网络优化器详解:从 SGD、Momentum 到 Adam 的优化算法演进

Posted on 2025-04-14 | In 深度学习 | 2.9k | 10 分钟
系统梳理神经网络中的优化算法,从 SGD、Momentum、AdaGrad 到 Adam,解析各优化器的参数更新公式、自适应学习率机制与适用场景。
Read more »
1…8910…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%