跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

LoRA 详解:低秩适配的原理与代码实现

Posted on 2025-04-11 | In 大模型训练与微调 , 模型微调与参数高效适配 | 2.3k | 10 分钟
讲解 LoRA(Low-Rank Adaptation)的原理:冻结预训练权重、只对增量做低秩分解,用极少的参数完成大模型微调,并给出线性层与注意力模块上带 LoRA 的代码实现示例。
Read more »

HuggingFace AutoModel 系列详解:自动加载类与任务对照

Posted on 2025-04-11 | In 大模型全栈知识 , Transformer 机制 | 1.5k | 6 分钟
系统介绍 HuggingFace Transformers 中的 AutoModel 系列自动加载类:按任务类型划分的常用类及其用途、如何根据模型名称自动匹配架构与预训练权重,并给出文本生成等场景的加载与推理代码示例。
Read more »

BPE 与 WordPiece 分词方法对比:子词分割与 Tokenizer 原理

Posted on 2025-04-10 | In 自然语言处理 | 5.4k | 25 分钟
对比 BPE 与 WordPiece 两种经典子词分割算法,解析 Tokenizer,在编码与解码阶段的词元切分、映射及词汇表构建机制,及其在预训练模型中的应用。
Read more »

Tokenizer 分词器详解:BPE、WordPiece 与编解码流程

Posted on 2025-04-10 | In 大模型全栈知识 , 预训练与语言模型 | 4.1k | 19 分钟
系统讲解分词器:编码与解码两个阶段中分词、映射、反映射与文本重组的四步流程,对比 GPT 系列常用的 BPE 与 BERT 系列常用的 WordPiece,并给出使用 GPT-2 分词器做编码解码的代码示例。
Read more »

NCCL 详解:多 GPU 集合通信库与 PyTorch 集成

Posted on 2025-04-08 | In 大模型训练与微调 , 通信与硬件 | 1k | 3 分钟
讲解 NVIDIA NCCL 集合通信库:它解决的问题、重要概念与支持的通信操作类型、设备要求与拓扑自动识别优化,并给出在 PyTorch 中初始化进程组、创建分布式模型与调用集合通信的示例。
Read more »

常用 NVIDIA 运维指令速查:互联拓扑、NUMA 与 NVLink 查询

Posted on 2025-04-08 | In 大模型训练与微调 , 通信与硬件 | 1.7k | 9 分钟
整理 GPU 服务器运维常用的 NVIDIA 指令:用 nvidia-smi 与 nvidia-smi topo -m 查看设备状态与互联拓扑、判断是 SYS 还是 NVLink 连接,并结合 NUMA 亲和性与 CPU 绑定排查系统规模与拓扑完整性问题。
Read more »

人类对齐与强化学习—RLHF 全流程与 PPO 原理源码解读

Posted on 2025-04-07 | In 大模型训练与微调 , 人类对齐与强化学习 | 4k | 14 分钟
从 deepspeed-chat 开源实现入手讲解 RLHF:强化学习中智能体与环境的交互框架、NLP 场景下的强化学习,以及 Actor、Reference、Critic、Reward 四个模型在 PPO 训练流程中的分工与公式推导。
Read more »

MCP 协议详解:为大模型设计的统一上下文接入标准

Posted on 2025-03-28 | In Agent 与 Workflow , 协议与接入标准 | 817 | 2 分钟
讲解 Model Context Protocol(MCP)这一面向大模型的统一开放接口:由模型、上下文与协议三部分构成的核心框架、MCP 与智能体的关系,以及一个可直接运行的服务示例。
Read more »

FlashInfer 详解:LLM 注意力内核库与负载均衡调度

Posted on 2025-03-27 | In 大模型推理优化 , 注意力与 KV Cache 优化 | 399 | 1 分钟
介绍 FlashInfer 这一面向大模型服务的注意力内核库与生成器:提供 FlashAttention、稀疏注意力、PageAttention 与采样等高性能实现,覆盖稀疏与密集 KV 存储的 CUDA 与 Tensor 核心模板,并提供负载均衡调度能力。
Read more »

LLM 推理优化技术纵览:子图融合、模型压缩与量化蒸馏

Posted on 2025-03-21 | In 大模型推理优化 , 推理框架与系统架构 | 6.1k | 23 分钟
系统梳理大模型推理优化的两大方向:通过算子合并减少 kernel 调用与显存读写的子图融合(FasterTransformer、DeepSpeed Inference、MLC LLM),以及稀疏化、量化与蒸馏三类模型压缩技术。
Read more »

NVIDIA GPU 架构演进详解:从 Pascal 到 Blackwell

Posted on 2025-03-18 | In 大模型训练与微调 , 通信与硬件 | 1.6k | 6 分钟
按时间线梳理 NVIDIA GPU 架构的关键技术:Pascal 的 16nm 工艺与 NVLink、Volta 引入的 Tensor Core、Turing 的 RT Core、Ampere 的第三代 Tensor Core、Ada Lovelace、Hopper 的 Transformer 引擎直到 Blackwell,并列出各代代表产品。
Read more »

大语言模型简史:从 Transformer (2017) 到 DeepSeek-R1 (2025)

Posted on 2025-03-13 | In 大模型全栈知识 , 模型认知与生态 | 8.3k | 29 分钟
以 2017 年 Transformer 架构为起点回顾大语言模型的发展脉络:自注意力带来的并行化革命、2018 到 2020 年的预训练模型时代,一直到 2025 年以高性价比与强推理能力引发行业震动的 DeepSeek-R1。
Read more »
1…91011…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%