跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

FP16、BF16 与 FP32 精度详解:位结构、表示范围与 PyTorch 实测

Posted on 2024-06-06 | In 大模型全栈知识 , 预训练精度 | 2k | 8 分钟
拆解三种浮点格式在 IEEE 754 下的符号位、指数位与尾数位结构:FP16 的 5 位指数与 10 位尾数、BF16 用 8 位指数换取更大表示范围、FP32 的 24 位尾数精度,并用 PyTorch 代码实测分辨率、机器精度与二进制转换过程。
Read more »

快速下载 HuggingFace 模型的几种方式:从浏览器到 Hf_transfer

Posted on 2024-06-06 | In 大模型全栈知识 , 工具与工程实践 | 1.7k | 6 分钟
针对国内网络环境总结 HuggingFace 模型的下载方法:网页与多线程下载器(IDM、Aria2)、git clone 的取舍,以及 huggingface-cli 配合 hf_transfer 与 snapshot_download 实现断点续传和满速下载的具体命令。
Read more »

AWQ 激活感知权重量化详解:4-Bit 量化与 vLLM 部署

Posted on 2024-06-03 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 1.4k | 6 分钟
讲解 AWQ(Activation-aware Weight Quantization):依据激活分布保护关键权重通道的硬件友好低位纯权重量化,相比 FP16 提速 3 倍、显存降至三分之一,并给出 AutoAWQ 量化与 vLLM 部署的代码示例。
Read more »

GPTQ 量化详解:基于近似二阶信息的一次性权重量化

Posted on 2024-06-03 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 762 | 3 分钟
讲解 GPTQ 这一面向大语言模型的一次性权重量化方法:利用近似二阶信息逐层压缩权重,并结合 Transformers 加载 GPTQ-Int8 模型、用 AutoGPTQ 量化自定义模型以及配合 vLLM 部署的完整示例。
Read more »

LLM.int8() 量化详解:混合精度分解的 8-Bit 矩阵乘法

Posted on 2024-06-03 | In 大模型推理优化 , 显存与 GPU 利用率优化 | 530 | 2 分钟
讲解 LLM.int8() 的混合精度分解量化:先按列提取激活中的离群特征,对离群维度保留 FP16 高精度计算、对其余部分做 INT8 量化矩阵乘,最后反量化相加,在不掉点的前提下压低显存占用。
Read more »

BGE-M3 检索模型与私有化部署:FastAPI 向量服务搭建

Posted on 2024-06-02 | In 大模型全栈知识 , 模型认知与生态 | 427 | 2 分钟
梳理 BGE-M3 这一兼具多功能、多语言与多粒度特性的文本检索模型,并给出私有化部署方案:用 FastAPI 与 sentence-transformers 封装编码接口,配合 uvicorn 提供向量检索服务。
Read more »

InternLM2 模型卡梳理:20 万字长上下文与全维度能力提升

Posted on 2024-06-02 | In 大模型全栈知识 , 模型认知与生态 | 2.5k | 10 分钟
梳理 InternLM2 系列模型的特性:在 20 万字长输入中几乎完美实现长文大海捞针、在 LongBench 与 L-Eval 等长文任务上领先,并给出 Model Zoo、性能表现、依赖安装与半精度及量化加载的使用示例。
Read more »

旋转位置编码 RoPE 详解:从绝对位置编码到旋转变换

Posted on 2024-06-02 | In 大模型全栈知识 , 预训练注意力机制 | 5.2k | 23 分钟
系统推导旋转位置编码:从绝对位置编码与正弦编码出发,讨论良好位置编码应满足的性质,再用复数与旋转矩阵的形式推导 RoPE 如何用绝对位置的旋转表达相对位置关系。
Read more »

人类对齐与强化学习—DPO 直接偏好优化原理详解

Posted on 2024-06-02 | In 大模型训练与微调 , 人类对齐与强化学习 | 2.3k | 9 分钟
解读 DPO 论文:跳过显式奖励模型,把偏好优化直接写成语言模型上的分类损失。文章先梳理 RLHF 的 SFT、奖励建模与 RL 微调三阶段流水线,再展开 PPO 算法总览与 DPO 目标函数的推导。
Read more »

七大 LLM 推理服务框架横向对比与选型

Posted on 2024-06-01 | In 大模型推理优化 , 推理框架与系统架构 | 3.8k | 15 分钟
横向对比 vLLM、Text Generation Inference、CTranslate2、OpenLLM、Ray Serve 等七个主流大模型推理框架:各自的安装方式、适用场景与优缺点,帮助按批量吞吐、CPU 推理或流水线部署等需求选型。
Read more »

LLaMA-Factory 使用指南:从环境校验到自定义数据集微调

Posted on 2024-05-24 | In 大模型训练与微调 , 模型微调与参数高效适配 | 5.5k | 21 分钟
介绍使用 LLaMA-Factory 完成大模型微调的完整流程:硬件与 CUDA、PyTorch 环境校验,模型下载与可用性验证,原始模型推理,构建自定义数据集,以及预训练、指令微调与对齐等全链路训练方式。
Read more »

图解 BERT 与 ELMo:NLP 中的迁移学习与词嵌入演进

Posted on 2024-05-16 | In 大模型全栈知识 , 预训练与语言模型 | 3.9k | 14 分钟
以图解方式讲解 BERT 的工作原理:模型输入输出、与卷积神经网络的差异、词嵌入的演进,以及 ELMo 如何用语境化表示解决一词多义问题,帮助理解预训练加微调的迁移学习范式。
Read more »
1…111213…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%