跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

模型认知与生态Category

08-04

DeepSeek-V4 技术报告解读:混合注意力与百万 Token 上下文

06-10

Qwen3.5 与 Qwen3 深度架构对比:混合 SSM-Transformer 的效率革命

06-08

DeepSeek-V4 高效长上下文注意力:FP4 混合精度与稀疏注意力解析

09-08

LLM 领域重要论文清单:从 Transformer 到前沿探索

09-02

美团 LongCat-Flash 技术报告解读:5600 亿参数的智能体 MoE 模型

07-16

BGE-M3 详解:密集检索、多向量检索与稀疏检索三合一嵌入模型

07-03

MiniCPM-O 端侧全模态模型解读:端到端语音与视觉理解

04-22

手算 LLM 参数量:以 Qwen2.5-32B 为例逐层拆解

03-13

大语言模型简史:从 Transformer (2017) 到 DeepSeek-R1 (2025)

03-13

DeepSeek 进化史:从 V1、V2、V3 到 R1 的技术路线全梳理

03-05

LLM 参数量、计算量与显存占用分析:从 Decoder-Only 结构出发

02-18

DeepSeek-V3 技术报告解读:FP8 训练、DualPipe 与 MoE 负载均衡

1…345
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.6k 赣ICP备20004005号
0%