DeepSeek-V4 技术报告解读:混合注意力与百万 Token 上下文 Posted on 2026-08-04 | In 大模型全栈知识 , 模型认知与生态 | 1.6k | 6 分钟梳理 DeepSeek-V4 面向百万 token 上下文的架构设计:压缩稀疏注意力 CSA 与 HCA 交替的混合注意力、V4-Pro 的架构参数、预训练与后训练的 On-Policy 蒸馏配方,以及支撑超长上下文的基础设施设计。Read more »
vLLM 推理框架部署 Qwen3-235B-A22B 大语言模型实践 Posted on 2026-07-23 | In 大语言模型 | 10.2k | 62 分钟本文记录使用vLLM部署Qwen3-235B-A22B大语言模型的完整过程,涵盖Docker启动参数、服务日志与推理配置要点。Read more »
Qwen3.5 与 Qwen3 深度架构对比:混合 SSM-Transformer 的效率革命 Posted on 2026-06-10 | In 大模型全栈知识 , 模型认知与生态 | 503 | 1 分钟逐项对比 Qwen3 与 Qwen3.5 的架构差异:混合 SSM-Transformer 设计、Gated DeltaNet 线性注意力层的参数构成、视觉编码器与图文对齐方式的演进,并解释 DeepStack 为何在 Qwen3.5 中消失以及序列并行支持的取舍。Read more »
DeepSeek-V4 高效长上下文注意力:FP4 混合精度与稀疏注意力解析 Posted on 2026-06-08 | In 大模型全栈知识 , 模型认知与生态 | 2.1k | 7 分钟解析 DeepSeek-V4 在百万 token 长上下文下的注意力设计:专家权重 FP4 与其他参数 FP8 的混合精度存储、DeepSeek 稀疏注意力(DSA)降低注意力计算成本,以及 vLLM 保持 KV 缓存紧凑与 GPU 满载的实现手段。Read more »
Glyph 技术报告解读:把长文本渲染成图像的上下文压缩方案 Posted on 2025-10-30 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 1.3k | 4 分钟Glyph 不再把文本当作离散 token 序列直接输入 LLM,而是先渲染成紧凑图像再用视觉语言模型处理,用一个视觉 token 承载数十个文本 token。本文解读其研究背景、技术架构与性能评估。Read more »
上下文工程 Context Engineering 综述:超越提示词的信息负载优化 Posted on 2025-10-28 | In 大模型全栈知识 , 上下文工程 | 813 | 2 分钟梳理上下文工程这一正式学科:它超越简单的提示设计,系统优化大语言模型的信息负载。文章分基础组件与系统实现两层展开,并给出从检索增强生成到多智能体架构与工具集成推理的发展脉络。Read more »
dots.ocr 模型部署实战:基于 vLLM 的推理服务与解析流程 Posted on 2025-10-27 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 686 | 3 分钟记录 dots.ocr 的部署方式:自 vLLM 0.11.0 起已集成 Dots OCR,可直接用官方镜像启动模型服务器,并给出版面全解析、单图与单 PDF 解析的命令示例与提示词模式说明。Read more »
dots.ocr 技术报告解读:单模型统一布局检测与内容识别 Posted on 2025-10-27 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 545 | 1 分钟解读 dots.ocr 如何用一个 17 亿参数的视觉语言模型统一文档布局检测与内容识别并保持正确阅读顺序:在 OmniDocBench 上取得文本、表格与阅读顺序的 SOTA,且对低资源语言有很强的解析能力。Read more »
PaddleOCR-VL 模型部署实战:Docker 镜像与 vLLM 服务启动 Posted on 2025-10-27 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 346 | 1 分钟记录用 PaddleOCR 官方 Docker 镜像快速启动 vLLM 推理服务、部署 PaddleOCR-VL-0.9B 的过程,包含 GPU 与网络参数配置、服务启动命令,以及官方流水线用法的参考链接。Read more »
MinerU2.5 模型部署实战:vLLM 镜像与解析服务搭建 Posted on 2025-10-27 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 434 | 2 分钟记录在容器内部署 MinerU2.5 的完整流程:拉取并改造 vLLM 镜像、替换国内 APT 与 PyPI 源、安装字体依赖与 mineru 包、下载模型权重,以及启动文档解析服务的命令与常见问题处理。Read more »
DeepSeek-OCR 模型部署实战:Docker 镜像与 vLLM 推理服务 Posted on 2025-10-27 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 531 | 2 分钟记录在容器内部署 DeepSeek-OCR 的完整流程:拉取并配置 vLLM 镜像、创建 Python 3.12 环境、安装指定版本的 vLLM 与 flash-attn,以及启动 OpenAI 兼容推理服务的关键命令与踩坑点。Read more »
MinerU2.5 技术报告解读:解耦两阶段的高精度文档解析模型 Posted on 2025-10-24 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 1.4k | 5 分钟解读上海 AI 实验室 MinerU2.5 如何用 1.2B 参数在文档解析上超越通用多模态大模型:把全局布局分析与局部内容识别解耦为两阶段,在 OmniDocBench 等主流基准全面领先,并梳理其数据引擎与评估优化。Read more »