Agent 设计模式—记忆策略:八种 AI 记忆方案的原理与取舍 Posted on 2025-08-12 | In Agent 与 Workflow , Agent 设计模式 | 374 | 1 分钟记忆是 AI 智能体的核心能力之一。本文剖析全量记忆、滑动窗口、相关性过滤、摘要压缩、向量数据库、知识图谱、分层记忆与类操作系统内存管理八种常见记忆方案的原理、特点与适用场景。Read more »
多智能体应用测试用例设计:意图识别与协同精度验证 Posted on 2025-08-04 | In Agent 与 Workflow , 多 Agent 协作 | 1.2k | 4 分钟记录多智能体平台的测试用例设计:绑定通用聊天、故障检测与按姓名查询三个子智能体的意图识别应用,给出多智能体协同精度不低于 75%、单智能体意图识别与工具调用精度不低于 82% 的验收标准与典型用例。Read more »
多智能体系统 MAS 详解:为什么需要以及怎么做 Posted on 2025-07-29 | In Agent 与 Workflow , 多 Agent 协作 | 7.5k | 26 分钟以 Anthropic 的多智能体研究系统为例,讲解多智能体系统的价值与方法:非线性与涌现性、从预训练 scaling law 到推理计算 scaling law 的范式转移,以及主智能体与子智能体分工的最佳实践。Read more »
Agent 设计模式—多智能体框架:五大主流框架选型对比 Posted on 2025-07-24 | In Agent 与 Workflow , Agent 设计模式 | 441 | 1 分钟横向对比 AutoGen、CrewAI、LangGraph、OpenAI Swarm 与 Magentic-One 五个主流多智能体框架在定位、上手难度、可扩展性、LLM 支持与社区生态上的差异,并给出按业务场景快速选型的决策路径。Read more »
LLM 推理过程详解:Prefill 与 Decode 两阶段的差异与优化 Posted on 2025-07-23 | In 大模型推理优化 , 推理框架与系统架构 | 289 | 1 分钟拆解大语言模型推理的两个阶段:Prefill 阶段并行处理提示词并生成 KV 缓存,属于计算密集型;Decode 阶段逐个生成 token,属于显存带宽密集型,并分别给出两阶段的资源特征与优化技术。Read more »
主流大模型评测数据集速查:从 AIME、GPQA 到 MMLU Posted on 2025-07-22 | In 大模型训练与微调 , 数据工程与准备 | 402 | 1 分钟整理大模型常用评测数据集及其来源:AIME2025 数学竞赛题、GPQA 专家级多选问答、LiveCodeBench 编程竞赛题、Arena-hard 人类偏好对话、BFCL-v3 工具调用、MMLU 与 CMMLU 知识评测以及 ARC-AGI 抽象推理。Read more »
Agent 设计模式—智能体系统基础:Workflow 与 Agents 的架构抉择 Posted on 2025-07-21 | In Agent 与 Workflow , Agent 设计模式 | 1.1k | 3 分钟从 Anthropic 与 Google 的定义出发,辨析工作流系统与智能体系统在决策方式、确定性与适应性上的差异,给出智能体系统的设计策略,并解释为何在上下文窗口与工具规模的限制下需要引入多智能体协作。Read more »
BGE-M3 详解:密集检索、多向量检索与稀疏检索三合一嵌入模型 Posted on 2025-07-16 | In 大模型全栈知识 , 模型认知与生态 | 965 | 4 分钟BGE-M3 是一款同时支持密集检索、多向量检索与稀疏检索的多功能、多语言、多粒度文本嵌入模型。本文梳理三种检索方式的原理与权重计算示例,并给出混合检索加重排序的 RAG 实践方案。Read more »
Agent 设计模式—Agentic RAG:从传统 RAG 到智能体检索增强 Posted on 2025-07-10 | In Agent 与 Workflow , Agent 设计模式 | 1.6k | 5 分钟梳理 LLM 与 RAG 的最新进展(增强检索、语义缓存、多模态集成),解析 Agentic RAG 的定义、核心能力及其与传统 RAG 的差异,并详解路由、查询规划、工具使用、ReAct、动态规划与执行五类智能体的工作方式。Read more »
MiniCPM-O 端侧全模态模型解读:端到端语音与视觉理解 Posted on 2025-07-03 | In 大模型全栈知识 , 模型认知与生态 | 2.9k | 10 分钟解读面壁智能 MiniCPM-o 这一端侧多模态大模型系列:以端到端方式接受图像、视频、文本与音频输入并生成文本和语音输出,覆盖音频编码、语音解码、端到端视觉理解与全模态流式机制,8B 参数达到 GPT-4o 级别体验。Read more »
MinerU 官方镜像构建:基于 Sglang 的 Dockerfile 实践 Posted on 2025-06-10 | In 文档理解与知识抽取 , 文档解析与 OCR 技术 | 3.5k | 18 分钟记录基于 sglang 基础镜像构建 MinerU 官方 Docker 镜像的过程:安装 mineru core 依赖、下载并配置模型权重、设置容器入口命令,并说明视觉语言模型在整个文档解析链路中的角色定位。Read more »
探秘 Transformer 之(2):总体架构与文本生成执行流程 Posted on 2025-05-07 | In 大模型全栈知识 , Transformer 机制 | 12.2k | 45 分钟梳理 Transformer 的总体架构与执行流程:设计动机、模型结构与注意力模块,并按分词、编码、嵌入、位置编码、注意力计算到采样的顺序完整走一遍文本生成过程。Read more »