Text-RCNN 详解:双向循环结构与最大池化的结合 Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 578 | 1 分钟讲解 Text-RCNN 如何兼顾 RNN 与 CNN 的优势:用双向循环结构获取上下文信息以避免 RNN 的位置偏置,再用最大池化自动筛选对分类最重要的特征,绕过 CNN 滑动窗口大小难定的问题,并给出词表示与文本表示的学习过程。Read more »
TextCNN 详解:用一维卷积抽取文本特征的经典模型 Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 1.5k | 5 分钟讲解 TextCNN 的模型结构:依次经过嵌入层、一维卷积层、最大池化层、全连接层与 softmax,利用卷积和池化抽取关键词特征来完成句子分类,并说明多通道设置与不同卷积核尺寸的作用。Read more »
Text-GCN 详解:用词共现图做文本分类 Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 499 | 1 分钟讲解 Text-GCN:用词共现与文档-词关系为整个语料库构造一张异构图,把文档和词都作为节点,再用图卷积网络学习节点表示并送进分类器,无需预训练词嵌入即可在多个基准上超过当时的文本分类方法。Read more »
TextRNN 详解:基于多任务学习的循环神经网络文本分类 Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 769 | 2 分钟讲解这篇把多任务学习引入 RNN 文本分类的工作:现实问题常被拆成相互关联的子任务,文章提出三种不同的信息共享机制,让所有任务在同一个网络中共同学习,从而利用任务间的共享表示提升效果。Read more »
命名实体识别 NER 综述:从词典规则到深度学习的技术演进 Posted on 2025-09-08 | In NLP技术全景 , NLP应用任务 | 5.7k | 20 分钟系统梳理命名实体识别任务:从 MUC-6 提出的任务定义出发,介绍基于词典规则与统计机器学习的传统方法,再展开深度学习 NER 的通用框架——输入层、编码层与解码层的典型设计与代表模型。Read more »
Elasticsearch 相似度算法详解:TF-IDF 与 BM25 的原理与演进 Posted on 2025-09-08 | In NLP技术全景 , 信息检索与搜索技术 | 470 | 1 分钟讲解 Elasticsearch 计算文档相似度的两种核心算法:由词频与逆文档频率构成的 TF-IDF,以及 5.0 之后成为默认、在 7.x 中取代 TF-IDF 的 BM25,并说明自定义相似度算法的适用场景。Read more »
FastText 详解:层次 Softmax 与 N-Gram 特征的高效文本分类 Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 946 | 3 分钟讲解 Facebook AI Research 开源的 fastText 文本分类器:由模型架构、层次 Softmax 与 N-gram 特征三部分构成,在保持分类效果的同时把训练时间大幅缩短,并对比其与 word2vec 词向量的异同。Read more »
Word2vec 详解:Skip-gram、CBOW 与训练技巧 Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 1.4k | 5 分钟讲解 Word2vec 的原理:以语言模型为外壳、实际取训练后的权重作为词向量,分别展开用一个词预测上下文的 Skip-gram 与用上下文预测中心词的 CBOW,并推导一般情形与负采样、高频词下采样等训练 trick。Read more »
隐马尔可夫模型(HMM)详解:概率图模型与序列标注原理 Posted on 2025-09-08 | In 机器学习 | 9.2k | 41 分钟隐马尔可夫模型(HMM)是经典的概率图模型,通过隐藏状态序列与观测序列的联合建模,结合前向-后向算法与维特比算法解决分词、标注等序列问题。Read more »
美团 LongCat-Flash 技术报告解读:5600 亿参数的智能体 MoE 模型 Posted on 2025-09-02 | In 大模型全栈知识 , 模型认知与生态 | 269 | 1 分钟解读美团 LongCat-Flash 这一 5600 亿参数的混合专家模型:用零计算专家按 token 动态分配 186 亿到 313 亿激活参数、用快捷连接 MoE 提升推理效率,在兼顾计算效率的同时强化智能体能力。Read more »
视觉多模态理解模型盘点(5~8 月):GLM-4.5V、MiMo-VL 等 Posted on 2025-08-19 | In 大模型全栈知识 , 多模态技术梳理 | 1.2k | 4 分钟盘点 2025 年 5 到 8 月发布的视觉多模态模型:GLM-4.5V 与 GLM-4.1V-Thinking、MiMo-VL-7B-RL、MiniCPM-V-4、Intern-S1、step3、Qwen2.5-VL-72B、InternVL3-8B 与 Ovis2.5,逐一给出参数规模、上下文长度与能力特点。Read more »
人类对齐与强化学习—On-Policy 与 Off-Policy 深度辨析 Posted on 2025-08-15 | In 大模型训练与微调 , 人类对齐与强化学习 | 199 | 1 分钟从基本定义、原理区别、数学表达、实例类比到矛盾分析,逐层辨析强化学习中 on-policy 与 off-policy 两种学习策略的本质差异:训练所使用的数据究竟来自当前策略还是其他策略。Read more »