跳到正文
孔明の博客

AI 大模型研发与应用


  • Home

  • Archives

  • Search

Text-RCNN 详解:双向循环结构与最大池化的结合

Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 578 | 1 分钟
讲解 Text-RCNN 如何兼顾 RNN 与 CNN 的优势:用双向循环结构获取上下文信息以避免 RNN 的位置偏置,再用最大池化自动筛选对分类最重要的特征,绕过 CNN 滑动窗口大小难定的问题,并给出词表示与文本表示的学习过程。
Read more »

TextCNN 详解:用一维卷积抽取文本特征的经典模型

Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 1.5k | 5 分钟
讲解 TextCNN 的模型结构:依次经过嵌入层、一维卷积层、最大池化层、全连接层与 softmax,利用卷积和池化抽取关键词特征来完成句子分类,并说明多通道设置与不同卷积核尺寸的作用。
Read more »

Text-GCN 详解:用词共现图做文本分类

Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 499 | 1 分钟
讲解 Text-GCN:用词共现与文档-词关系为整个语料库构造一张异构图,把文档和词都作为节点,再用图卷积网络学习节点表示并送进分类器,无需预训练词嵌入即可在多个基准上超过当时的文本分类方法。
Read more »

TextRNN 详解:基于多任务学习的循环神经网络文本分类

Posted on 2025-09-08 | In NLP技术全景 , 深度学习文本模型 | 769 | 2 分钟
讲解这篇把多任务学习引入 RNN 文本分类的工作:现实问题常被拆成相互关联的子任务,文章提出三种不同的信息共享机制,让所有任务在同一个网络中共同学习,从而利用任务间的共享表示提升效果。
Read more »

命名实体识别 NER 综述:从词典规则到深度学习的技术演进

Posted on 2025-09-08 | In NLP技术全景 , NLP应用任务 | 5.7k | 20 分钟
系统梳理命名实体识别任务:从 MUC-6 提出的任务定义出发,介绍基于词典规则与统计机器学习的传统方法,再展开深度学习 NER 的通用框架——输入层、编码层与解码层的典型设计与代表模型。
Read more »

Elasticsearch 相似度算法详解:TF-IDF 与 BM25 的原理与演进

Posted on 2025-09-08 | In NLP技术全景 , 信息检索与搜索技术 | 470 | 1 分钟
讲解 Elasticsearch 计算文档相似度的两种核心算法:由词频与逆文档频率构成的 TF-IDF,以及 5.0 之后成为默认、在 7.x 中取代 TF-IDF 的 BM25,并说明自定义相似度算法的适用场景。
Read more »

FastText 详解:层次 Softmax 与 N-Gram 特征的高效文本分类

Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 946 | 3 分钟
讲解 Facebook AI Research 开源的 fastText 文本分类器:由模型架构、层次 Softmax 与 N-gram 特征三部分构成,在保持分类效果的同时把训练时间大幅缩短,并对比其与 word2vec 词向量的异同。
Read more »

Word2vec 详解:Skip-gram、CBOW 与训练技巧

Posted on 2025-09-08 | In NLP技术全景 , 文本表示与词嵌入技术 | 1.4k | 5 分钟
讲解 Word2vec 的原理:以语言模型为外壳、实际取训练后的权重作为词向量,分别展开用一个词预测上下文的 Skip-gram 与用上下文预测中心词的 CBOW,并推导一般情形与负采样、高频词下采样等训练 trick。
Read more »

隐马尔可夫模型(HMM)详解:概率图模型与序列标注原理

Posted on 2025-09-08 | In 机器学习 | 9.2k | 41 分钟
隐马尔可夫模型(HMM)是经典的概率图模型,通过隐藏状态序列与观测序列的联合建模,结合前向-后向算法与维特比算法解决分词、标注等序列问题。
Read more »

美团 LongCat-Flash 技术报告解读:5600 亿参数的智能体 MoE 模型

Posted on 2025-09-02 | In 大模型全栈知识 , 模型认知与生态 | 269 | 1 分钟
解读美团 LongCat-Flash 这一 5600 亿参数的混合专家模型:用零计算专家按 token 动态分配 186 亿到 313 亿激活参数、用快捷连接 MoE 提升推理效率,在兼顾计算效率的同时强化智能体能力。
Read more »

视觉多模态理解模型盘点(5~8 月):GLM-4.5V、MiMo-VL 等

Posted on 2025-08-19 | In 大模型全栈知识 , 多模态技术梳理 | 1.2k | 4 分钟
盘点 2025 年 5 到 8 月发布的视觉多模态模型:GLM-4.5V 与 GLM-4.1V-Thinking、MiMo-VL-7B-RL、MiniCPM-V-4、Intern-S1、step3、Qwen2.5-VL-72B、InternVL3-8B 与 Ovis2.5,逐一给出参数规模、上下文长度与能力特点。
Read more »

人类对齐与强化学习—On-Policy 与 Off-Policy 深度辨析

Posted on 2025-08-15 | In 大模型训练与微调 , 人类对齐与强化学习 | 199 | 1 分钟
从基本定义、原理区别、数学表达、实例类比到矛盾分析,逐层辨析强化学习中 on-policy 与 off-policy 两种学习策略的本质差异:训练所使用的数据究竟来自当前策略还是其他策略。
Read more »
1…567…16
戈孔明

戈孔明

185 posts
50 categories
736 tags
GitHub E-Mail
我的平台
  • 个人博客
  • 知识库
© 2020 — 2026 戈孔明 | 531.7k 赣ICP备20004005号
0%