Inkling 技术报告解读:Thinking Machines Lab 的 975B 开源 MoE 模型

梳理 Thinking Machines Lab 首个开源模型 Inkling 的设计要点:975B 总参数的 MoE、长序列外推更优的相对位置编码与 Short Convolutions、无编码器的多模态输入,以及 Muon 与 Adam 混合优化器和 3000 万次 RL rollouts 的强化学习配方。

Inkling —技术报告摘要

来源:官方博文+ Model Card(无独立arXiv)
团队:Thinking Machines Lab(Mira Murati创立)
发布时间:2026.07
许可证:Apache2.0


1. 预训练 Recipe

训练策略

项目详情
模型架构MoE Transformer, 975B总参 / 41B激活
MoE设计遵循DeepSeek-V3:256 routed experts + 2 shared experts/layer, top-6 activated
RouterSigmoid + aux-loss-free load-balancing bias,routed与shared联合归一化
注意力滑动窗口:全局 = 5:1交错,8 KV heads
位置编码相对位置编码(非RoPE),长序列外推更优
Short Convolutions①K/V投影后 ②attention/MLP残差分支回主残差流前
多模态(无编码器)音频=dMel频谱图;图像=40×40 patches + 四层hMLP;轻量嵌入后与text联合处理
上下文1M tokens
优化器Muon(大矩阵权重)+ Adam(其他参数)
权重衰减耦合到lr²,保持权重规模稳定
硬件NVIDIA GB300 NVL72
同系列Inkling-Small:276B / 12B激活

训练数据

项目详情
总量45T tokens
模态文本 + 图像 + 音频 + 视频
数据配比原文未详述

2. 后训练 Recipe (SFT)

项目详情
覆盖数学、Agent代码/工具使用、音频、图像、对话、安全
初始SFT用开源模型(含Kimi K2.5)生成的合成数据引导
SFT占比少量计算,大部分给RL

3. RL Recipe

训练策略

项目详情
规模异步RL,3000万+次rollouts
性能曲线推理性能对数线性提升
Controllable Thinking Effort通过system message + per-token cost指定effort级别
涌现现象CoT自发精简化:完整语法句子→电报式压缩(非奖励目标驱动,纯效率压力)

认识论训练

项目详情
校准RL + proper scoring rules,大量已解决真实问题
评分器①Rubric评分器(清单评估)②Claims评分器(agent网络搜索验证每个事实声明)
弃权感知不确定时说”我不知道”

安全训练

项目详情
FORTRESS78.0%(开源最强)
StrongREJECT98.6%
关注CBRN、网络安全、失控、谄媚、弱势用户、有害操纵

4. 关键亮点

  1. 975B/41B MoE:开源权重最大参数模型之一
  2. 相对位置编码(非RoPE):长序列外推更优
  3. Short Convolutions:K/V后+残差分支输出前,双重位置
  4. 无编码器多模态:dMel音频+pixel patch图像直接嵌入
  5. Muon + Adam混合优化器 + 权重衰减耦合lr²
  6. 3000万次RL rollouts:推理性能对数线性提升
  7. CoT自发精简:效率压力下涌现的电报式思维
  8. 弃权感知+Claims验证:认识论训练提升可靠性
本文结束 感谢您的阅读