梳理 Thinking Machines Lab 首个开源模型 Inkling 的设计要点:975B 总参数的 MoE、长序列外推更优的相对位置编码与 Short Convolutions、无编码器的多模态输入,以及 Muon 与 Adam 混合优化器和 3000 万次 RL rollouts 的强化学习配方。
Inkling —技术报告摘要
来源:官方博文+ Model Card(无独立arXiv)
团队:Thinking Machines Lab(Mira Murati创立)
发布时间:2026.07
许可证:Apache2.0
1. 预训练 Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 模型架构 | MoE Transformer, 975B总参 / 41B激活 |
| MoE设计 | 遵循DeepSeek-V3:256 routed experts + 2 shared experts/layer, top-6 activated |
| Router | Sigmoid + aux-loss-free load-balancing bias,routed与shared联合归一化 |
| 注意力 | 滑动窗口:全局 = 5:1交错,8 KV heads |
| 位置编码 | 相对位置编码(非RoPE),长序列外推更优 |
| Short Convolutions | ①K/V投影后 ②attention/MLP残差分支回主残差流前 |
| 多模态(无编码器) | 音频=dMel频谱图;图像=40×40 patches + 四层hMLP;轻量嵌入后与text联合处理 |
| 上下文 | 1M tokens |
| 优化器 | Muon(大矩阵权重)+ Adam(其他参数) |
| 权重衰减 | 耦合到lr²,保持权重规模稳定 |
| 硬件 | NVIDIA GB300 NVL72 |
| 同系列 | Inkling-Small:276B / 12B激活 |
训练数据
| 项目 | 详情 |
|---|---|
| 总量 | 45T tokens |
| 模态 | 文本 + 图像 + 音频 + 视频 |
| 数据配比 | 原文未详述 |
2. 后训练 Recipe (SFT)
| 项目 | 详情 |
|---|---|
| 覆盖 | 数学、Agent代码/工具使用、音频、图像、对话、安全 |
| 初始SFT | 用开源模型(含Kimi K2.5)生成的合成数据引导 |
| SFT占比 | 少量计算,大部分给RL |
3. RL Recipe
训练策略
| 项目 | 详情 |
|---|---|
| 规模 | 异步RL,3000万+次rollouts |
| 性能曲线 | 推理性能对数线性提升 |
| Controllable Thinking Effort | 通过system message + per-token cost指定effort级别 |
| 涌现现象 | CoT自发精简化:完整语法句子→电报式压缩(非奖励目标驱动,纯效率压力) |
认识论训练
| 项目 | 详情 |
|---|---|
| 校准 | RL + proper scoring rules,大量已解决真实问题 |
| 评分器 | ①Rubric评分器(清单评估)②Claims评分器(agent网络搜索验证每个事实声明) |
| 弃权感知 | 不确定时说”我不知道” |
安全训练
| 项目 | 详情 |
|---|---|
| FORTRESS | 78.0%(开源最强) |
| StrongREJECT | 98.6% |
| 关注 | CBRN、网络安全、失控、谄媚、弱势用户、有害操纵 |
4. 关键亮点
- 975B/41B MoE:开源权重最大参数模型之一
- 相对位置编码(非RoPE):长序列外推更优
- Short Convolutions:K/V后+残差分支输出前,双重位置
- 无编码器多模态:dMel音频+pixel patch图像直接嵌入
- Muon + Adam混合优化器 + 权重衰减耦合lr²
- 3000万次RL rollouts:推理性能对数线性提升
- CoT自发精简:效率压力下涌现的电报式思维
- 弃权感知+Claims验证:认识论训练提升可靠性

