2026年6月大模型发布全景汇总:80+条开源与商业模型动态梳理

统计区间: 2026-06-01 ~ 2026-06-18 | 共收录: 80+ 条模型发布动态


6/18

开源

  1. MolmoMotion (Allen AI) — 基于 Molmo 2 的视频 3D 运动预测模型,支持文本/点云指定轨迹预测。权重、数据集和基准已开源。huggingface.co/blog/allenai/molmomotion
  2. LOGOS 统一化学模型 (通智实验室/千问) — 首个统一”化学语法”的多任务化学可生成模型,1B 参数,合成预测 Top-1 准确率 74.8% 超越 NatureLM。模型权重、数据集与技术报告已开源。mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg

商业/API

  1. Grok 4.3 (xAI) — 在 Amazon Bedrock 上正式可用。100 万 token 上下文,支持可调推理努力级别。输入 $1.25/M token,输出 $2.50/M token。x.ai/news/grok-amazon-bedrock
  2. MaineCoon (Catnip) — 22B 实时音频-视觉原生多模态模型。x.com/testingcatalog/status/2067488704428380273

6/17

开源

  1. Sumi (全开源 7B 扩散 LLM) — 从头训练的全开源 7B 文本扩散模型,1.5T token 预训练。首个可复现的扩散 LLM 基准参考。arxiv.org/abs/2606.19005
  2. ACE-Ego (阿里/千问) — 开源具身 VLA 模型。ithome.com/0/965/292.htm
  3. GLM-5.2 (智谱/Z.ai) — MIT 协议开源,1M 上下文,Coding/Agent 能力大幅提升。CodeArena、Design Arena 等多项基准达开源第一。zhipuai.cn/zh/research/161
  4. MiniMax MSA + M3 — MiniMax 发表 MSA 稀疏注意力论文并开源 M3 模型权重。marktechpost.com

商业/API

  1. Cartesia Sonic 3.5 & Ink 2 — 实时语音模型栈,Sonic 3.5 文本转语音延迟约 82ms。x.com/testingcatalog/status/2066773392527655252
  2. Qwen-RobotManip / Qwen-RobotWorld / Qwen-RobotNav (阿里千问) — 三款具身 AI 模型:VLA 操作、世界模型、视觉导航。qwen.ai/blog?id=qwen-robotmanip
  3. Seedance 2.0 Mini (字节跳动) — 视频生成模型,比 2.0 Fast 快 2 倍,图生视频 0.023 元/千 tokens。ithome.com/0/964/672.htm
  4. Grok Imagine 1.5 Fast — 速度优化版,6 秒 720p 视频约 25 秒。x.com/testingcatalog/status/2067170263507087720
  5. Soniox v5 Real-Time — 低延迟实时语音转文本模型。x.com/ArtificialAnlys/status/2067257887815295291
  6. GPT-Bidi-1 (OpenAI) — 备选轻量模型,ChatGPT 端开始灰度。ithome.com/0/965/407.htm

6/16

开源

  1. MiniMax M3 权重 + MSA 技术 (MiniMax) — 428B 总参/23B 激活 MoE,原生多模态,1M 上下文。GDPval-AA 开源第一,Code Arena 领先。mp.weixin.qq.com/s/AW6L89QZkwN-jD27hQ84ww
  2. GLM-5.2 (智谱) — MIT 协议,1M 上下文,DeepSWE SOTA 46.2%。x.com/berryxia/status/2067033511069135005
  3. SubQ 1.1 Small — 小参数轻量模型。subq.ai
  4. Ling & Ring 2.6 (蚂蚁集团) — Hybrid Linear Attention 架构。Ling-2.6-1T token efficiency 领先约 4 倍。mp.weixin.qq.com/s/j8ZXKvDZzMkSSiUyXecqGA
  5. Qwen-Robot Suite (阿里千问) — 三合一具身 AI 模型基准套件。qwen.ai/blog?id=qwen-robotsuite
  6. Mistral “fat” 开源模型系列 — Mistral 预发布新开源系列。x.com/testingcatalog/status/2066924902372802779

商业/API

  1. DFlash + Spec V2 (Z Lab/Modal/SGLang) — 下一代投机解码,Qwen 3.5 397B 推理速度达 4.3x。lmsys.org
  2. Catnip MaineCoon — 22B 实时音频-视觉原生模型。
  3. Seedance 2.0 Mini (字节跳动) — 低成本视频生成。
  4. xAI Grok Imagine Video 1.5 — 视频生成模型,6 秒 720p 约 25 秒。x.ai/news/grok-imagine-video-1-5
  5. Step 3.7 Flash (阶跃星辰) — 上线 Novita & OpenRouter。
  6. OpenAI GPT-Bidi-1 — 灰度测试中。

6/15

开源

  1. MiniMax M3 正式开源 — 原生多模态权重全量发布。ithome.com/0/964/598.htm
  2. Pythagoras-Prover (4B) — 数学定理证明扩散模型,无需验证器。x.com/rohanpaul_ai/status/2066656699826786513

商业/API

  1. Z.ai GLM-5.2 — 正式上线,1M 上下文,Coding Plan 发布。
  2. Perceptron Agentic Detection 视觉模型
  3. FSD V14 (特斯拉) — 基于 VLA 架构的全新端到端自动驾驶。
  4. ZCode (智谱) — Codex 级代码助手。

6/14

开源

  1. Step 3.7 Flash — 上线 DeepInfra。x.com/StepFun_ai/status/2066053068337402211

商业/API

  1. Rio3.5 (约旦卢 AI 实验室) — 推理模型,基准超越 Qwen3.7。twitter.com/zenmagnets/status/2065796012820848699
  2. Seedance 2.0 Mini (字节跳动) — Dreamina 集成。

6/13

开源

  1. MiniMax M3 权重 + HuggingFace — 428B 总参/23B 激活。
  2. Kimi K2.7-Code (月之暗面) — 编程模型,Kimi Code Bench v2 相比 K2.6 提升 21.8%,token 使用减少 30%。x.com/Kimi_Moonshot/status/2065377579130142937
  3. GLM-5.2 (智谱) — 旗舰开源,1M 上下文,MIT 协议。
  4. Rio 3.5 Open 397B — 开源 397B MoE,超越 Qwen 3.7。x.com/kimmonismus/status/2065911865390063791

商业/API

  1. Gemini-SQL2 (Google) — Text-to-SQL 准确率 80.04%。ithome.com/0/963/820.htm
  2. X2-VL (科大讯飞) — 全自研多模态大模型。
  3. “Count Anything” (新 AI 模型) — 图像任意物体计数。
  4. NVIDIA Cosmos 3 — 全多态世界模型,Physical AI。
  5. Gemini SQL2 — Text-to-SQL 大幅领先。

6/12

商业/API

  1. Gemini Omni Flash (Google) — 视频理解达 SOTA,支持图像/视频/文本/音频编辑。x.com/OfficialLoganK/status/2065118111360303414
  2. Midjourney V8.1 — 取代 V7 成为默认模型,HD 模式支持。updates.midjourney.com

开源

  1. Kimi K2.7-Code (月之暗面) — 更高 token 效率的编程模型,HuggingFace 发布。huggingface.co/moonshotai/Kimi-K2.7-Code
  2. VISTA-4B (inclusionAI) — 基于 Qwen3.5-4B 的 GUI 定位视觉模型,开源 HuggingFace。huggingface.co/inclusionAI/VISTA-4B

6/11

开源

  1. DiffusionGemma (Google DeepMind) — 文本扩散模型,4x 速度提升,26B MoE 达 1000+ tokens/s。Apache 2.0。deepmind.google/blog/diffusiongemma-4x-faster-text-generation
  2. DeepSeek-R1 开源实现 (Hugging Face open-r1) — 完全开源复现。github.com/huggingface/open-r1

商业/API

  1. Grok Voice (xAI) — 语音交互新功能。

6/10

开源

  1. Gemma 4 12B (Google DeepMind) — 统一无编码器多模态,逼近 26B MoE,16GB 显存可跑。Apache 2.0。deepmind.google/blog/introducing-gemma-4-12b-a-unified-encoder-free-multimodal-model
  2. Cohere North Mini Code — 30B MoE (3B 激活),Apache 2.0,Coding Index 33.4%。huggingface.co/blog/CohereLabs/introducing-north-mini-code
  3. MiMo-V2.5-Pro-UltraSpeed (小米) — 1T MoE 达 1000+ tokens/s,部分开源。mp.weixin.qq.com/s/EZvmrx8xfM9MZNCMDwImFQ

商业/API

  1. Claude Fable 5 & Claude Mythos 5 (Anthropic) — Fable 5 通识版多项 SOTA,Mythos 5 无安全限制版。均 $10/$50 per M tokens。anthropic.com/news/claude-fable-5-mythos-5

6/9

开源

  1. VoxCPM2 (OpenBMB) — 2B 语音生成模型,200 小时数据训练,支持 30 种语言。Apache 2.0。x.com/OpenBMB/status/2063991963133903317

商业/API

  1. MiMo-V2.5-Pro-UltraSpeed (小米) — 1T 参数 MoE 突破 1000 tokens/s。
  2. Apple Foundation Models 第三代 — Apple Intelligence 核心,端+云架构。machinelearning.apple.com
  3. ABot-Earth0.5 (高德) — 全球首个 3D 原生世界生成模型,覆盖 190+ 国家。ithome.com/0/961/378.htm

6/8

开源

  1. Harness-1 (UIUC/Chroma) — 20B 检索智能体,强化学习训练。权重开源。marktechpost.com

6/6

商业/API

  1. Riverflow 2.5 — 高分辨率文生图模型。x.com/OpenRouter

6/5

开源

  1. Nemotron 3.5 Content Safety (NVIDIA) — 基于 Gemma 3 4B 的可定制多模态安全模型。
  2. Google Magenta RealTime 2 (MRT2) — 实时音乐生成,MacBook 延迟 <200ms。

商业/API

  1. Nex-N2-Pro (neolab) — 基于 Qwen3.5-397B-A17B 的 MoE 模型,性能达 GPT-5.5 水平。
  2. NVIDIA Nemotron 3 Ultra — 专为长时间运行 Agent 设计的高效推理模型。

6/4

开源

  1. Miso One — 8B 开源语音模型,110ms 延迟。x.com/kimmonismus

商业/API

  1. Grok Imagine 1.5 Preview (xAI) — 图像生成预览版。
  2. Ideogram v4.0 — 2K 分辨率 + JSON 提示词支持。

6/3

开源

  1. Step 3.7 Flash (阶跃星辰) — 196B MoE,Apache 2.0。KV-cache 为 DeepSeek 的约 22%,高效推理。x.com/StepFun_ai/status/2061655529731342402
  2. Holo3.1 (H Company) — 基于 Qwen 的 GUI 代理模型,0.8B~35B 多种尺寸。

商业/API

  1. MAI-Thinking-1 (微软) — 中等规模推理模型,”干净数据”训练,Build 2026 发布。theverge.com

6/2

开源

  1. MiniMax M3 — 100 万 token 上下文、原生态模态、MSA 稀疏注意力。首个预训练阶段即融合多模态的开源模型。minimax.io/blog/minimax-m3
  2. JetBrains Mellum2 — 12B 代码专用 MoE 模型,HuggingFace 发布。huggingface.co/blog/JetBrains/mellum2-launch
  3. SenseNova-U1-8B-MoT-Infographic (商汤) — 专注信息图表理解的视觉模型。

商业/API

  1. xAI Composer 2.5 — 快速建模 IDE 集成。
  2. Qwen3.7-Plus (阿里千问) — 多模态能力全功能增强。
  3. NVIDIA Cosmos 3 — Physical AI 世界与动作模型。

6/1

6/1 日报主题为 OpenAI 发布 Rosalind。模型发布数据较少。


按类型汇总

开源模型(权重可下载 / 可本地部署)

日期模型厂商规模协议
6/02MiniMax M3MiniMax428B MoE (23B active)
6/02Mellum2JetBrains12B MoE
6/02SenseNova-U1-8B-MoT-Infographic商汤8B
6/03Step 3.7 Flash阶跃星辰196B MoEApache 2.0
6/03Holo3.1H Company0.8B~35B
6/04Miso OneMiso8B
6/05Nemotron 3.5 Content SafetyNVIDIA基于 Gemma 3 4B
6/05Magenta RealTime 2Google
6/08Harness-1UIUC/Chroma20B开源
6/09VoxCPM2OpenBMB2BApache 2.0
6/10Gemma 4 12BGoogle DeepMind12BApache 2.0
6/10North Mini CodeCohere30B MoE (3B active)Apache 2.0
6/10MiMo UltraSpeed (部分)小米1T MoE
6/11DiffusionGemmaGoogle DeepMind26B MoEApache 2.0
6/11DeepSeek-R1 开源复现Hugging Face开源
6/12Kimi K2.7-Code月之暗面开源
6/12VISTA-4BinclusionAI4B开源
6/13MiniMax M3 权重全量MiniMax428B MoE
6/13GLM-5.2智谱 AIMIT
6/13Rio 3.5 Open 397B约旦卢实验室397B MoE
6/15M3 正式开源MiniMax
6/15Pythagoras-Prover4B
6/16Ling & Ring 2.6蚂蚁集团开源
6/16Qwen-Robot Suite阿里千问开源
6/16Mistral “fat” 系列Mistral开源
6/17Sumi 7B Diffusion LLM7B开源
6/17ACE-Ego VLA阿里开源
6/18MolmoMotionAllen AI开源
6/18LOGOS 化学模型通智实验室/千问1B开源

商业 / API 模型

日期模型厂商亮点
6/02Composer 2.5xAIIDE 集成建模
6/02Qwen3.7-Plus阿里千问多模态能力增强
6/02NVIDIA Cosmos 3NVIDIAPhysical AI 世界模型
6/03MAI-Thinking-1微软中等推理模型
6/04Grok Imagine 1.5xAI图像生成预览
6/04Ideogram v4.0Ideogram2K 分辨率
6/05Nex-N2-ProneolabGPT-5.5 级别性能
6/05Nemotron 3 UltraNVIDIA长时 Agent 推理
6/06Riverflow 2.5高分辨率文生图
6/09MiMo-V2.5-Pro-UltraSpeed小米1T MoE 1000+ tokens/s
6/09AFM 第三代Apple端+云架构
6/09ABot-Earth0.5高德3D 世界生成模型
6/10Claude Fable 5 / Mythos 5Anthropic多项 SOTA
6/11Grok VoicexAI语音交互
6/12Gemini Omni FlashGoogle视频理解 SOTA
6/12Midjourney V8.1Midjourney默认升级
6/13Gemini-SQL2GoogleText-to-SQL 80.04%
6/13X2-VL科大讯飞全自研多模态
6/14Rio3.5约旦卢实验室超越 Qwen3.7
6/15Z.ai GLM-5.2智谱1M 上下文
6/16DFlash Spec V2Z Lab/Modal/SGLang投机解码 4.3x
6/16Grok Imagine Video 1.5xAI视频生成
6/16GPT-Bidi-1OpenAI轻量模型灰度
6/17Cartesia Sonic 3.5 / Ink 2Cartesia实时语音 #1
6/17Seedance 2.0 Mini字节跳动低成本视频生成
6/17Qwen-Robot 系列阿里千问具身 AI 三件套
6/17Soniox v5 Real-TimeSoniox实时语音转文本
6/18Grok 4.3xAIAmazon Bedrock
6/18MaineCoon 22BCatnip实时音视频原生

关键趋势

  1. 中国模型开源井喷: MiniMax M3、GLM-5.2、Kimi K2.7-Code、Ling & Ring 2.6、Step 3.7 Flash 等密集开源,GLM-5.2 在多项基准首次达到闭源旗舰水平。
  2. 具身 AI 爆发: 阿里 Qwen-Robot 三件套(Manip/World/Nav)、特斯拉 FSD V14、小米 MiMo、Google DiffusionGemma 等形成密集发布潮。
  3. 实时语音成为新战场: Cartesia Sonic 3.5/Ink 2、Google MRT2、Soniox v5、Catnip MaineCoon、Grok Voice 等多款实时语音模型密集发布。
  4. 扩散架构复兴: DiffusionGemma (4x 加速)、Sumi (7B 扩散 LLM) 挑战自回归范式。
  5. 1M token 上下文成标配: GLM-5.2、MiniMax M3、Grok 4.3 均支持百万级上下文。
本文结束 感谢您的阅读