统计区间: 2026-06-01 ~ 2026-06-18 | 共收录: 80+ 条模型发布动态
6/18
开源
- MolmoMotion (Allen AI) — 基于 Molmo 2 的视频 3D 运动预测模型,支持文本/点云指定轨迹预测。权重、数据集和基准已开源。huggingface.co/blog/allenai/molmomotion
- LOGOS 统一化学模型 (通智实验室/千问) — 首个统一”化学语法”的多任务化学可生成模型,1B 参数,合成预测 Top-1 准确率 74.8% 超越 NatureLM。模型权重、数据集与技术报告已开源。mp.weixin.qq.com/s/50q5uY849FKnBzk1Q04MRg
商业/API
- Grok 4.3 (xAI) — 在 Amazon Bedrock 上正式可用。100 万 token 上下文,支持可调推理努力级别。输入 $1.25/M token,输出 $2.50/M token。x.ai/news/grok-amazon-bedrock
- MaineCoon (Catnip) — 22B 实时音频-视觉原生多模态模型。x.com/testingcatalog/status/2067488704428380273
6/17
开源
- Sumi (全开源 7B 扩散 LLM) — 从头训练的全开源 7B 文本扩散模型,1.5T token 预训练。首个可复现的扩散 LLM 基准参考。arxiv.org/abs/2606.19005
- ACE-Ego (阿里/千问) — 开源具身 VLA 模型。ithome.com/0/965/292.htm
- GLM-5.2 (智谱/Z.ai) — MIT 协议开源,1M 上下文,Coding/Agent 能力大幅提升。CodeArena、Design Arena 等多项基准达开源第一。zhipuai.cn/zh/research/161
- MiniMax MSA + M3 — MiniMax 发表 MSA 稀疏注意力论文并开源 M3 模型权重。marktechpost.com
商业/API
- Cartesia Sonic 3.5 & Ink 2 — 实时语音模型栈,Sonic 3.5 文本转语音延迟约 82ms。x.com/testingcatalog/status/2066773392527655252
- Qwen-RobotManip / Qwen-RobotWorld / Qwen-RobotNav (阿里千问) — 三款具身 AI 模型:VLA 操作、世界模型、视觉导航。qwen.ai/blog?id=qwen-robotmanip
- Seedance 2.0 Mini (字节跳动) — 视频生成模型,比 2.0 Fast 快 2 倍,图生视频 0.023 元/千 tokens。ithome.com/0/964/672.htm
- Grok Imagine 1.5 Fast — 速度优化版,6 秒 720p 视频约 25 秒。x.com/testingcatalog/status/2067170263507087720
- Soniox v5 Real-Time — 低延迟实时语音转文本模型。x.com/ArtificialAnlys/status/2067257887815295291
- GPT-Bidi-1 (OpenAI) — 备选轻量模型,ChatGPT 端开始灰度。ithome.com/0/965/407.htm
6/16
开源
- MiniMax M3 权重 + MSA 技术 (MiniMax) — 428B 总参/23B 激活 MoE,原生多模态,1M 上下文。GDPval-AA 开源第一,Code Arena 领先。mp.weixin.qq.com/s/AW6L89QZkwN-jD27hQ84ww
- GLM-5.2 (智谱) — MIT 协议,1M 上下文,DeepSWE SOTA 46.2%。x.com/berryxia/status/2067033511069135005
- SubQ 1.1 Small — 小参数轻量模型。subq.ai
- Ling & Ring 2.6 (蚂蚁集团) — Hybrid Linear Attention 架构。Ling-2.6-1T token efficiency 领先约 4 倍。mp.weixin.qq.com/s/j8ZXKvDZzMkSSiUyXecqGA
- Qwen-Robot Suite (阿里千问) — 三合一具身 AI 模型基准套件。qwen.ai/blog?id=qwen-robotsuite
- Mistral “fat” 开源模型系列 — Mistral 预发布新开源系列。x.com/testingcatalog/status/2066924902372802779
商业/API
- DFlash + Spec V2 (Z Lab/Modal/SGLang) — 下一代投机解码,Qwen 3.5 397B 推理速度达 4.3x。lmsys.org
- Catnip MaineCoon — 22B 实时音频-视觉原生模型。
- Seedance 2.0 Mini (字节跳动) — 低成本视频生成。
- xAI Grok Imagine Video 1.5 — 视频生成模型,6 秒 720p 约 25 秒。x.ai/news/grok-imagine-video-1-5
- Step 3.7 Flash (阶跃星辰) — 上线 Novita & OpenRouter。
- OpenAI GPT-Bidi-1 — 灰度测试中。
6/15
开源
- MiniMax M3 正式开源 — 原生多模态权重全量发布。ithome.com/0/964/598.htm
- Pythagoras-Prover (4B) — 数学定理证明扩散模型,无需验证器。x.com/rohanpaul_ai/status/2066656699826786513
商业/API
- Z.ai GLM-5.2 — 正式上线,1M 上下文,Coding Plan 发布。
- Perceptron Agentic Detection 视觉模型。
- FSD V14 (特斯拉) — 基于 VLA 架构的全新端到端自动驾驶。
- ZCode (智谱) — Codex 级代码助手。
6/14
开源
- Step 3.7 Flash — 上线 DeepInfra。x.com/StepFun_ai/status/2066053068337402211
商业/API
- Rio3.5 (约旦卢 AI 实验室) — 推理模型,基准超越 Qwen3.7。twitter.com/zenmagnets/status/2065796012820848699
- Seedance 2.0 Mini (字节跳动) — Dreamina 集成。
6/13
开源
- MiniMax M3 权重 + HuggingFace — 428B 总参/23B 激活。
- Kimi K2.7-Code (月之暗面) — 编程模型,Kimi Code Bench v2 相比 K2.6 提升 21.8%,token 使用减少 30%。x.com/Kimi_Moonshot/status/2065377579130142937
- GLM-5.2 (智谱) — 旗舰开源,1M 上下文,MIT 协议。
- Rio 3.5 Open 397B — 开源 397B MoE,超越 Qwen 3.7。x.com/kimmonismus/status/2065911865390063791
商业/API
- Gemini-SQL2 (Google) — Text-to-SQL 准确率 80.04%。ithome.com/0/963/820.htm
- X2-VL (科大讯飞) — 全自研多模态大模型。
- “Count Anything” (新 AI 模型) — 图像任意物体计数。
- NVIDIA Cosmos 3 — 全多态世界模型,Physical AI。
- Gemini SQL2 — Text-to-SQL 大幅领先。
6/12
商业/API
- Gemini Omni Flash (Google) — 视频理解达 SOTA,支持图像/视频/文本/音频编辑。x.com/OfficialLoganK/status/2065118111360303414
- Midjourney V8.1 — 取代 V7 成为默认模型,HD 模式支持。updates.midjourney.com
开源
- Kimi K2.7-Code (月之暗面) — 更高 token 效率的编程模型,HuggingFace 发布。huggingface.co/moonshotai/Kimi-K2.7-Code
- VISTA-4B (inclusionAI) — 基于 Qwen3.5-4B 的 GUI 定位视觉模型,开源 HuggingFace。huggingface.co/inclusionAI/VISTA-4B
6/11
开源
- DiffusionGemma (Google DeepMind) — 文本扩散模型,4x 速度提升,26B MoE 达 1000+ tokens/s。Apache 2.0。deepmind.google/blog/diffusiongemma-4x-faster-text-generation
- DeepSeek-R1 开源实现 (Hugging Face open-r1) — 完全开源复现。github.com/huggingface/open-r1
商业/API
- Grok Voice (xAI) — 语音交互新功能。
6/10
开源
- Gemma 4 12B (Google DeepMind) — 统一无编码器多模态,逼近 26B MoE,16GB 显存可跑。Apache 2.0。deepmind.google/blog/introducing-gemma-4-12b-a-unified-encoder-free-multimodal-model
- Cohere North Mini Code — 30B MoE (3B 激活),Apache 2.0,Coding Index 33.4%。huggingface.co/blog/CohereLabs/introducing-north-mini-code
- MiMo-V2.5-Pro-UltraSpeed (小米) — 1T MoE 达 1000+ tokens/s,部分开源。mp.weixin.qq.com/s/EZvmrx8xfM9MZNCMDwImFQ
商业/API
- Claude Fable 5 & Claude Mythos 5 (Anthropic) — Fable 5 通识版多项 SOTA,Mythos 5 无安全限制版。均 $10/$50 per M tokens。anthropic.com/news/claude-fable-5-mythos-5
6/9
开源
- VoxCPM2 (OpenBMB) — 2B 语音生成模型,200 小时数据训练,支持 30 种语言。Apache 2.0。x.com/OpenBMB/status/2063991963133903317
商业/API
- MiMo-V2.5-Pro-UltraSpeed (小米) — 1T 参数 MoE 突破 1000 tokens/s。
- Apple Foundation Models 第三代 — Apple Intelligence 核心,端+云架构。machinelearning.apple.com
- ABot-Earth0.5 (高德) — 全球首个 3D 原生世界生成模型,覆盖 190+ 国家。ithome.com/0/961/378.htm
6/8
开源
- Harness-1 (UIUC/Chroma) — 20B 检索智能体,强化学习训练。权重开源。marktechpost.com
6/6
商业/API
- Riverflow 2.5 — 高分辨率文生图模型。x.com/OpenRouter
6/5
开源
- Nemotron 3.5 Content Safety (NVIDIA) — 基于 Gemma 3 4B 的可定制多模态安全模型。
- Google Magenta RealTime 2 (MRT2) — 实时音乐生成,MacBook 延迟 <200ms。
商业/API
- Nex-N2-Pro (neolab) — 基于 Qwen3.5-397B-A17B 的 MoE 模型,性能达 GPT-5.5 水平。
- NVIDIA Nemotron 3 Ultra — 专为长时间运行 Agent 设计的高效推理模型。
6/4
开源
- Miso One — 8B 开源语音模型,110ms 延迟。x.com/kimmonismus
商业/API
- Grok Imagine 1.5 Preview (xAI) — 图像生成预览版。
- Ideogram v4.0 — 2K 分辨率 + JSON 提示词支持。
6/3
开源
- Step 3.7 Flash (阶跃星辰) — 196B MoE,Apache 2.0。KV-cache 为 DeepSeek 的约 22%,高效推理。x.com/StepFun_ai/status/2061655529731342402
- Holo3.1 (H Company) — 基于 Qwen 的 GUI 代理模型,0.8B~35B 多种尺寸。
商业/API
- MAI-Thinking-1 (微软) — 中等规模推理模型,”干净数据”训练,Build 2026 发布。theverge.com
6/2
开源
- MiniMax M3 — 100 万 token 上下文、原生态模态、MSA 稀疏注意力。首个预训练阶段即融合多模态的开源模型。minimax.io/blog/minimax-m3
- JetBrains Mellum2 — 12B 代码专用 MoE 模型,HuggingFace 发布。huggingface.co/blog/JetBrains/mellum2-launch
- SenseNova-U1-8B-MoT-Infographic (商汤) — 专注信息图表理解的视觉模型。
商业/API
- xAI Composer 2.5 — 快速建模 IDE 集成。
- Qwen3.7-Plus (阿里千问) — 多模态能力全功能增强。
- NVIDIA Cosmos 3 — Physical AI 世界与动作模型。
6/1
6/1 日报主题为 OpenAI 发布 Rosalind。模型发布数据较少。
按类型汇总
开源模型(权重可下载 / 可本地部署)
| 日期 | 模型 | 厂商 | 规模 | 协议 |
|---|---|---|---|---|
| 6/02 | MiniMax M3 | MiniMax | 428B MoE (23B active) | — |
| 6/02 | Mellum2 | JetBrains | 12B MoE | — |
| 6/02 | SenseNova-U1-8B-MoT-Infographic | 商汤 | 8B | — |
| 6/03 | Step 3.7 Flash | 阶跃星辰 | 196B MoE | Apache 2.0 |
| 6/03 | Holo3.1 | H Company | 0.8B~35B | — |
| 6/04 | Miso One | Miso | 8B | — |
| 6/05 | Nemotron 3.5 Content Safety | NVIDIA | 基于 Gemma 3 4B | — |
| 6/05 | Magenta RealTime 2 | — | — | |
| 6/08 | Harness-1 | UIUC/Chroma | 20B | 开源 |
| 6/09 | VoxCPM2 | OpenBMB | 2B | Apache 2.0 |
| 6/10 | Gemma 4 12B | Google DeepMind | 12B | Apache 2.0 |
| 6/10 | North Mini Code | Cohere | 30B MoE (3B active) | Apache 2.0 |
| 6/10 | MiMo UltraSpeed (部分) | 小米 | 1T MoE | — |
| 6/11 | DiffusionGemma | Google DeepMind | 26B MoE | Apache 2.0 |
| 6/11 | DeepSeek-R1 开源复现 | Hugging Face | — | 开源 |
| 6/12 | Kimi K2.7-Code | 月之暗面 | — | 开源 |
| 6/12 | VISTA-4B | inclusionAI | 4B | 开源 |
| 6/13 | MiniMax M3 权重全量 | MiniMax | 428B MoE | — |
| 6/13 | GLM-5.2 | 智谱 AI | — | MIT |
| 6/13 | Rio 3.5 Open 397B | 约旦卢实验室 | 397B MoE | — |
| 6/15 | M3 正式开源 | MiniMax | — | — |
| 6/15 | Pythagoras-Prover | — | 4B | — |
| 6/16 | Ling & Ring 2.6 | 蚂蚁集团 | — | 开源 |
| 6/16 | Qwen-Robot Suite | 阿里千问 | — | 开源 |
| 6/16 | Mistral “fat” 系列 | Mistral | — | 开源 |
| 6/17 | Sumi 7B Diffusion LLM | — | 7B | 开源 |
| 6/17 | ACE-Ego VLA | 阿里 | — | 开源 |
| 6/18 | MolmoMotion | Allen AI | — | 开源 |
| 6/18 | LOGOS 化学模型 | 通智实验室/千问 | 1B | 开源 |
商业 / API 模型
| 日期 | 模型 | 厂商 | 亮点 |
|---|---|---|---|
| 6/02 | Composer 2.5 | xAI | IDE 集成建模 |
| 6/02 | Qwen3.7-Plus | 阿里千问 | 多模态能力增强 |
| 6/02 | NVIDIA Cosmos 3 | NVIDIA | Physical AI 世界模型 |
| 6/03 | MAI-Thinking-1 | 微软 | 中等推理模型 |
| 6/04 | Grok Imagine 1.5 | xAI | 图像生成预览 |
| 6/04 | Ideogram v4.0 | Ideogram | 2K 分辨率 |
| 6/05 | Nex-N2-Pro | neolab | GPT-5.5 级别性能 |
| 6/05 | Nemotron 3 Ultra | NVIDIA | 长时 Agent 推理 |
| 6/06 | Riverflow 2.5 | — | 高分辨率文生图 |
| 6/09 | MiMo-V2.5-Pro-UltraSpeed | 小米 | 1T MoE 1000+ tokens/s |
| 6/09 | AFM 第三代 | Apple | 端+云架构 |
| 6/09 | ABot-Earth0.5 | 高德 | 3D 世界生成模型 |
| 6/10 | Claude Fable 5 / Mythos 5 | Anthropic | 多项 SOTA |
| 6/11 | Grok Voice | xAI | 语音交互 |
| 6/12 | Gemini Omni Flash | 视频理解 SOTA | |
| 6/12 | Midjourney V8.1 | Midjourney | 默认升级 |
| 6/13 | Gemini-SQL2 | Text-to-SQL 80.04% | |
| 6/13 | X2-VL | 科大讯飞 | 全自研多模态 |
| 6/14 | Rio3.5 | 约旦卢实验室 | 超越 Qwen3.7 |
| 6/15 | Z.ai GLM-5.2 | 智谱 | 1M 上下文 |
| 6/16 | DFlash Spec V2 | Z Lab/Modal/SGLang | 投机解码 4.3x |
| 6/16 | Grok Imagine Video 1.5 | xAI | 视频生成 |
| 6/16 | GPT-Bidi-1 | OpenAI | 轻量模型灰度 |
| 6/17 | Cartesia Sonic 3.5 / Ink 2 | Cartesia | 实时语音 #1 |
| 6/17 | Seedance 2.0 Mini | 字节跳动 | 低成本视频生成 |
| 6/17 | Qwen-Robot 系列 | 阿里千问 | 具身 AI 三件套 |
| 6/17 | Soniox v5 Real-Time | Soniox | 实时语音转文本 |
| 6/18 | Grok 4.3 | xAI | Amazon Bedrock |
| 6/18 | MaineCoon 22B | Catnip | 实时音视频原生 |
关键趋势
- 中国模型开源井喷: MiniMax M3、GLM-5.2、Kimi K2.7-Code、Ling & Ring 2.6、Step 3.7 Flash 等密集开源,GLM-5.2 在多项基准首次达到闭源旗舰水平。
- 具身 AI 爆发: 阿里 Qwen-Robot 三件套(Manip/World/Nav)、特斯拉 FSD V14、小米 MiMo、Google DiffusionGemma 等形成密集发布潮。
- 实时语音成为新战场: Cartesia Sonic 3.5/Ink 2、Google MRT2、Soniox v5、Catnip MaineCoon、Grok Voice 等多款实时语音模型密集发布。
- 扩散架构复兴: DiffusionGemma (4x 加速)、Sumi (7B 扩散 LLM) 挑战自回归范式。
- 1M token 上下文成标配: GLM-5.2、MiniMax M3、Grok 4.3 均支持百万级上下文。

