盘点 2025 年 5 到 8 月发布的视觉多模态模型:GLM-4.5V 与 GLM-4.1V-Thinking、MiMo-VL-7B-RL、MiniCPM-V-4、Intern-S1、step3、Qwen2.5-VL-72B、InternVL3-8B 与 Ovis2.5,逐一给出参数规模、上下文长度与能力特点。
GLM-4.5V/GLM-4.1V-Thinking
https://www.modelscope.cn/models/ZhipuAI/GLM-4.5V,2025 年 8 月 11 日发布的 GLM-4.5V 拥有 106B 总参数(12B 活跃)、64k 上下文,支持任意宽高比 4K 图像及中英双语多轮对话,提出基于课程采样的强化学习方法(RLCS),具备图像-视频-GUI-文档全场景视觉推理与可开关的深度思维模式。智谱开源 9B 参数视觉语言模型 GLM-4.1V-9B-Thinking,支持 64 K 上下文、任意长宽比 4 K 图像与双语输入。

MiMo-VL-7B-RL-2508
https://www.modelscope.cn/models/XiaomiMiMo/MiMo-VL-7B-RL-2508, 2025年8月,小米开源70亿参数MiMo-VL-7B-RL-2508多模态模型,支持长上下文,原生分辨率ViT+MLP融合图文,强化推理可控,MMMU达70.6。

MiniCPM-V-4
https://www.modelscope.cn/models/OpenBMB/MiniCPM-V-4, 2025年8月5日,面壁智能推出开源多模态模型MiniCPM-V 4.0,以 4B 参数量、上下文长度32k、图文/视频输入,实现了持平 GPT-4.1-mini 的视觉语言理解性能,并支持在手机设备上的低延迟流畅运行;MiniCPM-o 在视频、语音、文本的全模态实时流式交互方面,实现了持平 GPT-4o-202405 的能力水平。。

Intern-S1
2025年8月,上海AI Lab开源 235B-MoE 多模态模型 Intern-S1,支持 32k 上下文,原生解析文本/图像/视频/化学式/蛋白序列,科学推理开源第一。
step3
https://www.modelscope.cn/models/stepfun-ai/step3, 2025 年 8 月发布的 Step3 是一个 321 B 总参数量、38 B 激活参数的 MoE 多模态模型,支持 64 k token 上下文,以 bf16/block-fp8 格式部署,具备 MFA 高效注意力与视觉-语言推理能力。
Qwen2.5-VL-72B-Instruct
**实现细节:https://zhuanlan.zhihu.com/p/1921289925552210138**
Qwen2.5-VL相比Qwen2-VL增强了模型对时间和空间尺度的感知,并进一步简化了网络结构,提高了模型效率。
时间和图像大小的感知
在空间维度上,Qwen2.5-VL 不仅能够动态地将不同尺寸的图像转换为不同长度的 token,而且检测框、点等坐标直接用图像的实际尺寸尺度表示,无需进行传统的坐标归一化,使模型能够直接学习图像的尺度。在时间维度上,引入了动态 FPS(Frames Per Second)训练和绝对时间编码,将 mRoPE 的 id 直接与时间的快慢对齐,使模型能够通过时间维度 id 的间隔来学习时间的节奏。更简洁高效的视觉编码器
视觉编码器在多模态大型模型中起着至关重要的作用。从零开始训练了一个原生动态分辨率的 ViT,涵盖了 CLIP、视觉语言模型对齐以及端到端训练等阶段。为了解决 ViT 在多模态大型模型训练和测试阶段的负载不均衡问题,引入了窗口注意力机制 (Window Attention),以有效降低 ViT 端的计算负载。在 ViT 设置中,只有四层是全注意力层,其余层均使用窗口注意力机制。最大窗口大小为 8x8,小于 8x8 的区域无需填充,而是保留其原始比例,从而确保模型保持原生分辨率。此外,为了简化整体网络结构,采用 RMSNorm 和 SwiGLU 结构,使 ViT 架构与 LLM 更加一致。
https://www.modelscope.cn/models/Qwen/Qwen2.5-VL-72B-Instruct, 2025 年 1 月发布的Qwen2.5-VL-72B-Instruct(720 亿参数,32k 上下文,支持图像/视频/JSON 输入输出)具备视觉定位、长视频理解、结构化输出及代理功能。

InternVL3-8B
https://www.modelscope.cn/models/OpenGVLab/InternVL3-8B, 2025-05-30 发布的 InternVL3-8B 是一款 80 亿参数、支持 8K 上下文长度的视觉-语言多模态大模型,原生支持图像-文本交错输入,具备卓越的多轮对话与跨模态理解能力。

Ovis2.5-9B
https://www.modelscope.cn/models/AIDC-AI/Ovis2.5-9B/, 2025年8月16日发布的 Ovis2.5-9B(90亿参数,8K上下文),原生分辨率视觉+深度推理,支持图片/图表/文档/视频/文本多模态输入。Ovis 借鉴 LLM 的文本嵌入策略,引入可学习的视觉嵌入表,将视觉特征转化为概率化的视觉 token,并通过多次索引加权生成视觉嵌入,从而实现视觉与文本嵌入的结构化对齐与高效融合。


