第 38 周『模型速递(9.22-9.28)』
Qwen3-Max
Qwen发布了Qwen3-Max模型,这是Qwen系列迄今为止规模最大、能力最强的模型。Qwen3-Max包括Base、Instruct和Thinking三个版本。Instruct正式发布版本在代码生成与智能体表现方面表现卓越,而Thinking版本虽仍在训练中,但已展现出强大的推理能力。Qwen3-Max-Instruct正式版已经上线Qwen Chat并在阿里云百炼提供API。
Qwen3-Max-Base是Qwen3-Max的基础版本,模型总参数超过1T,预训练使用了36T tokens。模型结构沿用了Qwen3系列的模型结构设计范式。
Qwen3-Max-Instruct的预览版已在LMArena文本排行榜上稳居全球前三。正式发布版本进一步提升了其能力,尤其在代码生成与智能体表现方面表现卓越。
Qwen3-Max-Thinking是Qwen3-Max的推理增强版本,目前仍在训练中。该模型通过集成代码解释器并运用并行测试时计算技术情况下,展现了前所未有的推理能力,尤其在极具挑战性的数学推理基准测试AIME 25和HMMT上,均取得了满分。Qwen团队表示期待在不久的将来公开发布这一版本。
Qwen3-VL
Qwen正式推出全新升级的Qwen3-VL系列。目前发布并开源了旗舰模型Qwen3-VL-235B-A22B的Instruct和Thinking两个版本,其中Instruct版本在关键视觉基准测试上超越Gemini 2.5 Pro,Thinking版本在多模态推理任务上达到业界领先水平。该模型采用Apache 2.0许可证开源。
Qwen3-VL系列在视觉代理方面表现突出,能够在PC和手机上操作GUI,理解按钮、调用工具并完成真实世界任务,在OS World上达到SOTA水平。在视觉编码方面,模型能将屏幕截图转换为代码(HTML/CSS/JS,Draw.io),实现真正的”所见即所得”开发。模型支持256K+上下文长度,可扩展到1M,能够处理2小时视频和多页长PDF。OCR功能支持32种语言(从之前的19种提升),增强了对模糊、倾斜或稀有字符的鲁棒性,改进了长文档结构解析能力。
Qwen3Guard
阿里开源了基于Qwen3构建的安全审核模型系列Qwen3Guard,专为全球实时AI安全设计。该模型系列支持119种语言和方言,提供3种规模:0.6B、4B和8B。Qwen3Guard包含两个主要版本:
- Qwen3Guard-Stream具备低延迟、实时流式检测能力;
- Qwen3Guard-Gen可进行强大的全上下文安全分析,是强化学习奖励建模的理想选择。该模型采用三级风险分类:安全、有争议和不安全,并在安全基准测试中表现领先,涵盖英语、中文及更多语言。所有模型均以Apache 2.0许可证开源。
Qwen3-Omni
Qwen团队开源发布了原生全模态大模型Qwen3-Omni,该模型能够处理文本、图像、音频和视频等多种输入形式,并通过实时流式响应同时生成文本与自然语音输出。
该模型采用基于MoE的Thinker-Talker架构,支持119种文本语言、19种语音输入语言和10种语音输出语言。在36项音频及音视频基准测试中,Qwen3-Omni取得了32项开源SOTA与22项总体SOTA的优异成绩,性能超越了Gemini-2.5-Pro、Seed-ASR、GPT-4o-Transcribe等知名闭源模型,同时其图像和文本性能在同尺寸模型中也达到了SOTA水平。
模型支持实时音频/视频交互,纯模型端到端音频对话延迟低至211ms,视频对话延迟低至507ms。它还支持长达30分钟的音频理解,并可通过system prompt定制行为、修改回复风格和人设。此外,模型还支持function call功能,可实现与外部工具或服务的高效集成Qwen-Image-Edit-2509
Qwen团队开源了图像编辑模型Qwen-Image-Edit-2509,新模型支持多图联合编辑,并原生集成了ControlNet,大幅提升了单图编辑的一致性。
升级后的Qwen-Image-Edit-2509首次支持1-3张图像作为输入,通过拼接训练策略实现了”人物+人物”、”人物+商品”、”人物+场景”等多种组合编辑。同时,它还兼容ControlNet关键点图进行姿态控制。
在单图编辑场景下,模型在人物面部ID保持、商品特征保留、文字字体/颜色/材质编辑等方面的一致性得到了显著提升。这使得模型可广泛应用于肖像风格化、老照片修复、海报与表情包生成等任务。此外,模型原生集成了ControlNet的常用条件,如深度图、边缘图、关键点图等。Qwen3-TTS-Flash
Qwen团队推出了旗舰级文本转语音模型Qwen3-TTS-Flash,该模型支持多语言、多音色及多种汉语方言,并在性能测试中达到SOTA水平。
Qwen3-TTS-Flash定位为旗舰语音合成模型,采用统一架构,支持17种音色,每种音色均可输出10种语言。它覆盖了普通话以及闽南语、吴语、粤语、四川话、北京话、南京话、天津话、陕西话等9种汉语方言。同时,模型还提供英式、美式及其他地区口音的英语,以及法语、德语、俄语、意大利语、西班牙语、葡萄牙语、日语、韩语。
第 37 周『模型速递(9.15-9.21)』
Tongyi-DeepResearch-30B-A3B
阿里巴巴同易实验室在 9 月正式发布 Tongyi-DeepResearch-30B-A3B,这是一款专为 长期研究与信息检索优化 打造的 MoE 架构大模型代理。它融合 128K 超长上下文、双重推理机制与端到端代理训练流水线,支持 ReAct 与 IterResearch 模式,能完成从搜索、浏览到交叉验证与证据合成的全流程研究任务。
- MoE 稀疏激活:总参数约 305 亿,单次推理仅激活 30~33 亿,兼顾性能与效率。
- 128K 上下文:支持长周期对话、复杂研究与证据追踪,可承载多轮研究任务。
Tongyi-DeepResearch 代表了 MoE 架构 × 长上下文 × 深度代理推理 的最新探索。第 36 周『模型速递(9.07-9.14)』
MiniCPM 4.1
MiniCPM 发布新版本的面壁小钢炮 MiniCPM 4.1 基座模型。在 MiniCPM 4.0 的基础上,MiniCPM 4.1 新增 8B 参数的行业首个原生稀疏架构深思考模型,同级 SOTA 表现带来超快、超准的深思考能力,真正让端侧设备实现高效「深思考」。 - 首个原生稀疏架构的深思考模型,通过可训练稀疏注意力创新,代码、数学推理等任务的推理速度比同尺寸开源模型快 3 倍以上;
- 在知识、推理、编程、指令遵循等综合能力方面,达到同级 SOTA 水平;支持高效双频换挡:长文本用稀疏,短文本用稠密。
此外,MiniCPM 4.1 进一步实现了长文本缓存的大幅锐减,在 128K 长文本场景下,MiniCPM 4.1-8B 相较于 Qwen3-8B 仅需 25% 的缓存存储空间,让端侧算力不再有压力,成为业界目前最为友好的端侧模型。HunyuanImage-2.1
这是一个开源的文生图模型,支持原生2K生图,在多个方面达到业界领先水平: - 在2.0架构的基础上全面升级,更加注重生成效果与性能之间的平衡,性能更强;
- 不仅支持中英文的原生输入,还能够实现中英文文本与复杂语义的高质量生成;
- 生成图片的整体美学表现和适用场景的多样性方面都有了显著提升;
Qwen3-Next
Qwen团队设计了全新的Qwen3-Next的模型结构。 该结构相比Qwen3的MoE模型结构,进行了以下核心改进:混合注意力机制、高稀疏度 MoE 结构、一系列训练稳定友好的优化,以及提升推理效率的多 token 预测机制。
基于Qwen3-Next的模型结构,Qwen团队训练了Qwen3-Next-80B-A3B-Base模型,该模型拥有800亿参数仅激活30亿参数。 该Base模型实现了与Qwen3-32B dense模型相近甚至略好的性能,而它的训练成本(GPU hours) 仅为Qwen3-32B的十分之一不到,在32k以上的上下文下的推理吞吐则是Qwen3-32B的十倍以上,实现了极致的训练和推理性价比。
MoE架构总参数量80B,推理时仅激活约3.7%(3B)参数。相比Qwen3的128总专家和8路由专家,Qwen3-Next扩展至512总专家(10路由+1共享),通过全局负载均衡机制,持续增加专家数量仍能稳定降低训练损失,最大化资源利用率。第 35 周『模型速递(8.30-9.06)』
Kimi K2-Instruct-0905
Kimi K2-Instruct-0905 是 Kimi K2 的最新、最强大的版本。它是一个最先进的混合专家(MoE)
语言模型,具有 320 亿激活参数和总共 1 万亿参数,主要特点: - 增强的智能代理编码能力:Kimi K2-Instruct-0905 在公共基准测试和实际编码代理任务中表现出显著的性能提升。
- 改进的前端编码体验:Kimi K2-Instruct-0905 在前端编程的美观性和实用性方面都有所改进。
- 扩展的上下文长度:Kimi K2-Instruct-0905 的上下文窗口从 128k 扩展到 256k 个标记,为长时任务提供了更好的支持。
LongCat-Flash-Chat
美团开源的一个强大的高效语言模型,总参数量为 5600 亿,采用创新的专家混合(MoE)架构。该模型结合了动态计算机制,根据上下文需求激活 186 亿至 313 亿个参数(平均约 270 亿),从而优化了计算效率和性能。为了实现先进的训练和推理效率,采用了缩短连接架构,扩展了计算-通信重叠窗口,实现了每秒超过 100 个token(TPS)的高效推理,全面训练和扩展策略确保了稳定高效的训练,而定制的数据策略增强了模型性能。
注:一个 560B参数的 MoE模型,模型采用动态计算机制,可根据上下文需求激活 18.6B∼31.3B参数。
推理代码1
2
3
4
5
6SGLANG_USE_MODELSCOPE=true python3 -m sglang.launch_server \
--model meituan-longcat/LongCat-Flash-Chat-FP8 \
--trust-remote-code \
--attention-backend flashinfer \
--enable-ep-moe \
--tp 8
Hunyuan-MT-7B
腾讯混元带来一个在国际机器翻译比赛拿下30个第1名的翻译模型Hunyuan-MT-7B,它总参数量仅7B,支持33个语种、5种民汉语言/方言互译,是一个能力全面的轻量级翻译模型,具备以下核心特性与优势:
- 在WMT25参赛的31种语言中,有30种语言获得了第一名的成绩;
- Hunyuan-MT-7B在业界同尺寸模型中效果最优;
- Hunyuan-MT-Chimera-7B是业界首个开源翻译集成模型,可以进一步提升翻译效果;
- 提出了一个完整的翻译模型训练范式,从预训练->CPT->SFT->翻译强化->集成强化,翻译效果达到同尺寸SOTA。
推理代码1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17from modelscope import AutoModelForCausalLM, AutoTokenizer
import os
model_name_or_path = "Tencent-Hunyuan/Hunyuan-MT-7B"
tokenizer = AutoTokenizer.from_pretrained(model_name_or_path)
model = AutoModelForCausalLM.from_pretrained(model_name_or_path, device_map="auto")
messages = [
{"role": "user", "content": "Translate the following segment into Chinese, without additional explanation.\n\nGet something off your chest"},
]
tokenized_chat = tokenizer.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=False,
return_tensors="pt"
)
outputs = model.generate(tokenized_chat.to(model.device), max_new_tokens=2048)
output_text = tokenizer.decode(outputs[0])
print(output_text)
Step-Audio-2-mini
阶跃星辰开源发布最强开源端到端语音大模型 Step-Audio 2 mini,该模型在多个国际基准测试集上取得 SOTA 成绩。它将语音理解、音频推理与生成统一建模,在音频理解、语音识别、跨语种翻译、情感与副语言解析、语音对话等任务中表现突出,并率先支持语音原生的 Tool Calling 能力,可实现联网搜索等操作。
Step-Audio 2 mini 在多个关键基准测试中取得 SOTA 成绩,在音频理解、语音识别、翻译和对话场景中表现突出,综合性能超越 Qwen-Omni 、Kimi-Audio 在内的所有开源端到端语音模型,并在大部分任务上超越 GPT-4o Audio。
HunyuanWorld-Voyager
腾讯混元于9月2日正式发布开源其3D世界模型系列最新成员——HunyuanWorld-Voyager(混元Voyager),这是业界首个支持原生3D重建的超长漫游世界模型。它突破传统视频生成在空间一致性与探索范围上的限制,可基于单张图像和自定义相机路径,生成世界一致的3D点云序列与长距离漫游视频,并支持直接导出为3D格式。模型具备”3D输入-3D输出”特性,与混元1.0高度兼容,可扩展漫游范围、提升复杂场景质量,并支持风格化编辑与多任务应用,如3D纹理生成、深度估计、场景重建等,全面赋能虚拟现实、游戏开发与物理仿真等领域。
在权威评测中,混元Voyager荣登斯坦福大学李飞飞团队发布的WorldScore世界模型排行榜综合能力榜首,超越所有现有开源方案,在视频生成与3D重建两大核心任务中均表现最优。
第 34 周『模型速递(8.23-8.30)』
整个8月,大模型开源社区依旧很卷,除了很火的Qwen-Image、GLM4.5V、MiniCPM-V 4.5、DeepSeek-V3.1,还有很多其他的模型值得注意,比如小红书的dots.vlm1、书生InternVL-3.5系列模型、万相Wan2.2-S2V-14B,美团也是压线开源LongCat模型。
通义万相2.2-S2V-14B
通义万相最新开源Wan2.2-S2V,一款音频驱动的视频生成模型,参数量14B,可生成影视级质感的高质量视频。Wan2.2-S2V接收单张静态图像和音频输入,生成与音频同步的高质量视频。
通义万相团队针对复杂场景的视频生成优化,在复杂的电影和电视剧场景中表现出色,能够呈现逼真的视觉效果,包括生成自然的面部表情、肢体动作和专业的镜头运用。同时支持全身与半身角色生成,可高质量地完成对白、演唱及表演等多种专业级内容创作需求。
推理代码
1 | git clone https://github.com/HumanAIGC/Wan-S2V.git |
MiniCPM-V 4.5系列
面壁智能正式开源 8B 参数的面壁小钢炮 MiniCPM-V 4.5 多模态旗舰模型,成为行业首个具备”高刷”视频理解能力的多模态模型,高刷视频理解、长视频理解、OCR、文档解析能力同级 SOTA,且性能超过 Qwen2.5-VL 72B,堪称最强端侧多模态模型。
MiniCPM-V 4.5 同时支持常规模式和深度思考模式,实现了性能与响应速度的有效平衡,常规模式在绝大部分场景下提供出色的多模态理解能力,深度思考模式则专注于应对复杂与复合型推理任务。
注:主打高刷视频理解。
推理代码
1 | import torch |
HunyuanVideo-Foley
8月28日,腾讯混元宣布开源端到端视频音效生成模型HunyuanVideo-Foley,只需输入视频和文字,就能为视频匹配电影级音效。HunyuanVideo-Foley不仅打破了 AI 生成的视频只能 “看” 不能 “听” 的局限,让无声AI视频成为历史,更是真正做到了 “看懂画面、读懂文字、配准声音” ,带来沉浸式视听体验。这款音效生成工具可广泛应用于短视频创作、电影制作、广告创意和游戏开发等场景。
推理代码
1 | git clone https://github.com/Tencent-Hunyuan/HunyuanVideo-Foley |
VibeVoice-1.5B
微软最新开源的文本转语音模型VibeVoice-1.5B 可生成富有表现力的长文本、多说话人合成语音,具备研究级扩展性与高度灵活性。
该模型不仅是一个 TTS 引擎,更是一个完整框架:支持单次会话生成 90 分钟连续自然语音,并发合成 4 个不同说话人,并可处理跨语言合成与歌唱合成场景。依托流式架构设计及即将发布的 70 亿参数流式模型,VibeVoice-1.5B 将成为 AI 会话音频、播客制作及合成语音研究的重大突破。
SpatialGen-1.0
「杭州六小龙」之一群核科技在其首届 TechDay 上开源发布了业界首个专注于 3D 室内场景生成的空间大模型SpatialGen。依托群核科技海量室内 3D 场景数据与多视角扩散模型技术,SpatialGen 生成的多视角图像能确保同一物体在不同镜头下始终保持准确的空间属性和物理关系。输入一张场景的原图,以及场景布局图,即可输出相应场景的多视角图像,也可以进行深度图、语义图等其他类别的输出。有了多视角图像结果,就可以通过一个开源的高斯重建的算法(AnySplat)重建高斯点云,随后可以进行视频的渲染,最终得到了一个漫游视频。
推理代码
1 | git clone https://github.com/manycore-research/SpatialGen.git |
InternVL-3.5系列
8月26日,上海人工智能实验室开源书生InternVL-3.5系列模型,共9个模型,Dense模型有1B、2B、4B、8B、14B、38B,MoE模型有InternVL3.5-20B-A4B、InternVL3.5-30B-A3B InternViT-300M、InternVL3.5-241B-A28B
NextStep-1系列
8月18日,阶跃开源NextStep-1系列模型,一个 14B 自回归模型,一个图像生成和编辑模型。
第 33 周『模型速递(8.17-8.23)』
DeepSeek-V3.1
DeepSeek-V3.1在本周正式开源,DeepSeek-V3.1 是一个支持思考模式和非思考模式的混合模型。与此前版本相比,此次升级在多个方面进行改进:
- 混合思考模式:通过更改聊天模板,一个模型可以同时支持思考模式和非思考模式;
- 更智能的工具调用:通过后训练优化,模型在工具使用和代理任务中的表现显著提升;
- 更高的思考效率:DeepSeek-V3.1-Think 在回答质量上与 DeepSeek-R1-0528 相当,但响应速度更快。
DeepSeek-V3.1 是在 DeepSeek-V3.1-Base 基础上进行后训练得到的模型,其基座 checkpoint 通过两阶段长上下文扩展方法构建。
注:代码能力提高,但文本能力并没提高,甚至有些下降。Seed-OSS系列
近日,字节跳动 Seed 团队正式发布了 Seed-OSS 系列开源大型语言模型,使用12T token进行训练,在多个主流开源基准测试中表现出色。Seed-OSS 系列提供强大的长上下文、推理、代理和通用功能,以及对开发者友好的多功能特性: - 灵活控制思考预算:允许用户根据需要灵活调整推理长度,这种动态控制推理长度的能力在实际应用场景中提高了推理效率;
- 增强的推理能力:特别针对推理任务进行了优化,同时保持了平衡且出色的通用能力;
- 代理智能:在工具使用和问题解决等代理任务中表现卓越;
- 研究友好:考虑到预训练中包含合成指令数据可能会影响后训练研究,发布了带有和不带指令数据的预训练模型,为研究界提供了更多样化的选择;
- 原生长上下文:使用长达512K的长上下文进行训练。
注:没有专门训练中文。
推理代码1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21pip3 install -r requirements.txt
pip install git+ssh://git@github.com/Fazziekey/transformers.git@seed-oss
from modelscope import AutoModelForCausalLM, AutoTokenizer
import os
import re
model_name_or_path = "ByteDance-Seed/Seed-OSS-36B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name_or_path)
model = AutoModelForCausalLM.from_pretrained(model_name_or_path, device_map="auto") # You may want to use bfloat16 and/or move to GPU here
messages = [
{"role": "user", "content": "How to make pasta?"},
]
tokenized_chat = tokenizer.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=True,
return_tensors="pt",
thinking_budget=512 # control the thinking budget
)
outputs = model.generate(tokenized_chat.to(model.device), max_new_tokens=2048)
output_text = tokenizer.decode(outputs[0])
Qwen-Image-Edit
继近期开源Qwen-Image后,通义千问Qwen团队进一步开源发布其图像编辑模型Qwen-Image-Edit。Qwen-Image-Edit基于20B的Qwen-Image模型进一步训练,成功将Qwen-Image的文本渲染特色能力拓展到编辑任务上,以支持精准的文字编辑。此外,Qwen-Image-Edit将输入图像同时输入到Qwen2.5-VL(获取视觉语义控制)和VAE Encoder(获得视觉外观控制),以同时获得语义/外观双重编辑能力。主要特性包括:
- 语义/外观 双重编辑: Qwen-Image-Edit不仅支持low-level的视觉外观编辑(例如增删改等,需要保持图片部分区域完全不变),也支持high-level的视觉语义编辑(例如IP制作,物体旋转,风格迁移等,整体像素值可以变化,但需要保持语义不变)
- 精准文字编辑: Qwen-Image-Edit支持中英双语文字编辑,可以在保留文字大小/字体/风格的前提下,直接编辑图片中文字,进行增删改。
- 强大的跨基准性能表现: 在多个公开基准测试中的评估表明,Qwen-Image-Edit 在编辑任务中均获得SOTA,是一个强大的图像生成基础模型。
推理代码1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26pip install git+https://github.com/huggingface/diffusers
import os
from PIL import Image
import torch
from modelscope import QwenImageEditPipeline
pipeline = QwenImageEditPipeline.from_pretrained("Qwen/Qwen-Image-Edit")
print("pipeline loaded")
pipeline.to(torch.bfloat16)
pipeline.to("cuda")
pipeline.set_progress_bar_config(disable=None)
image = Image.open("./input.png").convert("RGB")
prompt = "Change the rabbit's color to purple, with a flash light background."
inputs = {
"image": image,
"prompt": prompt,
"generator": torch.manual_seed(0),
"true_cfg_scale": 4.0,
"negative_prompt": " ",
"num_inference_steps": 50,
}
with torch.inference_mode():
output = pipeline(**inputs)
output_image = output.images[0]
output_image.save("output_image_edit.png")
print("image saved at", os.path.abspath("output_image_edit.png"))
InfiniteTalk
InfiniteTalk是由MeiGen-AI团队开源的一种创新的稀疏帧视频配音框架,只要给定输入视频和音频轨道,InfiniteTalk就会合成一个新的视频,该视频不仅具有准确的唇形同步,同时还会将头部动作、身体姿势和面部表情与音频对齐。与仅关注嘴唇的传统配音方法不同,InfiniteTalk 支持无限长度的视频生成,并保持准确的唇形同步和一致的身份保留。此外,InfiniteTalk 还可以作为一个图像-音频到视频的模型,以一张图像和一段音频作为输入。
Ovis2.5系列
阿里国际发布了最新的多模态大模型Ovis2.5,这是 Ovis2 的继任者,专为原生分辨率视觉感知和增强的多模态推理设计。为了加强推理能力,Ovis2.5 不仅在链式思维(CoT)上进行训练,还进行了反思性推理训练,包括自我检查和修正。 这种高级功能在推理时作为可选的 思考模式 提供,使用户能够在复杂输入上以延迟换取更高的准确性。Ovis2.5-9B 在 OpenCompass 多模态评估套件中取得了平均 78.3 分的成绩(在参数少于 40B 的开源 MLLM 中处于领先地位),而轻量级的 Ovis2.5-2B 得分为 73.9,继续延续了”小模型,大性能”的理念,适用于资源受限的场景。
推理代码
1 | pip install torch==2.4.0 transformers==4.51.3 numpy==1.25.0 pillow==10.3.0 moviepy==1.0.3pip install flash-attn==2.7.0.post2 --no-build-isolation |
8月12日,上海人工智能实验室开源Lumina-mGPT 2.0,一个仅使用解码器的自回归模型,统一了包括文生图、图像对生成、主体驱动生成、多轮图像编辑、可控生成等任务。
8月12日,快手开源8B推理模型Klear-Reasoner-8B。
8月13日,阶跃开源定理证明模型 StepFun-Prover-Preview-32B。
第 32 周『模型速递(8.10-8.16)』
GLM-4.5V系列
智谱近期发布了最新的 GLM-4.5V 开源工作——全球100B级效果最佳的开源视觉推理模型。GLM-4.5V 基于智谱新一代旗舰文本基座模型 GLM-4.5-Air(106B参数,12B激活),延续 GLM-4.1V-Thinking 技术路线,在 42 个公开视觉多模态榜单中综合效果达到同级别开源模型 SOTA 性能,涵盖图像、视频、文档理解以及 GUI Agent 等常见任务。
推理代码
1 | vLLM推理 |
Hunyuan-GameCraft
腾讯混元最新开源的游戏视频生成工具Hunyuan-GameCraft,只需要输入一张图+文字+描述+动作指令(按键盘方向键),就能 输出高清动态游戏视频,无论是第一人称跑酷,还是第三人称探险,它都能实时生成流畅画面,仿佛你真的在游戏世界里自由穿梭。
Hunyuan-GameCraft具备三大优势:
- 自由流畅:统一连续动作空间,支持高精度控制(角度/速度),支持”边跑边转视角”的复杂操作;可以生成动态内容(例如主角和NPC运动、云层移动、雨雪、水流运动等);
- 记忆增强:生成长视频时,角色和环境保持稳定不”穿帮”;通过混合历史条件,实现历史帧记忆,避免长视频生成时不连贯;
- 成本骤降:无需人工建模或渲染,制作成本更低;对比现有的游戏模型闭源方案,泛化性强。阶段一致性蒸馏方案和DeepCache压缩推理步数,量化13B模型支持消费级硬件RTX 4090,无需高端服务器。
Baichuan-M2-32B系列
Baichuan-M2-32B 是百川 AI 近期最新开源的的医疗增强推理模型,是百川发布的第二款医疗模型。该模型专为现实世界的医疗推理任务设计,在 Qwen2.5-32B 的基础上结合了创新的大型验证系统。通过对真实世界医疗问题进行领域特定微调,它在保持强大通用能力的同时实现了突破性的医疗性能。
Baichuan-M2的核心亮点: - 全球领先的开源医疗模型:在HealthBench上超越所有开源模型以及许多专有模型,达到接近GPT-5的医疗能力;
- 医生思维对齐:基于真实的临床案例和患者模拟器训练,具备临床诊断思维和强大的患者互动能力;
- 高效部署:支持单RTX4090上的4位量化部署,在单用户场景下的MTP版本中,token吞吐量提高了58.5%。
第 31 周『模型速递(8.2-8.10)』
gpt-oss系列
OpenAI 正式开源gpt-oss-120b / 20b 系列大模型,专为强大的推理、代理任务和多用途开发场景设计,单卡 H100 或 16 GB 内存可实现本地部署,支持可调推理深度、完整思维链、函数调用、网页浏览及 LoRA 微调,两款模型情况如下: - gpt-oss-120b —— 适用于生产环境、通用目的和高推理需求的场景,可以装入单个 H100 GPU(117B 参数,其中 5.1B 激活参数)
- gpt-oss-20b —— 适用于低延迟以及本地或特定用途的场景(21B 参数,其中 3.6B 激活参数)
Qwen-Image
通义千问团队开源了首个图像生成基础模型 Qwen-Image,一个20B的MMDiT模型,展示其在复杂文本渲染和精确图像编辑方面取得的显著进展,模型主要特性包括: - 卓越的文本渲染能力: Qwen-Image 在复杂文本渲染方面表现出色,支持多行布局、段落级文本生成以及细粒度细节呈现。无论是英语还是中文,均能实现高保真输出;
- 一致性的图像编辑能力(即将推出): 通过增强的多任务训练范式,Qwen-Image 在编辑过程中能出色地保持编辑的一致性;
- 强大的跨基准性能表现: 在多个公开基准测试中的评估表明,Qwen-Image 在各类生成与编辑任务中均获得SOTA,是一个强大的图像生成基础模型。
MiniCPM-V4.0
面壁小钢炮开源了新一代多模态模型 MiniCPM-V 4.0,依靠 4B 参数,取得 在 OpenCompass、OCRBench、MathVista 等多个榜单上取得了同级 SOTA 成绩,且 实现了在手机上稳定、丝滑运行。在 Apple M4 Metal 上正常运行 MiniCPM-V 4.0 模型,显存占用仅为 3.33 GB。
官方还正式开源了 推理部署工具 MiniCPM-V CookBook,支持 MiniCPM-V 4.0 本地部署的 IOS App 已开源,开发者可在 CookBook 中下载使用,帮助开发者面向不同需求、不同场景、不同设备,均可实现开箱即用的轻量、简易部署。混元Dense模型系列
腾讯开源了一系列混元Dense模型,包括Pretrain和Instruct版本,参数规模分别为0.5B、1.8B、4B和7B,消费级显卡即可运行,适用于笔记本电脑、手机、智能座舱、智能家居等低功耗场景,且支持垂直领域低成本微调。这模型沿用了与Hunyuan-A13B相似的训练策略,继承了其强大的性能特点: - 混合推理支持:支持快速和慢速思考模式,允许用户根据需要灵活选择。
- 超长上下文理解:原生支持256K上下文窗口,在长文本任务上保持稳定性能。
- 增强的Agent能力:针对Agent类任务进行了优化,在BFCL-v3、τ-Bench和C3-Bench等基准测试中取得了领先的结果。
- 高效的推理:利用GQA并支持多种量化格式,实现高效的推理。
dots.vlm1
8月6日,小红书开源dots.vlm1模型,采用全自研的12亿参数NaViT视觉编码器和DeepSeek V3的大语言模型构建,在视觉的理解和推理任务上均有不俗的表现。

