Kimi K3 开放日:模型权重、技术报告与三项 Infra 技术同步开放
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重与技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
为什么值得看
月之暗面公开最强模型的权重与技术报告,并同时开源三项训练 Infra 技术,读者可据此了解其规模效率的实现路径。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重与技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。
月之暗面公开最强模型的权重与技术报告,并同时开源三项训练 Infra 技术,读者可据此了解其规模效率的实现路径。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
Nathan Lambert 认为智谱 GLM-5.2 是首个在编码 harness 中作为通用智能体真正好用的开放权重模型,其热度在社区中只有 DeepSeek R1 发布时有类似规模。
作者亲自用 GLM-5.2 在 Claude Code 中跑通工作流,并给出与 DeepSeek R1 时刻的对照,可看开源模型替代前沿闭源的具体进度。
智谱上线并开源 GLM-5.2,主打 1M 上下文与长程任务能力,模型权重采用 MIT 协议,已在 Hugging Face 与 ModelScope 开放下载。
原文给出 GLM-5.2 在长程编码任务上的基准位置与 1M 上下文设计,读者可据此判断开源编码模型与 Claude Opus 的差距。
智谱宣布 GLM-5.2 面向 GLM Coding Plan 全量用户开放,覆盖 Lite、Pro、Max 和团队版;该模型支持 1M 上下文,官方称其在长程任务中保持领先,并称其为此前最强的国产 Coding 模型。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。
智谱披露 GLM-5.2 的 1M 上下文、下周开源与 MIT 协议,读者可据此判断开放程度与部署节奏。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。
Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。
DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。
DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。
DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。
DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。
DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。
DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。
官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。
月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。
K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。
NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。
42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。
DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。
官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。
DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。
官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
DeepSeek 发布 DeepSeek-V3,生成速度达 60 tokens/秒,比 V2 快 3 倍。官方称该版本能力增强,API 保持兼容,并开源模型与论文。
原文给出 DeepSeek-V3 相对 V2 的生成速度提升与开源范围,可用于判断该版本的迭代幅度。