跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

101条精选相关主题产品更新论文研究开源生态

最新精选

第 81–100 条 · 共 101 条
7月7日周二
  1. AI at Meta BlogAI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta Superintelligence Labs 发布 Muse Image 并预览 Muse Video

    Meta Superintelligence Labs 发布其首个媒体生成模型 Muse Image,并预览 Muse Video。Muse Image 以智能体方式运行,调用搜索和编码工具,能自我改进并随测试时算力扩展而提升,已上线 Meta AI 应用、meta.ai、美国 Instagram Stories 及部分国家的 WhatsApp。

    为什么值得看

    Meta Superintelligence Labs 首发的图像生成模型,其智能体式工具调用与推理时算力扩展为图像生成提供了新范式。

7月1日周三
  1. Google DeepMind BlogAI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash

    Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。

    为什么值得看

    官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。

6月17日周三
  1. 智谱AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM-5.2上线并开源:专注Coding与长程任务

    智谱上线并开源 GLM-5.2,主打 1M 上下文与长程任务能力,模型权重采用 MIT 协议,已在 Hugging Face 与 ModelScope 开放下载。

    为什么值得看

    原文给出 GLM-5.2 在长程编码任务上的基准位置与 1M 上下文设计,读者可据此判断开源编码模型与 Claude Opus 的差距。

6月16日周二
  1. 通义大模型AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-Robot 发布:通义实验室推出导航、操作与世界模型三款具身基础模型

    通义实验室发布 Qwen-Robot 系列,用三个专业基础模型弥合从认知到行动的鸿沟:Qwen-RobotNav 统一指令跟随、点/目标导航、目标追踪和自动驾驶四类任务,Qwen-RobotManip 基于超过 38,100 小时数据实现跨本体训练,Qwen-RobotWorld 以自然语言动作接口跨场景预测物理未来。

    为什么值得看

    通义实验室一次发布三款具身基础模型,给出统一语言接口与跨本体数据方案,可观察大模型接入物理行动的路径。

6月13日周六
  1. 智谱AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.2 全量开放,下周开源并采用 MIT 协议

    智谱宣布 GLM-5.2 面向 GLM Coding Plan 全量用户开放,覆盖 Lite、Pro、Max 和团队版;该模型支持 1M 上下文,官方称其在长程任务中保持领先,并称其为此前最强的国产 Coding 模型。GLM-5.2 API 将于下周上线,模型下周正式开源,遵循 MIT 协议。

    为什么值得看

    智谱披露 GLM-5.2 的 1M 上下文、下周开源与 MIT 协议,读者可据此判断开放程度与部署节奏。

6月9日周二
  1. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的统一无编码器多模态模型,视觉与音频输入直接进入 LLM 主干,不再依赖独立编码器。

    为什么值得看

    Gemma 4 12B 用无编码器架构把多模态能力压进 16GB 显存笔记本,读者可判断本地智能体部署的可行边界。

5月20日周三
  1. Jeff Dean(@JeffDean)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.5 Flash 模型

    Google 发布 Gemini 3.5 Flash 模型,即日起在 Antigravity 及 Google 各产品和 API 中向所有人开放。相比 Gemini 3.1 Pro,3.5 Flash 在几乎所有基准测试上表现更好,编码能力提升明显,输出速度是其他前沿模型的 4 倍 tokens/秒。

    为什么值得看

    Google 以更快的 Flash 补充 Gemini 3.5 系列,读者可了解其在速度与能力上的取舍定位。

5月18日周一
  1. Google DeepMind BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Omni Flash,支持对话式视频编辑

    Google DeepMind 发布 Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本作为输入生成高质量视频,并通过自然语言多轮对话编辑视频内容。

    为什么值得看

    Google 把 Gemini 的推理与世界知识接入视频生成,读者可据此判断多模态创作工具的能力边界。

5月16日周六
  1. Google DeepMind BlogAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.5 Flash,主打智能体与编码

    Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。

    为什么值得看

    原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。

4月24日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,提供 1M 上下文

    DeepSeek-V4 Preview 正式发布并开源,主打低成本 1M 上下文。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,面向快速与低成本场景。

    为什么值得看

    DeepSeek-V4 两个版本公布参数规模与 1M 上下文定位,可据此对比开源与闭源模型的成本路线。

  2. Hugging Face(@huggingface)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 开源发布,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。其中 DeepSeek-V4-Pro 为 1.6T 总参数、49B 激活参数,官方称性能可对标顶级闭源模型;DeepSeek-V4-Flash 为 284B 总参数、13B 激活参数,定位快速高效。API 已同步更新,权重已在 Hugging Face 开放。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数规模与 1M 上下文定位,可据此判断开源模型的成本路线。

  3. DeepSeek(@deepseek_ai)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 deepseek-v4-pro 与 deepseek-v4-flash API

    DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。

    为什么值得看

    DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。

  4. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4-Flash 模型

    DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。

    为什么值得看

    官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。

  5. DeepSeek(@deepseek_ai)AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4 Preview 正式发布并开源,支持 1M 上下文

    DeepSeek-V4 Preview 正式上线并开源,主打低成本 1M 上下文长度。DeepSeek-V4-Pro 总参数 1.6T、激活 49B,官方称性能对标全球顶级闭源模型;DeepSeek-V4-Flash 总参数 284B、激活 13B,定位快速、高效、经济的选项。

    为什么值得看

    DeepSeek-V4 Preview 开源并给出两个版本的参数与 1M 上下文,可据此了解其开放程度与定位。

  6. DeepSeekAI 评估 · 92/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布并开源 DeepSeek-V4 预览版,标配 1M 上下文

    DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。

    为什么值得看

    官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。

4月20日周一
  1. Hugging Face(@huggingface)AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K2.6,主打开源编码与长时程 Agent

    月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。

    为什么值得看

    K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。

2月25日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 团队训练 42M 模型 SONIC 控制人形机器人全身动作并开源

    NVIDIA 团队训练了一个 42M 的 Transformer 模型 SONIC 用于控制人形机器人全身动作,并开放代码和模型检查点。该模型以人类动捕数据做逐帧监督,将运动跟踪作为全身控制的统一可扩展任务,数据本身即隐含奖励函数。

    为什么值得看

    42M 模型用人类动捕数据替代手工奖励设计,并开源代码与检查点,对具身智能研究者是可复用的训练范式。

12月1日周一
  1. DeepSeekAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V3.2 与 V3.2-Speciale 正式版,强化 Agent 与思考推理

    DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。

    为什么值得看

    官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。

9月29日周一
  1. DeepSeekAI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3.2-Exp 发布,训练推理提效,API 同步降价

    DeepSeek 正式发布实验性模型 DeepSeek-V3.2-Exp,在 V3.1-Terminus 基础上引入 DeepSeek Sparse Attention 稀疏注意力机制,针对长文本训练和推理效率进行优化,公开评测集上表现与 V3.1-Terminus 基本持平。

    为什么值得看

    官方说明稀疏注意力机制在长文本训练推理上的提效路径,以及 API 降价带来的成本变化。

3月25日周二
  1. DeepSeek(@deepseek_ai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V3-0324 发布:推理能力提升,改用 MIT 许可开源

    DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。

    为什么值得看

    官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。