ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 上的成绩与成本
ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 基准上的成绩:ARC-AGI-2 得分 84.6%,每任务成本 0.25 美元;ARC-AGI-1 得分 95.5%,每任务成本 0.12 美元。Patrick Loeber 引用该数据表示,相对其他前沿模型,Gemini 3.7 Flash 在低成本和两代 ARC-AGI 高分上表现突出。
ARC Prize 公布 Gemini 3.7 Flash 在 ARC-AGI 基准上的成绩:ARC-AGI-2 得分 84.6%,每任务成本 0.25 美元;ARC-AGI-1 得分 95.5%,每任务成本 0.12 美元。Patrick Loeber 引用该数据表示,相对其他前沿模型,Gemini 3.7 Flash 在低成本和两代 ARC-AGI 高分上表现突出。
DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。
DeepSeek-V4-Flash-Vision-Exp 已在 DeepSeek API 平台上线,这是一款实验性多模态模型,文本能力与 DeepSeek-V4-Flash 持平,涵盖智能体、推理和世界知识。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量较首个公开版本增加 2.5 倍,在 GMTKN55 基准 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol,以 meta-GGA 的计算成本超越当前最昂贵的全局杂化泛函。
微软 AI 的 MAI-Image-2.5-Pro 在 Artificial Analysis 图像编辑榜单首次登顶,超过 Reve 2.1、GPT Image 2 和微软自家的 MAI-Image-2.5,在文生图榜单排名第 7。
腾讯混元 Hyra 在数学领域再获四项进展:3D Blaschke–Lebesgue 常数宽度体普遍下界从 0.380799w³ 提升至 0.411040w³。
Ollama 模型库新增 Kimi K3 页面,地址为 ollama.com/library/kimi-k3。该条目已获 21 个点赞、10871 次浏览,相关数据由 xgo.ing 提供。
智谱 GLM-5.3 正式上线并开放 API,在 Artificial Analysis Intelligence Index 中取得 60 分,进入全球前沿模型能力区间,与 Claude Fable 5、GPT-5.6 Sol 处于同一水平,并与 Kimi K3 并列开源模型第一。
GPT-5.6 Sol 在 FrontierCode 1.1 上的性能表现已有详细解读,原文链接指向 devin.ai 的博客。该内容由 Windsurf 转发分享,但正文未给出具体分数或评测细节。
MAI-Image-2.6 在文生图 benchmark 排名第 2,同一模型在图像编辑排行榜上拿下第 3。该模型由此被定位为可胜任各类图像生成任务的全能选手。
微软 AI 的 MAI-Image-2.6-Preview 在 Arena.ai 单图编辑榜以 1,420 分升至第 3 名,较 MAI-Image-2.5 提升 19 分、排名从第 5 前进两位,超过 Google Nano Banana 和 Meta Muse Image。
Qwen 3.8 27B 在 Artificial Analysis 上取得 52 分。作者指出,这是首次有能在笔记本本地运行的模型基本与最强的模型持平,本地且开放权重的模型已足以完成多数日常任务。
哔哩哔哩 Index 语音团队发布 IndexTTS 2.5,支持中、英、日、西、阿五语种零样本配音,开放语速控制,并补齐上代的速度短板。
Logan Kilpatrick 转发 @unixpickle 的结果称,Gemini 在约 8 秒内解出了题目。该帖获得 1099 个点赞、54 条回复和 170251 次浏览。
Grok 4.6 接入 Augment Code 的 Cosmos 后,头三天成为 Cosmos 至今采用速度最快的模型。用户可通过 augmentcode.com 试用。 (说明:原文正文仅给出"前三天采用曲线最快"与试用入口两项事实,未披露参数规模、benchmark 分数或价格,故摘要按 50 字左右处理,未做任何补充。)
Google 宣布 Gemini 3.7 Flash 已面向所有 Pro 和 Ultra 用户在 Gemini 聊天中开放。官方称此次模型更新提升了多步任务的推理能力与准确率,例如把数十个文件和邮件整合成一份总文档。
阿里开源 Qwen3.8-27B,这是一个原生多模态稠密模型,仅 27B 参数,综合表现超过 Qwen3.7-Plus,在真实编码与办公工作流中表现突出。
原文给出 Qwen3.8-27B 的参数量、上下文与 Apache 2.0 许可,读者可据此判断小模型本地部署的能力边界。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
Logan Kilpatrick 称 Gemini 4 是迄今最具雄心的预训练。该说法转自 @haider1,原帖为 Gemini 4 预热内容,目前仅披露预训练定位,未公布参数规模、benchmark 分数或发布时间。
Google Antigravity 宣布 Gemini 3.7 Flash 上线,称其为面向编码和智能体任务的最强主力模型,可下载或升级 Antigravity 试用。原推作者(Varun Mohan)转发时评价能力大幅提升且 API 成本减半。
Google 发布 Gemini 3.7 Flash,作者称其是同等智能水平下效率最高的模型之一,表现优于 Sonnet 5、GPT-5.6 Terra 和 Muse Spark 1.2。
Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体任务最智能的主力模型,带来更高的指令遵循、首轮代码准确率和智能体任务执行质量。
Gemini 3.7 Flash 发布,相比 3.6 在多项任务上有较大提升。Logan Kilpatrick 介绍该版本速度快,价格比 3.6 Flash 低 50%(截至年底),并在约 3 周内依靠算法改进实现智能水平明显提升,已在 API、AI Studio、Antigravity 等平台上线。
Google DeepMind 发布 Gemini 3.7 Flash,在软件工程、网页开发和知识工作方面带来较大升级。该版本的首发价格为原 Gemini 3.6 Flash 成本的一半。Demis Hassabis 表示这一版本在编码、知识工作和网页开发上更强。
Google 宣布 3.7 Flash 上线,Google AI Pro 与 Ultra 订阅者即日起可通过 Gemini App 中的 Spark 体验该模型。
Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。
Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。
Google 在 3.6 Flash 发布仅三周后推出 3.7 Flash,称其在编码和智能体任务上有显著提升,并在软件工程、知识工作和网页开发方面带来改进,首发价格为 3.6 Flash 原价的一半。该模型已在 Antigravity 中供 Google 内部工程师使用,同时通过 Gemini API 在 Google AI Studio、Gemini Enterprise 等渠道提供。
Google 发布 Gemini 3.7 Flash,官方称其速度很快,价格比 3.6 Flash 低 50%(优惠持续至年底),并在约 3 周内通过算法改进实现智能水平明显提升。该模型已在 API、AI Studio、Antigravity 等渠道上线。
Google 员工发布 Gemini 3.7 Flash,价格与推理提升幅度及可用渠道都给出了具体数字。
Google DeepMind 发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 仅三周,定位为面向编码和智能体的主力模型。
Google DeepMind 发布 3.7 Flash,相比 3.6 Flash 在调试、问题解决等关键编码任务上有明显提升,并能用更少提示词设计更实用的网页布局和应用,在真实业务工作流中的推理与准确率也有改善。
Google DeepMind 发布 Gemini 3.7 Flash,官方称其在编码、知识工作和网页开发方面表现更强。该条推文未披露具体参数、价格或开放范围。
DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。
官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。
Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。
美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。
Grok 4.6 现已在 Devin Desktop 和 Devin CLI 中可用。该版本相较 Grok 4.5 有显著提升,性能超过 GPT-5.6 Sol,仅次于 Opus 5 和 Fable 5。
Mustafa Suleyman 在 X 上放出 MAI Thinking 1 的试用链接 aka.ms/mai-thinking-1,未附更多说明。该帖获得 49 次点赞、5 条回复、3 次转发和 17646 次浏览。
Mustafa Suleyman 宣布 Microsoft 首个推理模型 MAI-Thinking-1 从零构建,并已在 Microsoft Foundry 上线。
SpaceXAI 推出 Grok 4.6,定位可日常使用的主力模型,在同等价格下相比 Grok 4.5 有显著提升。该模型具备前沿智能水平,被评价为一款好用的日常主力模型。
SpaceXAI 发布 Grok 4.6,称其提供前沿智能水平,并在同一价格下较 Grok 4.5 有显著提升。来源推文还提到更大、更好的模型即将到来,并提及 1.5T 规模。