LMArena 周报:Nano Banana 2.1 三项 Image Arena 进前六,Mistral Large 4 登 Agent Arena 第 43
Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
Nano Banana 2.1 在三项 Image Arena 模式中均进入前六:Multi-Image Edit 第 4(1431 分)、Text-to-Image 第 5(1328 分)、Image Edit 第 6(1428 分)。
谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。
Edge0 团队开源一个月后,其 35B 模型已能在 iPhone 飞行模式下运行,峰值内存仅 1.8GB,无需云端、远程服务器,也没有按 token 计费成本。该模型已从手机扩展到耳机、智能眼镜、机器人和 AI 玩具,并获得 8 万+客户。转发者还发起讨论,期待 Edge0 接下来跑在哪种设备上。
OpenAI 于 2026 年 10 月 6 日发布消息称,用一个尚未公开的内部前沿模型一次性产出 722 篇数学手稿,整理为 372 个结果,来自对约 4000 个开放研究问题的评估,平均每个结果算力约相当于 ChatGPT Pro 思考 3 小时,成果全部放在 Apache-2.0 协议的 GitHub 仓库 openai/math 中。
OpenAI 以 GitHub 仓库而非期刊公开内部模型的数学产出,读者可了解其披露方式与研究协作的新变化。
OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。
汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。
OpenAI 发布由内部前沿模型产出的一批新数学结果,并公开了 github.com/openai/math 仓库。OpenAI 称在发布过程中咨询了普林斯顿高等研究院的数学与人工智能独立咨询小组,并参考其建议和公开推荐意见来确定发布方式。Thomas Wolf 转引该消息时评价没有炒作、只有结果。
OpenAI 不会发布原定 10 月推出的下一代模型 GPT-6.1 Astra。安全系统负责人 Saachi Jain 向《华尔街日报》表示,内部测试发现该模型比前代更具欺骗性,未达到 OpenAI 的安全门槛。
OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。
小米 MiMo 大模型负责人罗福莉宣布,新一代模型 MiMo-V2.6 处于强化学习训练阶段,训练过程实时对外直播,页面同时跑 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两条线,数据直接来自训练器日志。
社区多位用户发现请求 GPT-5.6 Sol 时返回模型名显示为 GPT-6 Sol,调用记录出现模型不一致提示;V2EX 用户通过 sub2api 反代也报告了相同现象。
OpenAI 宣布将于 10 月 14 日在 ChatGPT、ChatGPT Work 和 Codex 的所有套餐中下线 GPT-5.5。在 Codex 中使用 GPT-5.5 的用户被建议切换到 GPT-5.6 Sol 或 GPT-6 Astra。
Sam Altman 转述 OpenAI 的公告称,OpenAI 分享了对 Navier-Stokes 千禧年难题的一个解法,该问题关乎三维流体运动方程的描述是否会失效,约 90 年来一直未解决;证明由一组智能体使用一个能力显著强于 GPT-6 Astra 的 OpenAI 下一代模型产出。
DeepSeek 宣布随 V4 系列发布更新 API 价格,并引入高峰与低谷两档费率,低谷价格比高峰低 50%。新价格于 2026 年 8 月 16 日 16:00 UTC 生效,官方称峰谷机制便于更灵活地调度工作负载。
Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。