跳到正文

全部动态

今日 0 条
9月8日周二
  1. Greg Brockman(@gdb)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 可从 mel 频谱图零样本识别声音

    Astra 能够从 mel 频谱图中零样本识别声音,发布者称这还只是该模型的轻量推理,尚未触及能力上限。该演示由 Max @maxxrubin_ 分享,Greg Brockman 转发。

9月7日周一
  1. Paul Couvert(@itsPaulAi)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenBMB 开源 2B 模型 MiniCPM5-2B,面向端侧与 Agent

    OpenBMB 开源 MiniCPM5-2B,这是一个 2B 参数语言模型,主打端侧高智能密度,可在手机上本地离线运行,面向智能体、编码与工具调用优化。

  2. Genspark(@genspark_ai)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 上线 Muse Spark 1.3,覆盖 AI Chat、Code Agent 与 Claw

    Genspark 宣布 Muse Spark 1.3 已在其平台上线,覆盖 AI Chat、Code Agent 和 Claw。该模型被描述为 Meta 面向智能体时代的最强模型,在内部对比中比 Muse Spark 1.2 减少约 20% 工具调用和约 25% token 消耗。

  3. Hunyuan(@TXhunyuan)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy4 preview 升级:减少长思考与过度验证,降低 token 消耗

    腾讯混元发布 Hy4 preview 升级,针对用户反馈的复杂任务中长思考与过度验证问题做了优化,现已向所有人开放。官方称任务质量不变,轮次更少、输入输出 token 更低,基准测试与人工评测均已确认,并邀请用户在 WorkBuddy(WorkBuddy.ai)上试用并反馈问题。

9月6日周日
  1. Browser Use(@browser_use)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 在 Browser Use Benchmark v2 上以 77.3% 大幅领先 Opus 5 与 GPT-5.6

    Astra 在 Browser Use Benchmark v2 上取得 77.3%,远高于 Opus 5 的 50.5% 和 GPT-5.6 Sol xhigh 的 49.1%,在 60 项任务中有 22 项满分,而 Opus 5 无一满分。该消息由 Gregor Zunic 发布,并提到 fable 拒绝的任务过多。

  2. AI产品黄叔(@PMbackttfuture)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Astra 发布后的人类幼崽😱

    GPT 6 Astra 发布后,社交平台上出现了一条以"人类幼崽"为题的视频内容,该帖获 254 条回复、74 次转发、838 次点赞和 180337 次浏览。原文未披露 GPT 6 Astra 的具体功能、参数或可用性信息。

  3. AI产品黄叔(@PMbackttfuture)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Astra 之后 Codex 生图更精致,或因 Astra 能力更强

    有用户发现 GPT 6 Astra 上线后,Codex 里的生图效果明显更加精致,一度以为 GPT image 2.5 已经推出。经搜索后其判断,这一变化估计仍是 Astra 本身能力更强所致。

9月5日周六
  1. 小米技术AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布表格数据大模型 Xiaomi-TabLDM 并开源权重

    小米正式发布通用表格数据基础大模型 Xiaomi-TabLDM,以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或集成即可完成分类与回归预测。

  2. Augment Code(@augmentcode)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 上线 Cosmos,长程编码与多步智能体能力大幅提升

    OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。

  3. Poe(@poe_platform)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Astra 现已上线 Poe

    GPT 6 Astra 已在 Poe 平台上线,用户可直接试用并与其他领先模型对比。Poe 称其推动 AI 前沿,未披露参数量、上下文长度或跑分数据。

  4. Greg Brockman(@gdb)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Astra,先向 Pro、Enterprise 与 Business Premium 用户开放

    OpenAI 的 GPT-6 Astra 已在 Work/Codex 中向全部 Pro、Enterprise 和 Business Premium 用户开放,并同步上线 API,Plus 和 Business 用户将在之后开始逐步 rollout。

    为什么值得看

    原文给出 GPT-6 Astra 已向哪些用户开放与后续节奏,读者可据此判断自己何时能用上。

  5. Paul Couvert(@itsPaulAi)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Lyria 3.5 并集成进 Gemini

    Google 发布 Lyria 3.5,并集成进 Gemini。作者在预览阶段试用后表示其生成音乐的方式相当易用,提供 24 个可直接使用的模板、对歌词的完整控制以及 17 种风格。

  6. Fei-Fei Li(@drfeifei)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    World Labs 发布多模态世界模型 Atlas

    World Labs 发布 Atlas,称其为首个多模态世界模型,可生成图像和视频帧,并具备像素级精确的相机控制,还能将这些帧重建成3D。官方描述称其可建模世界、移动相机并模拟空间与时间。李飞飞转发该消息并指向更多 Atlas 内容。

  7. Fei-Fei Li(@drfeifei)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布世界模型 Atlas,用新视角预测统一像素生成与重建

    World Labs 发布面向空间智能的世界模型 Atlas,其核心是新视角预测,并称它是首个统一像素生成与像素重建的模型。团队表示这让数字化采集一个空间三维表示所需的数据量减少 50 到 100 倍,过去一个房间需要 100 到 300 张照片,Atlas 只需三张。

  8. Google AI(@GoogleAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash、Lyria 3.5 与 WeatherNext 3 等模型

    Google 本周发布 Gemini 3.8 Flash,称其在编码、智能体工作流和多步推理上有升级,同时推出专注网络安全的 Gemini 3.8 Flash Cyber。

9月4日周五
  1. Milvus(@milvusio)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 释放信号:长时运行智能体光靠上下文压缩不够,Milvus 3.0 补上记忆检索层

    GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。

  2. Philipp Schmid(@_philschmid)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 多模态任务实用性获赞,图像推理与数据提取排第一

    Gemini 3.8 在多模态任务上的真实世界实用性被评价为无可匹敌,Gemini 3.8 Flash 被称为新的最爱 Gemini 模型。其在图像推理和数据提取上排名第一,目标检测排名第二,速度比 Gemini 3.7 Flash 快 30%。

  3. 向阳乔木推荐看AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Max-0902 七个项目实测:网页、游戏与 PPT 表现如何

    作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。

  4. Stanford AI Lab(@StanfordAILab)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 Astra 发布:更聪明、更对齐,但存在代码冗余与确认过多问题

    Stanford AI Lab 毕业生 Yann Dubois 表示 Astra 已发布,主要变化包括更聪明、更对齐可信赖以及更好的 CUA 能力,并展示了 Astra 用 Blender 搭建的房子。他同时指出仍存在代码冗余过多、请求确认过于频繁等问题,并提醒 Astra 比 5.6 更严格遵循指令,包括旧技能中隐藏的不必要指令,建议使用前先清理。

  5. Greg Brockman(@gdb)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI GPT-6 Astra 在 ARC-AGI-3 取得 SOTA,该基准已被刷满

    Greg Brockman 引用 ARC Prize 消息称 ARC-AGI-3 现在已被刷满。OpenAI 的 GPT-6 Astra 在该基准上取得 SOTA:Astra 在 ARC-AGI-3 上得分 63%,通过新的 provider adapter harness 达到 99%,在 96% 的 ARC-AGI-3 关卡上超过人类表现,并构建出目前所见最精确的新环境符号模型。

  6. Greg Brockman(@gdb)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Astra,在 FrontierMath Tier 4 等基准达 SOTA

    OpenAI 发布 GPT-6 Astra,Greg Brockman 称其在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上达到当前最优水平。

  7. Greg Brockman(@gdb)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Astra

    OpenAI 的 Greg Brockman 在 X 上发布 GPT-6 Astra,并附上官方页面链接 openai.com/index/gpt-6-as…。该推文未披露模型能力、版本细节或开放范围。

  8. ChatGPT(@ChatGPTapp)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 开始推送 GPT-6 Astra,面向 ChatGPT 付费用户与 API

    OpenAI 宣布 GPT-6 Astra 今日起向有限数量的组织推送,未来几天将向所有 ChatGPT Plus、Pro、Business 和 Enterprise 用户开放,同时通过 OpenAI API 和 AWS 提供。官方建议在获得访问权限后下载 ChatGPT 桌面应用以获得最佳 Astra 体验。

  9. ChatGPT(@ChatGPTapp)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 GPT-6 Astra

    OpenAI 的 ChatGPT 账号宣布推出 GPT-6 Astra,称其为进入 Chat 的新星,原帖附带一段视频但未给出具体能力说明。

  10. ChatGPT(@ChatGPTapp)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 官方称 GPT-6 Astra 在电脑操作、浏览与智能体编码等六项能力上达到 SOTA

    ChatGPT 官方账号称 GPT-6 Astra 在六项能力上达到 state-of-the-art,分别是电脑操作、浏览、智能体编码、网络安全、科学和专业工作。该推文未给出具体的评测基准名称、分数或模型开放时间。

  11. Google AI(@GoogleAI)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 和 Google Research 发布 WeatherNext 3,称其为目前最先进的全球天气 AI 模型,预测能力比 WeatherNext 2 精细最多 5 倍。

9月3日周四
  1. Google DeepMind(@GoogleDeepMind)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind WeatherNext 3 将全球降水预报误差降低最高 50%

    Google DeepMind 的 WeatherNext 3 在全球降水预报上实现重大突破,误差最高降低 50%,此前全球天气模型难以准确预测降雨,往往只能给出模糊估计或漏掉强风暴边界。改进幅度最大的区域正是历史上预报可靠性较低的地区。

  2. Google DeepMind(@GoogleDeepMind)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 WeatherNext 3 全球天气预报模型

    Google DeepMind 联合 Google Research 推出 WeatherNext 3,该模型直接从真实世界实时观测数据中学习,能更快给出更本地化、更精准的预测。官方称这是全球天气预报方式的重大突破。

  3. Google DeepMind BlogAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型

    Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,直接使用实时地球静止卫星数据训练,可逐小时生成天气预报,温度和湿度等关键地表变量分辨率达 5 公里,整体比上一代 WeatherNext 2 的 25 公里网格清晰约五倍。

  4. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mustafa Suleyman 发布 MAI-Transcribe-2:比 GPT-Transcribe 快 10 倍,比 Gemini 3.5 快 5 倍

    MAI-Transcribe-2 语音转录模型发布,速度比 GPT-Transcribe 快 10 倍、比 Gemini 3.5 快 5 倍。该模型在 Artificial Analysis 准确率-延迟帕累托前沿排名第一,定价为市场最低。

  5. Patrick Loeber(@patloeber)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 征询早期反馈:该在哪些方面改进?

    Gemini 3.8 Flash 正在公开征集早期使用反馈,询问用户希望在哪些方面改进。该帖获得 945 条回复、1233 次点赞和 188485 次浏览。

  6. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax 发布 H3 Max Turbo 预览版,速度翻倍成本减半

    MiniMax 发布 H3 Max Turbo 预览版,这是 H3 Max 的更快、更省成本版本,运行速度为 H3 Max 的 2 倍、成本减半,同时在自家评测中达到原版 H3 Max 质量表现的第 97 百分位,并仍优于 H3 及其他视频模型。该版本保留 H3 Max 的提示词理解、美学和整体质量,生成时间减半;促销价下 768p 视频为每秒输出 0.01 美元,促销期持续两周。

  7. DeeplearningAIAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro-0813 正式发布,同步开源 agent harness

    DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。

  8. DeepLearning.AI(@DeepLearningAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4 Pro 0813 发布,并开源评测框架 DeepSeek Harness

    DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。

  9. Poe(@poe_platform)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Claude Fable 5.1 上线 Poe

    Anthropic 的 Claude Fable 5.1 已在 Poe 平台上线,Poe 称其为 Anthropic 目前能力最强的模型,面向高难度推理和长时程智能体任务。该模型支持 1M token 上下文窗口、网页搜索,以及从低到最高的自适应思考档位。

  10. Philipp Schmid(@_philschmid)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 在 cursor bench 上取得 69.9%,单任务成本 2.38 美元

    Gemini 3.8 Flash 在 cursor bench 上达到 69.9%,单任务成本为 2.38 美元。该信息来自一条简短的 X 推文,未给出评测设置或对比数据。

  11. Google AI(@GoogleAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.8 Flash Cyber 防御模型

    Google 发布 Gemini 3.8 Flash Cyber,称相比 3.5 代有大幅提升,是迄今能力最强的防御模型之一。该模型专为安全团队设计,可用于大规模编写修复漏洞的新代码,即补丁生成;Google 已用它保护自身代码,帮助 Chrome 团队生成比顶级商业模型多 2.6 倍的正确答案补丁。

  12. Google DeepMind(@GoogleDeepMind)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 模型在 CyberGym 等基准测试中自主发现漏洞并给出 2.6 倍有效修复

    Google DeepMind 的模型在 CyberGym 等基准测试中领先,能自主发现软件弱点,同时保持快速高效。在 Google Chrome 代码库的真实测试中,它产出的有效修复数量是此前的 2.6 倍,帮助更快保护软件。

  13. Google DeepMind(@GoogleDeepMind)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash Cyber,主打漏洞检测与自动修补

    Google DeepMind 发布 Gemini 3.8 Flash Cyber,称其面向防御方提供专家级漏洞检测和自动修补能力,帮助团队应对新出现的威胁。材料仅给出该说法,未披露模型细节或可用入口。

  14. Demis Hassabis(@demishassabis)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Flash 发布,新增 3.8 Flash Cyber 推进网络安全前沿

    Gemini 3.8 Flash 发布,这是 Gemini 在不到一个月内的又一次升级,也是 6 周内第 3 个更新的 Flash 模型,智能体与编程能力再度提升。同时推出的 Gemini 3.8 Flash Cyber 面向网络安全防御前沿。更多模型与网络安全工作细节见官方博客。