跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 1–20 条 · 共 26 条
今天10月10日周六
  1. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TypeSafe 的 Jev 十类真实用例:从 Agent 路由到自动驾驶的低成本决策

    TypeSafe AI 于 2026 年 9 月 15 日推出 Jev,并宣布获得 DCVC 领投的 4,000 万美元种子轮融资。Jev 不聊天不写文本,接收 state 与 typed questions,返回带校准概率的 Choice、Score 和 Noul 答案,通常耗时 70 到 500 毫秒,输入每百万 tokens 收费 0.042 美元、输出免费。

    为什么值得看

    梳理 Jev 的十类真实用例与每类成本延迟数据,可对照现有 LLM 工作流判断哪些小决策值得下放。

10月9日周五
  1. 量子位AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布办公Agent,可动态调用Claude系列模型

    Google Cloud发布署名Thomas Kurian的长文,推出通用办公Agent Gemini Agent,支持跨应用调用工具、定时与事件触发任务、多子Agent协作,并能依据任务在效果、速度与成本间动态选择Gemini系列或Anthropic Claude系列模型,未来计划支持更多闭源和开源模型。

    为什么值得看

    对比Meta与OpenAI的办公Agent路线,能帮读者看清谷歌这次把Agent嵌入企业组织体系的具体做法。

  2. 技术前沿AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 在 Gemini 中引入智能体能力,先从企业客户开始

    Google 在 Cloud 活动上宣布将 Gemini 带入智能体阶段,推出统一智能体,既能回答问题也能代用户完成任务,初期面向企业、之后再向消费者开放。该智能体可接收目标而非指令,自行规划工作并调用自定义技能与工具;默认自动选择模型,用户也可手动切换,首批第三方模型为 Anthropic 的 Claude。

    为什么值得看

    Google 把 Gemini 智能体先落到企业场景,文中给出的模型选择、系统连接与审计线索可供评估落地边界。

  3. Sundar Pichai(@sundarpichai)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布面向工作场景的统一 Gemini agent

    Google 在 NASA Hangar One 的 Gemini at Work 活动上发布新的 Gemini agent,面向工作场景提供单一通用智能体入口。

    为什么值得看

    Google Cloud 客户活动上发布统一 Gemini agent,其架构原则与跨模型编排思路可供企业评估落地路径。

10月8日周四
  1. Google Cloud BlogAI 评估 · 88/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Cloud 发布 Gemini agent:面向工作的统一智能体

    Google Cloud 在 Gemini at Work 2026 上发布 Gemini agent,一个面向工作的统一智能体,可回答问题、处理知识工作、生成图像媒体并编写运行代码,全部通过单一提示框和单一 API 完成。

    为什么值得看

    Google Cloud 把 Gemini 从模型入口升级为统一工作智能体,读者可据此判断企业级 Agent 平台的竞争格局与落地条件。

  2. 数字生命卡兹克AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI开源722份数学手稿,引发数学界震动

    OpenAI在GitHub发布openai/math仓库,公开722份数学手稿、归为372组成果,覆盖数论、代数几何、组合数学等方向,全部来自一个未公开的内部模型。作者称这些成果平均每个花费约3小时ChatGPT Pro级思考算力,其中包含将准黎曼猜想推进到7/8、复数域矩阵乘法指数降到2.25等说法,同时记录了25位菲尔兹奖得主联名信等数学界的质疑与争议。

    为什么值得看

    梳理OpenAI一次性公开722份数学手稿所引发的学界反应与争议,并讨论AI科研中评审环节的瓶颈。

10月7日周三
  1. 国际大厂AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部模型 722 篇数学论文,攻克 500 个公开数学难题中的 90 个

    OpenAI 从一个未发布内部前沿模型公开了 722 篇数学手稿,归入 372 个结果族,来自约 4000 个研究问题的评测,平均每个结果约消耗 3 小时 ChatGPT Pro 推理算力,同时发布论文、证明工件与部分推理摘要,模型本身仍未公开。

    为什么值得看

    汇总了 OpenAI 内部数学模型的稿件规模与算力投入,以及 Mistral、Google 等多个同期发布的对照信息。

10月4日周日
  1. 新智元AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌 10 月 9 日起调整 Gemini 订阅权限,免费用户仅剩 Flash-Lite

    谷歌宣布自 10 月 9 日起调整 Gemini 模型访问权限:免费用户仅能使用 Flash-Lite,AI Plus 订阅用户失去 Pro 模型使用权只保留 Flash 系列,只有 AI Pro 和 Ultra 用户可继续使用 Pro 模型及 Deep Think 最大并行推理能力。

    为什么值得看

    材料梳理了谷歌 Gemini 各档订阅权限的调整细节和第三方模型清退时间点,可据此判断现有工作流将受何影响。

10月1日周四
  1. AI寒武纪AI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌发布 Gemini 4 Argon:单次输出上限提至100万Token

    谷歌发布 Gemini 4 Argon,单次输出 Token 上限从 64K 提升至 100 万,面向软件工程、法律金融等企业级知识工作及网络安全防御场景。

    为什么值得看

    谷歌新一代模型把单次输出上限提升至100万Token,并给出内部代码迁移与定价细节,可据此判断长程任务的成本与落地边界。

9月23日周三
  1. 花叔AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Opus 5.5,OpenAI 随后推出 GPT-6 Sol 与 GPT-6 Luna

    Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。

    为什么值得看

    作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。

9月16日周三
  1. Philipp Schmid(@_philschmid)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布

    Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布,延续上月 3.5 Transcribe 对实时语音智能体的投入。

    为什么值得看

    Gemini 3.8 Live 公布了实时语音定价与智能体任务得分,可据此判断实时语音智能体的能力与接入方式。

9月3日周四
  1. Google DeepMind BlogAI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,称前者在软件工程、智能体任务和多步推理上有明显提升,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    为什么值得看

    官方披露了两款新模型的基准表现、定价与访问渠道,可用于对比 Flash 系列在编码与网络安全能力上的迭代节奏。

9月2日周三
  1. Google DeepMind BlogAI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 为 Gemini 3.7 Flash 等模型推出智能体视频理解功能

    Google DeepMind 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体视频理解功能,通过原生视频工具动态搜索、扫描目标片段,替代固定帧率的静态处理方式。

    为什么值得看

    原文给出 token 与成本降幅及基准表现,读者可据此判断长视频分析的落地成本变化。

8月22日周六
  1. Sundar Pichai(@sundarpichai)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.7 Flash 成为 Google 增长最快模型,ARC-AGI-2 得分 84.6%

    Google 的 Gemini 3.7 Flash 首周打破了此前 Gemini 的增长纪录,成为 Google 增长最快的模型,目前已接入 Search 和 Gemini app。ARC Prize 公布的评测数据显示,该模型在 ARC-AGI-2 上得分 84.6%、每任务 0.25 美元,在 ARC-AGI-1 上得分 95.5%、每任务 0.12 美元,以低成本和高分在前沿模型中较为突出。

    为什么值得看

    Google CEO 给出 Gemini 3.7 Flash 首周增速与 ARC-AGI 两项成绩,可据成本与分数判断其定位。

8月14日周五
  1. Google AI(@GoogleAI)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash,面向编码与智能体并推出半价优惠

    Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。

    为什么值得看

    Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。

  2. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 发布 Gemini 3.7 Flash:价格较 3.6 Flash 低 50%,智能水平提升

    Google 发布 Gemini 3.7 Flash,官方称其速度很快,价格比 3.6 Flash 低 50%(优惠持续至年底),并在约 3 周内通过算法改进实现智能水平明显提升。该模型已在 API、AI Studio、Antigravity 等渠道上线。

    为什么值得看

    Google 员工发布 Gemini 3.7 Flash,价格与推理提升幅度及可用渠道都给出了具体数字。

8月6日周四
  1. Google DeepMind BlogAI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 WeatherNext 气旋预报模型

    Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,称其在预测气旋路径、强度和风场结构上达到 SOTA。

    为什么值得看

    Google DeepMind 公开气象模型权重与代码,并说明其预报精度提升大致相当于十年气象学进展。

  2. Sundar Pichai(@sundarpichai)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 结束 Google 27 年任职,将创办公共利益公司

    Sundar Pichai 发文感谢 Jeff Dean 在 Google 27 年的工作,Jeff Dean 将与 Sanjay Ghemawat 一起创办一家公共利益公司,聚焦加速 ML、科学与工程领域的发现。Google 将作为创始投资方和云合作伙伴提供支持。

    为什么值得看

    Google 27 年老将 Jeff Dean 离职创办公共利益公司,读者可从中看到高层人事变动与 Google 的投资支持角色。

7月31日周五
  1. Demis Hassabis(@demishassabis)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2 机器人模型套件

    Google DeepMind 发布 Gemini Robotics 2,这是一套面向机器人的新一代物理 AI 模型。官方称机器人现在可以推理每一个动作,完成此前无法实现的任务,例如系精细的绳结,并支持多机器人协作解决复杂工作流。该系列还为人形机器人带来全身智能与更高级的灵巧操作能力。

    为什么值得看

    DeepMind 官方发布 Gemini Robotics 2,点出全身智能、精细操作与多机器人协作三项能力。

7月30日周四
  1. Google AI(@GoogleAI)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2 与具身推理模型 Gemini Robotics ER 2

    Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。

    为什么值得看

    Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。