跳到正文

全部动态

今日 17 条
7月30日周四
  1. Google AI(@GoogleAI)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2 与具身推理模型 Gemini Robotics ER 2

    Google DeepMind 推出 Gemini Robotics 2,作为驱动新一代机器人的智能层,支持全身智能控制、高级灵巧操作和多机器人协作。新发布的具身推理模型 Gemini Robotics ER 2 充当机器人的高层大脑,负责观察环境、推理完成任务所需动作并与视觉-语言-动作模型协同执行,同时跟踪进度,使机器人能够完成复杂多步工作流、在步骤失败时自我纠正并适应全新场景。

    为什么值得看

    Google DeepMind 发布 Gemini Robotics 2 系列,读者可了解机器人全身控制与具身推理的新分工。

  2. Google DeepMind BlogAI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布具身推理模型 Gemini Robotics ER 2

    Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,可通过 Gemini API、Google AI Studio 公开使用,并在 Gemini Enterprise Agent Platform 上开启私密预览。

  3. Google DeepMindAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2,展示机器人协同

    Google DeepMind 发布 Gemini Robotics 2,并展示了机器人之间协同工作的能力。

  4. Ideogram(@ideogram_ai)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 与 PrunaAI 联合发布 P-Image-Ideogram 图像模型家族

    Ideogram 发布 P-Image-Ideogram 图像模型家族,与 PrunaAI 联合开发,主打质量、速度与成本之间的帕累托最优权衡。该家族提供四种质量模式,支持原生 1K 和 2K 生成,每张图像起价 0.003 美元,现已在 API 及所有合作平台上线。

  5. xAI(@xai)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0

    xAI 发布下一代语音模型 Grok Voice Think Fast 2.0,官方称其在智能水平、转写准确率和对话能力上均有提升。相关介绍见 x.ai/news/grok-voic…。

  6. xAI(@xai)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 推出 Grok Voice Think Fast 2.0,面向真实场景语音智能体

    xAI 发布 Grok Voice Think Fast 2.0,专为真实世界语音智能体打造,可在嘈杂环境中清晰收音,能对复杂工作流进行推理,对话听起来也更自然。

  7. v0(@v0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 在私密网络安全基准上性价比领先,GPT 5.6 精度最高但成本高 7 倍

    Malte Ubl 在私密网络安全基准上测试 Kimi K3,认为它是网络安全任务的性价比之选,召回率、精度与价格平衡最好,GPT 5.6 召回率与精度最高但单次运行成本高出 7 倍多。

  8. Google DeepMind BlogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 在 Google Flow Music 发布 Lyria 3.5 音乐生成模型

    Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并在 Google Flow Music 中上线。官方称该模型在音乐性、歌词和人声质量上均有提升,包括更丰富复杂的旋律结构、提示词遵循与结构感知更好的歌词、更具情感表现力和发音更准的人声,同时可更便捷地控制输出的节奏与时长。

7月29日周三
  1. Hunyuan(@TXhunyuan)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯开源 AngelSpec:端到端投机解码框架,Hy3-A21B 上 DFly 提速 1.98–2.40×

    腾讯开源 AngelSpec 端到端投机解码框架,同时支持训练与部署。在 Hy3-A21B 上,DFly 在 4 至 64 的并发测试区间实现 1.98–2.40× 端到端加速,吞吐量较 DFlash 高 10.5–11.8%。训练代码与 Hy3-A21B MTP/DFly drafter 权重已发布于 GitHub、Hugging Face 和 ModelScope。

  2. Jina AIAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina Reranker v3.5 发布:0.6B 列表式重排器,专攻垂直领域与结构化数据

    Jina AI 推出 jina-reranker-v3.5,保持 0.6B 参数规模和 LBNL 列表式架构,专门解决垂直领域适配、结构化记录逻辑识别和长列表显存爆炸三大工程痛点。

  3. Ideogram(@ideogram_ai)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ideogram 发布 9.3B 开源图像模型 Ideogram 4.0,与 AMD 合作规模化部署

    Ideogram 发布 Ideogram 4.0,一个 9.3B 参数的开源权重 Diffusion Transformer 图像模型,称其在 LMArena 和 Design Arena 上超过所有开源权重图像模型,X-Omni 英文 OCR 文字渲染得分为 0.97,行业平均为 0.30–0.50。

7月28日周二
  1. Google DeepMind BlogAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 Gemini Robotics 2,为机器人带来全身智能

    Google DeepMind 发布 Gemini Robotics 2,包含三款模型:负责视觉-语言-动作的 Gemini Robotics 2、负责具身推理的 Gemini Robotics ER 2,以及本地运行的 Gemini Robotics On-Device 2。

  2. Poe(@poe_platform)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Claude Opus 5,Anthropic 称其为最强 Opus 模型

    Poe 宣布可在其平台试用 Anthropic 最新模型 Claude Opus 5,并称这是迄今能力最强的 Opus 模型,以一半价格接近 Claude Fable 5 级别的智能。该模型在智能体编码、知识工作、视觉理解和长时任务上有明显提升,试用入口为 poe.com/Claude-Opus-5。

  3. Google AI Developers(@googleaidevs)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Flash-Lite 演示处理 100 万+ 图片的视觉任务

    Google 用 Gemini 3.5 Flash-Lite 演示大规模重复性视觉任务,在 100 万+ 张商品目录图片上批量提取原始特征并转化为干净的结构化数据。该模型以低延迟和 token 效率满足大规模工作流需求。

7月27日周一
  1. 月之暗面 KimiAI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 开放日:模型权重、技术报告与关键 Infra 技术同步开放

    月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重、技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。

    为什么值得看

    Kimi K3 开放权重、技术报告与 Infra 技术,读者可了解其 2.8 万亿参数 MoE 与 3 倍规模化效率的具体做法。

  2. 月之暗面 KimiAI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 开放日:模型权重、技术报告与三项 Infra 技术同步开放

    月之暗面在 Kimi K3 开放日发布 Kimi K3 模型权重与技术报告,并开源支撑其训练的关键 Infra 技术 MoonEP、FlashKDA 和 AgentEnv。

    为什么值得看

    月之暗面公开最强模型的权重与技术报告,并同时开源三项训练 Infra 技术,读者可据此了解其规模效率的实现路径。

  3. Patrick Loeber(@patloeber)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemma 下载量逼近 10 亿,Gemma 4 本地编程智能体教程发布

    Google Gemma 本周下载量突破 9 亿次,官方称即将达到 10 亿。博主 Patrick Loeber 同期发布博客,介绍如何将 Gemma 4 作为本地编程智能体运行。

  4. Modal BlogAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    月之暗面发布 Kimi K3,Modal 发布首日上线并给出推理性能数据

    月之暗面发布 Kimi K3,一个 2.8 万亿参数的多模态模型,具备 1M token 上下文窗口和原生视觉能力。

    为什么值得看

    读者可看到 2.8T 参数开源模型在发布当天上线的推理性能数据与 Moonshot 的架构取舍,理解大模型可服务性背后的工程细节。

7月26日周日
  1. Demis Hassabis(@demishassabis)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemma 4 下载量超 3 亿次,Gemma 开源模型系列累计突破 9 亿次

    Gemma 4 模型下载量已超过 3 亿次,整个 Gemma 开源模型系列的累计下载量则突破 9 亿次。这一数据由 Demis Hassabis 发文澄清,并引用了 Olivier Lacombe 关于 Gemma 模型家族跨过 9 亿次下载里程碑的推文。

7月25日周六
  1. Midjourney(@midjourney)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney 发布 V8.2 并设为默认模型

    Midjourney 发布 V8.2,并将其设为平台默认模型。官方称此次更新聚焦美学、个性化与图像质量,新风格更具创意、大胆、前卫和新鲜感,个性化效果也优于以往。

  2. Patrick Loeber(@patloeber)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5,称接近 Fable 5 能力且价格减半

    Anthropic 发布 Claude Opus 5,称其是一款善于思考且主动的模型,能力接近 Fable 5,价格只有后者一半。转发的评论者注意到此次还下调了 prompt cache 的最低额度,认为这是基础设施层面的推进。

  3. cat(@_catwu)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5,主打长时自主运行任务

    Anthropic 发布 Claude Opus 5,称其是一款主动且考虑周全的模型,具备接近 Fable 5 的前沿智能水平,价格为其一半。作者表示该模型擅长长时间自主运行的任务,邀请用户试用并反馈。

  4. Alex Albert(@alexalbert__)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5 发布:跨领域 token 效率与智能水平同步提升

    Anthropic 发布 Opus 5,团队称在提升智能水平的同时大幅优化了该模型在各领域的 token 效率。Alex Albert 表示其使用体验非常顺滑,在许多编码任务上他更偏好 Opus 5 而非 Fable 5。

  5. Mike Krieger(@mikeyk)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 5

    Anthropic 发布 Claude Opus 5,官方称其思考更主动,接近 Fable 5 的前沿智能水平,价格仅为其一半。Mike Krieger 表示 Opus 5 迅速成为他工作和周末的日常主力模型,能连续数小时处理复杂任务,并称其能持续深挖棘手问题;他还用它构建了一些游戏。

  6. Alex Albert(@alexalbert__)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Opus 5

    Anthropic 发布 Claude Opus 5,称其为兼顾思考与主动性的模型,智能水平接近 Fable 5,价格只有后者一半。转述者 Alex Albert 以欢迎语转发该消息,未在推文中给出更多技术细节。

  7. AI SDK(@aisdk)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在 AI SDK 中使用 Claude Opus 5

    Claude Opus 5 发布,被 Anthropic 描述为一款深思熟虑且主动的模型,智能水平接近 Fable 5,但价格只有后者的一半。AI SDK 已支持接入该模型。

7月24日周五
  1. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft 发布 MAI-Image-2.5-Pro 图像模型并在 Foundry 开放预览

    MAI-Image-2.5-Pro 今日在 Foundry 开放预览,Microsoft 称其为最高保真度的专业级图像模型。该模型面向超高质量图像、精细编辑和图像内文字精确渲染,并与同家族其他图像模型一起供开发者按质量、速度、成本的权衡选择。

  2. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MAI-Voice-2-Flash 发布:比 MAI-Voice-2 快 2 倍、便宜 32%

    MAI-Voice-2-Flash 正式发布,速度比 MAI-Voice-2 快 2 倍,价格便宜 32%,为每 100 万字符 $15。该模型已进入公开预览,并已驱动企业呼叫中心平台 Dynamics 365 Contact Center,可将 GPU 成本最高降低 89%。

  3. Mustafa Suleyman(@mustafasuleyman)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 MAI 模型进展:PowerPoint 图像模型成本较 GPT-Image-2 降 84%

    微软正在推进 MAI 系列模型的落地,覆盖 PowerPoint、OneDrive、Bing、Dragon Copilot 等产品。PowerPoint 图像模型成本较 GPT-Image-2 下降 84%,OneDrive 保存率提升 26%、延迟降低约 25%,Bing 已将其作为默认模型。Dragon Copilot 转写模型支持 58 种语言,多语言临床转写错误率减半。

7月23日周四
  1. Patrick Loeber(@patloeber)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.6 Flash 与 3.5 Flash-Lite 发布 24 小时后的反馈征集

    Gemini 3.6 Flash 与 3.5 Flash-Lite 发布 24 小时后,官方称已收集并正在审阅超过 1K 条回复,认为这一时间虽早,但已能清晰看出需要改进的方向。团队表示目标是在真实世界任务与效率上大幅推进这两款模型,并称"还需要继续推进"。

  2. Hunyuan(@TXhunyuan)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯 Hy3 上线 OpenCode,支持 Go text 与 256K 上下文

    腾讯最新模型 Hy3 已在 OpenCode 上线,可在 Go text 中调用,支持 256K 上下文。该消息由 Hunyuan 官方账号发布。

  3. Microsoft Research(@MSFTResearch)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软发布 MagenticLite 与 Fara1.5 模型:入门指南与技术报告

    微软研究发布 MagenticLite 和 Fara1.5 两款模型,并提供入门指南、模型入口及 Fara1.5 的博客与技术报告。相关资源已在 Models 页面开放获取。

  4. Microsoft Research(@MSFTResearch)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MagenticLite 模型全面开源,MagenticBrain 与 Fara 1.5 上线 Hugging Face

    微软研究院宣布 MagenticLite 的模型已全面开源,MagenticBrain 和 Fara 1.5 以开放权重上线 Hugging Face,此前这两个模型只在 Microsoft Foundry 提供。该应用、harness 以及整个技术栈中的所有模型现在均已开放。

7月22日周三
  1. Poe(@poe_platform)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite

    Poe 宣布 Google DeepMind 的 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 已在其平台上线。Gemini-3.6-Flash 被描述为 Google 的新主力模型,在编码、知识工作和多模态表现上更强,并改善了 computer use。

  2. Patrick Loeber(@patloeber)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.6 Flash 与 3.5 Flash-Lite 寻求真实任务与效率反馈

    Gemini 3.6 Flash 与 3.5 Flash-Lite 发布后征集反馈,目标是让这两个模型在真实世界任务和效率上有大幅提升。发布者向用户征询使用 24 小时后的真实评价。

  3. Hunyuan(@TXhunyuan)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元 Hy3 登 Agent Arena 开源模型第 5、前端代码赛道第 2

    腾讯混元 Hy3 在 Agent Arena 开源权重模型中排名第 5(总榜第 25),在前端代码赛道(Frontend Code Arena)位列开源模型第 2(总榜第 16)。

  4. Sualeh Asif(@sualehasif996)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.5 上手感获好评,成为重度用户第二常用模型

    Grok 4.5 使用体验获好评,Dan Shipper 称其已成为 Kieran Klaassen 第二常用的模型,并直言需要更新自己的认知。

  5. Google AI Developers(@googleaidevs)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Gemini 3.6 Flash 在 GitHub Copilot 中全面可用

    Google 的 Gemini 3.6 Flash 现已全面可用,并正在 GitHub Copilot 中逐步推送。该模型面向网页与应用开发、编码及智能体任务;在测试中,它在编码和智能体工作流上的任务完成率高于 Gemini 3.5 Flash,token 效率也更好。用户可在 GitHub Copilot 应用或 @code 中试用。

  6. Google AI Developers(@googleaidevs)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gemini 3.5 Flash-Lite 对比 3.1 Flash-Lite:企业文档任务准确率 58% vs 41%

    Google DeepMind 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。Box 的评测显示,Gemini 3.5 Flash-Lite 在真实企业文档任务上整体准确率为 58%,高于 Gemini 3.1 Flash-Lite 的 41%,其中数据分析提升 27pp、零售提升 28pp。Box 称其速度更快、体量更轻。

  7. Google AI Developers(@googleaidevs)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 称 Gemini 3.6 Flash 在 BU Benchmark 达 68%

    Browser Use 表示,Gemini 3.6 Flash 是他们测试过的浏览器智能体中性价比最高的模型,在其 BU Benchmark 上达到 68%。该成绩超过 GPT-5.6-sol 的 67% 和 Sonnet 4.6 的 62%,仅次于 Opus 4.8 的 74%,但成本仅为后者的一小部分。