Browser Use 称 Gemini 3.6 Flash 在 BU Benchmark 达 68%
Browser Use 表示,Gemini 3.6 Flash 是他们测试过的浏览器智能体中性价比最高的模型,在其 BU Benchmark 上达到 68%。该成绩超过 GPT-5.6-sol 的 67% 和 Sonnet 4.6 的 62%,仅次于 Opus 4.8 的 74%,但成本仅为后者的一小部分。
Browser Use 表示,Gemini 3.6 Flash 是他们测试过的浏览器智能体中性价比最高的模型,在其 BU Benchmark 上达到 68%。该成绩超过 GPT-5.6-sol 的 67% 和 Sonnet 4.6 的 62%,仅次于 Opus 4.8 的 74%,但成本仅为后者的一小部分。
OpenCode 现已接入 Gemini 3.6 Flash 和 3.5 Flash Lite,均支持 1M 上下文。其中 3.6 Flash 的输出价格比 3.5 Flash 便宜 17%,Flash Lite 则便宜 80%。
Vercel 将 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 接入 AI Gateway,模型标识分别为 'google/gemini-3.6-flash' 和 'google/gemini-3.5-flash-lite'。开发者可经 Vercel AI Gateway 调用这两款模型。
Google 展示了合作伙伴如何把最新的 Gemini 3.6 Flash 和 3.5 Flash-Lite 模型集成进用户日常使用的工具中。原文未披露具体合作方、参数规模或 benchmark 数据。
Microsoft Research 公开致谢数据集创建者、社区贡献者、维护者与合作伙伴,称他们持续推动这项工作。该团队同时开放征集额外语言支持,以用于下一个版本的发布。
Gemini 3.6 Flash 已在 Antigravity 上线。发布者同时宣布重置所有人的每周配额,方便用户继续构建。
Google 推出 Gemini 3.5 Flash Cyber,基于 3.5 Flash 构建,在 CyberGym 等基准上达到前沿竞争力,面向规模化发现与修复网络安全漏洞场景优化,成本更低。该模型将在 AI 代码安全智能体 CodeMender 中独家提供给政府和可信伙伴,作为限时访问试点项目的一部分。鉴于技术的双用途性质,Google 对部署采取了审慎方式。
Google AI Developers 宣布 Gemini 3.6 Flash 和 3.5 Flash-Lite 即日起在 Gemini API 中可用,开发者可通过 Google AI Studio 和 Android Studio 使用。此外,Gemini 3.6 Flash 还可在 Antigravity 和 Gemini Enterprise Agent Platform 中构建。
Google 发布 Gemini 3.5 Flash-Lite,官方称其是面向低延迟、高吞吐开发者工作流的最快且最具成本效益的模型。该模型针对规模化重复任务、并行 subagent、agentic search 和大批量文档处理做了优化。
Google AI Developers 宣布发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,两款模型面向可扩展的智能体工作流,强调 token 效率与更低延迟。推文提示可阅读后续线程了解更多细节。
开发者 Patrick Loeber 表示自己过去几周用 Gemini 3.6 Flash 做开发,感觉它明显更好,token 效率更高,因此往往也更快,并为此写了一篇包含全部细节的开发指南,链接为 ai.google.dev/gemini-api/doc…。
Google DeepMind 推出三款新模型,用于让 AI 智能体更快、更聪明且更便宜。Gemini 3.6 Flash 用比 3.5 Flash 更少的 token 在相同成本下完成更高质量的工作;Gemini 3.5 Flash-Lite 面向文档处理和智能体搜索等日常任务;Gemini 3.5 Flash Cyber 用于发现并修补关键软件漏洞。
Google 发布 Gemini 3.6 Flash 和 3.5 Flash-Lite。3.6 Flash 修复了关键问题并提升 token 效率,价格低于 3.5 Flash;3.5 Flash-Lite 相比 3.1 FL 大幅提升,定位超低成本、高吞吐任务。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,主打规模构建 AI 智能体的效率、延迟与可靠性。
微软研究院推出 Aurora 1.5,将开放预测能力进一步扩展,同时发布 Flint 重定义可视化、FlowDAgger 加速自适应。此外,AI 智能体攻破了 Rowhammer 防御,内存技术正在重塑对话式 AI。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含面向实时交互的 Flash 版和面向高质量生成的 Plus 版,Flash 首包延迟约 300ms。
字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,已在火山方舟体验中心上线。该模型支持一条 prompt 统一编排对白、音效与环境声并做时间控制,当前时间控制精度为 100ms,单次可生成约 2 分钟音频并支持延展,保持角色音色一致,覆盖 20+ 语种。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,专门用于快速查找、验证并修复漏洞。
通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。
Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。
Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。
Thinking Machines 发布多模态模型 Inkling,可跨文本、图像和音频模态高效推理,全量权重已开放,并可在 Tinker 上微调。林俊旸(@JustinLin610)对此表示称赞,同时追问小模型为何没有开源。
Grok 4.5 在 Proximal 的 FrontierSWE 基准上综合实现与性能排名第 2,研究能力排名第 1,仅次于 Claude Fable 5,领先 Opus 4.8、GPT-5.5 和 GLM-5.2。
Thinking Machines 推出开放权重模型 Inkling,定位为在广泛能力类别上表现扎实的基础模型,可用于实际使用与定制。Inkling 能跨文本、图像和音频模态高效推理,官方公开完整权重,并已在 Tinker 上开放微调,同时提供 Inkling Playground 供试用。
Hugging Face 宣布发布新的开放权重模型,未披露具体模型名称、参数规模与性能数据。
腾讯混元发布旗舰级 295B 模型 Hy3 的 1-bit 与 4-bit 版本,可在单 GPU 上部署。该模型支持通过 llama.cpp 运行并开启 MTP,在更低硬件门槛下获得强大智能,相关 benchmark 与下载链接已放出。
腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。
阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。
GPT-5.6 在 IQ 测试中取得 136 分的初始成绩,据称比 99% 的人类更聪明,并成为首个得分超过 130 的模型。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
Poe 宣布上线 OpenAI 的 GPT-5.6 系列,包含 Sol、Terra、Luna 三款模型。据其说明,GPT-5.6-Sol 是 OpenAI 目前最强的模型,面向复杂推理、高级编码和智能体工作流;GPT-5.6-Terra 侧重日常办公、编码、分析与研究的均衡能力;GPT-5.6-Luna 主打快速、低成本,适合高并发和常规任务。
Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报,面向真实场景的天气、气候和能源应用。该版本由 Microsoft Research 发布。
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。
Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。
Poe 平台现已上线 Grok 4.5。据 Poe 介绍,这是 xAI 的最新旗舰模型,带来更强的推理、编码能力和改进的长上下文处理,面向复杂多步工作和智能体任务。用户可通过 poe.com/grok-4.5 试用。
SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。
Sualeh Asif 表示这是他在用单个智能体迭代时个人第一个比 Opus 更偏好的模型,Fast Grok 4.5 使用体验非常好。他称该模型总能绕过看似棘手的障碍,沟通直接、易于交流,且非常智能。他同时提到 Cursor 与 SpaceXAI 合作训练 Grok 4.5,这是其迄今最强模型,也是首个不止用于软件工程的模型。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个不止面向软件工程打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升,完全从零训练。
Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。
Cognition 发布其迄今最强的模型 SWE-1.7,已在 Devin Desktop 和 Devin CLI 上线。官方称其成绩与最强前沿模型仅差几分,成本仅为后者一小部分,并以 1000 tok/s 的闪电模式提供服务,团队表示在扩展规模时仍持续看到 RL 带来收益。