Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite
Google AI Developers 宣布发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,两款模型面向可扩展的智能体工作流,强调 token 效率与更低延迟。推文提示可阅读后续线程了解更多细节。
Google AI Developers 宣布发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite,两款模型面向可扩展的智能体工作流,强调 token 效率与更低延迟。推文提示可阅读后续线程了解更多细节。
Google DeepMind 推出三款新模型,用于让 AI 智能体更快、更聪明且更便宜。Gemini 3.6 Flash 用比 3.5 Flash 更少的 token 在相同成本下完成更高质量的工作;Gemini 3.5 Flash-Lite 面向文档处理和智能体搜索等日常任务;Gemini 3.5 Flash Cyber 用于发现并修补关键软件漏洞。
Google 发布 Gemini 3.6 Flash 和 3.5 Flash-Lite。3.6 Flash 修复了关键问题并提升 token 效率,价格低于 3.5 Flash;3.5 Flash-Lite 相比 3.1 FL 大幅提升,定位超低成本、高吞吐任务。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,主打规模构建 AI 智能体的效率、延迟与可靠性。
OpenAI 公开发布 GPT-5.6(含 Sol 与 Luna),并将桌面端 agentic 编程产品更名为 ChatGPT Work。SpaceX AI 推出低成本、Opus 级编程模型 Grok 4.5,Meta 发布 Muse Spark 1.1 并预览 Muse Video、上线 Muse Image。
Anthropic 在与美国政府沟通后重新上线 Claude Mythos 和 Fable 模型,并发布 Claude Sonnet 5,主打更低价格运行智能体、提升 agentic coding 与基准表现。Google 推出 NotebookLM 竖屏短视频摘要与更快的图像生成器 Nano Banana 2 Lite,中国开源 LongCat-2.0 MoE 模型同期发布。
Anthropic 发布 Claude Opus 4.8,基准分数提升,并推出面向长时间多智能体任务的 Dynamic Workflows;微软发布基于 OpenClaw 的常驻助手 Microsoft Scout 及 MAI Thinking 1 等自研 MAI 模型。
腾讯混元发布 Hunyuan Research Agent 的首个版本 Hyra-1.0,面向性能驱动的研究与工程任务,通过递归方式改进解决方案。官方展示了 AI4AI、AI4Science 和 AI4Fu 方向的 demo,并给出 hy.tencent.com/research/hyra 链接。
微软研究院推出 Aurora 1.5,将开放预测能力进一步扩展,同时发布 Flint 重定义可视化、FlowDAgger 加速自适应。此外,AI 智能体攻破了 Rowhammer 防御,内存技术正在重塑对话式 AI。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含面向实时交互的 Flash 版和面向高质量生成的 Plus 版,Flash 首包延迟约 300ms。
字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声,端到端生成完整声音场景,已在火山方舟体验中心上线。该模型支持一条 prompt 统一编排对白、音效与环境声并做时间控制,当前时间控制精度为 100ms,单次可生成约 2 分钟音频并支持延展,保持角色音色一致,覆盖 20+ 语种。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调的轻量网络安全模型,专门用于快速查找、验证并修复漏洞。
通义实验室发布面向实时双工交互的端到端全模态理解与生成模型 Wan-Streamer v0.2,把听、看、说、演统一进单个 Transformer,端到端响应延迟为 550ms(200ms 模型延迟加 350ms 网络延迟)。
Moonshot 发布 Kimi K3,称其为开放前沿智能,具备 2.8 万亿参数、100 万 token 上下文和原生多模态能力。
Kimi K3 给出参数、上下文与推理加速数据,并公布权重开放时间,可据此判断长上下文智能体编码的进展。
Thinking Machines 发布多模态模型 Inkling,可跨文本、图像和音频模态高效推理,全量权重已开放,并可在 Tinker 上微调。林俊旸(@JustinLin610)对此表示称赞,同时追问小模型为何没有开源。
Thinking Machines 推出开放权重模型 Inkling,定位为在广泛能力类别上表现扎实的基础模型,可用于实际使用与定制。Inkling 能跨文本、图像和音频模态高效推理,官方公开完整权重,并已在 Tinker 上开放微调,同时提供 Inkling Playground 供试用。
Hugging Face 宣布发布新的开放权重模型,未披露具体模型名称、参数规模与性能数据。
腾讯混元发布旗舰级 295B 模型 Hy3 的 1-bit 与 4-bit 版本,可在单 GPU 上部署。该模型支持通过 llama.cpp 运行并开启 MTP,在更低硬件门槛下获得强大智能,相关 benchmark 与下载链接已放出。
腾讯混元 Hy3 被开发者 Jen Zhu 实测称为"小但强"的模型,仅用 3 条提示词就通过 Hermes X Hy3 智能体生成了一个交互应用。该模型是 OpenRouter 上使用量最高的模型,累计消耗 6 trn tokens。
阿里通义实验室将语音交互模型 Fun-Realtime-AudioChat 全面升级并更名为 Qwen-Audio-3.0-Realtime,主打高表现力与共情对话、音色克隆、声纹级背景过滤的双工交互,以及动态工具调用能力。
阶跃星辰发布面向手机、汽车等终端场景的端侧模型全家桶 Step Edge,包含 Step Edge 基础模型、Audio、GUI、Gen 四款模型。官方称其支持低至 0.1 秒的端侧本地 toolcall 执行,文本、视觉、语音等多模态信息可本地处理,并配套自研 Step Inference NPU 引擎用于推理优化。
Aurora 1.5 为 Aurora 基础模型新增 22 个变量、逐小时时间分辨率与概率集合预报,面向真实场景的天气、气候和能源应用。该版本由 Microsoft Research 发布。
爆料者 leo 称 GPT-5.6 将是 5.x 系列最后一个模型,OpenAI 决定直接推 GPT-6,并在一个月内(甚至 7 月底)发布。
Meta Superintelligence Labs 发布 Muse Spark 1.1,这是 Muse Spark 的升级版多模态推理模型,主打智能体任务,在工具使用、计算机操作、编码和多模态理解上有明显提升。
Meta 发布 Muse Spark 1.1 并开放 Meta Model API 公测,读者可了解其百万 token 上下文与多智能体编排能力。
SpaceXAI 发布 Grok 4.5,在 GDPval-AA v2 上以 1543 Elo 排名第四,仅次于 Anthropic 最新的 Claude 系列,针对真实场景的智能体知识工作任务。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称其为迄今最强大的模型,也是首个不止面向软件工程打造的模型。有用户表示,在单智能体迭代场景下,Grok 4.5 是他个人首次更偏好于 Opus 的模型,速度快,能绕开看似棘手的障碍,直接且易沟通。
Cursor 宣布与 SpaceXAI 合作训练 Grok 4.5,称这是其迄今最强模型,也是首个不止面向软件工程打造的模型。Aman Sanger 表示该模型相比 composer 2.5 有巨大提升,完全从零训练。
Cognition 推出迄今最强模型 SWE-1.7,推理速度达 1000 tok/s,成本远低于最强前沿模型,benchmark 分数与之仅差几分。Scott Wu 表示,该模型在 Devin 中的实际表现"令人惊叹",且随着规模扩大,RL 仍在持续带来收益。
Cognition 发布其迄今最强的模型 SWE-1.7,已在 Devin Desktop 和 Devin CLI 上线。官方称其成绩与最强前沿模型仅差几分,成本仅为后者一小部分,并以 1000 tok/s 的闪电模式提供服务,团队表示在扩展规模时仍持续看到 RL 带来收益。
Mistral 发布首个具身导航模型 Robostral Navigate,这是一个 8B 机器人导航模型,可引导机器人自主执行自然语言指定的任务,仅需单个 RGB 摄像头,并在 R2R-CE 上达到 SOTA。
字节跳动 Seed 发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面提升。四大核心能力包括复杂信息可视化、交互式精准编辑、真实影像与人像质感、原生多语种输入与生成,支持十余种语言的直接输入与渲染。模型已上线火山方舟体验中心,并陆续在豆包、即梦上线。
Coinbase 已把编码任务交给 GLM 和 Kimi,费用砍半;视频还讨论了如何用国产模型"白嫖" Claude Code 全生态。中国能把 TOKEN 成本压到海外的 1/5 并免费开放,豆包一宣布收费就被骂"忘记初心",WorkBuddy 和 Trae 也突然爆火。
Meta Superintelligence Labs 发布其首个媒体生成模型 Muse Image,并预览 Muse Video。Muse Image 以智能体方式运行,调用搜索和编码工具,能自我改进并随测试时算力扩展而提升,已上线 Meta AI 应用、meta.ai、美国 Instagram Stories 及部分国家的 WhatsApp。
Meta Superintelligence Labs 首发的图像生成模型,其智能体式工具调用与推理时算力扩展为图像生成提供了新范式。
Claude Fable 5 在用户的留存分析中未经提示便自动使用了倾向得分匹配,将用户按活跃度对齐后再做同类比较。用户称 Fable 5 在各类任务中的判断力均有提升,包括在 Cowork 中撰写邮件和文档、在 Claude Code 中调试复杂错误。
Anthropic 于北京时间 7 月 2 日凌晨在 X 上解禁 Fable 5 模型,播客主播称其智商与任务完成质量有明显提升,适合讨论和写 Spec。但该模型对订阅用户仅开放套餐额度的 50%,消耗比 Opus 4.8 快,且只能用到 7 月 7 日。
Claude 的 Fable 5 宣布回归。该消息由 Alex Albert 发布,正文仅提到「Fable 5 is back」并附有一段视频,未披露具体版本、参数或可用性信息。
Google DeepMind 的 Nano Banana 2 Lite 已在 Replicate 平台上线,可通过 replicate.com/google/nano-ba 试用。该推文仅给出名称和试用入口,未披露具体能力或参数细节。
Claude Sonnet 5 现已在 Devin Desktop 和 Devin CLI 上线。该模型在提供前沿级编程性能的同时价格更实惠,并在 FrontierCode Extended 上超过 Opus 4.8。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
官方给出两款新模型的价格、延迟与定位差异,读者可据此判断图像到视频链式工作流的成本与适用边界。