DeepSeek 发布 V4-Flash 模型
DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。
为什么值得看
官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
DeepSeek 发布 DeepSeek-V4-Flash,官方称其推理能力接近 V4-Pro,在简单 Agent 任务上与 V4-Pro 表现相当。该模型参数规模更小、响应更快,并提供高性价比的 API 定价。
官方给出轻量版本与旗舰版本的推理对比和定价定位,读者可据此判断成本与能力的取舍。
DeepSeek 上线并同步开源 DeepSeek-V4 预览版,包含 DeepSeek-V4-Pro 与 DeepSeek-V4-Flash 两个版本,1M 上下文成为其所有官方服务标配。
官方给出 V4 双版本的开源链接、API 与 1M 上下文配置,便于判断长上下文与 Agent 能力的实际边界。
月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。
K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。
Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。
作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。
DeepSeek 发布两个正式版模型 DeepSeek-V3.2 和 DeepSeek-V3.2-Speciale,网页端、App 与 API 均已升级为正式版 V3.2,Speciale 仅以临时 API 形式开放供评测研究。
官方给出两个版本的定位与评测差异,读者可据此判断日常使用与高难度任务该选哪一个。
OpenAI 发布一段 GPT-5 工作场景演示,展示该模型分析用户反馈、制定产品计划并制作原型,以及总结后续步骤。演示面向办公与业务流程,具体能力细节以官方视频内容为准。
OpenAI 官方展示 GPT-5 在真实工作流中的多步任务处理,可据此判断其在业务流程中的落地位置。