Anthropic Haiku 5.5 对比 DeepSeek-V4.1 flash、GLM 5.3 flash:价格更低,Terminal Bench 4.0 评分持平或更高
Anthropic 的 Haiku 5.5 价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash。在 Terminal Bench 4.0 上,其 AA 测试评分比 GLM 5.3 flash 高一分,与另一竞品持平,且高于其余两个中国竞品。该对比由歸藏整理发布。
Anthropic 的 Haiku 5.5 价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash。在 Terminal Bench 4.0 上,其 AA 测试评分比 GLM 5.3 flash 高一分,与另一竞品持平,且高于其余两个中国竞品。该对比由歸藏整理发布。
Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。
DeepSeek 针对智能体"读多写少"的特点压缩了其记忆机制,每 token 仅占 890 字节缓存,比 DeepSeek-V1 小 437 倍。输入从 4K 扩展到 1M 时,每输出 token 的算力增加 25%。Flash 在 AA Index 上以 39 比 36 超过 V4-Pro,价格为每百万 token 0.27 美元对 0.67 美元。
Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。
小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。
作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。
OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。
小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。
小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。
作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。
小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。
小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。
Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。
GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。
DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。
Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。
Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。
DeepSeek 表示将与开源社区密切合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时提到可为需要 2000 块 GPU 加存储集群的大规模部署提供对接。推文附带了指向 huggingface.co 上 DeepSeek 模型和论文的链接。
DeepSeek 宣布 V4.1-Flash 采用更高效的架构,降低 API 价格,将节省的成本让给用户。新定价于 2026 年 9 月 10 日 04:00 UTC 生效,峰谷定价继续用于平衡需求,非高峰时段费率为高峰时段的 50%,弹性任务可安排在非高峰时段以节省成本。
DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。
DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。
DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。
DeepSeek 发布 DeepSeek-V4.1-Flash,称其更智能、更快、更高效,是新架构家族中体量最小的模型,并具备原生视觉理解能力。该模型面向更强能力、更快推理、更高吞吐设计,可扩展至更大模型。
DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。
官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。
Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。
智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。
智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。
匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。
作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。
智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。
智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。
阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。
这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。
DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。
DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,调用名称为 model='deepseek-v4-flash-vision-exp'。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
DeepSeek 宣布随 V4 系列发布更新 API 价格,并引入高峰与低谷两档费率,低谷价格比高峰低 50%。新价格于 2026 年 8 月 16 日 16:00 UTC 生效,官方称峰谷机制便于更灵活地调度工作负载。
DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。
DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。
官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。
美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。
DeepSeek 发布 DeepSeek-V4-Flash-0731,其模型架构和规模与预览版完全相同。本次升级仅适用于 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 以及 App 和 Web 端模型暂未变动。官方称 DeepSeek-V4-Pro 的正式发布即将到来。
DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 进入公开测试,称其 Agent 能力大幅升级,基准分数已远超 V4-Pro-Preview。官方 V4-Flash 原生支持 Responses API 格式,并已完成与 Codex 的适配,配置细节见官方 API 文档 api-docs.deepseek.com。
DeepSeek 官方公布 V4-Flash 公测 API 的 Agent 能力升级与 Codex 适配,可据此判断接入成本。
Malte Ubl 在私密网络安全基准上测试 Kimi K3,认为它是网络安全任务的性价比之选,召回率、精度与价格平衡最好,GPT 5.6 召回率与精度最高但单次运行成本高出 7 倍多。
Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。
从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。
GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。