跳到正文

#DeepSeek

今日 0 条
10月9日周五
  1. 歸藏(guizang.ai)(@op7418)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Haiku 5.5 对比 DeepSeek-V4.1 flash、GLM 5.3 flash:价格更低,Terminal Bench 4.0 评分持平或更高

    Anthropic 的 Haiku 5.5 价格低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash。在 Terminal Bench 4.0 上,其 AA 测试评分比 GLM 5.3 flash 高一分,与另一竞品持平,且高于其余两个中国竞品。该对比由歸藏整理发布。

10月8日周四
  1. 歸藏的AI工具箱AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 对比中国模型:价格更低,Max 和 Team 用户获赠 API 额度

    Anthropic 的 Haiku 5.5 定价低于 DeepSeek-V4.1 flash 和智谱 GLM 5.3 flash,在 Terminal Bench 4.0 上比 GLM 5.3 flash 高一分,与其他两个中国竞品相当或更高。Anthropic 还向每个 Max 和 Team 用户赠送对应额度的 API 金额,该 API 可在任何支持输入 API 的产品中使用。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 压缩智能体记忆:每 token 缓存 890 字节,比 DeepSeek-V1 小 437 倍

    DeepSeek 针对智能体"读多写少"的特点压缩了其记忆机制,每 token 仅占 890 字节缓存,比 DeepSeek-V1 小 437 倍。输入从 4K 扩展到 1M 时,每输出 token 的算力增加 25%。Flash 在 AA Index 上以 39 比 36 超过 V4-Pro,价格为每百万 token 0.27 美元对 0.67 美元。

10月5日周一
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 上线 DeepSeek V4.1 Flash 训练支持

    Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。

9月23日周三
  1. 夕小瑶科技说AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测小米 MiMo-V2.6:Pro 版 AA 智能指数 46 分,跑一道题 0.13 美元

    小米正式推出 MiMo-V2.6-Flash、MiMo-V2.6-Pro 及 Pro 的 UltraSpeed 版本;Pro 在 Artificial Analysis 智能指数拿 46 分,超过 Kimi K3 和 Qwen3.8 Max。

    为什么值得看

    作者用编程、设计、视频三类实测展示 MiMo-V2.6 的实际交付能力,并给出与同级模型的价格对比。

  2. 有机大橘子AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT 6 Sol 和 Luna 降价 50%,Opus 5.5 降价 40%

    OpenAI 今天更新 GPT 6 全系列,Sol 和 Luna 价格下降 50%,Terra 消失;Sol 和 Luna 沿用与 Astra 类似的训练方法,语言风格更清晰简洁,缓存机制也有改进、命中率更高。

9月22日周二
  1. 机器之心SOTA模型AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源 MiMo-V2.6 Pro/Flash,xAI 发布 Grok 4.7,APUS 开源决策模型 OpenJev-v1

    小米发布原生全模态模型 MiMo-V2.6 Pro 与 Flash 并开放 MIT 许可权重,API 沿用 V2.5 定价;Pro 与 Flash 在长程软件工程评测 DeepSWE v1.1 中分别达到 72.6 和 65.7,较本轮训练前提升约 14 分和 17 分。

  2. 数字生命卡兹克AI 评估 · 81/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米发布 MiMo V2.6 系列模型并全面开源

    小米发布 MiMo-V2.6 系列,含 Pro、Flash 和 20 倍速的 Pro-UltraSpeed 三个版本,AA 指数 46 分与同日发布的 Grok 4.7 打平,位列开源模型第一。

    为什么值得看

    作者以实测视角对比 Grok 4.7 与 MiMo V2.6 的性能、价格和速度,呈现国产开源模型的实际能力边界。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小米开源多模态模型 MiMo-V2.6-Pro,称智能水平接近 GPT-5.6-Sol Max

    小米发布开源模型 MiMo-V2.6-Pro,支持文本、图像、音频、视频多模态输入,权重已上传 Hugging Face。Artificial Analysis 称其以智能指数 46 成为开源权重模型榜首,较前代 MiMo-V2.5-Pro 的 26 大幅提升,每任务成本 0.13 美元,位于智能与单任务成本帕累托前沿。

    为什么值得看

    小米开源新模型以远低于同级的 token 价格进入智能成本帕累托前沿,可据价格与榜单位置观察开源与闭源的成本差距。

  4. Browser Use(@browser_use)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.7 发布,Long Horizon Browser Use Benchmark v2 得分 39.9 仍落后 DeepSeek

    Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。

9月20日周日
  1. Browser Use(@browser_use)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.3 FlashX 表现提升但价格明显上涨,DeepSeek v4.1 Flash 更胜一筹

    GLM 5.3 FlashX 表现已相当出色,但价格明显更贵,同时被 DeepSeek v4.1 Flash 比下去。该帖获 340 点赞、30059 次浏览。

9月11日周五
  1. ollama(@ollama)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 在 Ollama 云全面上线

    DeepSeek-V4.1-Flash 已在 Ollama 云全面上线,托管于美国与欧洲,承诺 prompts 和 responses 不记录、不用于训练。按 token 计费与 DeepSeek API 一致并含 off-peak 定价,可通过 Ollama 的 Pro、Max、Team 套餐或免费账号按量付费使用。

  2. ollama(@ollama)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4.1-Flash 在 Ollama 云端面向 Pro 订阅用户推送

    Ollama 宣布 DeepSeek-V4.1-Flash 正在 Ollama 云端推送,先面向 Max 和 Team 账号开放,随后扩展到 Pro 订阅用户。官方表示正在快速增加容量,以便向所有订阅用户推送。

9月10日周四
  1. Browser Use(@browser_use)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1 Flash 在浏览器任务上成本比 Sol 和 Opus 低 50 倍

    Browser Use 引用 Gregor Zunic 的评测称,DeepSeek V4.1 Flash 在 60 个高难度浏览器操作任务上处于帕累托前沿,性能接近 Sol 和 Opus 的同时,记录到的智能体成本低 50 倍。该评测还表示,跑完整个数据集的成本低于运行 Sol 的单个任务。

  2. DeepSeek(@deepseek_ai)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 宣布与开源社区合作推进 V4.1-Flash 推理支持

    DeepSeek 表示将与开源社区密切合作,推进 V4.1-Flash 的推理支持,并探索更多部署选项,同时提到可为需要 2000 块 GPU 加存储集群的大规模部署提供对接。推文附带了指向 huggingface.co 上 DeepSeek 模型和论文的链接。

  3. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 发布新定价,API 价格下调并保留峰谷差价

    DeepSeek 宣布 V4.1-Flash 采用更高效的架构,降低 API 价格,将节省的成本让给用户。新定价于 2026 年 9 月 10 日 04:00 UTC 生效,峰谷定价继续用于平衡需求,非高峰时段费率为高峰时段的 50%,弹性任务可安排在非高峰时段以节省成本。

  4. DeepSeek(@deepseek_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 上线 API,原生支持多模态

    DeepSeek 在 API 上线 V4.1-Flash,原生支持多模态,模型名设为 deepseek-flash。

  5. DeepSeek(@deepseek_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4.1-Flash 将 KV cache 的 HBM 需求降至上一代的 1/4

    DeepSeek V4.1-Flash 相比上一代大幅压缩 KV cache,所需 HBM 仅为 1/4、SSD 存储仅为 1/8。缓存命中费用常占 AI 智能体成本的很大一部分,压缩缓存可显著降低这部分开销。

  6. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 552B 参数 MoE 非对称架构模型

    DeepSeek 发布新模型,采用 552B 参数的 MoE 非对称架构。其新 Causal Encoder–Decoder 架构在输入端仅激活 8B 参数、输出端激活 16B 参数。官方称新预训练方法配合更大规模 RL 后训练,基准测试结果超过包括 DeepSeek-V4-Pro 在内的旗舰模型。

  7. DeepSeek(@deepseek_ai)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4.1-Flash 模型

    DeepSeek 发布 DeepSeek-V4.1-Flash,称其更智能、更快、更高效,是新架构家族中体量最小的模型,并具备原生视觉理解能力。该模型面向更强能力、更快推理、更高吞吐设计,可扩展至更大模型。

  8. DeepSeekAI 评估 · 89/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 V4.1 Flash:原生多模态、552B MoE,模型开源并调整 API 定价

    DeepSeek 正式发布 DeepSeek V4.1 Flash,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用 Causal-Encoder-Decoder 非对称结构,输入激活 8B、输出激活 16B,官方称其在基准测试中超越了包括 DeepSeek V4 Pro 在内的旗舰模型。

    为什么值得看

    官方给出新模型的参数结构、KV Cache 压缩与定价变化,可据此判断 Agent 类任务的成本走向。

9月9日周三
  1. DeeplearningAIAI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Z.ai 发布 GLM-5.3-Flash,Ox Alpha 谜底揭晓并开放权重下载

    Z.ai 正式发布视觉语言模型 GLM-5.3-Flash,即此前在 OpenRouter 上匿名预览的 Ox Alpha,并公开了权重。该模型采用 MoE Transformer 结合线性注意力与稀疏注意力,总参数 3200 亿、每 token 激活 180 亿,支持文本、图像和视频输入,最多 1,048,576 个 token,输出上限 128,000 个 token。

    为什么值得看

    智谱开源 GLM-5.3-Flash 的架构与成本数据,可用于判断低价视觉语言模型的性价比取舍。

9月3日周四
  1. DeeplearningAIAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro-0813 正式发布,同步开源 agent harness

    DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4 Pro 0813 发布,并开源评测框架 DeepSeek Harness

    DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。

8月27日周四
  1. AI产品黄叔AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    匿名模型 ox-alpha 确认为 GLM-5.3-Flash,作者实测两个任务

    智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  2. 智谱AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线并开源 GLM-5.3-Flash,定价为 GLM-5.3 的 1/10

    智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。

    为什么值得看

    智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

8月21日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4-Flash-Vision-Exp 展示多模态智能体能力

    DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。

  2. DeepSeek(@deepseek_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线 API 平台

    DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,调用名称为 model='deepseek-v4-flash-vision-exp'。

8月14日周五
  1. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

8月13日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 随 V4 系列更新 API 价格并推出峰谷计费

    DeepSeek 宣布随 V4 系列发布更新 API 价格,并引入高峰与低谷两档费率,低谷价格比高峰低 50%。新价格于 2026 年 8 月 16 日 16:00 UTC 生效,官方称峰谷机制便于更灵活地调度工作负载。

  2. DeepSeek(@deepseek_ai)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro

    DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。

  3. DeepSeekAI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro 正式版上线并调整 API 定价

    DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。

    为什么值得看

    官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。

  4. Paul Couvert(@itsPaulAi)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    美国封禁 Fable 5,DeepSeek V4 Pro 正式发布并可下载

    美国以"过于危险"为由下架 Fable 5,同期 DeepSeek V4 Pro 正式发布,性能同样强劲且开放下载。原文称其可像 PDF 文件一样下载,但未透露参数规模、benchmark 分数或具体开放形式。

7月31日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-0731 升级上线,架构与规模与预览版一致

    DeepSeek 发布 DeepSeek-V4-Flash-0731,其模型架构和规模与预览版完全相同。本次升级仅适用于 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 以及 App 和 Web 端模型暂未变动。官方称 DeepSeek-V4-Pro 的正式发布即将到来。

  2. DeepSeek(@deepseek_ai)AI 评估 · 76/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash 官方 API 开启公测,升级 Agent 能力并适配 Codex

    DeepSeek 宣布 DeepSeek-V4-Flash 官方 API 进入公开测试,称其 Agent 能力大幅升级,基准分数已远超 V4-Pro-Preview。官方 V4-Flash 原生支持 Responses API 格式,并已完成与 Codex 的适配,配置细节见官方 API 文档 api-docs.deepseek.com。

    为什么值得看

    DeepSeek 官方公布 V4-Flash 公测 API 的 Agent 能力升级与 Codex 适配,可据此判断接入成本。

7月30日周四
  1. v0(@v0)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 在私密网络安全基准上性价比领先,GPT 5.6 精度最高但成本高 7 倍

    Malte Ubl 在私密网络安全基准上测试 Kimi K3,认为它是网络安全任务的性价比之选,召回率、精度与价格平衡最好,GPT 5.6 召回率与精度最高但单次运行成本高出 7 倍多。

7月20日周一
  1. Interconnects AI — Nathan LambertAI 评估 · 83/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kimi K3 发布:开放权重的升级与生态新格局

    Moonshot AI 于 7 月 16 日发布旗舰模型 Kimi K3,这是一个 2.8T 参数的 MoE 模型,权重将于 7 月 27 日发布。在 Vals AI 指数上排名第 2,在 Artificial Analysis 智能指数上排名第 3,仅次于 Claude Fable 和 GPT-5.6 Sol Max,同时价格更低,并在前端代码竞技场排名第 1。

    为什么值得看

    从 K3 发布切入,梳理开放权重与闭源前沿差距收窄后的经济与政策连锁影响。

6月25日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 与 Kimi K2.7 在 FrontierCode Extended 上分别得分 43.0% 和 39.5%

    GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。