跳到正文

#DeepSeek

今日 8 条
9月8日周二
  1. Interconnects AI — Nathan LambertAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    最新开放模型盘点:#24:Motif-3、GLM-5.3、Hy4-preview 与开源模型许可证

    智谱 GLM-5.3 从 MIT 转为自定义许可证,规定若被许可方或其关联方运营模型即服务业务且连续 12 个月总收入超过 100 亿美元,须先通过 Z.AI 安全审查;该许可未定义"关联方",增加了采用不确定性。

  2. 腾讯技术工程AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我用腾讯 Kuikly 把 DeepSeek Harness 装进了手机:一码三端 DSH Mobile

    腾讯程序员用 Kuikly 框架开发了 DSH Mobile,一套 Kotlin 代码覆盖 Android、iOS 和鸿蒙,按 DSH 官方 Host 协议连接电脑上的 DeepSeek Harness。

9月7日周一
  1. 深网腾讯新闻AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    华为 Mate XT2 非凡大师发布:首发麒麟9050 Pro,19999 元起

    华为9月7日发布新一代三折叠手机 Mate XT2 非凡大师,首发麒麟9050 Pro 芯片,整机性能较 Mate XTs 提升42%,起售价19999元,比上一代涨2000元。该机改用U型双内折方案并首次加入独立外屏,出厂搭载 HarmonyOS 7 正式版,集成盘古大模型端侧AI能力。余承东透露华为三折叠手机全球发货量已超100万台。

  2. 卫诗婕|商业漫谈Jane's talkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    脉脉 CEO 林凡聊全球 AI 人才动向与大模型季报:明年科技公司只招 AI 人才?

    脉脉创始人兼 CEO 林凡走访 OpenAI、Anthropic、Google、Meta 后判断,AI 岗位需求已连续两年同比 10 倍增长,非 AI 岗位普遍缩招。他提出 AI 人才分基座技术、应用开发、业务效能三类,核心门槛是让 agent 自主运行超过 1 小时。企业内部 AI 落地需开放文档库、代码库等数据,OpenAI 用 9 个月完成全员 AI 覆盖。

  3. 语言即世界language is worldAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曾鸣谈AI产业史观:11个非共识判断,OpenAI、Anthropic大概率不是原生应用阶段的大赢家

    曾鸣提出AI产业化分三阶段,2026年是基础设施阶段基本完成的标志,围绕token形成共识,并已进入以Agent为新应用的智能体阶段。他认为Anthropic、OpenAI大概率不是原生应用阶段的大玩家,下一个最大机会是类似浏览器、统一Agent标准的平台。他还判断旧平台难演变成新平台,公司终将消亡,AI时代人与人的差异在于创造力。

9月6日周日
  1. ollama(@ollama)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 推出 DeepSeek-V4 错峰 token 半价

    Ollama 宣布推出错峰时段 token 费率,DeepSeek-V4-Flash 和 Pro 在工作日 UTC 12:00 至 18:00(太平洋时间 5am-11am)之外以及整个周末均按半价计费,错峰定价后续将覆盖更多模型。Ollama 云端上的 DeepSeek 模型托管在美国和欧洲,提供 ZDR 与快速性能。

9月4日周五
  1. DeeplearningAIAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小红书团队提出 Self-GC,用 LLM 自主管理智能体上下文

    小红书(RedNote)的 Xubin Hao 及同事提出自主管理上下文方法 Self-GC,在把上下文发给关联 LLM 之前,由一个大语言模型决定哪些部分保留、删减或丢弃。

9月3日周四
  1. 百度Geek说AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    都在开源 Harness,Codex 和 DeepSeek 到底有什么不一样?

    2026年8月,DeepSeek 开源 DeepSeek Harness 后两天冲上 9 万多 GitHub Star,OpenAI 随后开源 Codex 的 Harness 层,包括 CLI、app-server 和官方 SDK。

  2. DeeplearningAIAI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro-0813 正式发布,同步开源 agent harness

    DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。

  3. AI产品黄叔(@PMbackttfuture)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Grok Bot 额度一晚掉 52%,改用智谱 GLM-5.3-Flash 承接分身任务

    因重度使用 Grok Bot,即使额度刚被重置,一晚用量仍掉了 52%。作者此前已在某个 Bot 中接入 DeepSeek API 与智谱 Coding Plan,于是让分身把各 Bot 的大部分工作切换到智谱 Coding Plan 中的 GLM-5.3-Flash,切换成功。

  4. 枫言枫语AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vol. 173 苹果换帅,Claude 5.1 发布,GLM 低价偷家,英伟达要买 Hugging Face 等

    苹果 CEO Tim Cook 卸任,John Ternus 于 9 月 1 日正式接任;Anthropic 发布 Claude 5.1,GLM-5.3-Flash 以极高性价比推出。NVIDIA 计划以 129 亿美元收购 Hugging Face,OpenAI 公测 Ultrafast 模式并宣称提升 14 倍,还联合 Broadcom 研发 LLM 推理加速芯片。

  5. DeepLearning.AI(@DeepLearningAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4 Pro 0813 发布,并开源评测框架 DeepSeek Harness

    DeepSeek V4 Pro 0813 发布,同时受到关注的还有 DeepSeek 开源的评测框架 DeepSeek Harness。该框架会记录每一次工具调用、系统提示词和子智能体调度,开发者可以据此复现模型性能,而不必依赖封闭的测试环境。开发者还可以研究、fork 或重新制作自己的评测框架。

9月2日周三
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Grok BOT 分身自动转发任务、指挥其他 BOT 并私聊汇报结果

    AI产品黄叔构建了一个 Grok BOT 分身并拉进其他群,可自动把任务转发到所在群、指挥其他 BOT 完成任务,最后在私聊窗口汇报结果。他还提到 Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘专享资源与 Grok 额度,并能自行调用 DeepSeek API。

9月1日周二
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok Bot 实测:8核/16G/126G 专享配置可分担本机任务,支持调用 DeepSeek API

    Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘的专享配置和 Grok 额度,还可自行调用 DeepSeek API,无需理解服务器即可上手,被认为能分担不少本机任务。作者用 Zcode + GLM 5.3 Flash 整合《Grok Bot 橙皮书》与 awesome-grok-bot,做了网站 grokbot.aihuangshu.com 方便阅读理解。

8月31日周一
  1. 百度Geek说AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 源码解读:PTC 与创造模式如何重新设计 Agent 运行时

    作者基于 dsh 0.1.1-rc.2 的源码阅读与试用,分析了 DeepSeek Harness 的两个特殊模式:PTC 模式让模型写一段程序组合已有工具,把原本五次的模型往返压成一次;创造模式允许模型在运行中提交插件、动态注册和撤销工具。

8月29日周六
  1. AI炼金术AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OPC 已凉、FDE 会消亡?AI 炼金术聊 Codex 上门装机与 DeepSeek 新 harness

    徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。

8月28日周五
  1. HelloGitHubAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HelloGitHub 第 125 期:airllm 4GB 显存跑 70B 大模型、DeepSeek 开源智能体框架

    HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。

8月27日周四
  1. AI产品黄叔AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    匿名模型 ox-alpha 确认为 GLM-5.3-Flash,作者实测两个任务

    智谱认领了在 OpenRouter 和 OpenCode 双榜登顶的匿名模型 ox-alpha,其真实身份为 GLM-5.3-Flash,官方称同样智力只需1/40价格并支持原生多模态。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  2. 智谱AI 评估 · 82/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱上线并开源 GLM-5.3-Flash,定价为 GLM-5.3 的 1/10

    智谱上线并开源 GLM-5.3-Flash(320B-A18B),为 GLM-5 系列首个原生多模态模型,在 Artificial Analysis Intelligence Index 中取得 57 分,与 Claude Opus 4.8 持平。

    为什么值得看

    智谱开源 GLM-5.3-Flash,公开了参数规模、定价倍差与国产芯片推理的工程细节,可对比同级别前沿模型的成本路线。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

8月25日周二
  1. Milvus(@milvusio)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 开源 DeepSeek Harness 插件,DSH 智能体可直连 Milvus 查询

    Milvus 开源了 DeepSeek Harness(DSH)插件,DSH 已获 192K+ GitHub stars。安装插件并连接 Milvus 或 Zilliz Cloud 后,DSH 智能体可列出 collection、查看 schema,并执行标量查询、语义搜索、BM25 搜索和混合搜索。

  2. Milvus(@milvusio)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 将 MemSearch 接入 DeepSeek Harness,为其补上持久记忆与 Skill 生成路径

    Milvus 宣布将 MemSearch 接入 DeepSeek Harness(DSH),为其提供持久记忆和把重复经验转化为可复用 Skill 的路径。MemSearch 保存三类记忆:跨会话发生过什么、项目与用户仍成立的事实、以及重复频率高到足以成为 Skill 的工作流。

8月22日周六
  1. SemiAnalysisAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:开源模型正在追上闭源前沿吗?

    SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。

8月21日周五
  1. DeepSeek(@deepseek_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Files API 上线:免费使用,图片上传一次即可用 file_id 复用

    DeepSeek 上线 Files API,免费使用。图片上传一次后可通过 file_id 引用,节省请求带宽,并可在多次请求间复用同一张图片而无需重复上传。

  2. DeepSeek(@deepseek_ai)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 上线多模态 API,支持图像输入与三种传图方式

    DeepSeek 官方宣布多模态 API 支持,调用时设置 model='deepseek-v4-flash-vision-exp'。图像按 token 计费,每张最多 384 token,采用 V4-Flash 定价;支持 Chat Completions、Messages 与 Responses 接口,可混合输入文本与图像,图像可通过 base64、外部 URL 或 Files API 提供。

  3. DeepSeek(@deepseek_ai)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek V4-Flash-Vision-Exp 展示多模态智能体能力

    DeepSeek 发布 V4-Flash-Vision-Exp,这是一款可在多种智能体框架中顺畅运行的多模态实验模型,将视觉理解与各类工具结合,以解锁更多实用工作流。该模型定位为通过多模态扩展智能体用例。

  4. DeepSeek(@deepseek_ai)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线 API 平台

    DeepSeek 在 API 平台上线实验性多模态模型 DeepSeek-V4-Flash-Vision-Exp,调用名称为 model='deepseek-v4-flash-vision-exp'。

  5. DeepSeekAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Flash-Vision-Exp 上线多模态 API

    DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,用户可通过设置 model='deepseek-v4-flash-vision-exp' 调用。

8月20日周四
  1. 人民公园说AIAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness:Agent 工厂来了,但你的企业配用吗?

    DeepSeek Harness 被比作"造车工厂"而非 Codex 那样的"整车厂",主打可插拔的 Agent 生产架构。节目讨论其插件机制 Cordis 能否真正做到插拔自由,并质疑多数企业尚不具备 AI 原生工作流的落地条件,认为架构先进不等于能落地。

  2. 海外独角兽AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 发布:一套可热重载、可由 coding agent 自行修改的 Agent Harness

    DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。

    为什么值得看

    梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。

8月18日周二
  1. 歸藏的AI工具箱AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源 DeepSeek Harness 客户端 Pilot Harness,配桌面外壳与易用插件

    开发者歸藏开源了 Pilot Harness,一个为 DeepSeek Harness 打造的桌面客户端及配套插件,支持 macOS、Windows 和 Linux,提供 DMG、ZIP、AppImage、DEB、RPM 等安装包。

  2. ollama(@ollama)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama 上 DeepSeek V4 Flash 平均性能最佳,本地可选 qwen3.8

    Ollama 官方称 DeepSeek V4 Flash 在其平台上平均性能最佳,本地部署则可选用优化过的 qwen3.8:Apple Silicon 运行 ollama run qwen3.8:27b-mlx,NVIDIA 运行 ollama run qwen3.8:27b。

8月17日周一
  1. 晚点聊 LateTalkAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    晚点聊 179 期:蒸馏风暴——一场无人公开谈论的技术竞赛

    《晚点聊》第 179 期与《晚点 LatePost》主笔高洪浩讨论蒸馏,这一技术从早期的模型压缩演变为让模型变强的手段,并在 2026 年出圈。节目提到字节讨论训练超 5 万亿参数模型,张一鸣判断不蒸馏、也不被 Coding 这类短期热点影响,认为蒸馏最多只能逼近、很难真正超越。讨论还涉及智能体轨迹蒸馏、大规模蒸馏的数据管线与 know-how、蒸馏行为能否被隐藏,以及学生模型能否超越教师模型。

8月16日周日
  1. 42章经AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|42章经

    前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。

8月14日周五
  1. 智谱AI 评估 · 85/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱发布 GLM-5.3,编程能力提升并在网络安全任务中涌现新能力

    智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。

    为什么值得看

    官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。

8月13日周四
  1. DeepSeek(@deepseek_ai)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 Harness v0.1 开发者预览版并开源

    DeepSeek 发布 DeepSeek Harness v0.1 开发者预览版,面向全球构建 agent harness 的开发者开放,并以 MIT 许可证开源代码库。该工具基于 Cordis 元框架,核心思路是“一切皆插件”,模型、工具、技能、会话、沙箱、文件系统、循环、编排和 UI 均以插件实现,可混搭、替换和扩展。代码库地址为 github.com/deepseek-ai/de…。

    为什么值得看

    官方给出插件化 agent harness 的开放入口与 MIT 许可,可据此判断现有智能体工作流的可替换程度。

  2. DeepSeek(@deepseek_ai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 随 V4 系列更新 API 价格并推出峰谷计费

    DeepSeek 宣布随 V4 系列发布更新 API 价格,并引入高峰与低谷两档费率,低谷价格比高峰低 50%。新价格于 2026 年 8 月 16 日 16:00 UTC 生效,官方称峰谷机制便于更灵活地调度工作负载。

  3. DeepSeek(@deepseek_ai)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 DeepSeek-V4-Pro

    DeepSeek 发布 DeepSeek-V4-Pro,主要升级 Agent 能力并在生产场景取得明显收益。V4-Pro 与 V4-Flash 支持灵活的推理强度设置,简单任务用 low、日常 Agent 工作流用 high、复杂任务用 max。

  4. DeepSeekAI 评估 · 87/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek-V4-Pro 正式版上线并调整 API 定价

    DeepSeek 发布 V4 Pro 正式版,已同步在 APP、网页端和 API 上线,用户可在 APP 或网页端选择专家模式使用,API 模型名不变。正式版增强了 Agent 能力,公开基准测试集的 Code Agent 任务使用 DeepSeek Harness 极简模式测试(max 档位,topp=0.95,temperature=1.0)。

    为什么值得看

    官方给出 V4 Pro 正式版的 Agent 能力变化、思考强度分档与新定价,可据此判断接入与调用成本。