跳到正文

#DeepSeek

今日 3 条
今天10月10日周六
  1. 刘润AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    进化岛周报:刘润闭关写年度演讲首稿,Codex、Claude、Grok、CodeBuddy 四模型并行搭基建

    刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。

  2. 硅星人ProAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会为何不再是“科技春晚”:AI 大会也还没接住这个位置

    苹果发布会正逐渐失去“科技春晚”的光环:供应链爆料让新品提前曝光,2020 年后转为提前录制,智能手机进入成熟期后创新更多体现为性能与体验优化。与此同时注意力转向 AI 发布会,2024 年 5 月 OpenAI 发布 GPT-4o、DeepSeek R1 发布都引发大范围讨论。

  3. Harrison Chase(@hwchase17)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Open SWE 将模型选择移入 harness,单个任务中位成本下降 64%

    LangChain 的 Open SWE 把模型选择移入 harness,让每个任务交给仍能完成工作的最便宜模型,并按质量测试验证,单个任务中位成本下降 64%。

10月9日周五
  1. 刘小排rAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    韩国七家金融机构被黑事件:攻击者用 ARTEX 和 Claude Code、DeepSeek 等 AI 工具

    9月28日起,新韩银行等七家韩国金融机构遭渗透,6万多人信息外泄,韩国总统下令彻查。研究人员发现疑似攻击服务器运行开源工具 ARTEX(自主渗透测试控制台),主要接入 DeepSeek,其他会话还使用 GLM、Grok 和 Claude Code,服务器目录浏览未关,配置文件、CLAUDE.md 与 AI 聊天记录可被直接读取。

  2. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chris Barber 调查 70 位 AI 从业者:Anthropic 与 OpenAI 位居前沿,Google DeepMind 和 xAI 落后一代

    Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。

10月8日周四
  1. 硅星人ProAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为何越来越不说人话:从 Coding 过拟合到文言文式压缩

    开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。

10月5日周一
  1. 腾讯科技AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源模型烧向硅谷:企业用开放权重模型重构AI成本账

    腾讯科技报道,随着AI支出上升,美国企业正越来越多地转向价格更低的开放权重模型。AlphaSense 数据显示,今年 8 月和 9 月美国企业财报电话会议和投资者会议中提及开放权重或开源模型的次数是去年同期的 6 倍。

10月4日周日
  1. 极客公园AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。

10月3日周六
  1. orange.ai(@oran_ge)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地跑 Qwen Flash 读写速度一周内提升近十倍

    作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。

10月2日周五
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Batch 本周:开源权重模型 GLM-5.3 漏洞利用能力逼近 Claude Mythos,12% vs 14%

    Andrew 在 The Batch 本周通讯中指出,开源权重模型 GLM-5.3 在漏洞利用测试中达到 12%,逼近 Claude Mythos 的 14%。同期内容还包括小米新的开源权重模型、Gemini 3.8 Live、DeepSeek-V4.1-Flash 以及 AREX 智能体中心。

  2. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 测算:2027 年前出货的 AI 芯片能跑多少 AI 智能体?

    Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。

10月1日周四
  1. Geek(@geekbb)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    坏了一根 16G 内存后,我用 Qwen3.8-Max 修了一天 PVE

    三台 PVE 同时挂了两台,作者称用 Qwen3.8-Max 修了一天,感觉其表现强于 Grok-4.7 和 DeepSeek-V4.1-Flash,目前一台已修好,并因此对 Qwen3.8 刮目相看。

  2. Geek(@geekbb)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Qwen3.8-Max 修复 PVE 故障,用户称其比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打

    一位用户三台 PVE 同时挂了两台,用 Qwen3.8-Max 修了一天,称其表现比 Grok-4.7 和 DeepSeek-V4.1-Flash 还能打,目前已修好一台。该用户表示因此对 Qwen3.8 刮目相看。

9月30日周三
  1. orange.ai(@oran_ge)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 报告批评开源模型安全,被指借机推销闭源模型

    在 OpenAI 宣布企业套餐加入 GLM 5.3 等开源模型后,Anthropic 发布报告批评开源模型安全问题。报告称 GLM 5.3 是网络安全能力最强的开源模型、落后美国前沿模型约 4 个月,且是测试中唯一具备漏洞利用能力的模型,但可通过 abliteration 移除拒绝行为,单次成本约 4400 美元。

  2. Z PotentialsAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    外滩大会AI2C论坛全纪实:从入口到交易,AI正在重写消费的每一个环节

    2026外滩大会·AI2C论坛在上海举行,12位创业者与投资人围绕AI如何从消费入口走向交易展开讨论。影眸科技Hyper3D现场演示Rodin 2.5,4秒生成基础3D模型、80秒生成千万级面数高精度资产,并已为劳氏3万多个SKU重建3D资产、将单件建模成本从100美金压到1美金以下。下半场焦点转向Agent代理搜索与支付,FluxA提出支付需感知用户意图、进入Agent执行上下文。

9月28日周一
  1. AI科技评论AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naive AI 发布开源模型 Naive-N0.5-Flash,并披露两项 AI 研发任务

    Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。

  2. dbaplus社群AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图灵奖得主 Stonebraker 谈 LLM、智能体与数据库的未来

    图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。

9月27日周日
  1. 浮之静AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    浅谈 AI 进化史:从 ChatGPT 到 Agent 工作系统

    从 2022 年 11 月 30 日 ChatGPT 上线到 2026 年 9 月,AI 用不到四年从聊天框走向完整任务执行:LangChain、RAG 和 MCP 接上外部世界,Codex、Claude Code、Cursor 转向仓库级编程 Agent,Agent Skills 与 AGENTS.md 沉淀协作经验。

9月26日周六
  1. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    作者称用 DeepSeek Flash 做工程陷入无尽细节,转用 Opus 5.5 重构 ColaMD 2.0 求根治

    ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。

9月25日周五
  1. Guillermo Rauch(@rauchg)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel AI Gateway 数据:OpenAI 支出占比 10%→24%,Anthropic 从 69% 降至 40%

    Vercel AI Gateway 近两个月数据显示,Anthropic 支出占比从 69% 降至 40%,OpenAI 从 10% 升至 24%,并在 token 数量上领先。

9月24日周四
  1. bolt.new(@boltdotnew)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt Forge 开放模型一周数据:GLM 5.3 Flash 占 63%,DeepSeek V4.1 Flash 占 17%

    Bolt Forge 上线开放模型一周后,GLM 5.3 Flash 拿下 63% 的调用占比,DeepSeek V4.1 Flash 为 17%,两款 Flash 模型合计承接 80% 的提示词。更大模型就在选择器里,开发者仍持续选择快速模型,另有 9 美元/月的 bolt.new/lite 方案。

9月19日周六
  1. Suhail(@Suhail)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DSV4.1 中的 Engram 表:压缩与缓存

    DSV4.1 的 Engram 表被评价为"超级酷",其核心思路是一切都靠压缩,之后一切都靠缓存。该帖未披露具体参数量、benchmark 分数或可用性信息。

9月18日周五
  1. 夕小瑶科技说AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    每月花钱养的办公 Agent,最后成了谁的资产?——模型开源不等于 Agent 开源

    SemiAnalysis 披露其公司 AI token 开销已占员工薪酬的 30%,每位员工每月消耗约 50 亿 token。文章指出模型开源与 Agent 开源是两件事,真正承载用户资产的是负责调度模型、连接工具、管理记忆的 Agent Runtime,并以 DeepSeek Harness、网易有道 LobsterAI 为例讨论执行层开源。

9月15日周二
  1. 深网腾讯新闻AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话朱啸虎:基础大模型的故事今年是最后一年,办公Agent是大厂的天下

    金沙江创投朱啸虎在对话中判断,今年可能是基础大模型的最后一年,明年资本市场需要讲新故事,等Anthropic和国内大模型公司上完市,故事就讲得差不多了。他认为办公Agent肯定是大厂的天下,因为企业微信、飞书、钉钉掌握的组织关系与历史数据是创业公司难以逾越的上下文壁垒,创业公司只能选一家平台做垂直Agent。

9月7日周一
  1. 卫诗婕|商业漫谈Jane's talkAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    脉脉 CEO 林凡聊全球 AI 人才动向与大模型季报:明年科技公司只招 AI 人才?

    脉脉创始人兼 CEO 林凡走访 OpenAI、Anthropic、Google、Meta 后判断,AI 岗位需求已连续两年同比 10 倍增长,非 AI 岗位普遍缩招。他提出 AI 人才分基座技术、应用开发、业务效能三类,核心门槛是让 agent 自主运行超过 1 小时。企业内部 AI 落地需开放文档库、代码库等数据,OpenAI 用 9 个月完成全员 AI 覆盖。

  2. 语言即世界language is worldAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曾鸣谈AI产业史观:11个非共识判断,OpenAI、Anthropic大概率不是原生应用阶段的大赢家

    曾鸣提出AI产业化分三阶段,2026年是基础设施阶段基本完成的标志,围绕token形成共识,并已进入以Agent为新应用的智能体阶段。他认为Anthropic、OpenAI大概率不是原生应用阶段的大玩家,下一个最大机会是类似浏览器、统一Agent标准的平台。他还判断旧平台难演变成新平台,公司终将消亡,AI时代人与人的差异在于创造力。

9月3日周四
  1. 百度Geek说AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    都在开源 Harness,Codex 和 DeepSeek 到底有什么不一样?

    2026年8月,DeepSeek 开源 DeepSeek Harness 后两天冲上 9 万多 GitHub Star,OpenAI 随后开源 Codex 的 Harness 层,包括 CLI、app-server 和官方 SDK。

8月29日周六
  1. AI炼金术AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OPC 已凉、FDE 会消亡?AI 炼金术聊 Codex 上门装机与 DeepSeek 新 harness

    徐文浩与任鑫在播客中判断 OPC(一人公司)不成立、小团队成立,FDE 只是填缝、缝填完就消亡;现实中仍有年轻人在上海上门帮企业家安装 Codex、绑定信用卡。徐文浩称日常 80% 的开发工作已分不出国产模型与 GPT、Claude 的差别,但长程复杂任务仍有明显差距;他认为 DeepSeek 的新 harness 不是好 agent,却是「可塑软件」的内核。

8月22日周六
  1. SemiAnalysisAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:开源模型正在追上闭源前沿吗?

    SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。

8月20日周四
  1. 人民公园说AIAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness:Agent 工厂来了,但你的企业配用吗?

    DeepSeek Harness 被比作"造车工厂"而非 Codex 那样的"整车厂",主打可插拔的 Agent 生产架构。节目讨论其插件机制 Cordis 能否真正做到插拔自由,并质疑多数企业尚不具备 AI 原生工作流的落地条件,认为架构先进不等于能落地。

  2. 海外独角兽AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 发布:一套可热重载、可由 coding agent 自行修改的 Agent Harness

    DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。

    为什么值得看

    梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。

8月17日周一
  1. 晚点聊 LateTalkAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    晚点聊 179 期:蒸馏风暴——一场无人公开谈论的技术竞赛

    《晚点聊》第 179 期与《晚点 LatePost》主笔高洪浩讨论蒸馏,这一技术从早期的模型压缩演变为让模型变强的手段,并在 2026 年出圈。节目提到字节讨论训练超 5 万亿参数模型,张一鸣判断不蒸馏、也不被 Coding 这类短期热点影响,认为蒸馏最多只能逼近、很难真正超越。讨论还涉及智能体轨迹蒸馏、大规模蒸馏的数据管线与 know-how、蒸馏行为能否被隐藏,以及学生模型能否超越教师模型。

8月16日周日
  1. 42章经AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从蒸馏到合成数据到 RSI,模型竞争的下一个焦点是什么?|42章经

    前 Kimi 研究员、Evolvent AI 联创繁青认为,国内模型与国外差距缩小主要靠预训练架构创新,如 Kimi Linear 和 DeepSeek 的 Multi-head Latent Attention,蒸馏只是补后训练数据积淀不足的手段。

8月4日周二
  1. 晚点聊 LateTalkAI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?

    晚点聊邀请 RadixArk 与 SGLang 创始成员赵晨阳和华盛顿大学博士生曾致远,从推理与算法两条线拆解 Kimi K3。

  2. Paul Couvert(@itsPaulAi)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 新模型发布:几乎免费且足以构建任何应用

    新发布的 DeepSeek 被评价为史上最重要的 AI 发布之一:模型能力足以构建几乎任何东西,而成本几乎可以忽略。此前预算一直是许多人和项目的最大障碍,如今这一障碍已消失。

8月2日周日
  1. Interconnects AI — Nathan LambertAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    最新开源模型盘点:Laguna S2.1、Inkling 与 Kimi K3 展现开源模型在帕累托前沿的价值

    Thinking Machines 发布首个模型 Inkling,975B-A41B 多模态 MoE,可输入文本、图像和音频,并同步推出 276B-A12B 小版本。

7月31日周五
  1. 人民公园说AIAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    梁文锋闭门讲话解读:硬件10个月回本、API按成本6倍定价,DeepSeek 的成本壁垒怎么算

    DeepSeek 梁文锋一场闭门讲话被解读出理想主义背后的成本账:硬件约 10 个月回本、API 按成本 6 倍定价,融资的钱继续买卡,“反正开了你也做不了”被视为真正的成本壁垒。讲话还涉及用 TileLang 重构底层算子绕开英伟达生态,以及 Claude 加一两个工程师就完成 AMD 硬件适配原型。开源被形容为试吃,护城河藏在工程化与上下文里。

7月28日周二
  1. Web3天空之城AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋最新对话:AI 是十年范式转移,半导体规模需扩大 5 到 10 倍

    黄仁勋在专访中称 AI 是一场长达十年的范式转移,未来十年半导体产业规模需扩大到目前的 5 到 10 倍,并强调开源模型是科学进步与网络安全的基石。他表示英伟达中国销售额约为零,已告知投资者不要期待任何来自中国市场的收入,同时认为 DeepSeek、Kimi 引发的市场震荡是对开源模型影响力的误读。

  2. 卫诗婕|商业漫谈Jane's talkAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    百度王雁鹏聊 Agent Infra:巨头布局的隐秘赛道与模型、智能体的新动向

    播客对谈百度智能云 AI 计算首席科学家王雁鹏,讨论从模型时代到 Agent 时代的底层技术演变。他认为这一代 AI Infra 与上一代不同,是以 GPU 为核心构建,需要以 CPU 消耗窥见 Agent 诞生的真实价值,并梳理 Anthropic、OpenAI、Google 的路线差异以及国内多芯适配与开源生态的两大差异。

  3. 宝玉的分享AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    关于 Agent 的几个判断:通用 Agent 通吃、模型是护城河

    针对"通用 Agent 会吃掉垂直 Agent"等三个判断,作者补充了自己的六点看法:通用 Agent 赛道也会少数赢家通吃,小通用 Agent 同样没有生存空间。