跳到正文

#推理

今日 6 条
今天10月10日周六
  1. Z PotentialsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    专访 UCSD 正教授商静波:LLM 正在收敛,下一站押注超级智能

    34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。

  2. Latent Space [Youtube]AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 谈:AlphaFold 为何没有解决蛋白质折叠问题

    Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对话中指出,AlphaFold 的突破只是开始,蛋白质折叠远未解决,静态结构预测无法覆盖蛋白质动态与无序性。

  3. orange.ai(@oran_ge)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Luna 算不对简单数学,Haiku 拒绝翻译文章

    用户反馈 Luna 连简单数学都算不对,Haiku 则拒绝翻译文章。该用户由此感叹 AI 模型的发展走向十分诡异。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 回应 Noah Smith:纯 LLM 与神经符号混合系统不是一回事

    Gary Marcus 指责 Noah Smith 对其观点的批评"断章取义",称其若真正跟踪该领域,就应理解纯 LLM 与带神经符号 harness、代码解释器和验证器的 LLM 之间的区别。

  5. Interconnects AI — Nathan LambertAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nathan Lambert:AI 将迎快速进步,但不会走向通用超级智能

    Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。

  6. AI炼金术AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯

    ColaOS 创始人橘子在与「AI 炼金术」的对谈中复盘个人 Agent 这半年:flash 级模型让看邮件、订机票等任务的 token 成本降到当时的几十分之一,单用户月补贴从数百美金降至十美金左右,补贴成本已低于获客成本。他为此放弃卷办公赛道,转向做「996 之外」的个人 agent,并称 Opus 5.5 已把世界模型的活吃掉。

10月9日周五
  1. a16z(@a16z)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前 Intel CEO Pat Gelsinger:18 岁入职 Intel,边读博边设计 386 与 486 芯片

    前 Intel CEO Pat Gelsinger 回忆自己 18 岁被 Intel 招募,面试官给他的评语是"聪明、激进、傲慢,他会很合群"。他是 386 的第四号工程师、486 的架构与设计经理,这些工作都是在他攻读学士、硕士和博士期间完成的。他还讲述在斯坦福课堂上与教授争论其 carry lookahead adder 设计不成立的经历。

  2. 宝玉(@dotey)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》发布:AI 参与自身研发,智能体闯进真实系统

    《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。

  3. AI Will(@FinanceYF5)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理将成最大 AI 市场:规模已超训练,或改变数据中心建设方式

    推理将成为最大的 AI 市场,其规模已经超过训练。这一变化可能改变数据中心的建设方式,并影响未来机会所在的方向。

  4. AI Will(@FinanceYF5)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    推理将成最大市场:Jessie Dong 称小型数据中心更适合推理负载

    Jessie Dong 认为推理市场规模已超过训练,将改变数据中心建设方式与机会分布:推理不需要上千块 GPU 集中在一处,小型数据中心更易解决供电与监管问题。Nvidia 正在建设 25 个 5-20 MW 的小型数据中心,Akamai 则在全球 4,400 个小型站点上运行推理。她认为小型数据中心盈利能力更强、建设风险更低。

  5. AI Will(@FinanceYF5)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 数学模型攻克 7 个千禧年大奖难题中的 4 个

    OpenAI 新模型在 7 个千禧年大奖难题中的 4 个上取得实质进展,涉及 Navier-Stokes(声称)、Riemann、Hodge 和 Birch-Swinnerton-Dyer,结果尚待验证。据 Deedy 称,每个结果平均仅消耗 3 小时思考算力,所用模型尚未发布。

  6. 宝玉(@dotey)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Theo 质疑 Cursor 工程师 1000 万美元 Token 成本说法:实际 API 成本约每月 10 万-50 万美元

    Theo(t3.gg)反驳 Cursor 工程师 Lauren 每年 1.32 亿美元 Token 成本的估算,称真实 API 成本约为每月 10 万-50 万美元,按当前价格更接近每年 300 万美元。

  7. Mind the Future — Richard NgoAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社会理论与智能体基础:社会均衡如何扩展博弈论理性模型

    Richard Ngo 撰文梳理社会学与智能体基础研究的联系,重点讨论社会均衡、博弈论均衡、规范内化与集体行为三部分,主张将理性社会与政治行为理论作为 Von Neumann 和 Morgenstern 理性经济行为理论的扩展或替代。

10月8日周四
  1. Yann LeCun(@ylecun)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:数学将进入形式化证明大规模自动化的新时代

    Yann LeCun 认为数学正开启一个新时代:形式化证明将大规模自动化,研究重心会转向新概念、新抽象、新定义与新猜想的提出。他以船只发明削弱游泳重要性、却让人发现新大陆作类比。

  2. Gary Marcus(@GaryMarcus)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 点评 OpenAI 数学大动作

    Gary Marcus 与 Terence Tao 就 OpenAI 的数学领域大动作发表互补评论,试图解读数学研究的新范式。相关内容发布于 Gary Marcus 的 Substack。

  3. garymarcus.substack.comAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 评 OpenAI 新数学模型的模糊发布

    Gary Marcus 与 Terence Tao 就 OpenAI 新公布的数学成果发表互补评论。Marcus 指出,OpenAI 仅称"用同一流程、借助未发布模型"完成证明,未披露架构、失败率、训练与数据增强细节,还提到证明是否由 Lean 一次性生成并验证也不清楚。他认为无法判断该结果的通用性,甚至无法排除其只是借助 Lean 与合成数据在可验证领域取巧。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑 OpenAI 未公开模型数学证明报告缺乏科学细节

    Gary Marcus 批评 OpenAI 一份关于未发布模型的报告信息严重缺失:未说明"same procedure"具体流程、架构细节(证明是否一次性生成再由 Lean 验证)、失败率,以及训练、后训练和数据增强方式。因此无法判断该结果在数学领域之外的可泛化性,它既可能是迈向 AGI 的一步,也可能只是借助 Lean 与合成数据在可验证领域的技巧性应用。

10月7日周三
  1. MIT Technology ReviewAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Download:减肥药显现延缓衰老迹象,Energy Dome 用二氧化碳电池储能

    Eli Lilly 和 Novo Nordisk 称,服用其 GLP-1 减肥药的患者在追踪 DNA 与关键蛋白变化的分子“衰老时钟”上衰老更慢,但这一结果的解读仍存疑问。

  2. 腾讯科技AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辛顿首次参与递归自我改进研究:AI已开始参与造AI,人类或只剩一两年准备监管

    辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。

  3. Gary Marcus(@GaryMarcus)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:分不清神经网络自主解题与符号系统验证答案,就别评论 AI

    Gary Marcus 批评那些把「神经网络自己解决问题」与「神经网络提出答案、再由独立符号系统验证」混为一谈的评论者,称这种混淆正是对 AI 缺乏基本理解的典型表现。他强调,分不清这两者是根本性认知错误,不懂的人不应就 AI 发表评论。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 评 OpenAI 新数学成果:用 Lean 等符号 AI 加 LLM,但不等于 AGI

    Gary Marcus 就 OpenAI 新数学成果表态:该系统在 LLM 之外还使用了 Lean 等符号 AI,印证了他多年主张的神经符号 AI 路线。但他强调这并不意味着 OpenAI 已实现 AGI,因为数学领域的符号验证与符号数据增强无法在开放的真实世界中广泛泛化。他重申 2019 年的观点:神经符号 AI 是必要而非充分条件,世界模型同样关键。

  5. 刘润AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞:10年之后,职场上只会剩下两种人

    李飞飞在Huberman Lab等播客访谈中判断,未来十年职场上更有竞争力的是把一件事做到极致的专才和什么都能上手的通才,两者共同的能力是主动性。她创办的World Labs正探索空间智能,让机器理解并生成三维空间;她认为AI的下一个前沿在语言之外,机器人落地仍需更长时间。

10月6日周二
  1. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 联创 Christian Szegedy 长文《数学何去何从?》:AI 让数学「毕业」,两千年英雄攀登史落幕

    xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。

10月4日周日
  1. InfoQ 中文AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    o1 奠基人 Noam Brown:1 万个 Agent 解出世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。

10月3日周六
  1. orange.ai(@oran_ge)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本地跑 Qwen Flash 读写速度一周内提升近十倍

    作者称自己的本地机双 5070ti 跑 Qwen Flash,从上周末的 200 prefill、10 decode 提升到今天在 Strata 与自制 PR 支持下的 2200/67,只用一张卡,读写速度都提高近十倍。

  2. AI科技评论AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴佳俊 IROS 2026 演讲:结构化表征是机器人学会推理的脚手架

    斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表《Building Physical Agents via Structured Representations》报告,提出用结构化表征搭建物理世界智能体。他介绍了从演示中学习谓词与原子动作、让模型自行提出 DSL、并用演示标签对视觉判据做后训练等路径,并透露最近投稿的工作已将规划器也换成后训练的开源视觉模型。

10月2日周五
  1. AI前线AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前微软合伙人 Ramez Naam 长文质疑 RSI:Token 用量暴涨 124 倍,研发提速仅约一成

    前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。

  2. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:能微调 LLM 回答物理世界问题,不等于具备 6 岁儿童的物理直觉

    Yann LeCun 在 X 上发问:"我的家用机器人在哪?我的 L5 自动驾驶汽车在哪?"他指出,可以把 LLM 微调成能回答任何物理世界问题的模型,但这并不意味着它拥有足够的理解力和物理直觉,去预测一个 6 岁儿童就能预测的事情。

  3. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 测算:2027 年前出货的 AI 芯片能跑多少 AI 智能体?

    Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。

10月1日周四
  1. 十字路口CrossingAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Sutton《苦涩的教训》:AI 研究为何应当相信 Scaling Law

    Richard Sutton 在《苦涩的教训》中指出,回顾 70 年 AI 研究,长期最有效的往往是能持续利用更多算力的通用方法,而非人类精心设计的领域知识。国际象棋、围棋、语音识别与计算机视觉的历史都显示,研究者起初想用人类理解减少搜索,真正的突破却来自拥抱搜索和学习。他因此认为,搜索和学习是当前最能随算力扩展的两类方法,而试图把人类对心智的理解直接写进系统,长期会停滞甚至阻碍突破。

  2. 大模型智能AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 神秘 RL 后训练算法被指只是 STE 近似:解析 Score Centering 与 vLLM/Megatron 训推不一致问题

    针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。

9月30日周三
  1. AI科技大本营AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克、黄仁勋、Anthropic 联创同台:太空发电、硬件熔断与代码不再值钱

    在华盛顿一场科技圆桌论坛上,黄仁勋、马斯克与 Anthropic 联合创始人 Tom Brown 同台对话。

9月29日周二
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从词袋模型到 Jev:语言模型做文本分类的技术脉络

    Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。

9月28日周一
  1. AI科技评论AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Naive AI 发布开源模型 Naive-N0.5-Flash,并披露两项 AI 研发任务

    Naive AI 发布开源模型 Naive-N0.5-Flash,权重与推理代码以 MIT 许可证开放,API 输入每百万 Token 0.6 元、输出每百万 2.6 元。

9月25日周五
  1. Latent.Space(@latentspacepod)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Runway 的世界模型豪赌:视频、机器人、实时 AI 与神经操作系统

    Runway 联合创始人兼联合 CEO Anastasios Germanidis 阐述 AI 视频的终局是世界模型:Sora 曾触发 Runway 内部的生死冲刺,而扩大视频模型规模或许足以学到物理规律。他进一步提出实时生成可让世界模型充当机器人模拟器,软件的未来可能是直接以像素而非 HTML 和代码生成的界面,Runway 正朝完全神经操作系统推进。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 研究团队详解文档抽取中的置信度校准

    LlamaIndex 研究团队发布博客,讨论校准置信度分数对文档抽取和智能体决策的价值:设定置信度阈值后可自动接受高于阈值的取值、对低于阈值的做人工复核,阈值越高可保证的精度越高,例如置信度 0.7 对应 95% 精度、0.9 对应 98% 精度,代价是更多假阴性需要人工审核。

9月24日周四
  1. Latent.Space(@latentspacepod)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 播客对话 TypeSafe CEO:Jev、System One Model 与可靠 AI

    Latent.Space 发布对话 TypeSafe CEO @CompleteSkeptic 的播客,其打造的产品 Jev 被明确不称作「Decision Model」。他解释 AI 能解决极难问题却仍无法自动化基础工作,Jev 面向软件内的可靠决策而非聊天,TypeSafe 拒绝公开 benchmark 和 API 层的拒绝机制,并称即便有 10 亿美元也不会从头预训练模型。

  2. 网易科技AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曦望王湛:Token 成本是 AI 普惠的最后一公里

    曦望Sunrise联席CEO王湛在2026网易未来大会上提出,AI产业的损益表正在被Token重写,Token价格直接决定智能经济规模。他援引国家数据局数据称国内日均Token调用量已从2024年初的1000亿增至今年3月的140万亿,并判断算力结构性缺口大概率延续到2028年。曦望为此推出专为推理设计的启望S3 GPU,单卡性能为上一代5倍,单Token成本降低90%。

9月23日周三
  1. 屠龙之术AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AICC2026 观察:从 Chat 到 Agent,智能、算力与芯片走向何处

    AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。

9月22日周二
  1. Interconnects AI — Nathan LambertAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 的 JS Denain 与 Nathan Lambert 辩论 RSI、中美差距与模型能力参差

    Epoch AI 洞察团队负责人 JS Denain 与 Nathan Lambert 在播客中辩论了 RSI、机器人对 AI 加速的作用、中国模型落后程度以及蒸馏是否能解释这一差距。