跳到正文

#数据/训练

今日 12 条
今天10月10日周六
  1. Z PotentialsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    专访 UCSD 正教授商静波:LLM 正在收敛,下一站押注超级智能

    34 岁的 UCSD 正教授商静波认为,如果 AGI 指在广泛任务上达到普通人水平,那它某种意义上已经实现,真正未到来的是能在重要领域持续超越最优秀人类的超级智能。

  2. 爱范儿AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    技嘉为 B760/H610 主板更新 BIOS 支持新 LGA1700 处理器,AI 热潮推高内存成本、PC 出货量同比降 20.1%

    技嘉 10 月 9 日宣布,全部 B760 和 H610 主板将通过 BIOS 更新支持预计 2027 年初推出的新款英特尔 LGA1700 处理器,其中包含 DDR4 主板。

  3. 硅星人ProAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话Mercor:我们仅为强大AI提供了所需的1%数据,半年后模型会再有一次大跨越

    Mercor VP Chirag Mahapatra 在 Assembling 2026 上表示,前沿实验室在科学、材料科学、生物等复杂领域只收集到构建极高质量模型所需数据的 1% 到 2%,物理世界数据同样如此,整体可能只到 2% 到 5%。

  4. Latent Space [Youtube]AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 谈:AlphaFold 为何没有解决蛋白质折叠问题

    Google DeepMind 的 Pushmeet Kohli 与 Biohub 的 Sal Candido 在对话中指出,AlphaFold 的突破只是开始,蛋白质折叠远未解决,静态结构预测无法覆盖蛋白质动态与无序性。

  5. 爱范儿AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 ChatGPT 总爱在标题里塞色情赌博小广告?

    ChatGPT 会话标题末尾偶发出现外语词或赌博色情小广告,作者结合抓包记录与 EMNLP 论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》推断,标题由轻量推理模型生成,常在该结束生成时收尾失败,继续按概率输出词元。

  6. AI Will(@FinanceYF5)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 训练数据是唯一"一奏效就失效"的产品:模型做对约 70% 任务后数据就被弃用

    AI 训练数据被视为唯一"一旦奏效就贬值"的产品:当模型在某项任务上正确率达到约 70%,实验室就会砍掉这项任务的数据需求。这个市场还造就了全球最年轻的白手起家亿万富翁。

  7. AI Will(@FinanceYF5)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 讨论:数据将成下一个万亿美元品类,2031 年独立玩家不足 10 家

    Epoch AI 讨论中三位嘉宾给出三种判断:EverettRandle 认为数据是下一个 1 万亿美元品类;viks_rum 预计到 2031 年规模化独立玩家不足 10 家;Satya Nadella 称企业为智能付费两次,应保留自有数据。最值钱的数据或许是你永远不卖的数据。

  8. Interconnects AI — Nathan LambertAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Nathan Lambert:AI 将迎快速进步,但不会走向通用超级智能

    Nathan Lambert 认为 AI 会迎来快速进步,但不会走向通用超级智能。他指出,模型将在几年内成为超人的分布式 GPU 工程师,并可自动化预训练架构与数据选择研究,主要来自推理算力扩展与推理成本近指数级下降,而非模型研究能力的质变。他预计这会引发智能体模型的杰文斯悖论,需求只增不减,并带来 RL 环境质量提升的空间。

  9. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:他的一个智能体每天进行 5000 到 10000 次网络搜索

    Andrew Ng 在 The Batch 本周通讯中透露,他的一个智能体每天进行 5000 到 10000 次网络搜索,并认为智能体将需要多得多的数据中心。本期通讯还提及 GPT-6.1 Sol、Gemini 4 Argon、FLUX 3 Action 以及 HYSET。

  10. 创业邦AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    具身智能的数据竞赛,可能卷错了方向

    在2026(第二十届)DEMO CHINA现场,戴盟机器人王煜、灵御智能莫一林与OriginFlow秦深涛讨论具身智能落地路径。莫一林认为"模型"被高估、"身"被低估,灵御采用类自动驾驶L2的人机共驾模式,机器人已在超市做试吃,能以人的七八成效率完成七八成工作;秦深涛强调数据并非越多越好,关键是低成本获取多样高质量数据并跑通经济效率。

  11. Ed Zitron's Where's Your Ed AtAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ed Zitron 的垃圾债指南:AI 数据中心如何被高收益债与杠杆贷款撑起

    2026 年上半年垃圾债发行量达 2290 亿美元,而投资级债券为 8059 亿美元,垃圾债市场已膨胀至投资级市场的 28.4%,较 2011 年上半年的 30 亿美元增长 75 倍。

  12. a16z(@a16z)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前 Intel CEO Pat Gelsinger:能源产能就是经济产能,电网是 AI 扩张的天花板

    前 Intel CEO Pat Gelsinger 在 a16z 播客中称,美国整体能源产能停滞了约十五年,经济产能也随之停滞,即便近年国家能源产能年增约 4%。他认为能源产能会抑制 AI 热潮的乐观程度——"如果供不上电,为什么要建新数据中心、买百万块 GPU",并指出核能作为基荷值得扩建,而可再生能源对中国有深度依赖。

10月9日周五
  1. Z PotentialsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深度|RSI 的早期产业形态,最可能出现在企业 Agent

    Pyromind 押注 RSI 产业化的早期形态出现在企业 Agent 上线后的持续学习,用 AutoRL 和 Reward Data Flywheel 把真实任务反馈转化为可训练、可评估的模型能力。

  2. AI Will(@FinanceYF5)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型科技公司每位工程经理对应多少名工程师?基于 Levels.fyi 数据的统计

    有人基于 Levels.fyi 的提交数据,统计了大型科技公司中每位工程经理大约对应的工程师数量,AI 实验室则单独发布报告。该统计只是代理指标,更适合观察方向,不能视为精确的组织数据。

  3. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 回忆 1986 年首次赴美参会:在 MIT 展示多层网络海报,并与 Marvin Minsky 初次见面

    Yann LeCun 回忆 1986 年 6 月首次在美国参会并首次到访 MIT,展示了一张关于多层网络的海报。他在 Thinking Machines Inc 主办的招待会上首次见到 Marvin Minsky,对方惊讶于神经网络可被训练来计算两个二进制数的乘积。

  4. DatabricksAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    生物医学影像的真正瓶颈是数据,而不是模型

    生物医学影像领域的真正瓶颈在于数据而非模型。文章指出医院与卫生系统产生的数据虽多,但四个相关领域都卡在同一个数据环节上。

  5. Jerry Liu(@jerryjliu0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex:Markdown 成为人与智能体之间的通用信息表示,并推出非结构化文档转 Markdown 模型

    LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。

  6. SemiAnalysisAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:北京不会为前沿AI放慢脚步,中国采取速度优先的安全监管

    SemiAnalysis 统计 2021 年至 2026 年 9 月 15 日 9 家中国头部开发商的 857 个模型发布,仅 31 个(3.6%)附带开发者公布的安全评估结果,其中只有 9 个(1.1%)在发布时或之前公布。

  7. andrew chen(@andrewchen)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kenan Saleh:一家公司 3 个月从 $0 做到 $60M,本月将达 $100M run-rate

    Kenan Saleh 称其合作的一家公司 3 个月内从 $0 增长到 $60M,本月将触及 $100M run-rate,是他见过增长最快的公司。该公司向 AI 实验室和模型开发者售卖前沿数据(frontier data),他认为外界尚未充分认识到数据与算力、算法并列成为一等公民。

  8. Latent Space [Youtube]AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Synthesis Superintelligence:从半导体到超导体——Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk

    Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出“synthesis superintelligence”,主张让模型在真实物理实验中做强化学习,而非只训练互联网数据。他们认为科学发现不同于数学与编程,物理实验才是最终基准,失败实验可能是最有价值的训练数据,目标是让每台实验仪器具备“140 IQ”并压缩数十年的试错。

10月8日周四
  1. 划重点KeyPointsAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聚光灯之外:传统行业拥抱AI的真实落地图景

    养猪业连亏超10个月,佛山50人养猪设备公司老板刘文用AI重写卖了十年的软件;牧原与阿里云共建养猪大模型,一秒出诊断结果并铺设至1000多个猪场。一线从业者的阻力多来自数据割裂与部门墙,而非模型本身;刘文每月花不到6000元订阅AI,靠内容矩阵每月稳定获客30个。

  2. 硅星人ProAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 ZooWork 创始人 Ning Hu:企业 AI 最大的跃升,发生在硅谷之外

    ZooWork 创始人兼 CEO Ning Hu 在 Assembling 2026 AI 峰会炉边对谈中提出企业 AI 的 L1 到 L4 分级:L1 是人用 AI 提效,L4 是 AI 在岗位上执行并递归学习,目前多数企业仍停留在 L1。

  3. Simon Willison's WeblogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ben Affleck 谈影视特效中的机器学习与 Python

    Ben Affleck 自称会写"相当糟糕的" Python 脚本,长期关注计算机与电影从模拟向数字的转变。他提到视觉特效流程多年来已用到机器学习,用卷积神经网络(Transformer 的前身)在 tensor 上做边缘检测和特征提取,从而更轻松地抠掉绿幕画面并替换背景。

10月7日周三
  1. 笔记侠AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊 Rufus 创始成员:5年后手机购物 App 会消失

    前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。

  2. Julien Chaumond(@julien_c)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mistral 4 用 3.8% 的 GPU 实现 GPT-6 Astra 72% 的智能水平

    Mistral 4 仅用 3,800 块 Grace Blackwell 就达到 GPT-6 Astra 72% 的智能水平,后者使用超过 100,000 块 Grace Blackwell。按"每 GPU 智能"计算,Grok 4.7 约用 200,000 块 GPU,Claude Opus 5.5 约用 500,000 块 Trainium2,凸显 Mistral AI 团队的效率优势。

10月6日周二
  1. 十字路口CrossingAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    他们的新工作,是教 AI 取代自己:AI 训练数据供应链里的劳动者

    Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。

10月5日周一
  1. Z PotentialsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harvey 联创 Gabe Pereyra:应用公司如何借助开源与评测建立研究能力

    法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。

10月4日周日
  1. Yann LeCun(@ylecun)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:AI 进展让系统神经科学更有意思,物理直觉与世界模型仍是短板

    Yann LeCun 认为 AI 的进展反而让系统神经科学变得更有意思,因为当前 AI 在物理直觉、常识、世界模型、规划/推理、动机/驱动力和情感等方面都还没有特别好的解法。他表示,现在我们或许已经拥有实现并检验认知架构的工具。

  2. Amjad Masad(@amasad)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练专用小模型作为"替代品"

    Replit CEO Amjad Masad 提出,通用模型可在运行中训练自己的"替代品"——更小、更专一的领域模型,类似即时编译器在动态执行时按需生成优化机器码。他认为这类专用模型更便宜、更不易受提示词注入攻击,危害也更小,因为能力更有限。Masad 称当前关于递归自我改进的讨论很多,但"模型训练自己的替代品"这一方向却少有人关注。

  3. a16z(@a16z)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练更小、更垂直的替代模型

    Replit CEO Amjad Masad 提出"模型训练自己的替代者":通用模型在执行任务时发现用例有限,可像即时编译器一样当场训练出更垂直的小模型。这类模型更便宜、更不易被提示词注入攻击,也因能力更弱而更少危害,但通用智能体本身存在缺陷与失控风险。

10月3日周六
  1. InfoQ 中文AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 技术负责人谈蒸馏、开源与中美 AI 竞赛:蒸馏只能复制当前前沿

    Anthropic 强化学习方向技术负责人 Nicholas Marwell 和 Sholto Douglas 在播客访谈中表示,蒸馏无法把前沿继续向前推进,只能复制当前前沿,而真正进入下一代前沿需要巨额前期资本投入,因此他们反对模型蒸馏。

  2. 掘金本周最热AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Space-Bunny 匿名模型观察:0.03 倍积分、1M 上下文与模型选型的算术题

    作者在 WorkBuddy 模型面板观察到匿名模型 Space-Bunny,倍率 0.03x 且限时折扣,9 月 23 日上线后登顶 OpenRouter 与 OpenCode 调用量榜首,截至 10 月 2 日仍无人认领。

10月2日周五
  1. AI前线AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前微软合伙人 Ramez Naam 长文质疑 RSI:Token 用量暴涨 124 倍,研发提速仅约一成

    前微软合伙人 Ramez Naam 发表长文质疑递归自我改进(RSI)引发智能爆炸的判断,认为当前回路强度仅为起飞门槛的 10% 到 20%,需再增强 5 到 10 倍。

  2. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 测算:2027 年前出货的 AI 芯片能跑多少 AI 智能体?

    Epoch AI 测算,2025–27 年出货的 HBM 硬件最多可支撑约 3000 万至 1.7 亿个并发前沿模型智能体,按每周 168 小时不间断运行折算,相当于约 1.4 亿至 7.2 亿名全职员工的工作时长。

10月1日周四
  1. 大模型智能AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 神秘 RL 后训练算法被指只是 STE 近似:解析 Score Centering 与 vLLM/Megatron 训推不一致问题

    针对 arXiv 论文《Score Centering Stabilizes Off Policy Reinforcement Learning》被传为 OpenAI 后训练 RL 算法,有分析指出该 score centering 算法本质上是 STE(straight through estimation)的近似实现,其梯度与 STE 方案完全一致。

9月30日周三
  1. Lenny Rachitsky(@lennysan)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 助手争相挖掘 Google 数据,Google 却缺席?

    Lenny Rachitsky 发问:还有比你的 Google 数据更有价值的数据集吗?他指出每个 AI 助手都在"吞食"这些数据并做出奇妙的事,而 Google 在这一领域却不见踪影。该帖获得 119 条回复、16 次转发和 592 个点赞,浏览量达 116059。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 与 Snorkel AI 的 Vincent Chen 对谈:评测与 RL 环境仍待解决的难题

    Jerry Liu 主持了与 Snorkel AI 的 Vincent Chen 的晚餐对话,聚焦评测与 RL 环境。构建 RL 环境的一大挑战是"公平性":模型失败时难以归因于输入、harness 还是奖励模型;奖励设计困难,长周期评测因业务结果需数周至数月而极难推进。受监管行业仍需 human in the loop 保证约 100% 准确率,模型仍存在"锯齿状智能",长尾边缘案例持续失败。

9月28日周一
  1. Yangyi(@Yangyixxxx)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    讨论开源模型本地化与私有化部署:模型会越来越便宜吗?

    开源模型的私有化部署正成为新趋势:隐私与合规风险凸显、开源模型能力已过可用阈值、企业 token 开销失控推动成本考量,但版本迭代投入、使用频率不足导致综合成本高于云厂商、私有化部署稳定性仍是问题。

  2. Import AI — Jack ClarkAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 474:Platonic 心智空间、太空 TPU、智谱开启外层 RSI 循环

    本期 Import AI 介绍了 Michael Levin 关于心智或为 Platonic 模式空间界面的论文,认为身体与机器只是这些模式进入物理世界的接口;Anthropic 的 Perry Dong 与 Chelsea Finn 提出机器人缺少类似 LLM 的后训练通用配方,并介绍了 EXPO(-FT) 算法。

  3. dbaplus社群AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    图灵奖得主 Stonebraker 谈 LLM、智能体与数据库的未来

    图灵奖得主、Ingres 和 Postgres 创始人 Mike Stonebraker 认为,为智能体 AI 提供数据的数据源都是关系型的,而基础模型只处理纯文本将成为重大弱点。