跳到正文

#大佬观点

今日 28 条
10月9日周五
  1. 国际大厂AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 高管亲述:计算机操作进展与 Decisions API 诞生过程

    OpenAI 计算机操作产品工程负责人 Ari Weinstein 与 API 产品负责人 Nikunj Handa 在播客中回顾开发者日发布,Ari 称过去一年最关键的进步是智能体能排查错误、重试并组合截图、无障碍信息、页面结构与 Playwright、自行编写代码来操作软件。

  2. 国际大厂AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Bezos:AI 大幅提升生产率,或让人回归单人收入家庭

    Jeff Bezos 表示,AI 大幅提升生产率后,可能让人减少工作、进而造成劳动力短缺,并可能推动社会回归单收入家庭模式。相关言论由 Business Insider 于 2026 年 10 月 8 日报道。

  3. The Rundown AI(@TheRundownAI)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    特朗普:白宫将使用"Artificial Intelligence"一词者视为敌人

    美国总统特朗普在 Truth Social 发文称,白宫将任何使用"Artificial Intelligence"而非"Super Intelligence"这一新说法的人视为"敌人"。

  4. Latent Space [Youtube]AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Synthesis Superintelligence:从半导体到超导体——Periodic Labs 的 Liam Fedus 与 Ekin Dogus Cubuk

    Periodic Labs 的 Liam Fedus 和 Ekin Dogus Cubuk 提出“synthesis superintelligence”,主张让模型在真实物理实验中做强化学习,而非只训练互联网数据。他们认为科学发现不同于数学与编程,物理实验才是最终基准,失败实验可能是最有价值的训练数据,目标是让每台实验仪器具备“140 IQ”并压缩数十年的试错。

10月8日周四
  1. Fireworks AI(@FireworksAI_HQ)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 活动:swyx 谈 AI 团队为何终将自建数据、评测、模型乃至芯片

    每支严肃的 AI 团队最终都会自建数据、评测、模型,甚至芯片——Latent Space 的 swyx 在 Fireworks AI 活动上阐述"未来一切皆领域专用"这一判断。该活动定于 11 月 3 日在旧金山举行,参与需通过 bit.ly 链接报名。

  2. Yann LeCun(@ylecun)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:科学奖属于科学家,成果要发在同行评审平台

    Yann LeCun 回应 Brian Roemmele 与 Elon Musk 时表示,科学奖是给科学家的,科学家会把成果发表在接受同行评审的平台上,以便被审视、验证和复现。

  3. Satya Nadella(@satyanadella)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Satya Nadella 分享 X 长文文章链接

    Satya Nadella 在 X 上发布了一条指向 x.com 长文文章的链接,未附文字说明。该帖获得 2681 次点赞、314 次转发和 216 条回复,浏览量约 80.9 万。

  4. Microsoft Research(@MSFTResearch)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research:最重要的 AI 失败或许不是那些显而易见的

    Microsoft 合伙人研究经理 Jennifer Neville 在与主持人 Chad Atalla 的对谈中指出,最重要的 AI 失败未必是显而易见的那些,"令人意外的失败"能揭示人类对智能的预期与 AI 系统实际运作方式之间的分歧。

  5. Logan Kilpatrick(@OfficialLoganK)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Logan Kilpatrick:AI 正让数字世界几乎无所不能,物理世界也将如此

    Logan Kilpatrick 表示,AI 已让数字世界几乎一切皆有可能,而物理世界很快也会如此,这在很大程度上同样归功于 AI。该帖获 2790 次点赞、148 次转发与 14.8 万次浏览。

  6. Y Combinator(@ycombinator)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    思科总裁 Jeetu Patel:AI 基础设施订单两年从 0 做到 93 亿美元

    思科总裁兼首席产品官 Jeetu Patel 在 YC 播客《Main Function》中表示,思科正把自己定位为 AI 时代的"卖铲人",业务覆盖网络、安全、芯片与基础设施。其 AI 基础设施业务订单两年内从 0 增长到 93 亿美元。他还在节目中谈到如何让 32000 名工程师拥抱 AI,以及 AI 数据中心建设是否存在过度投资。

  7. Yann LeCun(@ylecun)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 反驳"所有 AI 都是垃圾"论:医学影像、防撞、反诈与无障碍也在其中

    Yann LeCun 公开反驳"所有形式的 AI 都是垃圾"的说法,列举 AI 在乳腺 X 光检查中筛查肿瘤、道路障碍物检测并将碰撞减少 40%、过滤邮件与社交平台上的垃圾信息和诈骗、识别外国干预民主进程的企图、帮助视障者听取视觉环境描述、以及机器翻译连接不同文化等用途。他称不应把孩子和洗澡水一起倒掉。

  8. Ben Thompson - 科技分析师和评论员AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前 Facebook 全球选举负责人 Katie Harbath 谈《Disrupting Politics》与 Facebook 2010 年代的转变

    前 Facebook 全球选举负责人 Katie Harbath 接受访谈,谈其新书《Disrupting Politics》,以及 Facebook 在 2010 年代经历的变化。访谈围绕她在该公司任职期间的经历展开。

  9. AI科技大本营AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    奥特曼《名利场》专访:证实 OpenAI 曾单方面叫停前沿模型训练

    在《名利场》专访中,OpenAI 首席执行官 Sam Altman 证实公司近期主动叫停了一项前沿模型训练任务,原因是能力跃升速度超过了安全对齐、可监控性与可解释性的进展。

  10. 51CTO技术栈AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI总裁布罗克曼:别急着做全自动Agent,先亲手做5遍再自动化

    OpenAI联合创始人、总裁格雷格·布罗克曼在Silicon Valley Girl访谈中建议,开发者接入AI工作流前应先亲手把流程做3到5遍,摸清脏数据、例外情况和权限边界后再自动化。他称模型写软件的能力已超过他认识的几乎所有人,自己已不再逐行写代码,而是给AI目标、反馈和约束。他还预判未来1到2年将出现一轮大规模创业复兴,前提是人必须保留控制权并承担责任,目标应当来自人。

  11. Yann LeCun(@ylecun)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:形式化证明大规模自动化将开启数学新时代

    Yann LeCun 认为形式化证明的大规模自动化将开启数学的新时代,研究重心会转向新概念、新抽象、新定义和新猜想的提出。他以船取代游泳作比:游泳的重要性下降,却让人得以发现新大陆。

  12. Yann LeCun(@ylecun)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:棋类、围棋与纯数学已是「心智健身房」

    Yann LeCun 回应 Kasparov,称部分学科已类似「心智健身房」,包括国际象棋、围棋等智力游戏以及纯数学的某些领域。他认为这些活动中最顶尖者,相当于体育竞技中的顶级运动员。

  13. Julien Chaumond(@julien_c)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MistralAI 数据中心 1905 年珍贵照片

    一张标注为 MistralAI 数据中心、拍摄时间约为 1905 年的罕见照片在社交平台流传。该帖获 467 次点赞、20 次转发和 17 条回复,浏览量 8016 次。

  14. DeepTech深科技AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    礼来CEO David Ricks:AI制药路还很长,人类可能只掌握10%-15%的生物学知识

    礼来CEO David Ricks在播客《Cheeky Pint》访谈中估计,人类目前可能只掌握10%-15%的生物学知识,需提升到50%以上AI才有望可靠预测复杂生物系统。礼来已启用配备1,016块英伟达Blackwell Ultra GPU的LillyPod超级计算机,并与英伟达共建AI创新实验室,未来五年投入最高10亿美元。他同时提到中国在全球药物研发管线中的份额已达约30%。

  15. CSDNAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kent Beck 最新演讲:AI 越是狂飙代码,工程师越得死踩刹车

    Kent Beck 在 Prodacity 大会演讲中称,自己写的三本编程手艺书如今"基本可以扔进垃圾桶"。他批评大模型是"神灯里的精灵":几秒吐出成千上万行语法正确、看似合情合理的代码,却往往无法真正跑通,只会以极低资本开销制造出不可维护的"屎山"。他主张工程师在 AI 交差后踩死刹车,于特性间隙重构,并以"未来期权"视角权衡特性产出与系统可修改性。

  16. 硅星人ProAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话 ZooWork 创始人 Ning Hu:企业 AI 最大的跃升,发生在硅谷之外

    ZooWork 创始人兼 CEO Ning Hu 在 Assembling 2026 AI 峰会炉边对谈中提出企业 AI 的 L1 到 L4 分级:L1 是人用 AI 提效,L4 是 AI 在岗位上执行并递归学习,目前多数企业仍停留在 L1。

  17. 硅星人ProAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为何越来越不说人话:从 Coding 过拟合到文言文式压缩

    开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。

  18. cat(@_catwu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队征集改进建议

    Claude Code 团队公开向用户征集改进意见,邀请用户提出希望 Claude Code 改进的方向。该帖获得 39 条回复、57 次点赞和 7612 次浏览。

  19. DeepTech深科技AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    鄂维南院士:AI for Science 的下半场,是重构整个科研体系|PAIR 2026

    中国科学院院士鄂维南在 PAIR Conference 2026 演讲中提出,AI for Science 的下半场是科研体系重构,将打破理论实验、学科之间、科研与产业三道边界。他称仅靠开源通用模型微调叠加科学能力做"科学基座模型"可能是伪命题,底层基座模型仍是最大挑战;同时提到 DPA-4 大原子模型、SpecXMaster 核磁谱解析平台等进展。

  20. Paul Graham(@paulg)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:你的使用限制就是我的机会

    Paul Graham 发帖称"你的使用限制就是我的机会",该帖获 2732 点赞、116 转发、73 条回复,浏览量超 49.8 万。原文未说明具体指哪款产品或何种使用限制。

  21. Paul Graham(@paulg)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:禁止 AI 智能体的业务,正是创业公司做竞品的机会

    Paul Graham 认为,任何禁止 AI 智能体的业务都为创业公司留出了做竞品的空间:需要禁用,说明用户想用,否则禁令毫无意义,这反过来意味着存在一个允许使用智能体的竞品需求。

  22. Spring BlogAI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    A Bootiful Podcast 对话传奇 Java 开发者 Kohsuke Kawaguchi

    Spring 的 A Bootiful Podcast 本期对话传奇 Java 开发者 Kohsuke Kawaguchi,回顾他在 Sun 参与 JDK 中 XML 与 Web 服务基础设施的经历,以及 Com4J、XML schema 校验器、守护进程工具等项目的由来。

  23. Amjad Masad(@amasad)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amjad Masad 回应 @Molson_Hart:全流程平台覆盖构思、设计、开发、评审、部署、安全与 DevOps

    Amjad Masad 回应 @Molson_Hart 称,该平台覆盖从构思、设计、开发、评审到部署、安全与 DevOps 的完整流程,只要用例足够复杂,用户需要操心和处理的事会少得多。

  24. Simon Willison's WeblogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ben Affleck 谈影视特效中的机器学习与 Python

    Ben Affleck 自称会写"相当糟糕的" Python 脚本,长期关注计算机与电影从模拟向数字的转变。他提到视觉特效流程多年来已用到机器学习,用卷积神经网络(Transformer 的前身)在 tensor 上做边缘检测和特征提取,从而更轻松地抠掉绿幕画面并替换背景。

  25. Guillermo Rauch(@rauchg)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:每个程序都可无限加固与优化,智能体需要知道何时停下

    Guillermo Rauch 指出,每个程序都能在加固(消除边缘情况、收紧输入、处理错误)和优化(性能剖析、基准测试、重写)两个方向上几乎无限推进,但时间、注意力和机会都有真实成本。他强调即便在 token 无限的世界里,也需要知道何时停止、接受哪些取舍,而 AI 智能体不管不顾都会一直钻下去。

  26. WSJ-TechnologyAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    观点:让物理学来监管 AI 行业——没有足够清洁电力就不建新数据中心

    WSJ 观点文章主张用物理学而非政策来监管 AI 行业:没有足够清洁电力运行,就不应新建数据中心。文章以电力供给作为 AI 扩张的硬约束。

  27. Amjad Masad(@amasad)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amjad Masad:数学注定最先被 AI 攻克,领域越纯粹越容易被破解

    Amjad Masad 提出,数学注定成为 AI 最先攻克的领域,因为领域越纯粹,AI 越容易破解。该观点获得 2198 次点赞、174 次转发与 129 条回复。

  28. Amjad Masad(@amasad)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit 不是消费级应用:多数创作者在创业或经营生意

    Replit 并非消费级应用,其多数创作者正在创业或经营生意。a16z 数据显示,Replit 按支出位列消费级 AI 应用前 10,但按流量排名却在后 5。高投入的 AI 重度用户的钱花在了休闲用户不显眼的地方。

  29. Sam Altman(@sama)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sam Altman 称新版 Chat 体验大幅提升,不愿回到旧版

    Sam Altman 表示自己等待新版 Chat 已久,并称不愿再回到旧版本。该帖未透露具体模型或版本号,仅以"Chat"指代这一产品,获得 758 次点赞和 132078 次浏览。 (注:原文信息极少,仅包含对"新版 Chat"的主观评价与互动数据,无可核验的功能、参数或版本细节,故摘要按原文实际内容压缩至两句话,未做任何补充推断。)

  30. WSJ-TechnologyAI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 卢德分子不会赢

    观点文章认为,AI 卢德分子不会获胜,因为人工智能满足了真实的社会需求,不会消失。

  31. Gary Marcus(@GaryMarcus)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 点评 OpenAI 数学大动作

    Gary Marcus 与 Terence Tao 就 OpenAI 的数学领域大动作发表互补评论,试图解读数学研究的新范式。相关内容发布于 Gary Marcus 的 Substack。

  32. garymarcus.substack.comAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 与 Terence Tao 评 OpenAI 新数学模型的模糊发布

    Gary Marcus 与 Terence Tao 就 OpenAI 新公布的数学成果发表互补评论。Marcus 指出,OpenAI 仅称"用同一流程、借助未发布模型"完成证明,未披露架构、失败率、训练与数据增强细节,还提到证明是否由 Lean 一次性生成并验证也不清楚。他认为无法判断该结果的通用性,甚至无法排除其只是借助 Lean 与合成数据在可验证领域取巧。

  33. Gary Marcus(@GaryMarcus)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑 OpenAI 未公开模型数学证明报告缺乏科学细节

    Gary Marcus 批评 OpenAI 一份关于未发布模型的报告信息严重缺失:未说明"same procedure"具体流程、架构细节(证明是否一次性生成再由 Lean 验证)、失败率,以及训练、后训练和数据增强方式。因此无法判断该结果在数学领域之外的可泛化性,它既可能是迈向 AGI 的一步,也可能只是借助 Lean 与合成数据在可验证领域的技巧性应用。

10月7日周三
  1. Gary Marcus(@GaryMarcus)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Terence Tao:AI 工具若负责任使用可支持后续工作,但目前常适得其反

    数学家 Terence Tao 表示,负责任地使用 AI 工具不仅能支持方案的初始生成,还能支持传统上由此衍生的所有后续有价值工作,但目前情况往往相反。

  2. Gary Marcus(@GaryMarcus)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Terence Tao 在 X 上发帖引热议

    数学家 Terence Tao 在 X 上发布了一条被 Gary Marcus 转引为"shitposting"的帖子,附带 🤣 表情。该帖互动量达 35 条回复、121 次转发、1386 次点赞和 116003 次浏览。原文未披露帖子具体内容。

  3. TechcrunchAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Tony Fadell 谈第一波 AI 硬件为何失败,以及下一步会怎样

    "iPod 之父" Tony Fadell 认为,第一代 AI 硬件未能解决真实问题,因而遭遇失败;他指出下一波产品必须赢得消费者信任。