跳到正文

#大佬观点

今日 37 条
10月5日周一
  1. elvis(@omarsar0)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与其等修复,不如自建个人 AI 智能体

    有开发者主张个人智能体应完全自有,从轨迹、记忆到输出全部掌控,并建议从零开始、保持极简、按需演进,或基于开源方案 Pi Durable 起步。他指出当前 muse、grok bot、instinct、dots 等个人智能体都不真正属于用户,数据安全、模型选型和产品定制都受制于厂商。

  2. Paul Graham(@paulg)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 引用 Trevor Blackwell:不存在完整的工具集

    Paul Graham 在 X 上引用 Trevor Blackwell 的话:"不存在所谓完整的工具集。"该帖获 718 次点赞、29 次转发,浏览量约 17 万。

  3. Gary Marcus(@GaryMarcus)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 就纽约市 AI 听证会发表证词并现身 MSNOW 直播

    Gary Marcus 就今日纽约市 AI 听证会发表证词,证词全文已发布于其 Substack,并即将在 MSNOW 直播中露面。

  4. David Heinemeier HanssonAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你在杞人忧天什么?AI 时代的繁荣不值得被末日论淹没

    David Heinemeier Hansson 撰文反驳气候、不平等与 AI 的普遍末日论,认为人类物质指标从未如此之好,泛化的焦虑只会破坏心智。他指出,若因恐惧 AI 而错失其带来的智能繁荣与创造力爆发,才是真正的损失;气候末日论三十年也未能遏制全球排放增长,反而拖垮了欧洲经济。

  5. Gary Marcus(@GaryMarcus)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus:骰子没有意识,LLM 里的随机性也不等于意识

    Gary Marcus 反驳"LLM 具有意识"的说法,指出 LLM 中存在包括 temperature 以及服务器动态在内的多种随机性来源,但这些都不会让矩阵运算产生意识。他同时喊话读者去看国会议员 Lieu 想传达的内容。

  6. Gary Marcus(@GaryMarcus)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 质疑将 ELIZA、深蓝等旧系统一律称为"超级智能"

    Gary Marcus 反驳将 AI 一律冠以"超级智能"(SI)的说法,指出 1965 年的 ELIZA 只是关键词匹配,深蓝只会下棋,早期 Google 搜索算法只能做搜索,最初的 ChatGPT 因不可靠和幻觉严重更像演示而非产品。他讽刺称照此标准自己的 Apple Watch 也算超级智能。此番评论针对 Elon Musk 提出的"不再叫 AI,改叫 SI 更好"。

  7. Gary Marcus(@GaryMarcus)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 批评 Elon 混淆「AI」与「超级智能」概念

    Gary Marcus 指出 Elon 未理解「AI」与「超级智能」的区别:AI 一词自 1956 年起就是标准术语,而「超级智能」在 Nick Bostrom 2014 年的论述中有特定含义,指在所有领域大幅超越人类认知能力的 AI。他认为混淆这两个术语极具误导性,且对过去 70 年从事 AI 研究的数十万人不尊重。

  8. Paul Graham(@paulg)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 分享创业者关于创业消耗全部时间与注意力的感悟

    Paul Graham 引用一位刚创业的朋友的话:"你说它会占用我所有的时间和注意力,但它确实占用了你所有的时间和注意力。"这条推文获得 703 个点赞、90 次转发和约 3.9 万次浏览。

  9. CSDNAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Research 负责人 Yossi Matias:AI 正在终结岗位头衔,初级员工要一出道就硬抗判断力

    Google Research 副总裁 Yossi Matias 在官方播客《The Google Research Podcast》首期访谈中表示,AI 正在终结"岗位头衔",以往需要熬 15 年才积累的判断力,如今初级员工一出道就得硬扛。

  10. InfoQ 中文AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI Codex 负责人 Tibo:未来 28 天每天交付一项用户可感知改进,否则重置额度

    OpenAI 的 ChatGPT 和 Codex 负责人 Tibo Sottiaux 承诺,未来 28 天每天推出一项对大多数 Codex 和 Work 用户明显有用的改进,否则进行一次完整的额度重置。

  11. Z PotentialsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harvey 联创 Gabe Pereyra:应用公司如何借助开源与评测建立研究能力

    法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。

  12. Guillermo Rauch(@rauchg)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DHH 对 Rust 的判断基本没错:Vercel 的 Rust 化与 Turborepo 从 Go 迁移的启示

    Vercel 的 Rust 化已进行一段时间,首批迁移项目之一是把 Turborepo 从 Go 迁到 Rust,迁移已完成,但内部对投资回报争议很大,因为人力迁移成本相当高。Guillermo Rauch 称 Go 很快、设计优雅、易于迭代,但如今 AI 智能体的冲击改变了权衡,"对人类最好"不再等于"对业务最好"。

  13. Demis Hassabis(@demishassabis)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Demis Hassabis 与 Sundar Pichai 谈 Google 用 AI 加速科学与医疗

    Google 用 AI 加速科学与医疗,AlphaGenome Atlas 已绘制人类基因组全部 9B 种单字母遗传变异并开放给研究人员,WeatherNext 3 号称迄今最准的全球天气 AI 模型,服务覆盖近 300 种语言、70 亿人。公司聚焦健康、自然灾害与天气韧性、学习、经济机会四个方向。

  14. Guillermo Rauch(@rauchg)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:README 要手写给人看,内部文档用 AI 英语给智能体看

    Guillermo Rauch 表示正在做一个新项目,其 README 完全手写,因为面向人类阅读;而文档内部部分则使用"AI 英语",因为面向 AI 智能体。他提出的经验法则是:博客、推文、README 属于人类交流场景,应保留讲故事的笔触,这与是否使用破折号无关。

  15. a16z(@a16z)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 联合创始人 Ben Horowitz 谈 18 岁组建的说唱组合,以及嘻哈如何成为他思考商业的素材来源

    Ben Horowitz 讲述自己 18 岁时因一位失明的儿时好友开始录制 DJ Red Alert 和 Chuck Chill Out 的电台节目寄给对方,后来两人组建了说唱组合 The Blind and Def Crew。他认为嘻哈特别是早期作品极具商业导向,自己撰写商业文章时许多想法都来自那些老说唱歌曲,因此会把歌词放在文章开头以示致敬。

  16. Andrej Karpathy(@karpathy)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:99% 关注 AI 的人入行不到一年,让"AI 恐龙"们困惑

    Andrej Karpathy 提出一个心智模型:如今关注 AI 的人中,99%+ 接触 AI 相关事物不足一年。他把 2026 年之前、甚至 2012 年之前就在 AI 领域的人称为"AI 恐龙",认为这种代际错位让老玩家感到非常困惑。

  17. Yann LeCun(@ylecun)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:训练前沿模型昂贵、蒸馏廉价,这一市场力量将推动前沿基础模型走向免费开源

    Yann LeCun 引用 @abuchanlife 的观点指出,训练前沿模型成本高昂而蒸馏前沿模型成本低廉,仅凭这一市场力量就足以推动前沿基础模型走向免费与开源,他还提到存在其他类似因素。

10月4日周日
  1. Lenny Rachitsky(@lennysan)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人访谈:模型选择器或将消失,智能体将接管多数网络操作

    OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 在访谈中表示,模型选择器很可能被取消,循环与图结构只是过渡阶段,未来互联网上大多数操作将由 AI 智能体完成。他还介绍了 OpenAI 在 AI 安全方面的思路。

  2. Paul Graham(@paulg)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:认为一切取决于最初想法的错误信念有多重危害

    Paul Graham 指出,认为一切取决于最初想法的错误信念会以多种方式害人:初始想法不奏效时让人放弃,同时给初始想法施加过大压力,仿佛它必须足够宏大。

  3. Yann LeCun(@ylecun)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:AI 进展让系统神经科学更有意思,物理直觉与世界模型仍是短板

    Yann LeCun 认为 AI 的进展反而让系统神经科学变得更有意思,因为当前 AI 在物理直觉、常识、世界模型、规划/推理、动机/驱动力和情感等方面都还没有特别好的解法。他表示,现在我们或许已经拥有实现并检验认知架构的工具。

  4. 小互(@imxiaohu)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小互:模型强不是你强,AI 生成视频缺品味只会沦为自嗨

    小互针对 Opus 5.5 生成的视频表示,AI 的能力不等于你的能力,用 AI 做的视频充其量只能看。他认为视频和文字一样需要编排、策划和反复打磨,缺乏品味与专业经验的作品只会让人不适、沦为自嗨。他建议在自己的专业领域用 AI 助力扩展能力,而不是妄想靠 AI 小科普视频走红。

  5. 有新NewinAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:押注 AI 头部赢家,让增长跑赢估值

    a16z 成长投资负责人 David George 在《Uncapped with Jack Altman》对谈中给当前产品周期打 9 至 10 分、资本周期打约 6 分,认为技术带来的增量市场仍巨大,少数公司增长可能持续超出预期。

  6. 爱范儿AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 安全团队成员 David Robinson 离职信引发安全文化讨论

    OpenAI 负责安全团队透明度工作、主导起草《Preparedness Framework》的 David Robinson 在大西洋月刊发文宣布离职,称公司持续冲刺发布的工作方式已达不到必要的谨慎程度。

  7. 宝玉(@dotey)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:别急着学 Lauren 不 Review PR,先弄明白她凭什么能这么做

    宝玉认为,Lauren 敢不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最强模型且不用考虑 Token 成本,而 GPT-6 操作电脑的水平虽已超过真人,也只能替代一部分验证工作。他建议从自己日常开发流程出发,把手动重复的环节交给 Agent,再沉淀成 Skill 反复迭代,同时方向仍要靠专业判断来指。

  8. 宝玉(@dotey)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:SpaceXAI 的 Lauren Tan 月并 2500 个 PR 如何不逐个 Review

    宝玉引用播客内容介绍,SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR,不逐个 Review,而是晚上让 AI 自检自合并、第二天早上抽查。

  9. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 安全报告负责人 David Robinson 离职并发文批评 AI 公司跑得太快

    OpenAI 负责撰写模型安全报告的 David Robinson 本周辞职,随后在《大西洋月刊》发文《我离开 OpenAI,因为它的文化出了问题》,称 OpenAI 与整个 AI 行业在安全上远远不够谨慎,问题出在文化而非具体规则或新法律。

  10. 李继刚(@lijigang_com)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李继刚:AI 世界里时间几乎不存在,Agent 探出有效路径后可固化为脚本或流程

    李继刚提出,AI 世界里时间几乎不存在,可以飞快地遍历可能性的解空间。Agent 一旦探出有效的路径,就能把其中稳定的部分「固化」成脚本或流程。

  11. 李继刚(@lijigang_com)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    新技术不要求每个组件都新,「新的组织方式」本身就能带来新能力

    新技术不要求每个组件都新,「新的组织方式」本身就能带来新能力。该观点指出,能力的跃升未必来自单个组件的全新突破,重新组织已有组件同样可以催生新的能力。

  12. Z PotentialsAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    红杉美国 Konstantine Buhler:99.9% 的脑力劳动将由 AI 完成,人类的价值转向选择、责任与信任

    红杉资本合伙人 Konstantine Buhler 提出,脑力劳动正沿着体力劳动的老路机械化:约两百年间体力劳动从 99% 由生物完成变为 99.9% 由机器完成,而不远的未来 99.9% 的脑力劳动也将由机器完成,认知革命规模更大、速度更快。

  13. InfoQ 中文AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    o1 奠基人 Noam Brown:1 万个 Agent 解出世界级难题,多 Agent 贡献不到 10%

    OpenAI 研究员、o1 早期奠基者之一 Noam Brown 在与 Dwarkesh Patel 的对话中表示,1 万个智能体花费 88 小时、消耗 1300 亿 token 解决一道千禧年大奖难题,功劳并不主要来自多智能体,他甚至连 10% 都不会归给多智能体,真正支撑突破的是足够强大的通用模型和让它持续并行思考的能力。

  14. Lenny Rachitsky(@lennysan)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sriram Krishnan:个人智能体时代产品经理回归

    Sriram Krishnan 认为,个人智能体的设计与 UX 让产品管理重新变得关键。Instinct、dot、muse、grok bot 都在大量投入产品工作,把 UX 与底层模型能力及其服务访问打通,用户往往不关心底层模型,而在意 muse 活动通知、Instinct 的点赞 emoji 这类细节。

  15. 腾讯科技AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一群计划"逃离"湾区的Anthropic研究员

    Anthropic前研究员雅各布·考克森9月初辞职并发帖称,构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",浏览量达1.74亿次,让"AI末日论者"圈子的担忧进入公众视野。这群人从2010年前后就在湾区讨论AI失控,部分人曾设想购买瑙鲁、在沙漠建电磁屏蔽设施。如今一些Anthropic早期员工开始考虑在美国偏远地区买地作为避难所,Anthropic规模已超3500人。

  16. Guillermo Rauch(@rauchg)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:安全将成为软件公司越来越大的职能,既是验证工程也是资本配置

    Guillermo Rauch 认为,安全将成为软件公司越来越大的职能,它既是验证工程(如"我的代码大概是内存安全的"),也是资本配置("该把最多 token 投向哪个攻击面")。随着 AI 对手日益精密、全球对中心化的依赖加深,两人一狗的小团队如何被信任成为挑战,但也是小团队可以颠覆的大片机会,他对此类投资感到兴奋。

  17. Amjad Masad(@amasad)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练更小、更专用的替代模型

    Replit CEO Amjad Masad 提出,通用模型可在运行中训练自己的"替代品"——更小、更专用的小模型。他把这一过程类比为即时编译器:模型在使用 Operator 或 Astra 等大模型执行任务时,若发现用例有限,便即时训练出专用模型。这种替代模型更便宜、更不易受提示词注入攻击、危害也更小,因为能力更弱。

  18. Guillermo Rauch(@rauchg)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 将让一切免费,包括 AI 自身,最后一块多米诺是免费能源

    Guillermo Rauch 提出 AI 会让一切变免费,包括 AI 自身,而最后倒下的多米诺骨牌是免费能源,他称这是人类的终极前沿。该帖获得 6046 次点赞、379 次转发与超 50 万次浏览。

  19. Paul Graham(@paulg)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 谈有人打印出其全部文章:规模堪比两卷百科全书

    Paul Graham 称最近遇到一个人把他所有文章都打印了出来,这是他此前从未见过的情况。他惊讶于这些文章体量之大,约等于两卷百科全书。

  20. Paul Graham(@paulg)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham 转发 Christian Szegedy:别押注飞机会失败,AI 推理质疑者描述的是去年春天的模型

    Christian Szegedy 公开反驳"AI 不会猜想、不会理论化、不会解释"的怀疑论,称这些说法描述的是去年春天的模型,几个月内将不再对应任何模型。他在 Terry Tao、Kevin Buzzard 和 Timothy Gowers 近期文章启发下,撰文阐述自己对 AI 能力的个人观察,Paul Graham 转发并配以"别押注飞机会失败"的评论。

  21. a16z(@a16z)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练更小、更垂直的替代模型

    Replit CEO Amjad Masad 提出"模型训练自己的替代者":通用模型在执行任务时发现用例有限,可像即时编译器一样当场训练出更垂直的小模型。这类模型更便宜、更不易被提示词注入攻击,也因能力更弱而更少危害,但通用智能体本身存在缺陷与失控风险。

  22. a16z(@a16z)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联创 Alex Atallah:Jev 等决策模型可成为智能体的对齐层

    OpenRouter 联合创始人 Alex Atallah 认为,Jev 等决策模型的一个潜在用途是做智能体对齐层,检查工具调用或智能体间通信是否符合原始系统提示词。他强调工具调用数量太多,需要廉价快速的模型来做拦截,OpenRouter 内部已有小原型在跑。他还提到,对红队类智能体,可用另一个模型检查每次工具调用是否越界,并叠加结构性防护。

  23. Harrison Chase(@hwchase17)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    专用智能体还是一个超级智能体?OpenRouter 联创 Alex Atallah 主张多个垂直智能体

    OpenRouter 联合创始人 Alex Atallah 认为 10 个专用"幕僚长"智能体胜过 1 个通用智能体,因为每个智能体只做一件事,能清楚看到它在哪出错。他指出通用个人智能体做跨域任务时,交给它的活越多,牺牲的理解就越多,而且没有人为这种牺牲负责。他预测未来用户会使用高度垂直的 sub-agent,再由一个幕僚长型智能体在它们之间协调。