跳到正文

全部动态

今日 0 条
10月5日周一
  1. meng shao(@shao__meng)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    反对个人 AI Agent:Nathan Baschez 提出共享「AI 工厂」范式

    Nathan Baschez 认为 99% 公司让员工各自折腾 Codex、Claude Code 等个人 AI Agent 的模式不是终局,下一步应是共享的「AI 工厂」。与 Skills 不同,工厂要求系统 Shared、Specific、Scrutinized——尤其可审视性决定反馈回路是否存在。他以两家百人咨询公司为例:集中建设共享工厂的一方在学习曲线上可深入约 5 倍。

  2. Tw93(@HiTw93)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    看到任何 Claude 的奖励、问卷、邮件,建议不要点击

    有用户提醒,收到任何 Claude 的奖励、问卷或邮件都不要点击,例如所谓 250 刀云额度。该用户称,Anthropic 虽然模型非常厉害,但行为可能不那么正派。

  3. Justine Moore(@venturetwins)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 生成 Threads 用户主题音乐视频走红

    一条用 AI 生成的音乐视频以 Threads 用户为主题,在社交平台引发关注。该视频由 Justine Moore 分享,附带的互动数据显示 7 条回复、2 次转发、15 个赞和 1777 次浏览。

  4. Z PotentialsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harvey 联创 Gabe Pereyra:应用公司如何借助开源与评测建立研究能力

    法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。

  5. 吴晓波频道AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    周末躺了两天,为什么周一反而更累?注意力被算法「隐形加班」

    法国勃艮第大学2023年实验显示,自由刷45分钟手机的年轻人警觉性与抑制控制能力明显下降,而安静看45分钟纪录片的一组没有这种变化,原因是大脑被迫频繁切换任务、产生「注意力残留」。QuestMobile 2026年中国移动互联网半年报告指出,月活跃用户规模同比仅增长1.2%,月人均使用时长却同比增长7.4%。组织心理学家提出心理脱离、放松、获得新掌控感和控制感四种「恢复体验」,其中控制感常被忽视。

  6. Spring BlogAI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Spring Office Hours S5E25:Josh Long 谈软件开发未来

    Spring Office Hours 播客 S5E25 由 Dan Vega 和 DaShaun Carter 主持,嘉宾 Josh Long,主题为软件开发未来,并回应近期流传的一个热门观点。

  7. SuperTechFansAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hacker News 头条:Bob Cringely 去世、代理硬预算上限、Strata 本地跑 Qwen3.8-Flash-Next 等

    Simon Willison 主张按量计费服务应默认设置硬预算上限,达到额度即停用并返回错误,而非仅发预警邮件;AWS 9 月推出的项目支出限制当时仅向有限客户开放。

  8. 腾讯科技AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开源模型烧向硅谷:企业用开放权重模型重构AI成本账

    腾讯科技报道,随着AI支出上升,美国企业正越来越多地转向价格更低的开放权重模型。AlphaSense 数据显示,今年 8 月和 9 月美国企业财报电话会议和投资者会议中提及开放权重或开源模型的次数是去年同期的 6 倍。

  9. Anton Osika – eu/acc(@antonosika)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    关于 benchmark「饱和」的讨论:基准是否只对人类有效,而非 ASI?

    Judith Dada 就 benchmark 可视化提出质疑:所谓「饱和」是否意味着基准只对人类有效、对 ASI 并不适用。她同时承认此前受过往参差不齐的可视化影响而先入为主,并表示现在的呈现应更接近她给出的新图。

  10. Guillermo Rauch(@rauchg)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel 的 Rust 化:DHH 说得对,但 AI 智能体改写了迁移成本账

    Vercel 持续推进 Rust 化,早期把 Turborepo 从 Go 迁移到 Rust,迁移虽完成,但内部对回报争议很大——Rust 更适合构建系统所需的底层系统访问,人力迁移成本却相当高。Guillermo Rauch 表示,随着 AI 智能体到来,这一权衡已被改写,"对人类最好"不再等于"对业务最好",Rust 也未必是终极工具链。

  11. AI Engineer(@aiDotEngineer)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reducto 的 Adit Abraham:文本摘要助检索,结构化表格助推理

    Reducto 的 Adit Abraham 指出,文本摘要有利于检索,结构化表格则有利于推理,因此智能体能否"找到"表格与能否"读"表格是两回事。该观点来自其在 World's Fair 2026 的演讲,AI Engineer NYC 将于 10 月 12 日至 14 日举行。

  12. Guillermo Rauch(@rauchg)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:新项目的 README 全手写,内部文档用 AI 英语

    Guillermo Rauch 正在开发一个新项目,其中 README 完全手写,因为面向人类阅读;而文档内部说明则使用 AI 英语,因为面向 AI 智能体。他提出这一经验法则:博客、推文、README 属于人类交流,关键不在于是否使用破折号,而在于用文字与他人建立连接的故事时刻。

  13. Jerry Liu(@jerryjliu0)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu:ChatGPT/Codex 是目前最好的深度工作智能体界面,但 Claude 应用缺少分支功能

    Jerry Liu 认同 ChatGPT/Codex 拥有当前最好的深度工作智能体界面,理由是它把编程与知识工作统一在一个界面中,ChatGPT 与 Codex 之间切换没有明确分离的流程,并支持分支(forking)。他仍喜欢 Opus 5.5,尤其用于产品演示,也认为 Claude Code CLI 已是 CLI 应用能做到的最好水平。

  14. a16z(@a16z)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 联合创始人 Ben Horowitz 谈 18 岁组建的说唱组合,以及嘻哈如何成为他思考商业的素材来源

    Ben Horowitz 讲述自己 18 岁时因一位失明的儿时好友开始录制 DJ Red Alert 和 Chuck Chill Out 的电台节目寄给对方,后来两人组建了说唱组合 The Blind and Def Crew。他认为嘻哈特别是早期作品极具商业导向,自己撰写商业文章时许多想法都来自那些老说唱歌曲,因此会把歌词放在文章开头以示致敬。

  15. Andrej Karpathy(@karpathy)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:99% 关注 AI 的人入行不到一年,让"AI 恐龙"们困惑

    Andrej Karpathy 提出一个心智模型:如今关注 AI 的人中,99%+ 接触 AI 相关事物不足一年。他把 2026 年之前、甚至 2012 年之前就在 AI 领域的人称为"AI 恐龙",认为这种代际错位让老玩家感到非常困惑。

  16. 宝玉(@dotey)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    马斯克的三条管理指令适合用在 AI Agent 身上,可惜 Agent 不怕被开除

    马斯克规定管理人员收到明确指令的邮件只能有三种回应:解释为何有误、要求澄清、或直接执行,否则将被要求立即辞职。有人将这三条规则套用到 AI Agent 上,但指出 Agent 并不怕被开除。

  17. idoubi(@idoubicc)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    开发者 idoubi 列出每天必开的 5 款自建应用,涵盖建站、Agent 对话与本地模型选型

    开发者 idoubi 公开了自己每天使用的 5 款自建应用:termany.sh 用于构建其全部产品,douchat.ai 用于与所有 agent 对话,snapok.app 负责截图,spotcat.ai 用于启动应用,autojev.ai 则为本地 agent 挑选快速模型。他称"做自己每天都用的东西是最好的感觉"。

  18. Justine Moore(@venturetwins)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Justine Moore 转发分享一段被赞"武器级"的硬核作品

    投资人 Justine Moore 在 X 上转发一段视频,称其为罕见的"武器级"硬核作品,让其他人看起来都像 LARPer。该帖获 774 条回复、1728 次转发、25259 次点赞和超 222 万次浏览。

  19. Yann LeCun(@ylecun)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:训练前沿模型昂贵、蒸馏廉价,这一市场力量将推动前沿基础模型走向免费开源

    Yann LeCun 引用 @abuchanlife 的观点指出,训练前沿模型成本高昂而蒸馏前沿模型成本低廉,仅凭这一市场力量就足以推动前沿基础模型走向免费与开源,他还提到存在其他类似因素。

  20. 向阳乔木(@vista8)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代人们直接购买任务结果:谁能稳定帮用户完成任务,谁就握有下一代入场券

    工业时代人们购买产品,互联网时代人们获取信息,AI 时代人们会越来越直接地购买任务结果。这一判断出自《智能AI时代的商业、组织与战略的本质》,认为谁能在高度复杂、持续变化的智能世界中持续稳定地帮用户完成任务,谁才有机会形成下一阶段最重要的入口和平台。

10月4日周日
  1. Lenny Rachitsky(@lennysan)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI ChatGPT 与 Codex 负责人谈模型选择器将消失、Agent 将接管网络操作

    OpenAI ChatGPT 与 Codex 负责人 @thsottiaux 在访谈中表示,模型选择器很可能消失,循环与图结构只是过渡阶段,未来互联网上大多数操作将由 AI 智能体完成,并谈及 OpenAI 的 AI 安全思路。

  2. Paul Graham(@paulg)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:认为一切取决于最初想法的错误信念有多重危害

    Paul Graham 指出,认为一切取决于最初想法的错误信念会以多种方式害人:初始想法不奏效时让人放弃,同时给初始想法施加过大压力,仿佛它必须足够宏大。

  3. Akshay Kothari(@akothari)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Akshay Kothari 推文

    该推文互动数据为:0 条回复、1 次转发、32 个点赞、2355 次浏览、4 次收藏,由 xgo.ing 提供支持。原文未披露具体内容。

  4. 掘金本周最热AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Muse 登顶 App Store 第一并开源 Muse Gadget SDK,AI Agent 开始进入下一个阶段

    Meta 的 Muse 登上美国 App Store Productivity 分类第一,评分 4.9、超过 10 万条评分,同时 Meta 开源了 Muse Gadget SDK。

  5. Geek(@geekbb)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AGI 之后是不是"超级智能中的超级智能",英文缩写该怎么写?

    有观点提出,AGI 出现之后是否会迎来"超级智能中的超级智能",并追问其英文缩写该如何命名。该内容获得 35 条回复、13 次点赞和 16557 次浏览,未给出具体结论或命名方案。

  6. Viking(@vikingmute)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    社交媒体成了复读机:同一段子在推上、小红书、知乎反复刷到

    同一段子在推上、小红书、知乎被反复搬运,回到小地方更感觉 AI 并不存在,世界仍是原来的世界。这条吐槽本身也被变着花样在不同平台刷到不下十回。

  7. 笔记侠AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么公司越大,内耗就越严重?企业如何避开"中等规模陷阱"

    研究30多家上市公司连续十年年报发现,员工人数达2000人左右时,人均劳动生产率、总资产收益率等指标会遇到天花板,即"中等规模陷阱"。作者将其归因于组织的三大内生矛盾,并提出"一个集团"、透明组织、智慧企业三大组织建设法宝加以对冲,认为这是组织数字化转型的终局。

  8. AI Engineer(@aiDotEngineer)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citadel Securities COO Jay Woo:公司缺少自身世界模型,如何用 Slack、演示文稿和会议构建

    Citadel Securities COO @jay_wooow 提出"公司没有自身的模型",主张用 Slack、演示文稿和会议记录构建企业世界模型。他将分享该模型如何保持时效,以及构建过程中出现的问题。演讲定于 10 月 14 日 AI Engineer New York 主题演讲,大会时间为 10 月 12 日至 14 日。

  9. Yann LeCun(@ylecun)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:AI 的进展让系统神经科学更令人兴奋

    Yann LeCun 认为 AI 的进展正在让系统神经科学变得更令人兴奋。他指出当前 AI 在物理直觉、常识、世界模型、规划/推理、动机/驱动力和情感等方面仍缺乏好的切入角度,而我们现在或许已拥有实现并检验认知架构的工具。

  10. 小互(@imxiaohu)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    小互:模型强不是你强,AI 生成视频缺品味只会沦为自嗨

    小互针对 Opus 5.5 生成的视频表示,AI 的能力不等于你的能力,用 AI 做的视频充其量只能看。他认为视频和文字一样需要编排、策划和反复打磨,缺乏品味与专业经验的作品只会让人不适、沦为自嗨。他建议在自己的专业领域用 AI 助力扩展能力,而不是妄想靠 AI 小科普视频走红。

  11. meng shao(@shao__meng)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    特朗普把 AI 改称 SI 后,.ai 域名产品要换 .si 吗?

    特朗普宣布将 AI 改称为 SI(Super Intelligence),由此引出 .ai 域名产品是否要改用 .si 域名的讨论。此前因 .ai 域名意外受益的 Anguilla,这次可能轮到斯洛文尼亚(.si 域名归属地)。

  12. AI产品黄叔(@PMbackttfuture)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 时代瓶颈竟是 CPU

    有观点指出,AI 时代的性能瓶颈不在 GPU 而在 CPU,与业界普遍认知形成反差。原文未给出具体数据或测试结论。 (说明:原始正文仅有一句标题式感叹与互动计数,无模型名、参数、benchmark 或可用性信息,故摘要按最短事实写法,未做任何补全。)

  13. 有新NewinAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z:押注 AI 头部赢家,让增长跑赢估值

    a16z 成长投资负责人 David George 在《Uncapped with Jack Altman》对谈中给当前产品周期打 9 至 10 分、资本周期打约 6 分,认为技术带来的增量市场仍巨大,少数公司增长可能持续超出预期。

  14. Paul Graham(@paulg)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paul Graham:没拿到 .com 域名也没关系,所谓"那个 .com"并不存在

    Paul Graham 表示,没拿到 .com 域名不必焦虑,因为"那个 .com"并不存在,它只是你目前唯一能想到的那个 .com。这条推文获得 3710 次点赞、141 次转发。

  15. 宝玉(@dotey)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉:别急着学 Lauren 不 Review PR,先弄明白她凭什么能这么做

    宝玉认为,Lauren 敢不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最强模型且不用考虑 Token 成本,而 GPT-6 操作电脑的水平虽已超过真人,也只能替代一部分验证工作。他建议从自己日常开发流程出发,把手动重复的环节交给 Agent,再沉淀成 Skill 反复迭代,同时方向仍要靠专业判断来指。

  16. 极客公园AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 之后,中国团队开始深挖 AI 的「直觉层」

    前 OpenAI 研究员 Diogo Almeida 创办的 TypeSafe AI 于 9 月 15 日发布只做判断的 Jev 模型后,OpenAI 推出 Decisions API。

  17. AI前线AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 技术负责人:蒸馏会毁掉前沿研发,中美 AI 竞赛不会单边暂停

    Anthropic 两位强化学习技术负责人 Nicholas Marwell 和 Sholto Douglas 在一档播客中表示,未来几年很可能出现能力达到或超过所有人类的模型,而蒸馏只能复制当前前沿、无法推进下一代,因此反对不设门槛地释放能力。

  18. 李继刚(@lijigang_com)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 发展的补短板史:支撑技术如何决定模型能力落地

    回看 Agent 的发展,基本是一路补短板:缺少当前事实就加检索和数据接口,长任务容易丢信息就加状态保存和上下文管理,工具调用会失败就加重试、检查和恢复,行动可能越权就加权限隔离和审批。这些支撑技术决定了模型的原始能力能否真正落进现实场景,但也带来延迟、维护成本、错误传播和协调开销。外围不断加支撑系统兜底,模型进步又把其中一部分能力吸收进去,让结构重新变简单。

  19. 李继刚(@lijigang_com)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 探出有效路径后,可将稳定部分固化成脚本或流程

    AI 世界里时间几乎不存在,可以飞快遍历可能性的解空间。Agent 一旦探出有效路径,就能把其中稳定的部分「固化」成脚本或流程。

  20. 宝玉(@dotey)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fable 5.5 生成人类 40000 年艺术史动画

    Fable 5.5 整理并生成了人类 40000 年艺术史动画,原作者感叹难以理解抽象的向量矩阵如何输出这些精美动画。其称即便最厉害的动画团队,也不是一两个月能完成的。