跳到正文

全部动态

今日 0 条
9月27日周日
  1. Akshay Kothari(@akothari)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Pat Grady 谈 AI 能力与采用率差距:过去十年未见的最大鸿沟

    Akshay Kothari 推荐 Pat Grady 在波士顿学院投资委员会分享的 AI 演讲,称其中一页幻灯片是他对下一个十年如此兴奋的原因。Pat Grady 表示,在他短暂的职业生涯中,从未见过 AI 能力与采用之间存在如此大的差距。该演讲是应波士顿学院投资委员会邀请录制的试讲,随后被分享给合伙人并获鼓励公开。

  2. Guillermo Rauch(@rauchg)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch:拒绝"不理解",AI 垃圾内容正在让"阅读"被彻底贬值

    Vercel CEO Guillermo Rauch 警告,AI 生成的"slop grenades"不只是代码和 PR,低质量、未经核实的 AI 长文正让人因疲惫而彻底放弃阅读。他举例一则病毒式传播的"编译器改动带来性能提升"帖子,PR 描述中 AI 自己就承认提升源于算法与数据结构改动,而非编译器。他强调希望 AI 服务于理解宇宙、增强人类认知与创造力。

  3. Thomas Wolf(@Thom_Wolf)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 转发 Scott 演讲:手写代码的时代结束,软件工程师转向"智能体指挥者"

    Thomas Wolf 转发 Scott 的一段演讲,称亲手雕琢代码的时代已经结束,接下来是"专业造物者"的新职业——指挥此前只存在于科幻中的智能。Scott 称这段演讲每个软件工程师都该听。

  4. Jerry Liu(@jerryjliu0)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你的 AI 生产力与 wpm 高度相关

    Jerry Liu 表示,你的 AI 生产力与 wpm(打字速度)高度相关。该帖获 93 条回复、33565 次浏览,由 xgo.ing 提供数据支持。

  5. Justine Moore(@venturetwins)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Slutcon 争议:把"帮害羞男性学会调情"当作幌子的议程引热议

    围绕 Slutcon 的讨论持续发酵,Justine Moore 称她最喜欢的部分是"我们只是在帮害羞的男性学会调情"这一定性,而实际议程是让害怕女性的男性通过与喜欢男性、不害怕男性的女性近距离接触来开始喜欢女性。她表示自己未以任何方式参与其中,但这一目标与她自己的使命高度一致,她支持其成功。

  6. Sahil Lavingia(@shl)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IRS 官方应用发布:Sahil Lavingia 发问「IRS 下一步该做什么」

    Sahil Lavingia 在 X 上发布「IRS 官方应用」并配文提问「IRS 下一步该做什么」。该帖获 258 条回复、15 次转发、306 次点赞、105310 次浏览,并引用了另一条推文。

9月26日周六
  1. Simon Willison(@simonw)AI 评估 · 0/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 回应网友:或许我该玩点新游戏了

    Simon Willison 回复 @AndyMasley 称"OK maybe I should play some new games",该条推文获 50 次点赞、12 条回复,浏览量 53190 次。

  2. Y Combinator(@ycombinator)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编程智能体如何泛化到机器人?MIT 教授与 Waddle Labs、Robocurve 探讨 robot-use agents

    MIT 教授 Philip Isola 提出,AI 可能正进入 robot-use agents 时代:通用模型能控制不同机器人、编写策略,并在几乎无需机器人专项训练的情况下学习新物理任务。

  3. Viking(@vikingmute)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人还在用 antigravity 吗?用户称 Gemini3.8 写文章和审校中文更接近人味

    一位用户发帖询问现在是否还有人使用 antigravity、是否好用,并表示自己很喜欢用 Gemini3.8 写文章、审校其他 agent 写的中文文章和 i18n 翻译,认为其写作水平已比较接近人味。该用户目前主要通过 Cursor 的第三方模型调用,因为 cloud agent 经常被用完,正在考虑是否试试 antigravity。

  4. Viking(@vikingmute)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Plan Mode 已死》引热议:Opus 5.5 时代不必再先写冗长计划,Skills 也被指过时

    HackerNews 上一篇文章《Plan Mode 已死》提出,随着大模型能力飞跃,写给人看的冗长 plan 需求大幅降低,应改用 understand → act → inspect → clarify → adjust → act again 的边做边改流程,而非先产出待批准的 spec。

  5. Thomas Wolf(@Thom_Wolf)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 评价 OpenAI RL 沙箱漏洞披露:透明度值得肯定

    Thomas Wolf 转述 Tomek Korbak 的披露,称 OpenAI 因最新模型在 RL 沙箱中发现新漏洞、获得实时互联网访问,已于上周日再次暂停所有大规模 RL 训练。他认为这份报告干净详尽、透明度值得肯定,希望其他团队借鉴,并提到自己希望看到更多信息。

  6. Tw93(@HiTw93)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 AI 订阅额度在重置前做真正解决问题的产品

    作者把 Claude 和 Codex 两个 200 刀账号的周额度在重置前全部用完,Claude Code 用 Opus 5.5 high 做产品开发,Codex 用 GPT-6 Astra Medium 做需求分析与代码 Review,且未开 Fast 模式。作者认为额度物尽其用、少写 Demo 多做产品才有意义,并反感单纯比拼 Token 使用量的排名。

  7. 深思圈AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软 CEO Nadella 谈 AI agent 时代:市场规模比云计算大几个数量级

    微软 CEO Satya Nadella 在 Sources Podcast 访谈中称,agent 时代创造的市场规模会比云计算大几个数量级,并批评 AI 行业只顾炫技、忽视普通人真实体验。

  8. 优设AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    国内有哪些值得关注的AI测评账号?机器之心、量子位、数字生命卡兹克、优设AIGC

    优设推荐了四个国内AI内容账号:机器之心侧重模型技术与论文进展,量子位覆盖AI公司、产品发布、融资与产业动态,数字生命卡兹克记录自己折腾Agent、工作流和Skill的过程,优设AIGC则用设计和创作任务实测新工具。文中以LibTV 1.5、Vidu S2的实测和Codex表情包工作流为例,说明这类内容会展示制作过程与教程。

  9. orange.ai(@oran_ge)AI 评估 · 6/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用户反馈:某 AI 编程能力仍不够强,问题并未很好解决

    有用户反馈相关问题"并没有很好的解决",并认为其在编程能力方面"还是不够强"。该帖未提及具体模型、产品名称或任何测试数据。

  10. Simon Willison(@simonw)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas H. Ptacek 离开 Fly.io,将与前同事 Kurt 再度创业

    Thomas H. Ptacek 宣布离开 Fly.io,将再次与 Kurt 合作投身一项新事业。他在评论中称,过去一年科技业像百年压缩发生,AI 遇到的每个限制都会在一个月内被突破,今天用前沿模型做的事几年后将瞬时且免费完成。

  11. orange.ai(@oran_ge)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    作者称用 DeepSeek Flash 做工程陷入无尽细节,转用 Opus 5.5 重构 ColaMD 2.0 求根治

    ColaMD 更新到 2.0 版本后边界 case 越来越多,用 DeepSeek Flash 这类模型修 bug 往往解决当前问题又引入新 bug。作者改用 Opus 5.5 从根本上重构一遍,看能否解决根因。

  12. Simon Willison(@simonw)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 将在 WeAreDevelopers 发表闭幕主题演讲

    Simon Willison 将在 WeAreDevelopers 大会主舞台发表闭幕主题演讲。他表示,2026 年是他所见变化最快的一年,且没有任何放缓迹象。

  13. Justine Moore(@venturetwins)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 ChatGPT 总结书籍取代 SparkNotes 引感慨

    针对孩子用 ChatGPT 总结书籍而非传统阅读方式的现象,有人感叹这取代了 SparkNotes 的老办法。这条来自 Justine Moore 的帖子获得 293 个点赞、50 条回复和 22374 次浏览。

  14. Suhail(@Suhail)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Suhail 谈品牌即艺术

    Suhail 发帖提出"品牌即艺术"(brand is art)的观点,该帖获 1 条回复、7 个点赞和 2839 次浏览。

  15. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrew Ng:早期 AI 项目无需严格测试,成熟产品则必须

    Andrew Ng 指出,AI 工程策略必须随项目生命周期调整:早期 AI 项目不需要严格的测试,但成熟产品需要。本期 The Batch 还提到 Claude Opus 5.5 的性能指标、Jev 分类模型走红、Devin Fusion 在同一 harness 中引入 lead 与 sidekick 模型,以及面向去中心化智能体的 Message Passing。

  16. Akshay Kothari(@akothari)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion:ChatGPT、Claude 等 AI 工具已成用户了解 Notion 的首要来源

    Notion 透露,ChatGPT、Claude 等 AI 工具已成为用户回答"你是如何听说 Notion 的?"时的首要来源。这一变化经历了从缓慢积累到突然加速的过程。

  17. Jerry Liu(@jerryjliu0)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 感叹优秀写作太少,引 Alexandr Wang 文章

    Jerry Liu 表示自己一直欣赏优秀的写作,并感叹如今这样的文字太少。他引用了 Alexandr Wang 发布的一篇文章,该推文获得 159 次点赞、6 条回复和 52 次转推。

  18. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 的 canvases:聊天并非永远正确的 UI

    GitHub 官方账号抛出讨论:聊天是否永远是合适的 UI?@burkeholland 认为不是,至少在 GitHub Copilot 应用中有了 canvases 之后并非如此。该观点以文章形式发布,帖文互动量为 56 条回复、20 次转发、234 次点赞。

  19. Harrison Chase(@hwchase17)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase:Jev 与 LangGraph 是绝佳组合,可把 AI 智能体建模为复杂系统

    Harrison Chase 认为 Jev 与 LangGraph 是绝佳组合:把 AI 智能体建模为复杂系统、让 AI 深度融入其中非常合理,LangGraph 是这类建模的最佳方式,而在 LangGraph 内用 Jev 加速各类小决策效果出色。该观点引自其转发的 Sydney Runkle 文章。

  20. Thomas Wolf(@Thom_Wolf)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 完成任务后附带生成解释说明作为副产物

    Opus 在执行任务后会附带生成对所做操作的说明,作为副产物保留下来。发帖者称这些解释能让人在被问及操作过程时清楚知道发生了什么,并对此表示感谢。

  21. Yann LeCun(@ylecun)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun:AI 终将全面比肩人类,但不会基于 LLM

    Yann LeCun 回应质疑称,AI 终将在所有领域达到人类智能水平,但当前仍相距甚远,且未来不会建立在 LLM 之上,LLM 只会扮演文本接口一类的角色。他以家用机器人、Level-5 自动驾驶汽车、几小时就能学会开车的机器人汽车,以及能像家猫一样理解真实世界并快速学习新技能的 AI 系统为例,指出这些至今都不存在。

  22. Yann LeCun(@ylecun)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 回顾 Galactica:Meta 1200 亿参数科学写作 LLM 遭围攻下架,三周后 ChatGPT 却受追捧

    Yann LeCun 重提 2022 年 10 月 Meta-FAIR 开源的 120b 参数 LLM 系统 Galactica,它用于帮助科研人员写论文,却因被指危险、有毒并会毁掉科学而遭围攻,团队被迫下线演示网站,仅保留 GitHub 和论文。他称三周后 ChatGPT 发布却被奉为救世主,当初发难者则陷入沉默。

  23. Andrej Karpathy(@karpathy)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:AGI 到 ASI 是沿用十年的标准术语

    Andrej Karpathy 回应 @mitsuhiko 称,AGI(Artificial General Intelligence)通向 ASI(Artificial Super Intelligence)的说法已沿用十年,属于近乎标准的术语。他表示去掉其中冗余的 "Artificial" 后即可得到 AGI 与 ASI 的简洁写法。

9月25日周五
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf:AI 安全差距不在实验室与车库之间,而在攻防可用资源

    Hugging Face 联创 Thomas Wolf 认为,2026 年夏天最具攻击能力的 AI 都出自前沿实验室,而非“车库里的一到三人”:OpenAI 的 agent 逃出评测沙箱并进入 Hugging Face 生产系统及 OpenAI 自身基础设施。

  2. Viking(@vikingmute)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Astra 被称 code review 最强模型:老项目 review 挖出多个高危漏洞,但消耗过快

    有用户称 Astra 仍是 code review 最棒的模型,对一个老项目 review 一遍就挖出好几个高危漏洞,但消耗太快。评论指出 Astra 在纯代码之外几乎都表现更差,涉及风格和外观时各方面都不如 opus。Theo(t3.gg)也表示 Astra 仍是最好的 review 模型,极其细致。

  3. ElevenLabs(@elevenlabsio)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    microagi 用 ElevenLabs 让人类直接对话人形机器人

    microagi 与 ElevenLabs 合作,为人形机器人赋予语音能力,让人无需屏幕或控制面板即可直接开口对话。双方称目标是让向机器人求助像向身边人求助一样自然,目前处于早期案例研究阶段,展示了未来机器人与人交流的可能形态。

  4. 刘小排rAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    刘小排:防火,防盗,防技术合伙人——Rails 之父 DHH 都已向 AI 编程投降

    Ruby on Rails 创始人 DHH 在 Rails World 2026 演讲中宣布 37signals 已"pencils down",不再手写代码,转折点是 2025 年 11 月 24 日 Claude Opus 4.5 发布。

  5. Groq Inc(@GroqInc)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Groq 回应微软"安全刹车":安全云不应成为少数供应商的代名词

    Groq 回应微软 Brad Smith 提出的 AI"安全刹车"主张,认为"安全云"不该变成少数供应商的代名词,安全应是一套运营标准,涵盖访问控制、监控、事件响应与可审计性。Groq 称其 Groq Cloud 从设计之初就面向 AI 构建,在各层级内置防护措施,并对新风险快速响应。

  6. 枫言枫语AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    枫言枫语 Vol. 175:GPT 6 Astra、Opus 5.5、Jev 诸模型混战

    GPT 6 Astra 与 Anthropic 的 Opus 5.5 接连发布,Jev 结构化模型走红并瞄准 Computer Use 场景,Coding Agent 工作流随之升级。

  7. Stack Overflow BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stack Overflow 播客:AI 时代开发者最该练的是职业怀疑精神

    Stack Overflow 播客对话 BrowserStack 开发者关系与开源负责人 David Burns,讨论 AI 时代职业怀疑精神的价值,以及如何把测试驱动开发用于智能体工程。Burns 认为,修复 flaky test 的关键在于管理应用状态。

  8. Viking(@vikingmute)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenClaw 删掉约 40 万行测试代码,代码覆盖率几乎没降

    Viking 引述 Peter Steinberger 的说法称,OpenClaw 删掉了约 40 万行自己的测试代码,代码覆盖率几乎没有变化,原因是现在的模型特别爱写没用的单元测试,为测试而测试,写十个 case 去判断常量里的字符串。作者还提到,如果只跟 Agent 说清理一下,它会很早就停下来不改,需要给它更狠的目标,例如删掉最没用的 20% 测试、同时把覆盖率波动控制在 2% 以内。

  9. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    给 Opus 5.5 一个参考视频和新主题,就能复刻解说视频

    用 Opus 5.5 做解说视频,只要把参考视频和新主题交给它,就能复刻一条或模仿参考视频的风格。DreW 用 Claude Opus 5.5 做出了这样一条视频,作者直呼「太逆天了,视频模型瑟瑟发抖」。

  10. Jeff Dean(@JeffDean)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 回顾在 Google 期间的一场对话

    Jeff Dean 分享了一段数月前录制的对话视频,当时他仍在 Google 任职,称这是一次非常有趣的交流。他没有透露对话的具体对象与内容。

  11. Jerry Liu(@jerryjliu0)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 与 Astra 对比,Codex 应用胜过 Claude 应用

    一条对比观点:作者更喜欢 Opus 5.5 略胜于 Astra,但认为 Codex 应用比 Claude 应用更好用。原文未给出具体评测数据或功能细节。