跳到正文

#Anthropic

今日 73 条
5月8日周五
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 解析 AI 生产力提升的三种度量:Task Substitution and Uplift

    METR 提出 AI 生产力提升(uplift)的三种定义:旧任务提升、价值提升与新任务提升,并论证在简化假设下三者满足旧任务提升 ≤ 价值提升 ≤ 新任务提升。以软件工程师每日 8 小时写文档与 pull request 为例,若 AI 将写 PR 效率提高一倍,旧任务提升为 +33%,新任务提升为 +50%,价值提升则介于两者之间。

  2. METRAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 评审 Anthropic 风险报告"自动化研发风险"章节

    METR 对 Anthropic 2026 年 2 月风险报告中"自动化研发风险"章节完成外部评审,认为该报告不足以支撑其结论。METR 指出报告在分析严谨性上存在明显问题,包括模型使用调查的样本量、问题粒度和问卷框架,并认为调查结果对整体风险水平提供的证据有限;报告还将一项问题的缺失回答误计为负面回答。

  3. 宝玉的分享AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队谈为何用 HTML 替代 Markdown 作为输出格式

    Claude Code 团队成员 Thariq 提出用 HTML 取代 Markdown 作为 AI 智能体的输出格式,理由是 HTML 信息密度更高、支持表格与 SVG 图表、便于分享和双向交互。

  4. Alex Albert(@alexalbert__)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firefox 团队借助 Claude Mythos Preview 于 4 月修复的安全漏洞超过过去 15 个月总和

    Alex Albert 称,在 Claude Mythos Preview 的帮助下,Firefox 团队 4 月修复的安全漏洞数量超过了过去 15 个月的总和。

5月7日周四
  1. Alex Albert(@alexalbert__)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 出席 Code with Claude 并将在主舞台演讲

    Alex Albert 今日全天出席 Code with Claude 活动,并将在太平洋时间下午 5:30 主舞台发表演讲,该演讲将在 livestream 播出。活动议程包括 9:00 主题演讲、10:30 的 Claude Code 新功能、11:15 的 GitHub 规模构建 Claude、12:00 的 Managed Agents 加速生产(均为 PT)。

  2. Alex Albert(@alexalbert__)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 上调 Claude Code 限额并放宽 Opus API 限流

    Anthropic 宣布即日起对 Claude Code 做三项调整:Pro、Max 与 Team 套餐的 5 小时速率限制翻倍;Pro 和 Max 套餐取消 Claude Code 的高峰时段限额下调;同时大幅提高 Opus 模型的 API 速率限制。

5月6日周三
  1. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 对话:Claude 为什么一直限速

    在 5 月 6 日的 Code with Claude 旧金山场,Anthropic 兄妹 Dario Amodei 和 Daniela Amodei 同台对话,Dario 称公司原本按每年 10 倍准备算力,但 2026 年第一季度增速年化约 80 倍,这是 Claude 一直限速的直接原因,他直言 80 倍太疯狂、希望回落到 10 倍。

5月5日周二
  1. 宝玉的分享AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Boris Cherny:Claude Code 之后,写代码正在变成管理 Agent

    Anthropic 内部 Claude Code 创建者 Boris Cherny 在 Sequoia AI Ascent 访谈中表示,他整个 2026 年没写过一行代码,每天合并几十个 PR,工作方式变成在 Claude App 里同时管理几百个 Agent,靠 cron 驱动的 Loop 模式自动盯 PR、修 CI、抓取反馈。

5月3日周日
  1. Eugene YanAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何与 AI 协作并让成果持续累积

    Eugene Yan 总结自己与 AI 协作的方法,提出五条原则:提供好的上下文、把个人偏好编码成配置、让验证变简单、委派更大的任务、并闭环沉淀。具体做法包括把代码和知识库分层组织、为每个项目维护带注释的 INDEX.md、用 CLAUDE.md 当作行为契约并按目录分级加载、把高频操作做成按需加载的 skill,以及在会话中纠正输出而非直接改文件,让转录成为配置更新的输入。

5月1日周五
  1. 张小珺Jùn|商业访谈录AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    和苏煜聊 Agent 技术史:从 Logical Agent 到 Language Agent,以及 OpenClaw Moment

    俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。

  2. cat(@_catwu)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Security 进入公测,集成网页版 Claude Code

    Claude Security 现已进入公开测试,内置于网页版 Claude Code 中。用户将仓库指向该功能后,可获得经过验证的漏洞发现结果,并在同一处代码编写环境中完成修复。

4月28日周二
  1. 宝玉的分享AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Copilot 改用按用量计费:AI 订阅补贴模式走到尽头

    GitHub Copilot 宣布自 2026 年 6 月 1 日起所有计划改为按用量计费,用户每月订阅费将等值兑换为 token 额度。此前微软长期补贴用户算力,2023 年《华尔街日报》曾报道部分用户每月造成高达 80 美元成本,而订阅费仅 10 美元。Anthropic 也曾允许每 1 美元订阅烧掉超过 8 美元计算成本。

4月24日周五
  1. 语言即世界language is worldAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    独家对话罗福莉:OpenClaw触发AI范式巨变,Agent时代1T基座只是入场券

    小米大模型团队负责人罗福莉在首次长访谈中表示,OpenClaw是一个划时代的Agent框架,它通过精细编排的Context、持久记忆与多模型调度弥补了模型的能力短板,把中层模型的上限激发了出来。

  2. DeepSeek(@deepseek_ai)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek 发布 deepseek-v4-pro 与 deepseek-v4-flash API

    DeepSeek 上线 deepseek-v4-pro 和 deepseek-v4-flash 的 API,用户保留原 base_url 只需更换模型名即可调用。

    为什么值得看

    DeepSeek 发布 V4 系列并公布旧模型退役时间,可用于评估现有 API 的迁移成本。

  3. cat(@_catwu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 如何保持产品迭代速度:AI 时代产品经理角色的转变

    Claude Code 团队在对话中讨论了该产品如何保持迭代速度,以及 AI 时代产品管理角色的变化和未来工作形态。相关对谈已在 Spotify 上线。

4月23日周四
  1. Monica_IM(@hey_im_monica)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Monica AI 上线 Claude 4.7 Opus 与 GPT Image 2

    Monica AI 已上线 Claude 4.7 Opus 和 GPT Image 2,前者带来更强的推理与深度分析能力,后者提供图像生成。官方称此次更新覆盖编程、写作与设计场景,用户可在 monica.im 体验。

  2. 宝玉的分享AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cat Wu 面试几百个 AI 产品经理候选人,几乎没人答对:AI PM 到底该干什么?

    Anthropic Claude Code 产品负责人 Cat Wu 在 Lenny's Podcast 中称,面试几百名 PM 候选人后发现,大多数人仍在用 6-12 个月路线图思维找工作,而 Claude Code 团队已把功能交付周期从半年压缩到一周甚至一天。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。

4月17日周五
  1. Alex Albert(@alexalbert__)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Labs 推出 Claude Design,由 Claude Opus 4.7 驱动

    Anthropic Labs 推出 Claude Design,用户可通过与 Claude 对话制作原型、slides 和 one-pager。该功能由 Claude Opus 4.7 驱动,官方称其为能力最强的视觉模型,目前以研究预览形式在 Pro、Max、Team 和 Enterprise 套餐上线,当天陆续推送。

  2. Alex Albert(@alexalbert__)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 修复 Opus 4.7 发布初期多个 bug

    Anthropic 的 Alex Albert 表示,用户昨天首次尝试 Opus 4.7 时可能遇到的多个 bug 现已修复,并感谢用户的耐心。他引用的 Ethan Mollick 推文称,Opus 4.7 的 Adaptive Thinking 现在更频繁地触发思考,包括昨天失败的任务,同时也带来更多网络搜索,在非编码任务上的输出质量有明显提升。

  3. 宝玉的分享AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    两小时激辩:黄仁勋为什么不怕 TPU、不怕华为、不怕出口管制?

    黄仁勋接受 Dwarkesh Patel 两小时专访,回应了 Nvidia 是否会被商品化、CUDA 是否为技术锁定、TPU 与 Trainium 的竞争以及对华出口管制等问题。他认为 Anthropic 使用 TPU 和 Trainium 是缺乏 Nvidia 早期投资的特殊个案,出口限制挡不住中国 AI 发展反而会推动其芯片自主化,并称推理市场已进入按响应速度分档定价的时代。

  4. 宝玉的分享AI 评估 · 86/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Design,由 Opus 4.7 驱动可从想法直接产出可运行原型

    Anthropic 发布 Claude Design,由 Claude Opus 4.7 驱动,在 claude.ai/design 提供左侧聊天、右侧画布界面,产出物为可交互的 React 代码和样式表,并可导出 HTML、PDF、PPTX、ZIP 或送入 Canva、Claude Code。

    为什么值得看

    作者以三轮交互实测 Claude Design,给出从模糊需求到可运行 React 原型的完整过程与边界,可作为判断设计类 AI 工具协作方式的参考。

  5. Binyuan Hui(@huybery)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 发布,系统卡又加了 200+ 页

    Opus 4.7 发布,附带又一份 200+ 页的系统卡,让作者直言模型发布速度已超过自己的阅读速度。此前 Mythos 的系统卡他还没读完。

  6. cat(@_catwu)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ClaudeDevs 开发者账号上线:集中发布更新与 API 动态

    Anthropic 推出面向 Claude 开发者的账号 ClaudeDevs,用于集中发布更新。该账号将提供 changelog、API 发布、社区动态和深度技术内容,为使用 Claude 构建应用的开发者提供来自团队的直接信息渠道。

  7. cat(@_catwu)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 将 Opus 4.7 默认 effort level 设为 xhigh

    Claude Code 已将 Opus 4.7 的默认 effort level 设为 xhigh,用户可用 /effort 命令自行调整。官方邀请用户体验并反馈。

  8. cat(@_catwu)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 提示技巧:把测试流程写进 claude.md 或加 /verify-app 技能,让模型自验改动

    让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。

  9. cat(@_catwu)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 在 Claude Code 上线

    Claude Opus 4.7 在 Claude Code 上线。官方建议把它当作可以委派任务的工程师,而不是逐行指导的结对程序员,并给出三条配套的工作流调整建议。

4月16日周四
  1. Mike Krieger(@mikeyk)AI 评估 · 14/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 新消息,博客详解

    Anthropic 在博客中发布了 Claude Opus 的新消息,并邀请用户反馈意见。原文仅给出博客链接 anthropic.com/news/claude-op,未披露具体版本号、参数或功能细节。

  2. Mike Krieger(@mikeyk)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Opus 4.7,Cursor 内部基准从 58% 升至 70% 以上

    Anthropic 联合创始人 Mike Krieger 宣布 Claude Opus 4.7 发布,称其在模糊、多步骤任务上比 4.6 表现更好。他给出 Cursor 内部基准成绩从 4.6 的 58% 提升到 70% 以上;Notion 在自身评测中看到 14% 的提升,工具错误减少到原来的三分之一。

  3. Poe(@poe_platform)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 提示:Opus 4.7 在编码任务上较 Opus 4.6 明显提升

    Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。

  4. Poe(@poe_platform)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 在 Yoruba、Igbo、Chichewa 等低资源语言上显示提升

    Opus 4.7 在 Yoruba、Igbo 和 Chichewa 等训练数据较少的语言上显示出提升。Poe 表示,对这些语言及其他语言的使用者来说,该模型将有明显改善。

  5. Poe(@poe_platform)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 采用新 tokenizer,token 用量最高增至 Opus 4.6 的 1.5 倍

    Opus 4.7 在底层换用了新的 tokenizer。测试显示,相比 Opus 4.6,它可能多消耗 1x 到 1.5x 的 token,建议据此提前规划用量。

  6. Poe(@poe_platform)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 4.7 有何不同:早期测试中更严谨处理长任务并自我验证输出

    Poe 早期测试显示,Opus 4.7 处理长时任务更严谨、指令遵循更精确,并会在汇报前自行验证输出,面向可减少人工监督的托管式工作。

  7. Poe(@poe_platform)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Claude Opus 4.7

    Poe 宣布 Claude Opus 4.7 已在平台上线,称其为 Anthropic 目前能力最强的模型,在编码、推理、长上下文理解、工具调用、视觉和多步智能体工作流方面有大幅提升。用户可在各平台的 Poe 应用及 Poe API(poe.com/Claude-Opus-4.7)中试用。

  8. Alex Albert(@alexalbert__)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 4.7 发布:强化异步任务执行与 token 控制

    Anthropic 发布 Claude Opus 4.7,称为目前能力最强的 Opus 模型,能更严谨地处理长时间运行任务、更精确地遵循指令,并在汇报前自行核验输出结果。Alex Albert 补充了他喜欢的几点:擅长异步工作和遵循指令、努力等级(effort levels)让 token 控制更可预测并新增 xhigh 等级、不再对高分辨率图像做降采样、在 UI、幻灯片和文档上的品味明显提升。

4月15日周三
  1. cat(@_catwu)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 桌面版重做上线,支持多会话并行管理

    Anthropic 的 Anthony Morris 宣布 Claude Code 桌面版重做上线,应用从头设计以便更容易并行处理任务。用户 cat 表示自己已连续数周每天使用该桌面版,它可以在同一处启动和管理本地与云端的多个 Claude Code 会话,还能查看 git 状态、固定活跃会话,并通过拖拽布局同时查看多个会话。

  2. 宝玉的分享AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    使用 Claude Code:会话管理与 100 万上下文

    Anthropic 员工 Thariq 撰文讲解 Claude Code 的会话管理方法,围绕上下文窗口升级到 100 万 Token 后,如何在继续、回溯、清空(/clear)、压缩(/compact)和子智能体五种选择间做决策。

  3. Alex Albert(@alexalbert__)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 桌面端发布新版本,重做界面并支持多会话并行

    Claude Code 桌面端发布新版本,带来大量新功能和性能改进,并重做了桌面端界面。用户现在可以在一个窗口里并行运行多个 Claude 会话,并用新的侧边栏统一管理这些会话。Alex Albert 表示,在 Cowork 和 Code 之间切换后,做大部分工作已不太需要打开其他应用甚至终端。

  4. Jan Leike(@janleike)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布自动化研究新成果

    Anthropic 的 jiaxinwen22、liangqiu_1994、Joe Benton 与 janhkirchner 完成了一项新研究,Jan Leike 转发称赞并附上博文链接。博文地址为 anthropic.com/research/autom,具体方法与结论详见原博客。

  5. Jan Leike(@janleike)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jan Leike:用 Claude 自主推进可扩展监督研究,PGR 指标超越人类研究者

    Jan Leike 公布一项新研究结果:团队用 Claude 在可扩展监督研究上实现完全自主的进展,以 performance gap recovered(PGR)衡量,Claude 迭代多种不同技术,最终以 1.8 万美元额度显著超过人类研究者。