跳到正文

#Anthropic

今日 73 条
4月15日周三
  1. cat(@_catwu)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出 Routines,支持按计划、GitHub 事件和 API 触发

    Claude Code 推出 Routines 功能,除定时计划外,还可通过 GitHub 事件或 API 触发模板化智能体,使用 Anthropic 的基础设施并接入用户自己的 MCP 与仓库。Noah Zweben 称该功能已改变 Anthropic 内部的文档和待办维护方式,并给出了入门链接。

4月10日周五
  1. cat(@_catwu)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 推出 Bedrock 和 Vertex 配置向导,设置速度大幅提升

    Claude Code 新增配置向导,自动处理 Amazon Bedrock 和 Google Vertex 的环境变量与配置文件,无需手动编写。Claude Code 还能检测到用户锁定旧模型时,在权限允许下建议升级到新模型。

  2. Andrej Karpathy(@karpathy)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy:AI 能力认知存在鸿沟,免费旧模型与前沿 Agent 模型差距悬殊

    Andrej Karpathy 指出,公众对 AI 能力的理解存在日益扩大的鸿沟:许多人仍以去年免费版 ChatGPT 的幻觉和怪癖来判断 AI 水平,而这类旧模型并不反映今年最新一代智能体模型(尤其 OpenAI Codex 和 Claude Code)的能力。

  3. Alex Albert(@alexalbert__)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 在 Claude 平台推出 advisor 策略:Opus 当顾问、Sonnet 或 Haiku 当执行者

    Anthropic 在 Claude 平台推出 advisor 策略,将 Opus 作为顾问与 Sonnet 或 Haiku 执行者配对,让智能体以较低成本获得接近 Opus 的智能水平。Alex Albert 表示,允许 Sonnet 呼叫 Opus 这类做法既提升表现,也因减少复杂任务消耗的 token 而降低总成本。

4月9日周四
  1. Alex Albert(@alexalbert__)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Managed Agents 并进入公测

    Anthropic 发布 Claude Managed Agents,提供面向性能调优的智能体 harness 与生产基础设施,官方称可将原型到上线缩短到数天,目前在 Claude Platform 上处于公测阶段。Alex Albert 转述称,它既适合周末快速搭智能体原型,也能承载面向数百万用户的上线场景,省去自托管的复杂度,同时保留 harness、工具和技能配置的灵活性。

  2. Mike Krieger(@mikeyk)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Managed Agents 公测版

    Anthropic 在 Claude 平台推出 Claude Managed Agents 公开测试版,用于规模化构建和部署智能体。据转述,它把针对性能调优的智能体运行框架与生产基础设施配套提供,目标是把从原型到上线的时间缩短到数天。原文未给出具体价格、配额或基础设施服务商。

4月8日周三
  1. Junyang Lin(@JustinLin610)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Project Glasswing,由 Claude Mythos Preview 支撑

    Anthropic 宣布推出 Project Glasswing,称这是一项旨在帮助保护全球最关键软件的紧急倡议。该项目由 Anthropic 最新的前沿模型 Claude Mythos Preview 提供支持,该模型在发现软件漏洞方面表现优于除最熟练人类之外的所有人。

  2. Dario Amodei(@DarioAmodei)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei:网络安全是前沿 AI 模型的首个明确现实威胁,但不会是最后一个

    Dario Amodei 称网络安全是前沿 AI 模型带来的首个明确而迫在眉睫的危险,但不会是最后一个。若能共同应对这一风险,它或可成为解决后续更难挑战的蓝图。

  3. Dario Amodei(@DarioAmodei)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei:AI 网络能力若用对,可造出比 AI 之前更安全的互联网

    Dario Amodei 表示,AI 网络能力用错的风险显而易见,但若用对,就有真正机会打造一个比 AI 网络能力出现之前从根本上更安全的互联网和世界。该帖获得 1198 次点赞、82 次转发。

  4. Dario Amodei(@DarioAmodei)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Project Glasswing 应对 AI 网络威胁

    Dario Amodei 表示,许多全球领先公司已加入 Anthropic 的 Project Glasswing,以正面应对能力日益增强的 AI 系统带来的网络威胁。该项目由 Anthropic 最新的前沿模型 Claude Mythos Preview 驱动,据称其在发现软件漏洞方面的能力超过除最顶尖人类之外的所有人。

  5. Alex Albert(@alexalbert__)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Mythos Preview 面向 Project Glasswing 发布伙伴开放

    Mythos Preview 目前已向 Project Glasswing 的发布伙伴开放,Anthropic 同步公布了该模型与项目的介绍页面 anthropic.com/glasswing。推文未披露模型参数、benchmark 分数或公开可用时间。

  6. Alex Albert(@alexalbert__)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Mythos Preview,距 Claude Opus 4.6 仅两个月

    Anthropic 在发布 Claude Opus 4.6 两个月后,公布新模型 Claude Mythos Preview。该帖由 Alex Albert 发出,获得 17565 次点赞和 301 万次浏览。

  7. Alex Albert(@alexalbert__)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Project Glasswing,由 Claude Mythos Preview 驱动

    Anthropic 宣布推出 Project Glasswing,一项旨在帮助保护全球最关键软件的紧急计划。该计划由其最新前沿模型 Claude Mythos Preview 驱动,官方称其在发现软件漏洞方面优于除最顶尖人类专家外的所有人。

4月6日周一
  1. 宝玉的分享AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 省 Token 指南:慎用 1M 上下文,不开新会话或者总是开新会话都不对

    宝玉梳理了 Claude Code 的提示缓存机制,指出频繁 /clear 或每步开新会话常因触发全价上下文重建而更贵,读取缓存的成本只有重新计算的十分之一。

4月4日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    编程智能体的六大组件:Claude Code、Codex CLI 等编码 harness 如何工作

    编程智能体是包裹 LLM 的应用层(agentic harness),负责仓库上下文、工具设计、prompt-cache 稳定性、记忆与长会话连续性。文章梳理出编码智能体的六大构建模块,并区分 LLM(引擎)、推理模型(增强引擎)与 agent(模型周围的控制循环)、coding harness 这几个概念。

4月1日周三
  1. 宝玉的分享AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 源码泄漏,但先别急着写源码分析

    Claude Code 源码泄漏后,宝玉不打算写源码分析,而是分享学大型开源项目的四步法:先跑起来、从单个功能点切入、动手做二次开发、最后从零搭建。他指出泄漏的 50 多万行代码只是 source map 还原结果,缺脚手架和私有 package,无法直接运行。Anthropic 的 Boris 回应称问题出在本应自动化、却仍人工操作的部署环节,未归咎或开除任何人。

  2. 宝玉的分享AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 总裁 Greg Brockman 谈砍掉 Sora、Super App、Spud 与 AGI 之路

    OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。

  3. Taranjeet(@taranjeetio)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 记忆条目上限 200 行,可装 mem0 插件修复

    Claude Code 源码中记忆入口存在 MAX_ENTRYPOINT_LINES 的 200 行上限,项目进行一周、保存超 100 条记忆后索引会截断,旧上下文丢失、Claude 随之遗忘。

3月28日周六
  1. 宝玉的分享AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Notion 联合创始人 Simon Last:我从去年夏天起就没写过一行代码了

    Notion 联合创始人 Simon Last 在 No Priors 播客访谈中称,他从 2025 年夏天起不再手写代码,工作方式转为设计端到端任务并管理编码 Agent。

3月26日周四
  1. METRAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 红队测试 Anthropic 内部智能体监控系统

    METR 员工 David Rein 与 Anthropic 合作,用三周时间对 Anthropic 内部智能体监控与安全系统的一部分做了红队测试,发现若干此前未知的漏洞,其中一些已被修复,均未严重动摇 Opus 4.6 Sabotage Risk Report 的主要结论。

  2. 宝玉的分享AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    在中国 AI 生态圈摸底两周,投资人看到了什么

    Delphi Ventures 创始合伙人 José Maria Macedo 在走访中国 AI 创始人、VC 和上市公司 CEO 两周后,表示自己更看好中国硬件、更看衰软件。

  3. Mike Krieger(@mikeyk)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic Labs 负责人 Mike Krieger 谈如何构建 agent-native 产品

    Anthropic Labs 联合负责人、Instagram 联合创始人 Mike Krieger 在 every 的 AI & I 播客中谈 agent-native 产品构建。

3月25日周三
  1. Citrini ResearchAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Citrini Research:AI 智能体时代的"Agentic Utilities"投资框架

    Citrini Research 提出"Agentic Utilities"框架,用于寻找超charged token消耗时代的受益标的,并披露其在 Citrindex 中已做多 AKAM、FSLY、CRCL 和 NET。

  2. Hugging Face(@huggingface)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 称在旧金山街头捡到标有 Claude Opus 5 权重的 USB key

    SemiAnalysis 发推称在旧金山 Hayes Valley 街头发现一个 USB key,标注内含 Claude Opus 5 权重,并询问是将其插入电脑上传到 Hugging Face,还是交给 Jack Clark(@jekbradbury)等人确认归属。目前并无任何证据表明该设备真实存在或包含模型权重。

  3. Alex Albert(@alexalbert__)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 新增 auto mode,由 Claude 代做权限决策

    Claude Code 推出 auto mode,不再需要逐条批准每次文件写入和 bash 命令,也不用完全跳过权限检查。在该模式下,Claude 会代为做出权限决策,并在每个操作执行前由安全机制进行检查。

3月24日周二
  1. Alex Albert(@alexalbert__)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    理论物理学家 Matthew Schwartz:Claude Opus 4.5 达到研二学生水平,研究提速 10 倍

    哈佛理论物理学家 Matthew Schwartz 让 Claude Opus 4.5 完成一项研究生级别的计算,发现其水平大致相当于二年级研究生,并让他的研究提速 10 倍。Anthropic 表示,AI 目前还无法自主完成原创工作,但可以大幅加速研究。

  2. Alex Albert(@alexalbert__)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 可在 macOS 上直接操作用户电脑完成任务

    Claude 现已支持操作用户电脑完成任务,可打开应用、浏览网页、填写表格,目前在 Claude Cowork 和 Claude Code 中以研究预览形式提供,仅限 macOS。

3月20日周五
  1. Taranjeet(@taranjeetio)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 举办 Claude Code 开发者午餐会

    mem0 在旧金山总部举办 Claude Code SF Builders Meetup 暨开发者午餐会,活动由 mem0 主办,现场氛围热烈,主办方向到场者致谢。

3月19日周四
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 实测 200 小时时间跨度 AI:2 小时沙盘推演未来工作流

    METR 三名研究员以约 200 小时时间跨度的 AI 进行了 2 小时沙盘推演,模拟 12-18 个月后的工作方式,获得约 3-5 倍效率提升。推演中 AI 在可验证任务上表现为 200 小时达 50% 成功率、40 小时达 80% 成功率,速度为 Claude 4.6 Opus 快速模式的两倍,写作能力在有上下文时相当于 METR 初级员工。

3月18日周三
  1. Alex Albert(@alexalbert__)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 线上研讨会报名链接公布

    Anthropic 放出线上研讨会报名链接(anthropic.com/webinars/best-…),面向想了解相关内容的用户开放注册。原文未披露研讨会主题、时间与嘉宾等具体信息。

3月17日周二
  1. 宝玉的分享AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 团队分享 Claude Code Skills 的九类用法与编写技巧

    Anthropic 的 Claude Code 团队工程师 Thariq Shihipar 总结了内部数百个活跃 Skills 的使用经验,将其归为库与 API 参考、产品验证、数据获取与分析、业务流程自动化、代码脚手架、代码质量与审查、CI/CD 部署、运维手册、基础设施运维九类。

3月16日周一
  1. 宝玉的分享AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智能体工程的 8 个等级

    Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。

3月15日周日
  1. Mike Krieger(@mikeyk)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mike Krieger:Claude 非高峰时段用量翻倍至3月27日

    Anthropic 联合创始人 Mike Krieger 宣布,Claude 在周末全天以及工作日太平洋时间5点至11点以外时段用量翻倍,活动持续至3月27日。该调整覆盖 Claude.ai、Cowork 和 Claude Code,官方称这是对用户的一次答谢。

3月12日周四
  1. METRAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Anthropic Claude Opus 4.6 破坏风险报告审查

    METR 完成对 Anthropic Claude Opus 4.6 破坏风险报告两个版本的审查,建议读者参考针对 2 月 11 日版本的那份。METR 认同该模型错位行为实质促成灾难性结果的风险"非常低但不可忽略",但对对齐评估的敏感度存疑,认为其结果可能被评估意识削弱,并发现若干未被对齐评估捕捉的低严重度错位行为。METR 还建议深入调查评估意识与混淆性错位推理。

3月10日周二
  1. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR:大量通过 SWE-bench 的 PR 不会被合入主分支

    METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。

3月6日周五
  1. Mike Krieger(@mikeyk)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 员工称 Claude 每日注册人数超过一百万

    Anthropic 的 Mike Krieger 表示,现在每天有超过一百万人注册 Claude,并向选择将 Claude 纳入工作与思考方式的人表示欢迎。

3月3日周二
  1. 无人知晓AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    孟岩对话李继刚:AI 拿走脑力后,人何以自处

    播客「无人知晓」主播孟岩与李继刚对谈三个多小时,提出工业革命拿走体力、AI 正在拿走脑力,留给人的是心力。两人围绕 AI 时代的阅读、表达与教育展开,谈到提示词、Agent、上下文窗口与「Your feed is your fate」,最终回到同一个问题:人何以自处。

  2. METRAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 用 Opus 4.6 复刻两款 CLI 游戏的观察记录

    METR 让 Opus 4.6 在简单 ReAct 框架下从零实现《杀戮尖塔》和《小丑牌》的 CLI 版本,结果两款游戏都能基本可玩,但存在大量缺失或损坏的机制,作者估计自己达到同等质量需要 2 到 8 周。

3月1日周日
  1. Mike Krieger(@mikeyk)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 登顶 App Store 免费榜第一

    Claude 今日在 App Store 排名第一,Mike Krieger 发文感谢新老用户支持,并表示团队会继续努力,欢迎用户随时反馈意见。

2月28日周六
  1. Mike Krieger(@mikeyk)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 就美国战争部长 Pete Hegseth 的言论发表声明

    Mike Krieger 表示"今天为在 Anthropic 工作感到自豪",并转发 Anthropic 官方针对美国战争部长 Pete Hegseth 言论发布的声明。该声明原文发布在 Anthropic 官网新闻页,帖文附带声明链接。