跳到正文

#Anthropic

今日 78 条
8月29日周六
  1. Anthropic(@AnthropicAI)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 新研究:Claude 能否自主对齐其他 AI

    Anthropic 公布新 Fellows 研究,测试 Claude 能否自主完成对其他 AI 的对齐工作。研究给 Claude 48 小时和 1 块 GPU,让它自行调研并提出方法,再独立训练和测试小模型,Anthropic 称效果出乎意料地好。

8月28日周五
  1. Anton Osika – eu/acc(@antonosika)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anton Osika 支持 OpenAI 集体网络防御倡议

    随着模型能力提升,网络攻击将更复杂,防御方采用技术的速度必须快于攻击方。Anton Osika 因此支持 OpenAI 发起的集体网络防御倡议。该公开信已获包括 Anthropic、AWS、Google、Microsoft、OpenAI 和 Oracle 在内的 100 多家组织签署。

  2. 宝玉的分享AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Warp 如何让 Agent 自我进化:用人类反馈改进代码审查 Skill

    Claude 博文《How Warp builds self-improving agents on Claude》介绍了终端工具 Warp 的内部实践:让 Agent 做代码审查时,问题不在于能力而在于缺少项目规范和历史经验的记忆,手动改系统提示词、完善 AGENTS.md 效果都不理想。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford 发布 Terminal-Bench-Science:面向科研工作流的 AI 智能体基准

    Stanford 联合全球科研机构专家发布 Terminal-Bench-Science,用于评估 AI 智能体在跨科学领域科研工作流中的表现,v0.1 版本包含 70 项任务。Claude Opus 5 在该基准上仅解出约 30%。该基准由 Terminal-Bench 团队打造,是一项持续进行的 Stanford 主导社区项目。

  4. Anthropic(@AnthropicAI)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 HHMI 合作推出 Model Hardware Standard

    Anthropic 与 @hhmi_science 合作,Model Hardware Standard 由此诞生。推文附视频讲述该标准的起源故事,未披露具体技术细节或发布时间。

  5. Anthropic(@AnthropicAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 邀请科学、机器人、电子与制造领域伙伴参与 MHS 研究预览

    Anthropic 邀请科学、机器人、电子与制造领域的相关方加入 MHS 研究预览,共同参与标准制定。官方表示将携手行业伙伴推进 MHS,并随后面向开源社区开放。

  6. Anthropic(@AnthropicAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic:开源 MHS 前仍需更多研究,LLM 缺乏物理直觉

    Anthropic 表示,开源 MHS 之前还有更多需要学习的地方,原因是 LLM 从文本和图像中学习物理世界,仍缺乏物理直觉。该研究预览版将用于构建更多安全评估,并加强对 AI 在物理世界中应用的防护。

  7. Anthropic(@AnthropicAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究预览将 MHS 扩展至开发板与摄像头等设备

    Anthropic 表示 MHS 目前对实验室与制造设备的覆盖最完善,不少开发者已用 Claude Code 操作开发板和摄像头等硬件。其研究预览将把 MHS 扩展到这些设备,使它们能在同一界面下工作。

  8. Anthropic(@AnthropicAI)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 启动 Model Hardware Standard(MHS)研究预览第一阶段

    Anthropic 启动 Model Hardware Standard(MHS)研究预览第一阶段,这是一项让 AI 智能体安全操作科研与先进制造中实体设备的新标准。更多细节见 anthropic.com/news/model-hardw。

  9. Anthropic(@AnthropicAI)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 早期测试:AI 智能体用 MHS 将量子计算机激光稳定率从 58% 提升至 99.3%

    AI 智能体在早期测试中使用 MHS 完成了多项实验:在 Genentech 实现带实时错误处理的药物发现实验,在 HHMI Janelia Research Campus 将成像实验从数周压缩到一天,并在 QuEra 的量子计算机上将激光稳定率从 58% 提升至 99.3%。

  10. Anthropic(@AnthropicAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 MHS:把 AI 接入硬件的集成时间从数天缩短到数小时

    Anthropic 发布 MHS,将 AI 与硬件的定制集成从数天或数周压缩到数小时甚至数分钟,并提供统一接口让设备可被发现、让智能体安全操作设备。原文称此前没有让智能体安全操作设备的标准方式。

  11. Greg Brockman(@gdb)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic、OpenAI、Google 等 100 多家机构联署公开信,呼吁全球加强网络防御

    Anthropic、AWS、Google、Microsoft、OpenAI、Oracle 等 100 多家机构联署公开信,呼吁全球加大网络防御力度。信中主张以全球性行动应对网络安全威胁,联署方覆盖主要云厂商与 AI 公司。

8月27日周四
  1. AI炼金术AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 原生组织转型 02:用 AI 推进流程、闭环迭代

    AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。

  2. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 更新 AI 最关键的数字:OpenAI 与 Anthropic 收入增长追踪

    Epoch AI 更新对 OpenAI 与 Anthropic 收入增长的追踪:OpenAI 过去一年收入 run rate 从 130 亿美元增至超 400 亿美元,Anthropic 2026 年第一季度 run rate 增长逾两倍,据报道 7 月底达 650 亿美元。

  3. AWS Architecture BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gallup 基于 Amazon Bedrock 打造 Gallup AI,为数万组织提供实时教练服务

    Gallup 基于 Amazon Bedrock 构建生成式 AI 助手 Gallup AI,将其 90 余年职场研究转化为实时个性化教练,直接嵌入 Gallup Access 应用。

  4. Anthropic(@AnthropicAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SALT Lab 研究:超半数人机协作对话涉及高影响任务

    SALT Lab 研究了人们如何与 AI 协作,发现其中超过一半的对话涉及"高影响任务"——即会影响他人或难以撤销的工作。该团队已在 alphaXiv 发布完整研究文章。

  5. Anthropic(@AnthropicAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 开放研究工具申请,寻求扩大研究模型规模

    Anthropic 表示希望扩大其研究模型的规模,并面向研究人员开放工具申请,邀请从事目前无法完成的研究工作的人提交意向。申请通过 forms.gle 表单提交。

  6. Anthropic(@AnthropicAI)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic:HIP Lab 与 METR 两项关于 Claude 的研究仍在进行中

    Anthropic 透露两项关于 Claude 的研究仍在进行:HIP Lab 正在研究 Claude 的行为与人们使用 AI 时感受之间的关系,METR 则在估算编程智能体带来的真实生产力增益。Anthropic 表示很快会分享这两项研究的更多内容。

  7. Anthropic(@AnthropicAI)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 向外部研究者开放隐私处理后的 Claude 使用数据

    Anthropic 首次向外部研究者提供研究 AI 影响的方式,所用数据来自真实且经过隐私保护的 Claude 使用数据。Anthropic 表示这类研究此前只能在 AI 实验室内部进行,并称无法独自讲清全部情况,因此开放了自家工具。

  8. LangChain BlogAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为何重构自家 Chatbot,以及其中的经验

    LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。

  9. LangChain BlogAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 公测 LangSmith LLM Gateway,为生产 Agent 提供运行时控制

    LangSmith LLM Gateway 进入公开 beta,作为位于 Agent 与模型之间的治理层,集中施加运行时控制。它支持组织、工作区、API key 和用户四级的限时支出上限与速率限制,命中上限时向 Agent 返回 402 响应;还可按自定义请求头识别终端客户,在多租户场景下用单个 API key 分别控制各客户的支出与速率。

8月26日周三
  1. 歸藏的AI工具箱AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智谱 GLM-5.3 Flash 开源:匿名模型 Ox Alpha 揭晓,价格远超 DeepSeek V4 Flash

    匿名上线 OpenRouter 的 Ox Alpha 正式揭晓为智谱 GLM-5.3 Flash,并已 MIT 开源上架 API。

    为什么值得看

    作者用三个有技术门槛的前端复刻案例实测该模型的多模态理解与编码能力,并给出与 DeepSeek V4 Flash 的对比。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将为所有 Claude 模型嵌入不可见水印以符合 EU AI Act

    为符合 EU AI Act 等新法规,Anthropic 将在所有未来的 Claude 模型中嵌入不可见水印,并最终覆盖较旧的模型。文本生成方面,Claude 采用 Google 的 SynthID 方法,通过种子生成器引导词汇选择形成统计模式,再由评分 API 检测;图像方面则嵌入 C2PA 元数据。

  3. Paul Couvert(@itsPaulAi)AI 评估 · 77/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen3.8-Flash 开源权重发布,预览 Qwen4 新架构

    阿里发布 Qwen3.8-Flash 的开源权重,这是一个多模态 MoE 模型,也是 Qwen4 架构的早期预览版,生产版本将随后通过 QwenCloud API 提供,定价为输入 $0.16/1M tokens、输出 $0.47/1M tokens。

    为什么值得看

    这条内容汇总了 Qwen3.8-Flash 的架构变化、激活参数与基准分数,便于对照同类开源模型的性价比路线。

  4. What's Next|科技早知道AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个中国 FDE 的光环、落差与「救火」日常

    2026 年 FDE(前线部署工程师)被称为「硅谷最性感的工作」,全球岗位数量过去两年增长了几十倍,OpenAI、Anthropic 等公司纷纷组建 AI 部署团队帮客户解决落地「最后一公里」。

  5. ollama(@ollama)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ollama v0.33 发布:一键配置 Claude Desktop 接入 Ollama 网关

    Ollama v0.33 发布,可将 Claude Desktop 配置为第三方网关提供方接入 Ollama,只需一个开关,云端与本地模型即可直接使用。该版本强调配置流程的简化,未披露更多技术细节。

  6. Latent.Space(@latentspacepod)AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 推出 Forward Deployed Engineering 播客,首期聚焦企业级语音智能体

    Latent.Space 与 @realbasilchatha 合作推出新的 Forward Deployed Engineering 播客栏目。

  7. cat(@_catwu)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 在 Chat 与 Cowork 之间统一记忆

    Anthropic 员工 cat 表示,根据用户反馈,Claude 已在 Chat 和 Cowork 之间统一记忆,用户只需告诉 Claude 记住一次,该上下文就能跨界面使用。引用内容称 Claude 现在在 chat 与 Claude Cowork 共用一份记忆且由用户决定其内容,把任务交给 Cowork 时,它会从过往对话中已知的信息起步。

8月24日周一
  1. 宝玉的分享AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    我的 AI 原生开发流程:用 Claude Code 给 BaoCut 加远程转录功能的完整复盘

    作者用 Claude Code 给字幕转录翻译 App BaoCut 加远程转录功能,把可行性分析、设计文档、高精度原型、编码、测试五个环节全部交给 Agent 执行,人只在关键节点确认和拍板。

8月22日周六
  1. AI炼金术AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 原生组织转型 01:用 AI 对齐事实、对齐打法

    AI 原生组织转型系列第一期提出,AI 不是组织的工具而是组织的替代品,应让 AI 接管对齐事实与对齐打法。作者认为知识工作约 60% 的时间耗在开会与协调上,局部提效动不了这个大头;AI 可把 N×N 沟通变成 N,并用 skill、检查点等方式把规范写进执行环境。文中列举出门问问、安克创新、Claude Tag、ZooClaw 等正在发生的做法。

  2. Ahead of AI — Sebastian RaschkaAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 文本水印如何工作:Anthropic 的水印机制解析

    Anthropic 宣布将为 Claude 模型的文本输出加水印,该水印对用户不可见,只有 Anthropic 能解码并判断文本是否由其模型生成。Sebastian Raschka 用 52 张幻灯片、48 分钟视频讲解了这一机制,并附有讲义文字稿,还讨论了水印可能失效或被移除的情况。

  3. DeepLearning.AI(@DeepLearningAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Grok 4.6 发布挑战 OpenAI 与 Anthropic,Anthropic 为 Claude 加水印,阿里开源 Qwen3.8 Max

    SpaceXAI 发布 Grok 4.6,直接挑战 OpenAI 和 Anthropic 的顶级模型。Anthropic 正为所有新 Claude 模型添加不可见水印,阿里则发布 2.4 万亿参数的开源权重模型 Qwen3.8 Max。研究者还构建了 Agentic ASR,像人类编辑一样修正语音转文字错误。

  4. SemiAnalysisAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:开源模型正在追上闭源前沿吗?

    SemiAnalysis 按早期扩展、推理、智能体三个时代分别用当时的基准和自建评测栈给模型打分,发现开源模型追上每个时代首个闭源模型所需时间逐代减半:早期从 Llama-2-70B 到 Llama-3.1-405B 历时一年多。

8月20日周四
  1. 海外独角兽AI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DeepSeek Harness 发布:一套可热重载、可由 coding agent 自行修改的 Agent Harness

    DeepSeek Harness(DSH)发布了一套可热重载的 harness,设计成适合 coding agent 自己修改和进化的形态,以本地 Web UI 为主要入口,并提供标准、PTC/Code、极简、创造四个模式。

    为什么值得看

    梳理 DeepSeek Harness 的插件化三层结构与 Creator 模式,读者可对照 Anthropic 路线理解两种 harness 设计取舍。

8月19日周三
  1. 前端充电宝AI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex凉了,凉得理所当然:前端开发者转向 Claude Code

    有观点认为,随着 AI 能力需回归 JavaScript / TypeScript 生产环境,前端开发者不必再先学 Python,可直接用 Anthropic 的 Claude Code 读代码库、写代码、调试并在终端跑工程级任务。文章称越来越多职位要求“能用 Claude Code 做前端工程化”,并借此推广一套 AI 算法就业课程,承诺未达 28W 年薪或涨幅低于 40% 全额退款。

8月18日周二
  1. Firecrawl(@firecrawl_dev)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Firecrawl 为 Claude 推出官方连接器,SimpleQA 得分 94.7%

    Firecrawl 发布面向 Claude 的官方连接器,为 AI 智能体加入网络搜索能力,在 SimpleQA 上得分 94.7%。该连接器由其实时索引驱动,覆盖研究场景与开放网络,可提供更新鲜的结果,目前已在 Anthropic 连接器目录上线。

  2. AI Breakfast(@AiBreakfast)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 年化运行收入突破 650 亿美元,IPO 预计 9 月或 10 月

    Anthropic 年化运行收入在 7 月底突破 650 亿美元,约为去年 12 月的 7 倍;Greg Brockman 称 OpenAI 该数字为 400 亿美元。据 Axios 报道,Anthropic 的 IPO 预计在 9 月或 10 月进行,摩根士丹利、高盛和摩根大通参与承销。

  3. 此话当真AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从「同事.skill」到「人生系统」:两个年轻 Builder 的公开实验

    周天奕花四小时用 Claude 做出「同事.skill」,可读取飞书、钉钉、Slack、微信聊天记录及 Markdown 文档,把人的技术能力、沟通风格和决策习惯「蒸馏」成可调用的 AI 技能包,上线 5 天在 GitHub 收获 7.3k 星标、累计 23k,衍生出 200 多个 skills。

8月17日周一
  1. Import AI — Jack ClarkAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 469:DiG-bench 评测科学 AI、RSI 模拟器与扎克伯格的技术悲观主义

    Import AI 第 469 期介绍新基准 DiG-bench,用 70 款隐藏规则的文字游戏测试 AI 自主发现环境规律的能力,Claude Opus 5 与 Fable 5 配合 Claude Code 表现最佳,GPT-5.5 紧随其后,但仅 Opus 5 和 Fable 5 能在最难的第 7 档取得 0.2 的成绩。

  2. 百度Geek说AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    商业客户端 Harness 资产管理实践:ACX 仓库插件化与三层治理

    商业客户端将 Harness 资产部署从单文件同步演进为 ACX 仓库整体插件化,提出「ACX 唯一事实源 + 三层资产治理 + 每日自动同步」方案,以应对多产品线、多 Agent、多台 Mac 本地部署带来的配置漂移与规则冲突。