跳到正文

#Anthropic

今日 74 条
7月1日周三
  1. AI Breakfast(@AiBreakfast)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    专为 Claude 优化的新键盘亮相

    一款专为 Claude 优化的新键盘亮相,主打与 Claude 交互场景。原文仅提及该键盘"optimized for Claude",未披露品牌、型号、按键布局或售价等细节,也未说明是否已上市或开源。

  2. Poe(@poe_platform)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Poe 上线 Sonnet 5 与 Nano Banana 2 Lite

    Poe 平台上线 Anthropic 的 Sonnet 5 与 Google 的 Nano Banana 2 Lite。Sonnet 5 被称为 Anthropic 迄今最具智能体能力的模型,具备 Opus 级编码与推理能力,成本更低。Nano Banana 2 Lite 是 Google 最快、最具性价比的图像模型,约 4 秒生成清晰一致的图像。

  3. Windsurf(@windsurf_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonnet 5 在 Devin Desktop/CLI 中配额消耗较 Sonnet 4.6 低约 30%

    截止 8 月 31 日,Sonnet 5 在 Devin Desktop/CLI 中消耗的配额比 Sonnet 4.6 少约 30%,此后两者配额消耗相同。

  4. Windsurf(@windsurf_ai)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Sonnet 5 上线 Devin Desktop 和 Devin CLI

    Claude Sonnet 5 现已在 Devin Desktop 和 Devin CLI 上线。该模型在提供前沿级编程性能的同时价格更实惠,并在 FrontierCode Extended 上超过 Opus 4.8。

6月30日周二
  1. Modal BlogAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Science,Modal 提供可扩展算力

    Anthropic 发布面向科学家的 AI 工作台 Claude Science,生命科学研究人员可在与 Claude 的对话中直接运行计算任务,从数据处理到结构预测再到分子设计。

6月27日周六
  1. cat(@_catwu)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 桌面版分屏功能获用户好评

    Claude Code 桌面版的分屏(split screen)功能被用户称为最喜欢的功能之一。该推文展示了这一桌面端特性的使用画面,互动数据为 381 次点赞、35 条回复、14 次转发和 55251 次浏览。

6月26日周五
  1. Junyang Lin(@JustinLin610)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    XLANG NLP Lab 发布 OSWorld 2.0,评测长时程计算机操作智能体

    XLANG NLP Lab 发布 OSWorld 2.0,用于在长时程真实任务上评测计算机操作智能体。基准包含 108 个真实工作流,每个约需熟练人类 1.6 小时,平均约 318 次工具调用,而 OSWorld 1.0 约为 30 次。

  2. Epoch AIAI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 与 METR 发布 MirrorCode:测试 AI 能独立完成多大规模的软件项目

    Epoch AI 与 METR 联合发布 MirrorCode 基准,用于测试 AI 在长周期编码任务上的能力,任务是让模型在没有原始源码的情况下端到端重写整个程序,AI 方案需在包括留出测试在内的端到端测试中与原始程序输出完全一致。

6月25日周四
  1. Windsurf(@windsurf_ai)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GLM 5.2 与 Kimi K2.7 在 FrontierCode Extended 上分别得分 43.0% 和 39.5%

    GLM 5.2 在 FrontierCode Extended 上得分 43.0%,Kimi K2.7 得分 39.5%,与 GPT-5.5(44.8%)和 Claude Opus 4.8(51.8%)处于同一竞争梯队。

  2. Eric Jing(@ericjing_ai)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark Design 发布,被 PM 用户称为自己的 ClaudeCode 时刻

    Genspark 推出 Genspark Design,官方称这是由 Claude Opus 4.7 驱动的下一代设计与创作 AI,无需设计背景即可从粗略想法做出专业设计。

6月24日周三
  1. AI Breakfast(@AiBreakfast)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动

    Genspark 推出 Genspark Design,由 Claude Opus 4.7 驱动,主打无设计背景也能从想法做出专业设计。该工具集 UI 原型、视频、HTML 动画、海报于一处,可上传 Figma 文件或保存设计稿建立品牌设计系统并在团队内复用,还能依托 Genspark Code 一键把应用或网页设计转成可运行代码。

  2. Andrej Karpathy(@karpathy)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Tag,Claude 以团队成员身份加入 Slack

    Anthropic 推出 Claude Tag,让 Claude 以团队成员身份加入 Slack,可访问所选频道和工具、被 @ 后接受任务委派。Andrej Karpathy 认为这是 LLM 交互界面的第三次重大重构,前两次分别是网页版和被下载到电脑上的应用,这一次是自带工具与组织级上下文、持续存在且异步运行的实体,与人类团队并行工作。

  3. cat(@_catwu)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Tag 的 6 个常见自定义流程

    Claude Tag 可按任意场景自定义,官方列出了 6 个内部用户和外部设计伙伴反馈较好的常见流程,其中之一是事件响应:在告警线程中 @Claude,它会拉取图表、对比部署差异,返回根因和被标记的作者,团队在线程内批准后由 Claude 提交修复、合并并持续观察指标恢复直至解决告警。

  4. cat(@_catwu)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Tag 智能体权限配置入门指南

    Anthropic 发布 Claude Tag 智能体权限配置入门指南,介绍如何设置 agent 身份以及团队在 Claude Tag 上做出的关键设计决策。相关说明可在 claude.com/blog/agent-ide 查看。

  5. cat(@_catwu)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Tag,Claude 以团队成员身份加入 Slack

    Anthropic 发布 Claude Tag,一种让团队与 Claude 协作的新方式。在 Slack 中,Claude 作为团队成员加入,可使用你指定的频道和工具,用户 @Claude 即可派发任务。Anthropic 员工表示,内部版本已合并 65% 的产品 PR,这是其首个原生支持多人协作并具备主动性的产品。

  6. Alex Albert(@alexalbert__)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出 Claude Tag,Claude 以团队成员身份加入 Slack

    Anthropic 推出 Claude Tag,让 Claude 以团队成员身份进入 Slack,可访问用户指定的频道和工具。用户通过 @Claude 派发任务,自己可同时处理其他工作;转推者称这种用法更像管理团队而非使用工具。

6月22日周一
  1. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。

6月20日周六
  1. Andrew Ng(@AndrewYNg)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    吴恩达评美政府与 Anthropic 限制前沿模型访问

    吴恩达指出,过去两周美国政府与 Anthropic 先后采取行动,通过限制他人对前沿模型的使用来展示对 AI 访问权的控制力,这将加速企业和国家寻求不受他人终止的 AI 访问渠道。

  2. Demis Hassabis(@demishassabis)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AlphaFold 负责人 John Jumper 离开 Google DeepMind 加入 Anthropic

    John Jumper 宣布在近 9 年后离开 Google DeepMind,并加入 Anthropic。Demis Hassabis 回应称双方合作 9 年,AlphaFold 的成果展示了 AI 在科学与医学领域的可能性。

6月19日周五
  1. cat(@_catwu)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 上线 Artifacts,Team 与 Enterprise 可用

    Claude Code 新增 Artifacts 功能,可基于会话生成交互页面,例如 PR 讲解或项目实时面板,并通过私有链接分享给团队成员,目前在 Team 和 Enterprise 计划的 beta 阶段提供。作者表示该功能已改变其团队内部的工作方式,适合用于沟通架构变更、数据分析和新原型。

  2. Mike Krieger(@mikeyk)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 新增 Artifacts:用交互页面呈现会话内容

    Claude Code 新增 Artifacts,可根据会话生成 PR walkthrough、项目仪表盘等交互页面,并通过私有链接分享给团队,目前以 beta 形式面向 Team 和 Enterprise 套餐开放。Mike Krieger 表示,随着 Claude 的工作越来越深入和独立,让它在 Artifacts 中解释思路与产出很有价值,建议下次用它时让它把工作画成图。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan:论文结果显示 Codex 表现优于 Claude 与 Kimi

    Jim Fan 回应称,其论文结果显示 Codex 表现优于 Claude,Claude 又优于 Kimi,并称这是一个"在物理世界中无法被作弊"的基准测试。

6月16日周二
  1. 晚点聊 LateTalkAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    访谈 Cerebras 早期投资人周楠:英伟达挑战者、Scaling Law 的萌芽与被遗忘的百度美研

    高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。

6月15日周一
  1. Import AI — Jack ClarkAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 461:Sequent 称"对齐尚未步入正轨",发布 FrontierCode 与合成研究实习生

    英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为对齐研究"尚未步入正轨",计划两年内扩至 40-80 名全职员工并首期募资 1 亿至 1.5 亿美元,研究 scalable oversight、学习理论、博弈论与 personas 等方向。

  2. Modal BlogAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 产品更新:VM Sandboxes、区域路由降延迟、RBAC 等

    Modal 发布多项产品更新,Functions 新增区域路由,可将请求经 US West、EU West 或 Asia Pacific South 转发,降低非 US East 来源的网络延迟。

6月13日周六
  1. Augment Code(@augmentcode)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 应美国政府指令暂停 Fable 5 与 Mythos 5,Augment Code 已做降级回退

    Anthropic 表示,美国政府以国家安全为由发出出口管制指令,要求暂停所有外国国民(包括身处美国境外的及 Anthropic 的外籍员工)对 Fable 5 和 Mythos 5 的全部访问,因此必须对所有客户停用这两款模型,其他 Claude 模型不受影响。

    为什么值得看

    素材记录了模型因出口管制被停用的处置过程,可观察合规事件如何传导到具体开发工具链。

  2. 宝玉的分享AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为啥 Codex 还不推出类似 Claude Design 的产品?

    Anthropic 推出的 Claude Design 能凭一句话生成高精度可交互原型,而 Codex 迟迟没有同类产品,原因是 GPT-5.5 的模型能力还扛不住这个活。作者指出 Claude Design 与 Codex 属于 Harness 产品层,真正的差距在模型层:可交互原型要求模型在画 UI 前先想清数据结构与状态管理,目前只有 Claude Opus 4.8 做到了。

  3. Alex Albert(@alexalbert__)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Fable 提示词指南

    Anthropic 的 Alex Albert 分享了 Fable 提示词指南中的一条技巧,指南还包含更多使用 Fable 的提示词方法。完整指南可在 platform.claude.com 的构建文档中查看。

6月11日周四
  1. Epoch AIAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 分析:Mythos 的网络安全能力被高估了吗?

    Epoch AI 汇总约十五个网络安全基准构建 Cyber-ECI,评估 Anthropic Claude Mythos 系列在攻防能力上的真实位置。

  2. Dario Amodei(@DarioAmodei)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布前沿 AI 风险治理提案与就业转型政策框架

    Anthropic 发布提案,阐述政府应如何应对前沿 AI 带来的风险,并同步推出针对就业流失的政策框架,Anthropic 表示将为此提供大额资金支持。

  3. Dario Amodei(@DarioAmodei)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei:这些 AI 政策主张迟早要行动,越早越好

    Dario Amodei 表示,许多 AI 政策主张在政治光谱上都有常识性吸引力,越早采取行动,就能越早让所有人共享 AI 带来的好处。

  4. Dario Amodei(@DarioAmodei)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei:Anthropic 主张对前沿 AI 的透明度要求已不再足够

    Anthropic 长期主张对前沿 AI 施加透明度要求,理由是风险尚不够清晰、难以精准监管。Dario Amodei 表示,这种做法如今已不再足够。

6月10日周三
  1. AI炼金术AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    王昊奋:大模型越强,知识图谱反而越重要——本体是 AI Agent 的 harness

    同济大学长聘教授、OpenKG 发起人王昊奋认为,大模型越强,本体和知识图谱反而越重要,它们正是 AI Agent 所需的 harness。他把落地路线分为两派:Palantir 走本体优先、模型靠边,Claude 走模型优先、再补 MCP 与 skill,并称两者最终会你中有我。他还强调现有 AI 找的是相关性而非因果,严肃决策的解释权仍须握在人手里。

  2. Monica_IM(@hey_im_monica)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 上线 Monica AI,Anthropic 最强公开模型

    Claude Fable 5 正式上线 Monica AI,号称是 Anthropic 迄今最强的公开模型。该模型在编码、推理、视觉和长上下文任务上达到 SOTA,Stripe 借助它将数月的工程工作压缩到数天完成。

  3. Alex Albert(@alexalbert__)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alex Albert 分享 Fable 使用四条建议并重置各产品用量限制

    Anthropic 的 Alex Albert 表示已重置旗下各产品的用量限制,并为刚开始测试 Fable 的用户给出四条使用建议。

  4. Poe(@poe_platform)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 上线 Poe,面向长时复杂任务

    Poe 宣布 Claude Fable 5 已在其平台上线,称这是 Anthropic 迄今能力最强的模型,面向长时间运行的复杂工作,包括大规模代码迁移、深度研究和可运行数小时乃至数天的智能体会话。该模型在几乎所有测试基准上达到 SOTA,在编码、知识工作、科学研究和视觉方面表现突出,可通过 poe.com/Claude-Fable-5 使用。

  5. Scott Wu(@ScottWu46)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5 登陆 Devin,登顶 FrontierCode 基准

    Claude Fable 5 已在 Cognition 的 Devin 中上线,并在 FrontierCode 基准上拿下第一,该基准针对真实工程任务评估代码可合并性与质量。在最难任务上,其 FrontierCode Diamond 得分从 Opus 4.8 的 13.4% 提升至 29.3%。该基准发布仅一天后便迎来这一新登顶者。

  6. Andrej Karpathy(@karpathy)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 评 Claude Fable 5:同源 Mythos 加安全措施,多项基准达 SOTA

    Andrej Karpathy 称 Claude Fable 5 与 Mythos 是同一个底层模型,区别在于增加了安全措施,并在几乎所有测试基准上达到 SOTA。

  7. v0(@v0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    v0 上线 Claude Fable 5,面向 Premium 和 Team 套餐开放

    v0 宣布 Claude Fable 5 现可在 v0 中使用,面向 Premium 和 Team 套餐开放,入口为 v0.app。所引 Anthropic 内容称 Claude Fable 5 是 Mythos 级模型,在面向通用场景开放前已做安全处理,能力超过其此前任何已开放模型。

  8. Alex Albert(@alexalbert__)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Fable 5,称其能力超过此前所有公开模型

    Anthropic 发布 Claude Fable 5,描述为 Mythos 级模型,并称已将其做到可供通用使用,能力超过此前任何面向公众开放的模型。