跳到正文

#Anthropic

今日 10 条
今天10月10日周六
  1. garymarcus.substack.comAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Gary Marcus 呼吁立即将带互联网访问的开放式 AI 智能体下架召回

    Gary Marcus 援引《纽约时报》报道的 Anthropic 智能体事故,呼吁将可访问互联网的开放式 AI 智能体立即下架召回,直至其缺陷被修复。他指出当前一代合成智能体不可信任,并以刹车失灵的汽车作比;同时引用前 AI 员工 David Robinson 的说法,认为 OpenAI 及同行在能力更强、风险更高的技术上安全投入不足。

  2. 硅星人ProAI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会为何不再是“科技春晚”:AI 大会也还没接住这个位置

    苹果发布会正逐渐失去“科技春晚”的光环:供应链爆料让新品提前曝光,2020 年后转为提前录制,智能手机进入成熟期后创新更多体现为性能与体验优化。与此同时注意力转向 AI 发布会,2024 年 5 月 OpenAI 发布 GPT-4o、DeepSeek R1 发布都引发大范围讨论。

  3. 深思圈AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stripe 创始人 John Collison:AI agent 将重写整个互联网

    Stripe 联合创始人 John Collison 在 Sourcery 播客访谈中判断,AI agent 将重写商业与互联网,因为 computer use 是"通往真实世界的终极向后兼容层",AI 无需等 DMV 等机构改造网站就能直接操作现有界面办事。

  4. Tw93(@HiTw93)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex Pro 200 美元额度体感只有 Claude Max 200 美元账号 1/4

    用户体感 Codex Pro 200 美元套餐额度不足 Claude Max 200 美元账号的 1/4,前者使用 GPT-6 Astra Medium,后者使用 opus 5.5 high。正常使用下几乎一天就能用掉一个 Codex 重置周额度,约 2 天可将赠送的 62500 积分(约 2500 美元 Credits)用完。

  5. 腾讯科技AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果发布会的光环为何褪去:AI 开发者大会接棒“科技春晚”

    苹果发布会的“科技春晚”地位正在消退,OpenAI、Google、Anthropic 等 AI 开发者大会成为新的关注中心。2026 年 9 月 OpenAI DevDay 发布二十多项更新,重点推出可长期运行的个人 Agent Dots,并新增每月 500 美元会员档位、调整 GPT-6.1 Sol 价格体系,但新能力增量有限、悬念减弱。

  6. 向阳乔木(@vista8)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前端审美类工作只能切到 Claude 和 Kimi K3,作者感叹不知 Kimi 何时发新模型

    一位用户表示,凡是需要前端审美水平高一些的工作,就只能切换到 Claude 和 Kimi K3 来完成。他因此认为 Kimi 表现很牛,同时好奇 Kimi 什么时候发布新模型。

  7. Lenny Rachitsky(@lennysan)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sonnet 5.5 在对比中胜过 Asta 和 Sol

    Sonnet 5.5 在与 Asta 和 Sol 的对比中胜出,这一结果被评价为"wild"。原文未披露具体评测项目、分数或对比条件,仅提及该表现令人意外。

  8. Ed Zitron's Where's Your Ed AtAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ed Zitron 的垃圾债指南:AI 数据中心如何被高收益债与杠杆贷款撑起

    2026 年上半年垃圾债发行量达 2290 亿美元,而投资级债券为 8059 亿美元,垃圾债市场已膨胀至投资级市场的 28.4%,较 2011 年上半年的 30 亿美元增长 75 倍。

  9. Justine Moore(@venturetwins)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    教皇 Leo XIV 再发推暗讽 Anthropic:智能必须依赖记忆,而非像算法一样编译数据

    教皇 Leo XIV 在推文中称智能必须依靠记忆,人脑不应像算法那样只快速编译数据,而应回忆包含深层意义的亲身经历。该推文被解读为再次影射 Anthropic,附带的 vatican.va 链接指向其原帖。

  10. THE DECODERAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    16 岁少年用 Claude 规划登山路线,被困悬崖后直升机救援

    一名 16 岁少年用 Anthropic 的 Claude 规划加拿大 Crown Mountain 登顶路线,结果被困在需要攀岩装备的陡峭崖壁 "Widowmaker Arete" 上一处五英尺宽的岩台,最终由 North Shore Rescue 出动直升机吊救。

10月9日周五
  1. 宝玉(@dotey)AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》发布:AI 参与自身研发,智能体闯进真实系统

    《State of AI Report 2026》10 月 8 日发布,第九期由 Air Street Capital 的 Nathan Benaich 牵头,正文 240 多页,分研究、产业、政治、安全、预测五部分。

  2. ChinaTalkAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kevin Roose 谈 AGI 信徒:手握股权的奥本海默

    Kevin Roose 与研究员 Jasmine Sun 做客 ChinaTalk,讲述他新书《The AGI Chronicles》中 OpenAI、Anthropic、DeepMind 的历史,以及那群过度思考并担忧人工智能的人。Kevin 此前供职于《纽约时报》。

  3. 有机大橘子AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 之后:游戏、软件、硬件的门槛都在消失,一切终将开源?

    Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。

  4. 知行小酒馆AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    知行小酒馆 E253:AI 会改变世界,可它真的有让世界变好吗?

    知行小酒馆第 253 期邀请益盒 CharityBox 联合创始人治霖,讨论 AI 是否真正改善了弱势群体的生活。节目引用数据显示,截至 2026 年第一季度全球劳动年龄人口 AI 使用率为 17.8%,仍有 6.55 亿人缺乏电力;2026 年美国四大科技企业在 AI 领域投入预计超过 6500 亿美元,而将全球贫困率降至 1% 每年需 3040 亿美元。

  5. 刘小排rAI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    韩国七家金融机构被黑事件:攻击者用 ARTEX 和 Claude Code、DeepSeek 等 AI 工具

    9月28日起,新韩银行等七家韩国金融机构遭渗透,6万多人信息外泄,韩国总统下令彻查。研究人员发现疑似攻击服务器运行开源工具 ARTEX(自主渗透测试控制台),主要接入 DeepSeek,其他会话还使用 GLM、Grok 和 Claude Code,服务器目录浏览未关,配置文件、CLAUDE.md 与 AI 聊天记录可被直接读取。

  6. dbaplus社群AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向量数据库凉了?Claude Code、Cursor 为何集体抛弃 RAG?

    文章指出,2025 年 5 月 Anthropic 把向量搜索从 Claude Code 中移除,改用 grep,作者 Boris Cherny 称结果全面胜出且优势很大;此后 Cursor、Windsurf、Cline、Devin、Sourcegraph Amp 相继转向工具驱动的 agentic 检索。

  7. 跨国串门儿计划AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程师谈 Claude Code:提示词、运行框架与 Agent 安全边界

    Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。

  8. 有新NewinAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《State of AI Report 2026》:OpenAI 与 Anthropic 亲自下场做交付,软件产业分工正被改写

    10 月 8 日发布的《State of AI Report 2026》指出,OpenAI 与 Anthropic 今年 5 月组建企业部署服务公司,前线工程师进入客户现场把模型接入业务系统并持续维护。

  9. MIT Technology ReviewAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MIT科技评论:我们过于信任AI说「不」的能力

    AI安全高度依赖模型的「拒绝」能力,但这一机制既不可靠也可能被滥用。文章梳理了拒绝行为的训练方式与高维激活空间原理,并指出分类器叠加的「瑞士奶酪模型」存在漏洞,过度拒绝已导致正常提问被误拦;同时OpenAI与阿联酋等国家的合作、Anthropic与Google等模型对威权政府相关提问的差异化拒绝,都显示拒绝正在成为审查工具。

  10. AI Will(@FinanceYF5)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 列出它可取代人类的 20 种工作

    Claude Opus 5.5 列出了自己能够取代人类的 20 种工作。该内容由 X 平台账号 AI Will 发布,帖文显示获得 1115 次浏览。

  11. AI Will(@FinanceYF5)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Opus 5.5 列出将被 AI 取代的 20 种工作

    Claude Opus 5.5 列出了 20 种将被 AI 取代的人类工作。该内容源自 Min Choi 在 X 上发布的推文,并引用了 Claude Opus 5.5 的输出。

  12. AI Will(@FinanceYF5)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    70 位 AI 从业者给全球实验室划分梯队:仅 Anthropic 和 OpenAI 获 Frontier 共识

    70 位 AI 从业者对全球主要实验室划分梯队,只有 Anthropic 和 OpenAI 获得 Frontier 共识,即至少 75% 受访者将二者选入同一档。

  13. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Chris Barber 调查 70 位 AI 从业者:Anthropic 与 OpenAI 位居前沿,Google DeepMind 和 xAI 落后一代

    Chris Barber 询问 70 位 AI 数据公司工程师、研究员、创始人和实验室人员,将各 AI 实验室按代际分层。Anthropic 和 OpenAI 获共识评为前沿(frontier),Google DeepMind 与 xAI 获共识评为 n-1。

  14. AI Will(@FinanceYF5)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    给 Claude 布置的任务:预测未来

    有人让 Claude 尝试预测未来,并发布了完整 6 分钟的视频记录。内容来自 makevoid 发布的推文,展示把"预测未来"这一任务交给 Claude 后的结果。

  15. AI Will(@FinanceYF5)AI 评估 · 4/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    makevoid 质疑为何人们痴迷于 Opus 生成的 vi 内容

    开发者 makevoid 在 X 上发帖,表示不理解人们为何对 Opus 生成的 vi 内容如此痴迷,并附上了一段视频。该帖引用了另一条推文,帖文数据为 635 次浏览。

  16. 歸藏(guizang.ai)(@op7418)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Opus 5.5 订阅整合 Midjourney 与 Suno?多数功能尚未实装上线

    有用户称在 Opus 5.5 订阅中可使用 Midjourney 创建图片、Suno 生成音乐,但据其了解,这些功能很多都没有实装,Midjourney 和 Suno 尚未上线。部分任务已开始由 Opus 5.5 驱动,但用户不能主动选择。

  17. 歸藏(guizang.ai)(@op7418)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    国产厂商视角下 Anthropic 为何令人反感

    针对有人质疑"这有啥恶心的",作者认为立场决定判断:站在国产厂商一边,Anthropic 的做法当然令人反感。他同时提醒,不应因为 Anthropic 近期模型变强,就忘记它此前做过的事,转而替它说话。

  18. 歸藏(guizang.ai)(@op7418)AI 评估 · 5/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    作者回应因批评 Anthropic 而遭到的攻击言论

    针对因自己批评 Anthropic 而引来评论区攻击的人,作者回应称希望他们账号被封时不要抱怨。该内容未涉及具体产品或功能信息。

  19. 歸藏(guizang.ai)(@op7418)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型强该用用,怎么公司还说不得了

    有观点认为,模型能力强就该用,不该因为对某家公司有意见就避而不谈;并反问那些反对者,应该也没有 A÷ 的股份。

  20. elvis(@omarsar0)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Opus 5.5 搭建个人智能体团队,实现 agent 间通信

    有开发者用 Opus 5.5 搭建了带个人智能体上层的 agent-to-agent 通信系统,并称模型协调能力超出预期。他从单个 Claude Code 会话起步,先转向 subagent 多智能体并行,再构建了类似 Grok Bot 的常驻智能体团队,包含 CFO、CTO、CMO 等约 8 个专业 bot,一个月前开始试验 agent 间通信。

  21. orange.ai(@oran_ge)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用完 Opus5.5 之后,程序员的职业发展路径该如何调整?

    有开发者发帖提问:用完 Opus5.5 之后,工程师和程序员接下来的职业发展路径需要如何调整,并强调希望认真讨论而非吐槽。该帖获 171 条回复、21 次转发、403 个点赞和 200939 次浏览。

  22. a16z(@a16z)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 谈 CFO 角色演变:从会计师到银行家再到构建者,整个财务职能正在被 AI 重建

    a16z 认为 CFO 角色已从会计师、银行家转向"构建者",整个财务职能正围绕 AI 重建:AI 跨系统抓取并对账数据,AI 原生工具数天内上线并把月度结账变成每日;精通 Claude Code 或 Codex 的财务人员开始自建工具,最精简团队中财务占员工比例从 5% 走向 2%。

10月8日周四
  1. 硅星人ProAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 为何越来越不说人话:从 Coding 过拟合到文言文式压缩

    开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。

  2. cat(@_catwu)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队征集改进建议

    Claude Code 团队公开向用户征集改进意见,邀请用户提出希望 Claude Code 改进的方向。该帖获得 39 条回复、57 次点赞和 7612 次浏览。

  3. Feed: Artificial Intelligence LatestAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    三名工程师让 GPT、Claude 和 Grok 驾驶丰田卡罗拉去买 In-N-Out

    三名工程师把 GPT、Claude 和 Grok 接入一辆真实的丰田卡罗拉,让它们分别负责驾驶,目标是开到 In-N-Out。三家模型里只有一个成功完成任务。

10月7日周三
  1. Latent.Space(@latentspacepod)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stacklok:让 Kubernetes 创始人把 AI 智能体 harness 搬上云端

    两名 Kubernetes 创始人 Craig McLuckie 与 Joe Beda 创办 Stacklok,目标是把 AI 智能体 harness 完整带入云端,他们称之为 "cloud-native harness"。尽管 OpenAI 和 Anthropic 近期进展明显,云端智能体 harness 仍未完全解决。

  2. 笔记侠AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前亚马逊 Rufus 创始成员:5年后手机购物 App 会消失

    前亚马逊 Rufus 项目创始成员判断,5年后手机上的购物 App 会消失,入口交给能自己完成搜索、比较、下单的购物 Agent。亚马逊 Rufus 2023 年启动时仅七八人、约两个月做出演示版本,团队后扩至数百人;其公式为 Agent = 强模型 + 上下文 + 多步执行。

  3. 腾讯科技AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    辛顿首次参与递归自我改进研究:AI已开始参与造AI,人类或只剩一两年准备监管

    辛顿转发22位AI研究人员署名论文《如果AI研发自动化引发智能爆炸?》,首次正式参与递归自我改进(RSI)研究。论文援引Anthropic数据:AI生成获批代码占比从2025年1月的个位数升至2026年5月的超80%,Claude自主完成的内部AI研发工作比例从3月的约1%升至8月的26%。辛顿警告,若AI能力继续指数级加速,留给人类建立监管与安全机制的时间可能只有一两年。

  4. 国际大厂AI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JPMorgan CEO Jamie Dimon:Anthropic 的 Mythos 加剧了 AI 网络安全风险

    JPMorgan Chase CEO Jamie Dimon 表示,Anthropic 的 Mythos 大幅加剧了 AI 网络安全风险。他指出,AI 的进步已使网络安全风险急剧上升。

  5. Yangyi(@Yangyixxxx)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 封号不退款,X 广告账户万余美金余额因一次拒审全面停摆

    有用户反映 Claude 封号后不退款,损失 200 美金;同时 X 企业广告账户因一条广告进入审核,此后所有广告投放均被直接拒审,账户内一万多美金广告费无法动用。其联系 business support、官网经理及半年前对接的广告经理均无任何反馈,邮件连发 3 封未获回复。