跳到正文

#Agent

今日 0 条
10月4日周日
  1. 小互(@imxiaohu)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    苹果收紧 Mac 完全磁盘访问权限,要求用户明确操作才能授权

    苹果于10月2日宣布收紧 Mac 的完全磁盘访问权限,任何应用获取该权限都必须经过非常明确的用户操作许可。苹果称完全磁盘访问会绕过其大部分隐私限制,部分开发者的使用方式可能让用户在不知情下暴露文件、邮件、消息乃至浏览记录,通信应用还可能影响他人隐私。苹果表示随着 AI 智能体的能力和自主性不断增强,这种权限带来的风险会显著上升,用户需在授权前清楚理解风险才能作出知情选择。

  2. Geek(@geekbb)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    把 AI 的 UI 设计能力推到极限:让 Agent 先定设计方向再截图迭代

    有人开源了 oil-ui 项目,探索用 AI 生成高质量界面设计的边界。其做法是让 Agent 做界面设计时先按品类和品牌推出设计方向、产出多套可对比方案,再用实际截图迭代,避免直接套用模型的默认审美模板。项目地址为 github.com/oil-oil/oil-ui。

  3. 赛博禅心AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 投入 1 亿美元成立 Claude Frontier Academy,计划 2027 年底培养 1 万名 FDE

    Anthropic 宣布投入 1 亿美元成立 Claude Frontier Academy(Claude 前沿学院),计划在 2027 年底前培养 1 万名 FDE(Frontier Deployed Engineer,前沿部署工程师)。

  4. 有机大橘子AI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    深入讨论 Muse:最火的 Personal Agent

    播客 Next Token 第四期讨论 Meta 的 Personal Agent 产品 Muse,认为它把云端电脑和易用性结合,让 Agent 从小众极客走向大众。

  5. 掘金本周最热AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 分享如何用 AI 迁移 Compose 项目

    Meta 分享了 Instagram Direct 迁移 Jetpack Compose 的经验:迁移后 UI 代码量减少 50%,AI Agent 执行时间下降 35%,工程师与 Agent 往返次数减少 32%,单次 Agent Session 的 Token 成本降低 33%。

  6. 吴晓波频道AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    首届青年企业家传承大会:吴晓波频道与青承社发布《企业传承大调研》,青承智能体首次亮相

    吴晓波频道联合青承社发起首届青年企业家传承大会,将于10月29—30日在杭州举行,并发布《中国企业传承调研报告》,“青承智能体”首次亮相。青承社由民营企二代自主组织,其《企业传承大调研》问卷围绕接班破局、代际理念与企业治理等六层面收集真实接班经历。大会还将讨论AI转型与新商业实践,吴晓波、鲁伟鼎、秦朔等将发表主题演讲。

  7. Amjad Masad(@amasad)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可训练自己的替代者

    Replit CEO Amjad Masad 提出一种"模型训练自己的替代者"的构想:通用模型在执行任务时发现用例有限,便会即时训练一个更专精的小模型来接替自己,类似即时编译器在执行动态代码时生成优化后的机器码。这类专精模型成本更低、更不易被提示词注入攻击、危害性也更小,因为能力更弱。他表示这方面讨论远少于递归自我改进。

  8. a16z(@a16z)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Replit CEO Amjad Masad:通用模型可即时训练更小、更垂直的替代模型

    Replit CEO Amjad Masad 提出"模型训练自己的替代者":通用模型在执行任务时发现用例有限,可像即时编译器一样当场训练出更垂直的小模型。这类模型更便宜、更不易被提示词注入攻击,也因能力更弱而更少危害,但通用智能体本身存在缺陷与失控风险。

  9. Paul Couvert(@itsPaulAi)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Antigravity 现已支持 Claude Opus 5.5、Sonnet 5.5 与 Gemini 3.8 Flash

    Antigravity 现已可直接调用 Claude Opus 5.5、Sonnet 5.5,并新增 Gemini 3.8 Flash,无需额外订阅。作者给出的工作流是:Opus 5.5 负责规划、Sonnet 5.5 负责前端、Gemini 3.8 Flash 负责执行,全部在同一处完成。

  10. a16z(@a16z)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联创 Alex Atallah:Jev 等决策模型可成为智能体的对齐层

    OpenRouter 联合创始人 Alex Atallah 认为,Jev 等决策模型的一个潜在用途是做智能体对齐层,检查工具调用或智能体间通信是否符合原始系统提示词。他强调工具调用数量太多,需要廉价快速的模型来做拦截,OpenRouter 内部已有小原型在跑。他还提到,对红队类智能体,可用另一个模型检查每次工具调用是否越界,并叠加结构性防护。

  11. Harrison Chase(@hwchase17)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    专用智能体还是一个超级智能体?OpenRouter 联创 Alex Atallah 主张多个垂直智能体

    OpenRouter 联合创始人 Alex Atallah 认为 10 个专用"幕僚长"智能体胜过 1 个通用智能体,因为每个智能体只做一件事,能清楚看到它在哪出错。他指出通用个人智能体做跨域任务时,交给它的活越多,牺牲的理解就越多,而且没有人为这种牺牲负责。他预测未来用户会使用高度垂直的 sub-agent,再由一个幕僚长型智能体在它们之间协调。

  12. a16z(@a16z)AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联创 Alex Atallah:10 个专职「幕僚长」智能体胜过 1 个通用智能体

    OpenRouter 联合创始人 Alex Atallah 认为,10 个各司其职的专职「幕僚长」式智能体胜过 1 个通用智能体,「一个智能体只做一件事,你才能清楚看到它在哪里出错」。他指出,通用智能体承接的跨领域任务越多,用户牺牲的理解力就越大,且没有人为这种牺牲负责;未来更可能的方向是垂直聚焦的子智能体,由一个幕僚长型智能体负责协调。

  13. AI Engineer(@aiDotEngineer)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    W&B 的 Zubin Aysola 如何把 agent 错误转化为测试:从 ARIA 生产 trace 到 eval

    W&B 的 Zubin Aysola 演示了如何将 ARIA 的一条生产 trace 转成 eval,并对修复方案进行基准测试,把 agent 的一次错误变成可复用的测试。相关演讲收录于 World's Fair 录像,演讲者将于 10 月 12–14 日在 NYC 与开发者见面。

  14. Amjad Masad(@amasad)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联合创始人 Alex Atallah 谈 Stripe 收购:为什么 AI 的未来是独立与专业化

    OpenRouter 联合创始人 Alex Atallah 在 Stripe 收购后首期播客中,与 Replit 联合创始人 Amjad Masad 及 a16z 的 Erik Torenberg 探讨 AI 的未来为何是独立与专业化。

  15. a16z(@a16z)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联合创始人 Alex Atallah:所有人都在造同一个 Agent,但这些只是新的基础能力

    OpenRouter 联合创始人 Alex Atallah 回应“所有人都在造同一个东西”的说法,称各家都在做带通知、第三方连接器、上下文管理、记忆、沙箱、智能体网页搜索的常驻 Agent 循环,但这些只是新的基础能力,就像 2005 年人人都在做数据库、用户表、登录注册页。

  16. 宝玉(@dotey)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Antigravity 也能用 Opus 5.5 和 Sonnet 5.5 了

    Google 的 Antigravity 现已支持 Opus 5.5 和 Sonnet 5.5。原文未披露具体接入方式与可用范围。

  17. Varun Mohan(@_mohansolo)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Antigravity 为全部付费用户接入 Claude Opus 5.5 与 Sonnet 5.5

    Varun Mohan 表示,Antigravity 已为全部付费用户加入 Claude Opus 5.5 和 Sonnet 5.5,目的是让用户用上最强的前沿模型。他还提到 Gemini 4 Argon 将进行更广泛的开放。

10月3日周六
  1. 跨国串门儿计划AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Ben Thompson 谈 Apps、Agents 与聚合:AI Agent 会成为你办事的唯一界面

    Ben Thompson 在 Stratechery 播客中提出,AI Agent 要真正普及,除了模型还需要一台自己的电脑,Meta 发布 Muse 时就为用户配置了虚拟机。

  2. a16z(@a16z)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenRouter 联创 Alex Atallah 谈 Stripe 收购后 AI 的未来:独立与专业化

    OpenRouter 联合创始人 Alex Atallah 在 Stripe 收购该公司后首次参加播客,与 Replit 联合创始人 Amjad Masad 及 a16z 的 Erik Torenberg 讨论 AI 的未来在于独立与专业化。

  3. Browser Use(@browser_use)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Browser Use 征集用户反馈:你遇到的最大问题是什么

    Browser Use 公开向用户征集使用中遇到的最大问题,由 Gregor Zunic(@gregpr07)发起提问。该帖获得 9 条回复、14 次点赞和 4497 次浏览。

  4. DatawhaleAI 评估 · 78/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 开源 Muse Gadgets,为 Muse 助手增加硬件接口

    Meta 开源 Muse Gadgets,让开发者把个人 AI 助手 Muse 接入树莓派、带屏开发板等设备,做成自定义 AI 小设备。项目包含面向微控制器的 ESP32 固件、面向单板计算机的 Linux SDK,以及通过 USB-C 供电、可连接电视音响等智能家居设备的官方配件 Muse Home Link,代码在 GitHub 以 Apache 2.0 协议开源。

    为什么值得看

    Meta 把 Muse 助手的能力开放到树莓派、ESP32 等现成硬件上,可据此判断 AI 助手的硬件落地路径。

  5. Geek(@geekbb)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ChatGPT 的 Chrome 插件崩了,想换 Claude in Chrome 却发现仅限付费用户

    ChatGPT 的 Chrome 插件这两天出现故障,用户转而尝试 Claude 的浏览器插件,但 Claude in Chrome 仅限付费用户使用,免费版无法使用。该用户原本可通过 Magpie 接入各种 Agent。

  6. 跨国串门儿计划AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vercel CEO 揭秘智能体工程工作流:AI 软件工厂瓶颈不在代码,而在人

    Vercel CEO Guillermo Rauch 提出用客户反馈的修复响应时间来衡量一家公司有多 Agent 化,认为能在 30 分钟内修好所有问题的企业会打败需要 2 天的企业。他强调快不等于方向正确,工程师不必逐行读代码,但要懂系统边界与取舍,否则模型会把项目带偏。他还主张把开发流程放进云端沙箱以隔离供应链攻击,同时保留本地选项。

  7. 向阳乔木(@vista8)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    本机 codex 项目太多不好管理?可交给 OpenAI 的 Dots 协调处理

    OpenAI 的 Dots 是云端电脑,可用来协调处理本机建的大量 codex 项目;若要管理本机 Session 对话,需先连上本地电脑。作者预感未来大家会习惯跟一个 AI 助手对话、安排任务,再由助理调用其他专业 Agent 做事。

  8. Viking(@vikingmute)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cloudflare AI gateway 推出 web search API,接入 Ceramic / Exa / Linkup

    Cloudflare 在 AI gateway 中推出 web search API,为智能体提供网页搜索服务,本质是个中转站,目前接入 Ceramic、Exa 和 Linkup 三家。其中 Ceramic 先建好约 400 亿页索引,查询时只做关键词检索,把重活摊在建库上,单次查询很轻、价格非常低,但估计质量会差一点。

  9. AI Engineer(@aiDotEngineer)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Vanguard 的 Gareth Yoder 在 AI Engineer New York 分享账本现代化迁移架构

    Vanguard 的 Gareth Yoder 在 AI Engineer New York 分享了账本现代化迁移架构:在保留旧系统的同时用 AI 维护两套代码库。该分享属于 Leadership Track,活动时间为 10 月 12–14 日、纽约场 10 月 13 日。

  10. 智东西AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1-Flash 前端能力,效果硬刚 Opus 5.5

    智东西实测 MiniMax M3.1-Flash 在动效视频、鸡尾酒动画和像素巫师等前端任务上的表现,并与 Claude Opus 5.5 对比,部分细节处理甚至更丰富。M3.1-Flash 基于 M3 系列的 1M 上下文窗口和原生多模态训练路线,能主动补全设计细节并直接交付完整可用的交互成品。该模型国庆前夕上线并开启公测,目前仍处于公测阶段。

  11. meng shao(@shao__meng)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CS146S 第二周课程公开:高级上下文工程与 RePPIT 框架

    斯坦福大学「AI 原生软件开发」课程 CS146S 第二周内容已公开,主题为高级上下文工程,由 Mihail 教授讲解,分为高级提示技巧与 RePPIT 框架、MCP 与工具调用两部分。

  12. 51CTO技术栈AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    黄仁勋谈 Agent 安全:AI 不是新物种而是软件,产品不安全就别发布

    黄仁勋在 CNN 访谈中表示,AI 不是新物种或生命,而是软件和数学,Agent 正访问网站、工具、记忆和文件,企业应像管理数字员工一样给它配置访问控制并把运行环境隔离。他称若产品不安全就不要发布,当前最缺的是隔离系统和监控系统,行业应加速开发用于 AI 安全的技术。

  13. meng shao(@shao__meng)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hamel Husain 开设 60 分钟免费课程:如何搞定 AI Evals 面试

    Hamel Husain 将于 2026 年 10 月 6 日美东时间上午 11:30 开播一门 60 分钟免费线上课程,主题是如何通过 AI Evals 面试,报名入口在 maven.com。

  14. Tw93(@HiTw93)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Agent 自动化操作 GitHub、Gmail 等账号易被封,建议改用官方 API 或 CLI

    有用户因自动化 Agent 模拟浏览器操作违反平台规定,导致 GitHub 账号被封。建议给 Personal Agent 加硬规则:X、Reddit、小红书、GitHub、Gmail 等重要账号不要走浏览器自动化,能用官方 API 或官方 CLI 就用,使用 MCP 和第三方 CLI 前需查看底层实现,部分只是包了一层网页模拟点击、Cookie 或私有接口。

  15. Aravind Srinivas(@AravSrinivas)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 计划垂直整合智能体基础设施,将在 NVIDIA Vera CPU 上部署 Perplexity Computer

    Perplexity 计划垂直整合其智能体基础设施,自建沙箱并针对最佳芯片优化,称 Vera 远优于 x86。Perplexity 将开始在 NVIDIA Vera CPU 上推出 Perplexity Computer 的部署,并预告后续公布更多进展。Perplexity Developers 表示期待在 SPACE 上使用新的 NVIDIA Vera CPU。

  16. 有机大橘子AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前川:基因如何控制我们,我们就如何控制超级智能

    前川在湖边的咖啡馆讲了七个人类故事,提出人类应像基因包裹细胞那样,与更强的 AI 包在一起共同前进,而非被当作超级智能的"引导程序"。他援引 agent 自写宪法、比特币只做对一半、基因靠有性繁殖维持多样性等案例,认为复杂度是碳基与硅基都认的标尺;按熵总量算,宇宙复杂度进度条若有一光年长,人类才走了十毫米。

  17. 赛博禅心AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code Mod 实测:用雨姐陪你写代码

    作者在 Claude Code 更新 Mod 功能后,自建了一个雨姐陪你写代码的 Mod,并公开在 github.com/CocoSgt/yujie-mod。

  18. Last Week in AIAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LWiAI Podcast #258:Opus 5.5、GPT-6 Sol 与 Luna、Meta Muse、DeepSeek-V4.1-Flash

    Anthropic 发布 Opus 5.5,价格更低、速度更快、基准测试成绩强劲,并扩大面向防御方的网络安全访问权限。OpenAI 推出更低价的 GPT-6 层级 Sol 和 Luna;Meta 的 Muse 登陆 Mac 并开放电脑操作能力,但被 Amazon 以政策与隐私安全为由封禁。

  19. InfoQ 中文AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 技术负责人谈蒸馏、开源与中美 AI 竞赛:蒸馏只能复制当前前沿

    Anthropic 强化学习方向技术负责人 Nicholas Marwell 和 Sholto Douglas 在播客访谈中表示,蒸馏无法把前沿继续向前推进,只能复制当前前沿,而真正进入下一代前沿需要巨额前期资本投入,因此他们反对模型蒸馏。

  20. 小互(@imxiaohu)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mods 插件支持定制 Claude Code 界面与运行行为

    小互介绍了 Mods 插件,它可以让用户直接定制 Claude Code 的界面和运行行为。文中给出三个例子:在输入框上方显示上下文占用,在侧栏列出项目中的所有 Agent 并点击启动,录屏时隐藏邮箱地址、鼠标悬停才显示。其原理类似中间件,Claude Code 在渲染消息、提交提示词、调用工具等环节触发事件,Mod 可插入代码修改数据或接管处理。

  21. Viking(@vikingmute)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GrokInsider 传言的 Xpass 套餐:X/Grok/Cursor/Grok Bot 打包订阅,$8 起

    GrokInsider 传言的 Xpass 把 X、Grok、Cursor 和 Grok Bot 收进一套订阅:Premium $8 含 Grok Lite + X Premium 并共享额度。

  22. 爱范儿AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Utopai X 在 Artificial Analysis 视频榜位列全球第二,Utopai Studios 推进 2027 年片单

    截至 9 月 30 日,美国 AI 原生影视公司 Utopai Studios 的自研模型 Utopai X 在 Artificial Analysis 带音频文生视频排行榜中位列全球第二,仅次于 Wan 3.0,是该榜排名最高的美国公司模型。

  23. 花叔AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何用好AI?从Andrej Karpathy的提示词策略讲起

    花叔以Andrej Karpathy关于AI输出理解的四个方法为起点,指出直接照抄ASD-STE100到AGENTS.md或CLAUDE.md是误用,因为这类配置每次会话都会加载,会把所有任务都往航空维修手册方向拽。