跳到正文

#Anthropic

今日 78 条
10月6日周二
  1. 新智元AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    xAI 联创 Christian Szegedy 长文《数学何去何从?》:AI 让数学「毕业」,两千年英雄攀登史落幕

    xAI 联合创始人 Christian Szegedy 发长文《数学何去何从?》,宣告数学的「英雄探险时代」结束,AI 这架「飞机」已把旗插上无人登顶的山峰。

  2. Gary Marcus(@GaryMarcus)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 IPO 会建立在它最好的季度还是现实之上?

    Gary Marcus 质疑 Anthropic 的 IPO 是否建立在其最佳季度表现之上。据 The Information,Microsoft 已将内部 Claude 支出削减超过三分之一,Meta 的 Claude Code 用户数也已减半;Microsoft 此前为 Copilot 功能每年在 Anthropic 模型上的支出预计至少 20 亿美元。

  3. 宝玉(@dotey)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Codex Project 与 Claude Projects 有何不同:一个像论坛板块,一个像 Slack Channel

    Codex Project 与 Claude Projects 的组织方式被类比为论坛板块与 Slack Channel:前者像容器或分类,相关内容都放进来并可不断新开会话,但容易歪楼、上下文较乱;后者所有消息集中在一起,想深入某个子话题时新开 Thread 展开讨论,借此聚焦上下文。

  4. Gary Marcus(@GaryMarcus)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 IPO 会押注最好一季,还是现实?

    据 The Information,微软已将内部 Claude 支出削减超过三分之一,Meta 的 Claude Code 用户数减半。微软原本每年在 Anthropic 模型上支出至少 20 亿美元,用于为其生产力软件客户提供 Copilot 的 AI 功能,现已在 Copilot 中用部分自研模型替换 Claude。

  5. 十字路口CrossingAI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    他们的新工作,是教 AI 取代自己:AI 训练数据供应链里的劳动者

    Mercor 等数据公司正以时薪低至 45 美元起的零工,雇人编写评分细则、标准答案和推理轨迹来训练 AI,部分项目任务量骤减、时薪下调 8 美元,劳动者还被 Insightful 软件逐秒监控。Mercor 由三名 19 岁创始人于 2023 年创办,去年估值达 100 亿美元,每周约 3 万名专业人士在其平台工作,OpenAI 和 Anthropic 都曾是客户。

  6. 硅星人ProAI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一群计划"逃离"湾区的Anthropic研究员:AI末日论者的避难所与40%接管概率

    一些Anthropic研究员正考虑在美国偏远地区买地,作为AI失控后的避难选项。Anthropic前研究员Jacob Coxon今年9月初辞职,称构建AI的人"真诚地相信它可能在2030年前杀死我们所有人",该帖获1.74亿次浏览。

  7. AINLPAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Baseten 让 Claude Code 写推理引擎 VibeQwen,单流解码比 vLLM 快 90%

    Baseten 工程师 Shawn Rushefsky 分享实验,让 Claude Code 为 Qwen-3.6-35B-A3B 自主编写并优化推理引擎 VibeQwen。

  8. InfoQ 中文AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 工程师谈 Claude Code 下一步:CLAUDE.md 最终会消失,Mods 可定制 harness

    Anthropic Claude Code 团队核心成员 Thariq Shihipar 在 Latent Space 播客中表示,Claude Code 将支持 AGENTS.md,但随着模型能力提升,CLAUDE.md 这类静态指令文件最终可能不再需要,新项目甚至可以先不写。

  9. hidecloud(@hidecloud)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 居首,Claude 升至网页端第三

    a16z 发布第七版 Top 100 消费级 AI 应用榜,首次加入收入榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第三,月访问量近 1B。

  10. 宝玉(@dotey)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 Claude Projects 使用体验:多任务会话与 GitHub 直连

    宝玉推荐多用 Claude Projects,指出每个 Project 可拥有自己的 System Project 和记忆,也能使用 skills,项目下所有任务在同一会话中进行,子任务以 Thread 形式展开。

  11. 数字生命卡兹克AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    聊聊 A16Z 两份 AI 报告,以及一些反常识的真相

    作者卡兹克解读 A16Z 第七版《Top 100 消费级 AI 应用》与 9 月底更新的《市场状况 II》两份报告,整理出其中的反常识数据。

  12. Epoch AIAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 研究:中国 AI 公司如何赚钱

    Epoch AI 发布研究,梳理中国六家头部 AI 公司(阿里、字节、Z.ai、月之暗面、DeepSeek、MiniMax)的五类收入来源:面向消费者的 AI 应用、售卖模型访问、面向企业和政府的定制部署、授权费,以及用 AI 带动既有产品线。

  13. 宝玉(@dotey)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 与微软收紧员工内部使用 Claude,转向自家模型与工具

    据 The Information 10 月 5 日报道,Meta 和微软正在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。Meta 内部使用 Claude Code 的员工从年初约 6 万人降至最近约 3 万人,同时推广自研 Muse Code(已有超 6000 名员工使用,8 月起对外部客户测试)和内部工具 MetaCode(用户超 3 万)。

  14. NotebookLM(@NotebookLM)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 跻身 a16z 生成式 AI 网页产品榜前十

    NotebookLM 在 a16z 第七版 Top 100 消费级 AI 应用榜单中进入生成式 AI 网页产品前十。该榜单首次加入收入排行榜,ChatGPT 以移动端超 10 亿月活继续居首,Claude 以近 10 亿月访问量升至网页端第三,品类还扩展至 Lovable、Cursor、Suno、ElevenLabs、Kling、Manus 等。

  15. 宝玉(@dotey)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis 实测:同 200 美元订阅,Claude 的 Token 用量约为 OpenAI 的 5 倍

    半导体和 AI 产业研究机构 SemiAnalysis 实测了 Anthropic、OpenAI 等九家的 AI 订阅套餐,在两家主推的日常主力模型上,Claude 订阅折算出的价值约为 OpenAI 的 5 倍。

  16. Thomas Wolf(@Thom_Wolf)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Thomas Wolf 希望 Opus 4.6 长期保留

    Thomas Wolf 表示希望 Opus 4.6 能长期保留,起因是 David Holz 让 LLM 自由玩耍并自评谁玩得最开心,结果较新的模型似乎乐趣更少。多数模型选择了文字游戏,而 Opus 4.6 反复胜出,方式是想象由矛盾构成、存在于下落水滴中的短暂世界。

  17. a16z(@a16z)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人们究竟想让 AI 智能体做哪些任务?a16z Top 100 消费级 AI 应用榜单更多图表解读

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量近 1B。

  18. lmarena.ai(@lmarena_ai)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MTS Arena CEO 呼吁建立中立评估平台,OpenAI 与 Anthropic 不能自评模型安全

    MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。

  19. SemiAnalysisAI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SemiAnalysis:Anthropic订阅的API等效价值约为OpenAI的5倍

    SemiAnalysis用自建Tokenomics模型测量各AI订阅计划的额度与API等效价值,发现在中端模型档位上Anthropic提供约5倍于OpenAI的API等效价值。

  20. a16z(@a16z)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z Top 100 消费级 AI 应用榜:ChatGPT 月活超 10 亿,Claude 升至网页端第 3

    a16z 发布第七版 Top 100 消费级 AI 应用榜,ChatGPT 仍居首,移动端月活超 10 亿;Claude 升至网页端第 3,月访问量近 10 亿。榜单新增收入排行,品类已扩展到 vibe coding、音乐、设计、语音、视频、智能体乃至硬件,但 15 个消费互联网品类中有 9 个的前 100 名里没有任何 AI 产品。

  21. a16z(@a16z)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 的 Olivia Moore:消费级 AI 商业模式搞反了,85% 靠订阅、仅 13% 靠广告

    a16z 的 Olivia Moore 认为消费级 AI 商业模式被搞反了:目前几乎所有收入都来自直接订阅,在其 Web 榜单中 85% 的产品靠订阅变现,62% 另有 credits 或超额使用付费,仅 13% 采用广告等"用户即产品"的模式。

  22. lmarena.ai(@lmarena_ai)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Arena 智能体能力排名:Anthropic 与 OpenAI 领跑各领域

    Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。

  23. 宝玉(@dotey)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 将在欧盟为 ChatGPT 和 Codex 文字加水印

    OpenAI 宣布未来几周内,欧盟用户在 ChatGPT 和 Codex 里生成的文字会带上看不见的水印,以满足欧盟《人工智能法案》的透明度要求;8 月 Anthropic 已给 Claude 加了水印,原因是同一法案的透明度条款在今年 8 月 2 日生效。

  24. a16z(@a16z)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜:ChatGPT 居首,Claude 升至网页端第 3

    a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行榜,同时保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页端第 3,月访问量接近 1B。

  25. 宝玉(@dotey)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent 会话交互多借鉴自 Slack,Claude 最新 Projects 脱胎于 Thread 设计

    Agent 会话的交互设计有很多借鉴自 Slack,Claude 最新的 Projects 就脱胎于 Thread 设计,简洁好用。有观点指出,OpenAI 的一切产品决定都是从 Slack 上交流和协调的,而当年收购 Slack 的却是 Salesforce。

  26. Anthropic NewsAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 扩展 Cyber Verification Program,分三级开放高级网络安全能力

    Anthropic 推出扩展版 Cyber Verification Program,面向符合条件的安全从业者开放高级网络安全能力和放宽的拦截分类器,共设 Defense、Red Team、Specialized 三个访问层级,均可用 Claude Opus 5.5、Claude Sonnet 5.5、Claude Mythos 5.1 等模型。

  27. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. andrew chen(@andrewchen)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SF Tech Week 在 Jackson Square 新办公室开幕,议程超 1700 场活动

    SF Tech Week 今日开幕,Speedrun 将在其 Jackson Square 新办公室办活动,并与 1000+ 投资人举办 Demo Day。官方议程超过 1700 场活动,两年翻倍以上,来自 1058 家公司的 1266 位主办方参与,包括 OpenAI、Anthropic、Google、Mistral 等,Speedrun 投资组合公司主办 100+ 场。

  2. a16z(@a16z)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 发布第七版 Top 100 消费级 AI 应用榜:AI 支出前 1% 用户月均 903 美元

    a16z 发布第七版 Top 100 消费级 AI 应用榜,新增收入排行。榜单显示,AI 支出排名前 1% 的用户月均花费 903 美元,已超过后 50% 用户的总和,中位数用户仅 25 美元。ChatGPT 仍居首,移动端月活超 10 亿;Claude 在网页端升至第 3,月访问量接近 10 亿;品类已扩展到 vibe coding、音乐、设计、语音、视频、智能体和硬件等方向。

  3. a16z(@a16z)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 第七版 Top 100 消费级 AI 应用榜单发布,首次加入付费维度

    a16z 发布第七版 Top 100 消费级 AI 应用榜单,首次加入消费者实际付费情况的维度。数据显示付费高度集中于开发者、创作者等重度用户,Olivia Moore 与 Josh Elman 在播客中讨论了 ChatGPT、Claude、Gemini 的不同走向、个人智能体的隐私墙、OpenAI 的 10 亿美元广告收入规模,以及订阅制为何可能不是把消费级 AI 带给所有人的最终商业模式。

  4. elvis(@omarsar0)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ContextQA 推出 Ship:从 Slack 和 Linear 复现 bug,交给 Claude Code 或 Codex 修复

    ContextQA 推出自主质量工程师 Ship,可从 Slack 或 Linear 接收 bug 报告并复现,再把上下文交给 Claude Code 或 Codex 完成修复。该工具面向已部署的 PR 进行测试,用户可免费在 ship.contextqa.com 试用。作者指出,编码智能体需要这类反馈闭环,才能更好地修复自身 bug,而验证 agent 写的代码正成为软件工厂的一大瓶颈。

  5. a16z(@a16z)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    a16z 发布第七版 Top 100 消费者 AI 应用榜,新增收入榜

    a16z 第七版 Top 100 消费者 AI 应用榜发布,首次加入收入排行榜,并保留网页与移动端流量排名。ChatGPT 仍居第一,移动端月活超 1B;Claude 升至网页榜第三,月访问量近 1B。

  6. freeCodeCamp.orgAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何打断 AI 编码智能体的修复死循环

    freeCodeCamp 发布教程,讲解 AI 编码智能体为何会陷入反复修复不成功的循环,并给出停止、回退、重新描述、单点修改、真实验证五步流程。文章以一次重复扣费 bug 为例,展示先写失败测试再向智能体提精确需求的做法,修复本身只有十几行代码,并附一份可复用的检查清单。作者指出该模式在 Lovable、Replit、Cursor、Claude Code、Base44 等工具上都会出现。

  7. The Rundown AI(@TheRundownAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 头条:OpenAI 安全报告负责人因"破碎"文化离职,Anthropic 为养育 Claude 寻求宗教智慧

    OpenAI 安全报告负责人因"破碎"文化离职。The Rundown 圆桌讨论分享了自家的 AI 用例,AI 101 栏目则讲如何在不同模型间做选择。Anthropic 正为"养育"Claude 寻求宗教智慧。

  8. 架构师之路AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    想30分钟写出好skill?用Anthropic官方五项标准评审internal-comms

    写好 skill 的前提是先看懂好 skill 的标准,评审优秀 skill 有五项标准:description、触发策略、正文、第三层、一致性。

  9. 机器之心AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    VA-Bench 测出大模型空间智能执行断层:目标识别接近满分,完整任务成功率仅约一半

    VA-Bench 以观察、推理、行动、修正的闭环测试 12 个多模态模型,覆盖 14 类机器人操作任务共 280 个基础场景。表现最好的模型在目标识别与定位上达到 100%、操作语义理解达到 99.6%—100%,但 Qwen3.8-max、Opus-5 和 GPT-5.6-sol 的完整任务成功率分别只有 53.93%、52.86% 和 51.55%。

  10. Tw93(@HiTw93)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    看到任何 Claude 的奖励、问卷、邮件,建议不要点击

    有用户提醒,收到任何 Claude 的奖励、问卷或邮件都不要点击,例如所谓 250 刀云额度。该用户称,Anthropic 虽然模型非常厉害,但行为可能不那么正派。

  11. 十字路口CrossingAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    实测 MiniMax M3.1 Flash Preview 前端能力:三个案例对比 Opus 5.5

    MiniMax M3.1 Flash Preview 于 9 月 27 日上线 MiniMax Code 并开启公测,作者用动态简历、相机拆解实验台和纸艺项目复刻三个案例实测其前端能力。

  12. AI Engineer(@aiDotEngineer)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将在 AI Engineer New York 举办 Claude Managed Agents workshop

    Anthropic 的 Claude Managed Agents 实操 workshop 将于 10 月 12 日在 AI Engineer New York 开讲,由 cjav_dev 和 Harrison Stall 主讲,内容为 Managed Agent 的最新功能。活动 10 月 12 日至 14 日在纽约举行,workshop 需在会议通票之外另行购买。

10月4日周日
  1. AI寒武纪AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 公开私藏提示词:大模型4级玩法

    Andrej Karpathy 时隔两个月发文,公开了自己日常让大模型把内容讲透的四级递进技巧。第一级是写作,用航空维护文档规范 ASD-STE100 让模型产出受控文本。