跳到正文

全部动态

今日 0 条
10月9日周五
  1. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 回忆 1986 年首次赴美参会:在 MIT 展示多层网络海报,并向 Marvin Minsky 演示神经网络可计算两数乘积

    Yann LeCun 回忆 1986 年 6 月首次赴美参会并初次到访 MIT,以多层网络海报参展。他在 Thinking Machines Inc 的招待会上首次见到 Marvin Minsky,后者惊讶于神经网络可被训练来计算两个二进制数的乘积(他已完成该实验)。

  2. Simon Willison(@simonw)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Simon Willison 谈 Claude Haiku 5.5 的定价

    Simon Willison 发布了一篇关于新 Claude Haiku 5.5 定价的笔记,并附上其博客文章链接。材料仅提供推文摘要,未给出具体定价数字或分析内容。

  3. Simon Willison(@simonw)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Haiku 5.5 画骑自行车的鹈鹕比 Claude Haiku 4.5 强得多

    Haiku 5.5 在绘制"骑自行车的鹈鹕"上明显优于发布近一年、成本高 10 倍的 Claude Haiku 4.5。原文同时贴出了 Haiku 4.5 的绘制结果作对照。

  4. Simon Willison(@simonw)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软开源跨平台沙箱库 MxC,支持 Windows、macOS 和 Linux

    微软开源了一个跨平台沙箱库 MxC,覆盖 Windows、macOS 和 Linux,底层使用 processcontainer、bubblewrap 和 seatbelt。Simon Willison 转述称其看起来很有前景;Kyle Daigle 表示 MxC 可解决智能体需要多种沙箱的问题,在 Windows 上提供进程、会话、micro VM 以及与智能体 ID 的深度集成。

  5. Hailuo AI (MiniMax)(@Hailuo_AI)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MiniMax H3 人物移除 LoRA 教程:用 SAM 3.1 跟踪并补全背景

    Stable Diffusion Tutorials 分享了一个 MiniMax H3 的人物移除 LoRA,用 SAM 3.1 跟踪视频中的人物,将遮罩区域填成绿色,并在重叠窗口中生成替换背景。使用方式是提供原始视频以及首帧的无人物干净版本,模型已发布在 Hugging Face。该教程由 Hailuo AI 转发,未说明具体性能表现。

  6. The Rundown AI(@TheRundownAI)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 要闻:OpenAI 数学论文超 700 篇、Mistral 发布 Le Chonk、GPT-6 Astra 可对比网站

    OpenAI 的数学研究产出持续爆发,相关论文已超 700 篇;Mistral 推出开源模型 Le Chonk,加入西方开源模型浪潮。OpenAI 的 GPT-6 Astra 支持用户对比网站,Brett Adcock 的 Hark 则发布了一款主动式 AI 助手。

  7. The Rundown AI(@TheRundownAI)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 数学相关新进展

    该条内容仅指向一篇 OpenAI 数学主题文章的阅读链接,未提供模型名称、版本号、参数规模、benchmark 分数或可用性等具体信息。

  8. The Rundown AI(@TheRundownAI)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,输入 token 定价每百万 0.10 美元

    Anthropic 发布 Claude Haiku 5.5,称其为自家迄今最便宜、最快且能力最强的小模型。相比 Haiku 4.5,定价从每百万输入 token 0.10 美元起,运行成本约降低 75%,并与 OpenAI 的同类模型 GPT-6 Luna 持平;Anthropic 称其在多项基准上超过 GPT-6 Luna。

  9. The Rundown AI(@TheRundownAI)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日 AI 要闻:AI 的下一个前沿是人类细胞、把 Claude 的常规工作交给 Haiku 5.5、Grok Bot 开放路由至 Claude 等模型

    今日 AI 要闻聚焦四条:AI 的下一个前沿是人类细胞;Nate's Notebook 讨论"slop grenades"向下渗透;建议把 Claude 的常规工作交给 Haiku 5.5;Grok Bot 开放路由,可接入 Claude 及其他模型。

  10. The Rundown AI(@TheRundownAI)AI 评估 · 7/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    The Rundown AI 分享 AI 前沿进展阅读链接

    The Rundown AI 发布了一条指向 therundownai.beehiiv.com 的阅读链接,内容主题标注为 AI 的下一前沿进展。该帖未披露具体模型、产品名称或数据细节,仅提供跳转入口。

  11. The Rundown AI(@TheRundownAI)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    今日机器人要闻:Minerva 造排爆人形机器人,Agilink 教机械手刺绣

    Minerva 打造了一款用于排爆的人形机器人,Agilink 让机械手学会刺绣,另有一款小型机器人实现每走一步即充电,MIT 则为无人机赋予数学意义上的生存本能。以上为今日机器人领域的主要动态。

  12. Claude(@claudeai)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5 小模型

    Anthropic 发布 Claude Haiku 5.5,称其是迄今最便宜、最快且能力最强的小模型。官方表示其平均运行成本比 Claude Haiku 4.5 低约 75%。

  13. Claude(@claudeai)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 在编程、计算机使用与知识工作上大幅超越 Haiku 4.5

    Claude Haiku 5.5 在编程、计算机使用和知识工作三个方向相比 Haiku 4.5 有显著提升。该消息由 Claude 官方账号发布,但未披露具体基准分数、参数规模或定价等细节。

  14. Claude(@claudeai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Haiku 5.5,首次为 Haiku 系列加入可调 effort 设置

    Anthropic 发布 Haiku 5.5,这是首个带有可调 effort 设置的 Haiku 模型,用户可针对每个任务自行决定侧重成本还是智能表现。

  15. Claude(@claudeai)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 称 Haiku 5.5 在 10 万 token 以下任务中性价比突出

    Anthropic 表示 Haiku 5.5 在 10 万 token 以下的任务中性价比尤为突出,这类任务约占其上一代 Haiku 模型请求量的 90%。

  16. Claude(@claudeai)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Haiku 5.5 已在 Amazon Web Services、Google Cloud 和 Microsoft Azure 等全平台上线

    Anthropic 宣布 Haiku 5.5 已在包括 Amazon Web Services、Google Cloud 和 Microsoft Azure 在内的全平台上线。详情见 anthropic.com/claude-haiku-5…。

  17. Claude(@claudeai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Sonnet 5.5 缓存读取价格减半至每百万 tokens 0.10 美元

    Anthropic 宣布将 Claude Sonnet 5.5 的缓存读取价格减半,降至每百万 tokens 0.10 美元。官方称这一调整让 Sonnet 5.5 在大多数长时间运行任务上的成本降低约 20%。

  18. meng shao(@shao__meng)AI 评估 · 84/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-6 面向超 12 亿周活 ChatGPT 用户推送,新增 Intelligent UI 能力

    GPT-6 开始面向每周超过 12 亿 ChatGPT 用户全面推送,并带来新的 Intelligent UI 能力:回复可用文本、视觉与交互元素共同组织,包含图形、按钮、表单、图表乃至可直接使用的交互式工具。

    为什么值得看

    原文给出 GPT-6 面向 12 亿周活用户推送的消息,并拆解 Intelligent UI 的两层技术实现。

  19. meng shao(@shao__meng)AI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软将 Windows 定位为 hybrid intelligence 之家,发布四层 AI Agent 架构

    微软正式将 Windows 的战略定位从个人计算平台升级为 the home for hybrid intelligence,作为 AI Agent 在本地与云端的承载、安全隔离和企业管理主阵地,并发布四层架构。

  20. meng shao(@shao__meng)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    斯坦福 CS 329Z《Engineering AI Agents》第 4、5 讲公开:Tool Use 与 Frameworks & Orchestration

    斯坦福 Fall 2026 课程 CS 329Z《Engineering AI Agents》第 4、5 讲已公开,分别由 @Diyi_Yang 讲「Tool Use」、@Diyi_Yang @michaelryan207 @jyangballin 讲「Frameworks & Orchestration」。

  21. meng shao(@shao__meng)AI 评估 · 1/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    课程地址补发:pi-school.ziki.boo

    课程地址补发,链接为 pi-school.ziki.boo。

  22. meng shao(@shao__meng)AI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Haiku 5.5 benchmark 领先 GPT-6 Luna,用户从 CodeX 迁移到 Claude Code

    Claude Haiku 5.5 的 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测到的 token 输出速度也是 2 倍。Anthropic 官方称 Claude Haiku 5.5 是迄今最便宜、最快、最强的小模型,运行成本比 Claude Haiku 4.5 低约 75%。

  23. meng shao(@shao__meng)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里「AI Native 研发范式实践手册」四点陈述:从写代码到可靠交付仍需解决大量技术问题

    阿里在「AI Native 研发范式实践手册」结尾给出四点官方陈述:从写代码到可靠交付仍有较多技术问题待解,基础设施工程复杂度可能不亚于 Agent 应用层建设。企业知识资产尚未做到 Agent 友好,结构化、版本化、权限管理与质量治理仍有大量工作;组织设计影响更深远且更难有确定答案,AI 迭代速度还会持续冲击现有架构,需保持架构适应弹性。

  24. meng shao(@shao__meng)AI 评估 · 2/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    meng shao 分享 X 文章链接

    meng shao(@shao__meng)发布一条推文,附上 x.com 的文章链接(x.com/i/article/2108…),并带有 2 条评论、3 次转发、15 个点赞、2445 次浏览和 11 个数据指标。

  25. meng shao(@shao__meng)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 为 Deep Agents 的 Skills 做了三项工程升级:工具绑定、固定与中途重载

    LangChain 为 Deep Agents 框架的 Skills 带来三项工程升级:工具绑定 Skills 通过 SKILL.md 的 metadata.include_tools 声明工具。

  26. meng shao(@shao__meng)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯云开源自托管多智能体 AI 助手平台 Octop

    腾讯云开源自托管多智能体 AI 助手平台 Octop,面向家庭和小团队,主打多用户、多智能体和数据完全留在本机。整个系统为单个 Python 进程,数据落在 ~/.octop/,默认 SQLite(WAL 模式)并可切换 PostgreSQL;模型层走 OpenAI 兼容 API,支持 DashScope、Ollama 与可替换的存储和渠道。

  27. meng shao(@shao__meng)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    T3 Stack 作者 theo 开源 TypeScript 编译器 Rust 移植版 tsc-rs

    T3 Stack 作者 @theo 开源了 TypeScript 编译器、类型检查器和 LSP 的 Rust 完整移植版 tsc-rs,它并非从零设计,而是对微软官方 TypeScript 7(typescript-go)的逐行为移植,锁定上游提交 typescript-go @673a5f17,采用 MIT 协议。

  28. 宝玉(@dotey)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    光环被反编译,AI 助力可在 Android、Linux、Windows 上玩 Halo

    《光环》已被反编译,现在可以在 Android、Linux、Windows 上运行,项目地址为 github.com/OpenCommunityE。作者借此感叹,有了 AI,以前工作量巨大或很复杂的事情现在都在变成可能。

  29. 宝玉(@dotey)AI 评估 · 80/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布 Claude Haiku 5.5,价格降至上一代的十分之一

    Anthropic 发布 Claude Haiku 5.5,10 万 Token 以内请求每百万 Token 输入 0.1 美元、输出 0.5 美元,比 Haiku 4.5 便宜 90%,长请求为 0.5 和 2.5 美元,便宜一半。

    为什么值得看

    Haiku 5.5 的降价与跑分变化并列给出,可据此判断小模型在批量任务和子智能体场景中的成本位置。

  30. 宝玉(@dotey)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Max 和 Team 订阅用户每月获赠 API 额度

    本周起,Claude 的 Max 和 Team 订阅用户每月会拿到一笔 API 额度:Max 5x 为 100 美元,Max 20x 为 200 美元,Team 最多 500 美元,由团队成员共用。这笔额度只能在 Claude Platform 上使用。

  31. 宝玉(@dotey)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lauren 30 天消耗 1.5T Token:用得最多的是 Opus 5.5,Cloud 是消耗大头

    宝玉披露,Lauren 30 天 Token 消耗达 1.5T,用得最多的模型是 Opus 5.5,Cloud 是消耗大头。Cloud 上每个任务可用独立虚拟机并行,但改动验证不如本机方便。他同时提醒,不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最好模型且有充足 Token;AI 验证只能替代一部分,方向仍需人自己把握。

  32. 宝玉(@dotey)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 OpenAI Decisions API 做手势识别,多模态准确率优于 Jev 方案

    Francois Laberge 用 OpenAI 的 Decisions API 做手势识别,借助其视觉理解能力,准确率明显超过此前基于 Jev 的演示,速度也更快。他称这是 Decisions API 的一个很好的应用案例。

  33. 宝玉(@dotey)AI 评估 · 79/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 在 ChatGPT 推送 GPT-6 与 Intelligent UI 智能界面

    OpenAI 开始向 ChatGPT 推送 GPT-6,主打功能为 Intelligent UI,可根据问题类型生成可点击、可调节参数的界面,Plus、Pro、Business、Enterprise 用户今天起可用,免费版和 Go 版明天起陆续开放。

    为什么值得看

    对比了 OpenAI 与 Anthropic 在交互式回答上的两种路线,读者可据此判断界面生成的实现差异。

  34. 宝玉(@dotey)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 的 Tibo 宣布 Codex 与 ChatGPT Work 活跃用户达 4000 万,向付费用户赠送重置卡

    OpenAI 的 Tibo 宣布 Codex 和 ChatGPT Work 活跃用户达到 4000 万新高,为庆祝这一数字向所有付费账户发放一张重置卡,将在 PST 时区当天结束前送达。他同时预告 GPT-6 in Chat 是第三天发布的重点。

  35. 宝玉(@dotey)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Theo 质疑 Cursor 工程师 1000 万美元 Token 成本说法:实际 API 成本约每月 10 万-50 万美元

    Theo(t3.gg)反驳 Cursor 工程师 Lauren 每年 1.32 亿美元 Token 成本的估算,称真实 API 成本约为每月 10 万-50 万美元,按当前价格更接近每年 300 万美元。

  36. 宝玉(@dotey)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    赞同:选编程语言,其实还是在选约束和维护成本

    针对"都用 AI 写代码了为何还纠结 C/C++ 还是 Rust"的提问,该观点认为 AI 让写代码变便宜,不代表出错代价变低,Rust 编译器能提前拦住部分错误,而 C/C++ 的生态、平台支持和历史项目仍需 Rust 花时间追赶。即便未来 AI 直接生成机器码,如何确认 AI 做对了、需求是否理解正确与权限边界是否合理仍需可审查的依据,因此相当长一段时间内仍需编程语言和源代码。

  37. 宝玉(@dotey)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉分享 Fable 编排 SubAgent 与 Advisor 验收的 Claude Code 用法

    宝玉分享了自己在 Claude Code 中使用 Fable 的用法,把任务交给 Fable 负责分析、编排和验收,再派 SubAgent(Opus)去执行,大部分时间 Fable 在等 SubAgent 执行,因此可以持续派活而无需等待任务完成。

  38. 宝玉(@dotey)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    宝玉指出 Haiku 5.5 上下文超 100K 后价格涨 5 倍且被价格页隐藏

    宝玉指出 Haiku 5.5 的价格看似很低,但上下文一旦超过 100K,价格会上涨 5 倍,这一细节在价格页被隐藏起来。他引用其他用户的说法称这是阶梯定价,对比之下 GPT 的分界线是 272K,并认为这种设计相当于面向 Benchmark 的特化优化。

  39. 宝玉(@dotey)AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 更新 Claude 使用政策,11 月 12 日生效

    Anthropic 一年多来首次修改 Claude 使用政策,新版 11 月 12 日生效。最受关注的一条是禁止用户持续且无必要地辱骂或残忍对待 Claude,该规定来自其模型福利研究,执行手段仍以主动结束对话为主,Anthropic 未回应是否会进一步封号。

  40. elvis(@omarsar0)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DAIR.AI 推出 MCP 工具,可接入 Codex/Claude/Grok Bot 探索 AI 论文

    DAIR.AI 发布论文 MCP 工具,接入 Codex、Claude 或 Grok Bot 后即可发现并探索精选 AI 论文,索引涵盖其近两年在 X 上推荐的全部论文。功能包括查找与总结论文、探索 harness engineering 合集、检索 SOTA 结果、生成文献综述与调查、构建个人收藏及可视化论文。官方表示未来几周还将发布多项 benchmark,并持续更新。