跳到正文

#Anthropic

今日 0 条
9月18日周五
  1. Anthropic(@AnthropicAI)AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 用 Claude 优化 30 多个开源模型推理,平均提速 4 倍并开源代码

    Anthropic 在最新 Science Blog 中介绍,Claude 为 30 多个开源模型优化推理,平均提速 4 倍,部分工作是为 GPU 编写定制软件。这些模型面向分子系统结构建模、类药物分子设计和基因突变影响预测等生物学科研任务,此前运行成本较高。Anthropic 表示将开源全部优化代码。

  2. Anthropic(@AnthropicAI)AI 评估 · 45/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 发布三项指标追踪 AI 自我开发进度

    Anthropic 公布三项用于追踪 AI 发展的指标:AI 承担了多少 AI 研发工作、AI 智能体的受监督程度、算力如何分配,并给出 Anthropic 内部的指标快照。Anthropic 表示任何前沿开发者都可发布同样的指标,第三方也可验证,以缩小前沿实验室与公众之间的信息差。

  3. HeyGen(@HeyGen_Official)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HeyGen 在 ChatGPT 和 Claude 内运行,把临床笔记变成整月出诊视频

    HeyGen 现可在 ChatGPT 和 Claude 中运行,让医生把已经写好的笔记直接转成整月的出诊视频,无需摄像机和额外时间。原文称医学是唯一一个最有发言权的专家却最没时间记录的职业。

  4. Mike Krieger(@mikeyk)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mike Krieger 称 Claude Desktop 新式 Projects 已成日常主力

    Anthropic 的 Mike Krieger 表示,他如今在 Claude Desktop 上的大部分工作都在新式 Projects 中完成,可轻松并行启动多项任务,同时由协调者 Claude 快速响应。Omid Mogasemi 称该项目已开发数月,并成为他的新日常主力工具。

  5. Mike Krieger(@mikeyk)AI 评估 · 9/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mike Krieger 用 Claude 交互式 artifact 还原 Dungeon Crawler Carl 的 Iron Tangle 关卡

    Mike Krieger 因难以想象 Dungeon Crawler Carl 中 Iron Tangle 关卡的整体结构,用 Claude 做了一个交互式 artifact(claude.ai/artifact/NTcG6…),他表示自己终于理解了这一关卡。该内容获得 36 个点赞、8213 次浏览。

  6. Anthropic(@AnthropicAI)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 开放生命科学验证计划 LSVP 申请

    Anthropic 开放生命科学验证计划(LSVP)申请,生命科学从业者可在新的防护措施下使用其模型,其中首次包含 Mythos。该计划以 beta 形式面向学术实验室、初创公司和药企等各类团队推出,官方称将持续改进并逐步扩展到个人 Pro 和 Max 订阅。申请与访问授权详情见 anthropic.com/news/life-scie。

  7. cat(@_catwu)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 桌面端与网页端推出 Projects 功能

    Anthropic 的 ClaudeDevs 宣布在 Claude Code 桌面端和网页端推出 Projects,一个 project 即与 Claude 的一次对话,它会自行把工作拆成多个线程、以并行云会话运行并在其间传递上下文,用户离开后仍继续执行,目前面向部分用户 beta。

  8. Anthropic NewsAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 与 Accenture 合作开展前沿 AI 嵌入式评估

    Anthropic 宣布与 Accenture 合作,对其前沿 AI 模型开展独立评估,由 Accenture 旗下 AI 业务 Faculty 牵头,内容包括模型评估与红队测试、对齐评估和安全防护措施测试。

9月17日周四
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    基于 Claudian 改造:支持 antigravity cli,可用 OpenCodex 接入 Codex,并装入 Obsidian

    基于 Claudian 改造的版本新增了对 antigravity cli 的支持,并可通过 OpenCodex 接入 Codex,同时该 Claudian 插件已可安装到 Obsidian 中使用。原推未披露模型版本、参数或性能数据。

  2. 机器之心SOTA模型AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    太初开源 ZDTaichu5.0-9B 空间理解模型,Anthropic 合并 Claude Cowork 与聊天并推出 Docs、Slides

    太初团队开源 ZDTaichu5.0-9B 空间理解模型,结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器,支持文本、图片、视频输入,覆盖文档、图表、OCR 与视觉问答,并已提供权重、本地推理示例和适配的 vLLM 服务镜像。

  3. Harrison Chase(@hwchase17)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    评测发现模型未必受益于原生 harness

    Melissa Pan 在 Claude Code、Codex 和 Pi 上评测了 7 个模型,得出三点发现:harness 选择对任务成功率影响不大,但会显著影响成本;简单的 harness 也具竞争力;原生 harness 并不总是最佳选择。Harrison Chase 引用该结论指出,模型可能未必真正受益于原生 harness。

  4. Last Week in AIAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 称内部未发布模型解决 Navier–Stokes 千禧年难题,引发署名争议

    OpenAI 于 9 月 8 日称一个未发布的内部模型(能力显著强于 GPT-6 Astra)解决了 Navier–Stokes 存在性与光滑性问题,并公布了证明、预印本与 Lean 形式化文件。

  5. Mind the Future — Richard NgoAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI 如有序疏散而非踩踏:Richard Ngo 谈对齐与「羊群心态」

    Richard Ngo 提出用「有序疏散 vs 踩踏」类比 AI 发展:对齐难相当于门被卡住,而即使对齐本身不难,人群挤压冲向出口时开门也会难得多。他认为这一类比优于「军备竞赛」,并指出 AI 行业目前仍处「人群推搡前行、几乎无人重伤」的阶段,还有时间化解羊群心态。

  6. Simon Willison(@simonw)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Cowork 与 Chat 合并为统一版 Claude

    Anthropic 的 Mike Krieger 宣布 Claude Cowork 和 Chat 从今天起合并为一个 Claude,原因是用户常不确定该从哪个产品入手。

  7. Alex Albert(@alexalbert__)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Cowork 与聊天合并为统一 Claude

    Claude Cowork 与聊天功能合并为统一的 Claude,用户提出简短问题或交办一份报告后,Claude 会接手处理,即使合上笔记本也能继续,遇到不清楚的地方会主动询问,最终决定权仍归用户。

  8. cat(@_catwu)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Cowork 与聊天合并,并接入 Claude Design

    Anthropic 将 Claude Cowork 和聊天合并为一个 Claude,并接入 Claude Design,用户可直接让 Claude 生成 Slide、Design 或 Doc,无需切换标签页或应用。

  9. Mike Krieger(@mikeyk)AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Docs、Slides 和 Design 在每段对话中上线

    Anthropic 的 Mike Krieger 表示,Claude Docs、Claude Slides 和 Claude Design 即日起在所有对话中可用,由改版后的 Artifacts 平台驱动。用户可以直接提出设计、演示文稿或文档需求,得到可编辑、可下载、可带走的结果。他邀请用户试用并反馈。

  10. Mike Krieger(@mikeyk)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 将 Claude Cowork 与 Chat 合并为统一 Claude

    Anthropic 从今天起把 Claude Cowork 和 Chat 合并为一个统一的 Claude,先向 Pro 和 Max 用户在未来几周内逐步推送。官方称合并的原因是用户常不确定该从哪个产品入手,统一后由 Claude 自行决定实现路径,用户保留最终决定权,任务在关闭笔记本后仍可继续推进。

  11. 刘小排rAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的“老师”是如何进步的:从盗版书到 Project Panama 买书扫描

    Anthropic 在学完互联网公开信息后,曾于 2021~2023 年下载数百万份盗版书,2023 年遭举报。因法律风险,其内部项目 Project Panama 改为满世界购买实体书,通过液压切割设备切掉书脊、拆成散页后送入工业扫描仪数字化,扫描完的书再交由外包垃圾回收供应商处理。这些通过中间机构购入的冷门、专业、学术书籍甚至古籍孤本,最终成为 Claude 的训练数据。

  12. Anthropic NewsAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 推出生命科学验证计划(LSVP)

    Anthropic 推出生命科学验证计划(LSVP),通过资质与伦理审查后,生命科学团队可在 Mythos、Opus、Sonnet 模型上获得对生物相关工作更宽松的保障设置,覆盖药物发现、研究生物学、临床开发等场景。

9月16日周三
  1. 真格基金AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    清华博士张托肯谈用 AI 三天设计芯片与 Agent 在芯片设计中的边界

    清华大学电子工程系博士、现苏黎世联邦理工学院博士后张托肯用 AI 在三天内从零设计了一颗 Attention 计算芯片并完成流片,过程记录在《三天从零到流片:AI 带我设计一颗 Attention 计算芯片》一文中。

  2. Epoch AIAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:GPT-6 Astra 在数学基准上领先,软件工程并非如此

    Epoch AI 用 Epoch Capabilities Index(ECI)及面向数学和软件领域的 ECI 变体,对比 GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol 和 Kimi K3 四款近期模型,结果显示 GPT-6 Astra 在数学基准上领先,但在软件工程上并非如此。

  3. Suhail(@Suhail)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    日处理超 1B tokens 的 OpenAI 或 Anthropic 批量 API 用户,Suhail 想聊聊 batching 实践

    Suhail 公开征集每天通过 OpenAI 或 Anthropic 的批量 API 请求处理超过 1B tokens 的用户,希望了解实现 batching 的利弊得失。感兴趣的开发者可通过私信与他交流,该推文发布时已获得 16 次转发和 65 个点赞。

  4. Greg Brockman(@gdb)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 的 Astra 与 OpenAI 的 Luna 双双登顶:支出与 token 用量各占榜首

    Anthropic 的 Astra 上周成为按支出(美元花费)计算的榜首模型,OpenAI 的 Luna 则成为按 token 使用量计算的榜首模型,且领先幅度很大。这组对比显示,按钱包份额与按 token 份额衡量的模型排名出现分化。

  5. Latent.Space(@latentspacepod)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Latent.Space 新一期:为何你仍低估了提示词、Claude Code Mods 与前沿节奏

    Latent.Space 即将上线新一期节目,主题包括为何人们仍低估提示词、Claude Code Mods(昨日发布)以及前沿节奏。Thariq 刚完成录制,内容涉及此前较少谈及的技术细节。

  6. LlamaIndex 🦙(@llama_index)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈用 Stainless 维护 SDK:API 一变就要更新、测试和发布

    LlamaIndex 分享了借助 Stainless 为 LlamaParse 生成并维护 SDK 的经验,指出每次 API 变更都会带来更新、测试和发布成本,而代码中暴露的不一致命名与 schema 也更难被忽视。Stainless 团队已加入 Anthropic,George He 和 Yong Park 撰文回顾了做对了什么、学到了什么,以及更换 SDK 生成器为何比预想更需谨慎。

9月15日周二
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Fable 5.1 在 Artificial Analysis Intelligence Index v4.2 中并列第一

    Claude Fable 5.1 在 Artificial Analysis 的 Intelligence Index v4.2 上守住第一,并与 OpenAI 的新模型在更新后的基准测试中并列。

  2. 随机小分队AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    付费率15%,a16z投资的Town,再度掀起AI助理大战

    a16z 投资的 AI 助理 Town 上线 3 个月,试用用户付费率超过 15%,传闻正洽谈约 10 亿美元估值的新融资。Town 要求用户先连接邮箱和日历才能使用,会按任务难度分配模型,大部分任务仍依赖前沿模型,为此公司每年为每位工程师投入至少 7.5 万美元购买 AI 工具。

  3. Amjad Masad(@amasad)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Brian Chau 称一家以色列 Effective Altruism 公司幕后策划 OpenAI、Anthropic 与 Meta 网络攻击

    Brian Chau 发推称,一家以色列 Effective Altruism 公司是 OpenAI、Anthropic 和 Meta 三起网络攻击的幕后推手,并称 @lumpenspace 参与协助。该推文附带长线程,获 278 次转发和 3984 次点赞。上述指控目前仅为该推文单方说法。

  4. Tw93(@HiTw93)AI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    潮流周刊第 282 期:夜雾上海与 iPhone Duo 合盖动效搬上 MacBook

    潮流周刊第 282 期以雾天上海照片为题,收录了把 iPhone Duo 合盖动效搬到 MacBook、敲机身或桌面触发 Mac 快捷键的工具、对比各销售地区 iPhone 差异的表格,以及 Dario 呼吁放慢 AI 迭代的相关内容。

  5. 腾讯云开发者AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Prompt 越长越好吗?研究告诉你何时该停手

    腾讯云开发者文章梳理多项研究与官方工程实践,讨论 Agent 系统指令、Skill 与工具说明什么时候该补写、删减或按需加载,指出没有通用最佳长度。

  6. 深网腾讯新闻AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话朱啸虎:基础大模型的故事今年是最后一年,办公Agent是大厂的天下

    金沙江创投朱啸虎在对话中判断,今年可能是基础大模型的最后一年,明年资本市场需要讲新故事,等Anthropic和国内大模型公司上完市,故事就讲得差不多了。他认为办公Agent肯定是大厂的天下,因为企业微信、飞书、钉钉掌握的组织关系与历史数据是创业公司难以逾越的上下文壁垒,创业公司只能选一家平台做垂直Agent。

9月14日周一
  1. 腾讯技术工程AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    别再只卷 Prompt 了,真正拉开 Agent 差距的是 Context Engineering

    腾讯技术工程发布长文,梳理 AI 工程从 Prompt Engineering 到 ReAct 再到 Context Engineering 的三阶段演进,并以 Anthropic《Effective Context Engineering for AI Agents》为主要参考构建实践体系。

  2. 强少来了AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI产品经理的PRD怎么写|有意思小周刊vol.171

    「有意思小周刊」vol.171 汇总了 AI 产品经理 PRD 撰写方法:AI 产品面向概率性系统,不能沿用确定性功能的传统 PRD 思路,完整骨架含十个部分,其中场景定义与输入输出、能力与功能描述、效果要求、异常与降级设计、评测方案五块应占全文一半以上篇幅。

  3. Yann LeCun(@ylecun)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yann LeCun 回应:Dario 早在 2019 年就称 GPT-2 开源太危险

    Yann LeCun 回应称,Dario 早在 2019 年就声称 GPT-2 开源太危险,他当时就嘲讽过这一说法,并认为现在所有人都该嘲讽。

  4. Sahil Lavingia(@shl)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Sahil Lavingia 将《The Minimalist Entrepreneur》做成 9 个 Claude Code 技能

    Sahil Lavingia 把自己所著《The Minimalist Entrepreneur》转化为 9 个 Claude Code 技能,并称这是他 star 数最多的 GitHub 仓库,已超过 10,000 stars。

  5. 十字路口CrossingAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    具身智能走到十字路口:对谈苏度、蚂蚁灵波、自变量、破壳的四种一线判断

    GPT-6 Astra 是否会降维打击具身行业,成为这场圆桌讨论的核心问题之一。苏度科技韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳机器人许华哲四位一线从业者,围绕数据来源(仿真与真机、Real-to-Sim)、模型路线、商业化落地指标(高成功率、客户持续付钱)以及被高估与低估的领域展开分歧讨论。

9月13日周日
  1. Aadit Sheth(@aaditsh)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dario Amodei 呼吁 AI 行业放缓,Anthropic 承诺第三方常驻评估权限

    Anthropic CEO Dario Amodei 发新文《We Must Pace the Frontier》,主张 AI 行业应当放缓,并提出三部分计划,Anthropic 单方面承诺执行其中第一步:向第三方评估者提供永久、员工级别的系统访问权限,以核验安全措施执行、上报事故并在训练期间评估模型对齐情况。

  2. Julien Chaumond(@julien_c)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    有人提议将 OpenAI、Anthropic 等前沿实验室国有化

    针对当前 AI 实验室格局,@signulll 提出为何不直接取消 IPO 并把实验室国有化,让美国财政部成为唯一股东。该设想认为国有化可立即解决部分激励问题,由政府统一协调算力、模型发布、安全标准与节奏,无需竞争对手合谋。具体形式可参照联邦所有的战略技术公司,将 OpenAI、Anthropic 及后续指定的前沿实验室纳入其中,由总统任命董事会。

  3. Julien Chaumond(@julien_c)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    David Sacks 回应 Dario 与 Sam:想放慢前沿就放慢,别假装需要他人许可

    David Sacks 在回应中称,Sam Altman 与 Dario Amodei 已认同"放慢前沿"的说法,他认为按市场份额、收入增长和模型能力衡量,两家已在前沿智能上形成双头垄断,因此支持其自主决定放缓,但反对以反垄断豁免或监管审批为条件。Sacks 还质疑 METR 的独立性,称其与 Anthropic 的投资人和员工交织,并指出中国不太可能加入全球协议。