跳到正文

#现象/趋势

今日 0 条
10月9日周五
  1. AI Will(@FinanceYF5)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    第 9 份年度《State of AI》报告发布:AI 如何构建更强的 AI、世界模型与 Physical AI

    第 9 份年度《State of AI》报告发布,内容涵盖 AI 如何构建更强的 AI、世界模型、Physical AI、地缘政治、网络防御,以及对未来 12 个月的预测。报告列出了今年最重要的发现,并附带视频与原文链接。

  2. AI Will(@FinanceYF5)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    State of AI 第九份年度报告发布:AI 构建更好的 AI、世界模型与物理 AI

    State of AI 第九份年度报告正式发布,涵盖 AI 构建更好的 AI、世界模型、物理 AI、地缘政治、网络防御以及 12 个月预测等议题。报告可在 stateof.ai 阅读,作者 Nathan Benaich 另提供了主编剪辑版视频。

  3. lmarena.ai(@lmarena_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LMArena 研究 AI 智能体的错误归因:GPT-6 Luna、Astra 与 Sol 表现各异

    LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。

10月6日周二
  1. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. 新智元AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Caltech 用物理信息神经网络求解无强迫三维欧拉方程奇点候选解

    Caltech 的 Anima Anandkumar 团队用物理信息神经网络(PINN),在无边界自由空间、无外加强迫项的条件下跑通了三维欧拉方程的自相似爆破奇点候选解,论文链接发布在 tensorlab.cms.caltech.edu。

10月1日周四
  1. Epoch AIAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 推出 ChatGPT 使用情况浏览器:基于 YouGov 5,000 名美国用户数据

    Epoch AI 发布 ChatGPT 使用情况浏览器,基于 YouGov 提供的 5,000 名美国 ChatGPT 用户聊天元数据,覆盖约 830 万条消息、66 万次对话,部分记录可追溯至 2022 年 11 月 ChatGPT 上线后数周。

9月25日周五
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta AI 用专用记忆智能体缓解长上下文遗忘,Claude Sonnet 4.5 基准从 37.6% 升至 45.9%

    Meta AI 将主行动智能体与专用记忆智能体配对,以解决长上下文导致 AI 智能体忘记早期错误的问题。记忆智能体保存关于工具和过往错误的结构化笔记,只在关键时机注入简短提醒。该方案把 Claude Sonnet 4.5 的基准从 37.6% 提升到 45.9%。

9月21日周一
  1. 晚点LatePostAI 评估 · 68/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里达摩院医疗 AI 十年:从专病模型拼到通用影像模型 DAMO RADAR

    Science 刊发阿里巴巴达摩院通用医疗影像模型 DAMO RADAR 论文,针对腹部增强 CT,同一模型可识别 18 个腹部器官上的 146 种病症,突破一病一模限制。

8月6日周四
  1. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 调查:AI 已接手五分之一美国职场人原交给同事的工作任务

    Epoch AI 与 Ipsos 于 7 月 10–19 日调查 1,106 名美国在职成年人发现,20% 受访者称 AI 已接管至少一项原本交给同事或外包的工作,十项职场任务中 AI 使用率从维护记录的 25% 到设计系统与软件的 57% 不等。

7月7日周二
  1. Epoch AIAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:OpenAI Codex 代码库贡献出现 AI 提效迹象

    Epoch AI 分析 OpenAI 公开 Codex 仓库的 41 位核心贡献者,用 LLM 评委估算每个已合并 PR 在无 AI 辅助下所需的工程师工时。2026 年 Q2 有 8% 的贡献者-日对应超过 24 小时的无辅助工作量,高于 2025 年 Q2 的 2%。Epoch 指出 LLM 评委的估算并不完美,只能视为节省时间的上限。

6月22日周一
  1. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。

6月17日周三
  1. Epoch AIAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 提议为 AI 研发构建专属 O*NET 任务清单

    Epoch AI 提议为 AI 研发打造专属 O*NET,将前沿 AI 实验室的工作拆解为 6 大类、60 多项代表性任务,并按 0 到 5 分评估当前 AI 对每项任务的自动化程度。现有 O*NET 对约 1000 种职业的描述过于宽泛,难以追踪 AI 研究本身的自动化进展。该任务数据集可用于观察任务被自动化的比例、解读 benchmark 结果,并建立研究者之间的通用词汇。

5月11日周一
  1. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 调查:349 名技术工作者自述 AI 带来的工作价值中位数提升 1.4–2 倍

    METR 在 2026 年 2–4 月调查了 349 名技术工作者(含 87 名软件工程师、71 名研究人员、129 名学者与博士生、48 名创始人及管理者),受访者自述 AI 工具带来的工作价值中位变化为 1.4–2 倍,速度中位变化为 3 倍。

5月8日周五
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 解析 AI 生产力提升的三种度量:Task Substitution and Uplift

    METR 提出 AI 生产力提升(uplift)的三种定义:旧任务提升、价值提升与新任务提升,并论证在简化假设下三者满足旧任务提升 ≤ 价值提升 ≤ 新任务提升。以软件工程师每日 8 小时写文档与 pull request 为例,若 AI 将写 PR 效率提高一倍,旧任务提升为 +33%,新任务提升为 +50%,价值提升则介于两者之间。

4月21日周二
  1. METRAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 分析 NanoGPT speedrun:AI 智能体在 AI 研发中贡献了多少进展

    METR 依据 NanoGPT speedrun 排行榜分析 AI 智能体对 AI 研发的加速作用:2024 年 5 月至 2026 年 3 月,36 位贡献者提交 77 项记录,将 8×H100 上的 GPT-2-small(124M)训练时间从 45 分钟压缩至 1.43 分钟,累计提速 31 倍,其中 4 项记录归于 AI 智能体。

2月10日周二
  1. METRAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    一个更简单的 AI 时间线模型预测:AI 研发将在约 2032 年实现 99% 自动化

    一份基于 AI Futures 模型简化的新模型预测,在算力增长与算法进步维持当前趋势下,AI 研发将在 2032 年底实现超过 99% 的自动化,该模型将参数从 AIFM 的 33 个压缩到 8 个。其多数模拟显示,到 2035 年 AI 效率将提升 1000x 至 10,000,000x,研究产出提升 300x 至 3000x。模型采用不追求 100% 全自动化、任务间无替代性两项保守假设。

8月20日周三
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 与 FRI 试点研究:AI 研发自动化加速的预测结果

    METR 与 Forecasting Research Institute 对 8 位 AI 预测专家和 10 位超级预测者开展试点调查,预测 AI 研发自动化后的加速与社会影响。研究设定的关键事件包括:若 2027 年前 AI 在 AI 研发任务上追平顶尖人类研究员,AI 进步速度出现 3 倍以上提升的概率,以及这种加速是否会带来全球能耗一年内翻倍或减半等极端后果。