跳到正文

#数据/训练

今日 42 条
6月29日周一
  1. Import AI — Jack ClarkAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 463:NVIDIA 用 ENPIRE 让机器人自我改进,中国 10k GPU 集群与人类时代挽歌

    NVIDIA 推出 ENPIRE 框架,让编码智能体驱动真实机械臂自主试错、自动重置与评估,在 PushT、整理插针、用切割器剪扎带等任务上实现 99% 成功率。

  2. AI at Meta BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta 发布 Brain2Qwerty v2,非侵入式脑电实时解码词准确率达 61%

    Meta 发布 Brain2Qwerty v2,这是可从非侵入式脑记录实时解码句子的端到端流程,实现 61% 的词准确率,而其他非侵入式方法为 8%,表现最好的受试者达到 78%。

6月27日周六
  1. Stanford AI Lab(@StanfordAILab)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Auto-psych:AI 智能体自主完成心理学研究全流程的新系统

    Stanford AI Lab 分享的 Auto-psych 让 AI 智能体自行走完整个科研闭环:提出理论、设计实验、在线招募真实受试者,并根据结果迭代改进。研究者 noahdgoodman 称,他多年来设想的"自动化心理学研究"这次因 AI 取得了实质进展。

6月26日周五
  1. Lilian Weng(@lilianweng)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 发布关于 Scaling Laws 的长文

    Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。

  2. MongoDB BlogAI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB Atlas 迎来 10 周年:为 AI 应用而生的数据平台

    MongoDB Atlas 迎来 10 周年,目前每月有超过 25 万开发者上手使用,日处理查询超 3 万亿次,较 2023 年增长约三倍,并贡献 MongoDB 75% 的收入。这个最初以托管数据库形式出现的云产品,已扩展为面向 AI 应用的数据平台,支持运营数据、搜索与检索,避免开发者拼接割裂的系统。

6月24日周三
  1. 通义大模型AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qwen-AgentWorld 开源:让 Agent 先预测环境再行动

    通义实验室开源 Qwen-AgentWorld,称其为首个原生语言世界模型,覆盖 MCP、Search、Terminal、SWE、Web、OS、Android 七大领域,基于超 1000 万条真实交互轨迹经 CPT、SFT、RL 三阶段训练。

  2. Epoch AIAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 分析 1604 条中国 AI 岗位招聘信息,揭示算力与商业策略

    Epoch AI 抓取 DeepSeek、MiniMax、Moonshot、Z.ai、字节跳动和阿里六家中国 AI 公司的 1600 多份招聘信息,发现其推理仍依赖 Nvidia CUDA 与 TensorRT-LLM,同时探索昇腾、寒武纪等国产芯片,Z.ai 称今年初已用国产芯片端到端训练出 160 亿参数的 GLM-Image。

  3. Lilian Weng — Lil’LogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 详解 Scaling Laws:从早期学习曲线到算力最优分配

    一篇技术综述梳理了 scaling laws 的经验基础:Amari 等(1992)用贝叶斯方法导出四类幂律学习曲线,Hestness 等(2017)在机器翻译。

  4. Stanford AI Lab(@StanfordAILab)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Spiral:用 RL 让 LLM 学会并行采样与聚合推理

    斯坦福 AI Lab 提出 Spiral,一个用强化学习让模型端到端掌握串行、并行与聚合三种推理算力原语的框架。它用集合 RL 训练模型生成对聚合器集体有用的回答,再用标准 RL 让它把多个回答聚合成更优答案。目前仅优化串行算力的训练方式与部署时的多轴扩展存在根本错配,Spiral 仅凭最终输出奖励即可学习协调三种推理方式。

6月19日周五
  1. Jeff Dean(@JeffDean)AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 从 TPU v2 到 Ironwood 的训练超算论文:五代表现能效提升约 30 倍

    Google 同事 Norm Jouppi、Sridhar Lakshmanamurthy、Cliff Young 和 David Patterson 撰写的论文将发表于 2026 年 7/8 月《IEEE Micro》,题为 "Google's Training Supercomputers from TPU v2 to Ironwood"。

6月18日周四
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 分享向量数据库数据导入最佳实践:批处理限流、幂等重试与 blobHash

    Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。

  2. 通义大模型AI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    通义实验室联合人大开源统一科学大模型 LOGOS

    通义实验室 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源多领域科学生成基础模型 LOGOS,基于统一科学语法在六大科学任务上匹配或超越领域专用方法。

  3. Nick St. Pierre(@nickfloats)AI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Midjourney Medical 公布全身超声计算断层扫描计划:目标 5 万台扫描仪、每月 10 亿次扫描

    Midjourney Medical 宣布进军医疗影像,计划打造 5 万台全身超声计算断层扫描(ultrasonic computational tomography)扫描仪组成的机群,合计每月完成 10 亿次扫描,让全身成像覆盖地球上所有人。

  4. Jim Fan(@DrJimFan)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 揭秘 ENPIRE 物理 AutoResearch 背后的机器人安全与奖励机制

    Jim Fan 披露 ENPIRE 物理 AutoResearch 的幕后设计,需 8 台机器人可无人值守整夜运行。系统内置两层安全机制:硬性运动学限制在机器人越界时立即判定任务失败并自动重置,扭矩限制柔性夹爪则在接触失误时安全停转;同时定义机器人利用率、Token 利用率等遥测指标供 ENPIRE 实时感知资源。

6月17日周三
  1. 哔哩哔哩技术AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站特征选择算法LeAP:模型的“精准瘦身”实践

    B站搜索团队提出特征选择算法LeAP,将离散的特征打乱转化为端到端可学习的门控网络,并引入基于特征打散差异的自适应梯度去偏正则。该算法已被ECML-PKDD 2026录用,在Criteo、Avazu、ML-1M、AliCCP等公开数据集上达到SOTA水平。

  2. Epoch AIAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 提议为 AI 研发构建专属 O*NET 任务清单

    Epoch AI 提议为 AI 研发打造专属 O*NET,将前沿 AI 实验室的工作拆解为 6 大类、60 多项代表性任务,并按 0 到 5 分评估当前 AI 对每项任务的自动化程度。现有 O*NET 对约 1000 种职业的描述过于宽泛,难以追踪 AI 研究本身的自动化进展。该任务数据集可用于观察任务被自动化的比例、解读 benchmark 结果,并建立研究者之间的通用词汇。

  3. Satya Nadella(@satyanadella)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Azure 刷新 AI 训练基准:迄今最快训练时间、最大已报告规模

    Azure 在领先 AI 训练基准上实现迄今最快训练时间,并达到该基准已报告的最大规模。微软称这一成果来自芯片、系统、网络与软件的全栈创新,以及与 NVIDIA 的深度合作。

6月16日周二
  1. 晚点聊 LateTalkAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    访谈 Cerebras 早期投资人周楠:英伟达挑战者、Scaling Law 的萌芽与被遗忘的百度美研

    高通创投投资人周楠在播客中回顾了 9 年前投资 Cerebras Systems 的过程,这家提供新架构 AI 算力的芯片与系统公司于 5 月中旬完成 IPO,被外界视作英伟达的补充甚至挑战者。节目从这笔非共识投资切入,聊到 Scaling law 在硅谷萌芽的阶段,以及吴恩达、Dario Amodei 等人在百度美研的往事,并延伸至推理优化、Infra 创新与物理 AI 等新分歧。

  2. 卫诗婕|商业漫谈Jane's talkAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    智元姚卯青谈具身智能竞速:孵化数据平台觅蜂,行业离"GPT-1"还差一亿小时数据

    智元机器人合伙人姚卯青在访谈中表示,2026年具身智能连GPT-1阶段都未达到,真机数据量与支撑基座模型涌现所需规模相差四五个数量级。智元已将核心数据资产剥离,独立孵化一站式物理AI数据服务平台"觅蜂",对标具身版Scale AI,姚卯青兼任其董事长兼CEO。他预计2027到2028年行业有望达到1亿小时级数据规模,届时才可能出现真正的涌现能力。

6月13日周六
  1. Jeff Dean(@JeffDean)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jeff Dean 转发研究:单个皮层神经元可分类猫狗、识别语音并求解 10-bit parity

    一项新方法发现,单个皮层神经元就能完成猫狗分类、识别口头单词和求解 10-bit parity,而这些任务此前被认为需要整个神经网络才能完成。Jeff Dean 转发并称,真实生物神经元的能力远超感知机中的经典人工神经元。

6月12日周五
  1. 知行小酒馆AI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    对话沈帅波:AI 时代,普通人从零做自媒体还有机会吗?

    财经作家沈帅波在播客「知行小酒馆」讨论 AI 崛起后自媒体行业的变化:AI 可写文案、做图片、生成视频,有人用它同时运营几十个账号。他认为追热点的门槛已不是写作水平,而是能否搭起「内容工厂」,平台算法则是黑盒,规律和打法往往很快失效。

  2. 哔哩哔哩技术AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    B站 Index LLM 团队开源 CASTER:让 AI 像观众一样评估 UGC 视频

    哔哩哔哩 Index LLM 团队的 CASTER 已被 ACL 2026 Main Conference 收录,并开源模型、代码与数据集。其 MEDEA 框架用 Social-CoT 模拟多元观众反应,在 CASTER-Bench 上高质量类别 F1 达 0.650,超越 GPT-5.2 与 Claude-4.5-Opus,提升 17.1%。

  3. 卫诗婕|商业漫谈Jane's talkAI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    00 后创业者陈源培访谈:从 RoboMaster 到李飞飞实验室,两次「全球首次」与具身智能的路线之争

    灵初智能联合创始人陈源培在斯坦福李飞飞实验室实现了全球首次双臂长程灵巧操作,以及全球首次用人类数据训练机器人双臂灵巧操作。他认为具身 Scaling Law 的核心瓶颈是数据,单靠遥操数据难以堆到足够规模,百万小时级别的人类中心数据至少能让行业看到效果;跨本体泛化的关键是提取人类操作中的通用信息,再用强化学习补足机器人具体关节、力和接触细节。

  4. MongoDB BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB:生产级 AI 智能体需要生产级数据平台

    MongoDB 认为生产级 AI 智能体需要生产级数据平台,主张用原生 JSON 存储融合短期记忆、长期知识与企业的动态非结构化数据,并直接在运营数据上提供搜索、向量搜索、混合搜索和嵌入向量等信息检索能力,免去频繁同步。DevRev 的 AgentOS 基于 MongoDB Atlas 运行,每月处理数十亿次请求。MongoDB 称已有超过 67,000 家客户使用其服务。

  5. Richard Socher(@RichardSocher)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化科研系统成果,在 NanoGPT speedrun 等三个基准取得 SOTA

    Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。

6月11日周四
  1. UX MagazineAI 评估 · 16/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Databricks 首席 AI 科学家:核聚变有了,电线还没造

    Databricks 首席 AI 科学家 Jonathan Frankle 将当前 AI 比作"造出了核聚变却没造电线":模型能力过剩,而规格定义、评估纪律、应用模式和数据治理仍严重缺位。他称百万 token 的上下文窗口不意味着可以放弃文档管理,检索更多材料反而可能因干扰项增多而让表现变差。他还认为 DeepSeek 证明了好科学与时间投入能与金钱买时间相抗衡。

  2. Epoch AIAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:最大 AI 数据中心算力每 7 个月翻倍

    Epoch AI 的数据显示,自 2024 年 8 月 SpaceXAI 的 Colossus 1 上线以来,按算力容量计算的最大 AI 数据中心纪录每 7 个月翻倍。

  3. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Crownlands 开源 Gateway 4M,迄今最大活体人类单细胞组织数据集

    Crownlands 开源 Gateway 4M,这是迄今从活体人类中发布的最大单细胞组织数据集,用于推进大脑衰老与神经退行性研究。人类生物学数据对科学家和 AI 理解健康与疾病至关重要,Kevin Weil 称此举对加速 AI 在科学与健康领域的影响意义重大。

6月9日周二
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 推出托管记忆服务 Engram,把 Agent 记忆当基础设施而非聊天记录

    Weaviate 推出托管记忆服务 Engram,不再把记忆当作不断增长的提示词,而是作为基础设施处理。Engram 接收对话、字符串或预抽取事实等原始输入,通过异步流水线抽取信号、与已有记忆比对转换,并把干净状态写入数据库,供 Agent 后续可靠检索。该服务面向用户偏好记忆、跨任务学习、过期事实更新以及按用户、团队、工作流限定记忆范围等场景。

6月8日周一
  1. Google DeepMind BlogAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 在塞拉利昂试验 Guided Learning:数学成绩提升 0.258 个标准差

    Google DeepMind 公布在塞拉利昂开展的一项预注册对照试验结果,使用 Guided Learning 的学生数学成绩比对照组提升 0.258 个标准差,约相当于 1.2 至 1.7 年的常规学习进度。

6月7日周日
  1. Junyang Lin(@JustinLin610)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    人类研究员在 AI 自我改进中的角色是否越来越边缘化?

    针对 AI 递归式自我改进,有观点认为这一方向潜力巨大,但人类研究员在其中似乎越来越不重要,令人沮丧。该观点同时指出,人类监督将变得更加有原则、更高层级,届时想象力与愿景比以往任何时候都更重要。

6月6日周六
  1. Ahead of AI — Sebastian RaschkaAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 研究论文清单:2026 年 1 月至 5 月

    Sebastian Raschka 发布 2026 年 1 月至 5 月的 LLM 研究论文精选清单,涵盖架构与模型设计、高效训练与扩展、推理效率与 KV Cache、稀疏注意力与长上下文、推理与测试时计算、强化学习与 RLVR、智能体系统与工具使用、编码智能体与软件工程、扩散语言模型、模型评测与基准十大类。

6月5日周五
  1. Epoch AIAI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:AI 数据中心建设占美国 GDP 约 0.8%,占比仍小但增长迅速

    Epoch AI 数据显示,2026 年 Q1 AI 相关数据中心建设、算力硬件与网络设备投资约占美国 GDP 的 0.8%,带动整体计算基础设施升至 GDP 的约 1.5%,高于 2015–2022 年约 0.7% 的平均水平。AI 基础设施已成为美国私人投资增长的首要驱动力,该指标仅统计美国境内的私人投资。

6月4日周四
  1. cat(@_catwu)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 数据团队用 Claude 自动化 95% 业务分析查询

    Anthropic 数据团队借助 Claude 自动化了 95% 的业务分析查询,并发布博客介绍其构建数据分析智能体时在技能、数据基础与评估上的最佳实践,涵盖 evals、消融实验和在线验证方法。

6月2日周二
  1. Richard Socher(@RichardSocher)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Richard Socher:AI 仍需更好的数据,金融智能体在竞争性基准上大幅跃升

    Richard Socher 指出,AI 仍需要更好的数据才能给出更复杂的答案,金融智能体尤为如此。他提到团队合作打造了一款基于 Deep Agents、LangSmith 和 you.com Finance Research API 的宏观经济研究智能体,能分析 GDP 数据、检测异常并输出带引用的结构化简报。Socher 称在一个多家竞争对手也公布结果的竞争性基准上,很少见到如此大幅的提升。

6月1日周一
  1. Import AI — Jack ClarkAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Import AI 459:AI 监管之难、蛋白质折叠模型的缩放定律、AI 系统灭绝风险的定价

    Import AI 459 聚焦三项研究:弗吉尼亚大学、Anthropic 与加拿大银行的经济学家测算美国 AI 经济名义规模 2025 年约 2500 亿美元。

  2. Modal BlogAI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Modal 发布开源库 Modal Dojo,将 RL 后训练基础设施抽象为百行代码

    Modal 发布实验性开源库 Modal Dojo,让用户在 100 行以内代码中定义训练任务,只需配置奖励函数、模型和环境。Modal 表示 RL 后训练的瓶颈在基础设施,训练器与 rollout 引擎间的权重同步是主要开销,同集群内 RDMA 传输可将训练速度提升 100 倍,其 Sandbox 可每秒启动数千个、并发维持上百万个。

5月30日周六
  1. Fei-Fei Li(@drfeifei)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    李飞飞团队发布 GPIC:面向大规模视觉生成的 1 亿图文对数据集与基准

    李飞飞等人推出 GPIC(Giant Permissive Image Corpus),一个面向大规模生成模型时代的视觉生成数据集与基准,含 1 亿条 VLM 标注图文对用于训练、100 万条图文对用于评测,总计约 28 万亿像素。该数据集完全允许研究及商业用途,采用集中托管,并同时提供数据集、基准与模型。

5月25日周一
  1. Epoch AIAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI:算力短缺要来了吗?

    Epoch AI 测算,以 Kimi K2.6 类模型在 Q4 2025 全部 Nvidia GB200 与 GB300 上的推理能力,可提供 5 亿至 200 亿 output tokens/秒,取决于请求上下文长度(8,000 / 25,000 / 128,000 输入 token)。

5月20日周三
  1. Modal BlogAI 评估 · 21/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Applied Compute 如何在 Modal 上扩展强化学习训练

    Applied Compute 为 DoorDash、Cognition 等企业训练定制 AI 智能体,其核心训练机制是强化学习。团队用 Modal Sandboxes 搭建高保真环境、以 Modal Functions 做大规模并行评分,并靠预构建镜像的亚秒级冷启动让训练循环保持 GPU-bound 而非 CPU-bound。