跳到正文

#产品更新

今日 0 条
10月9日周五
  1. AI科技评论AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    星动纪元 VPP2 登顶 RoboDojo,14B 参数无额外数据开源可复现

    星动纪元(清华唯一持股的具身公司)推出世界动作模型 VPP2(Video Prediction Policy 2),以平均成功率 32.26%、平均得分 39.26 登顶 RoboDojo 榜首,超过此前 GPT-6-Astra 的 22.48% 和 28.97%,并拿下 generalization、precision、memory 三项第一。

9月29日周二
  1. Microsoft Research BlogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究院发布生物学 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的多模态世界模型加交互式 harness,连接科学工具、文献、湿实验与研究人员。该系统与 Broad Institute 合作用于胰腺导管腺癌研究,预测并优先排序数千种化合物以改变肿瘤细胞状态,从缩小搜索空间到筛出候选仅用一个周末,排名最高的化合物在多种湿实验中获得验证。

9月8日周二
  1. Google DeepMind BlogAI 评估 · 67/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 AlphaGenome Atlas:覆盖人类基因组 90 亿个单字母变异的预测图谱

    Google DeepMind 推出 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,并同步发布 AlphaGenome Variant Impact(AVI)评分,将 AlphaGenome 与 AlphaMissense 的预测压缩为单一数值,便于快速排序变异。

9月1日周二
  1. Epoch AIAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 FrontierMath Erdős 基准

    Epoch AI 发布 FrontierMath Erdős 基准,由 Thomas Bloom 从 erdosproblems.com 未解问题中挑选 68 道兼具数学意义与难度的问题,其中 50 道已由 Google Formal Conjectures 项目完成 Lean 形式化。

6月17日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 推出 ENPIRE:让 Codex 智能体驱动机器人自主实验

    NVIDIA GEAR 实验室发布 ENPIRE,为 8 个 Codex 智能体配备机器人集群、GPU 配额和充足 token 预算,目标是在保证安全、不浪费算力的前提下尽快解决任务。

6月12日周五
  1. Richard Socher(@RichardSocher)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化科研系统成果,在 NanoGPT speedrun 等三个基准取得 SOTA

    Richard Socher 宣布 Recursive 公开其自动化开放式发现系统,作为迈向递归自我改进超级智能(RSI)的 v0.1 版本。该系统在 NanoGPT speedrun、NanoChat 和 NVIDIA Sol-ExecBench 三个 AI 任务上均取得 SOTA,且取得这些结果的代码和思路由 AI 系统自身提出,而非团队发明。

6月11日周四
  1. Richard Socher(@RichardSocher)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Recursive 发布自动化开放式发现系统,在 NanoGPT speedrun 等三项 AI 任务取得 SOTA

    Richard Socher 宣布 Recursive 首次公开其自动化开放式发现系统的成果,该系统瞄准递归自我改进超级智能(RSI),可指向任意难题并产出有用发明。

4月30日周四
  1. Google DeepMind BlogAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下辅助患者诊疗的“三方协作”模式。

4月1日周三
  1. Jim Fan(@DrJimFan)AI 评估 · 74/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jim Fan 团队开源 CaP-X:让智能体在真实机器人上运行

    Jim Fan 团队开源 CaP-X,将智能体以机械臂和人形机器人形态带入物理世界,并配套感知 API、执行 API 与自动合成的技能库;团队称策略如 VLA 也只是 API 调用,因此它是旧技术栈的严格超集。