跳到正文

全部动态

今日 12 条
10月9日周五
  1. AK(@_akhaliq)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Plasticity:通过经验测量智能体自我改进的论文发布

    论文《Agent Plasticity: Measuring Self-Improvement Through Experience》发布,提出通过经验测量 AI 智能体自我改进能力的方法,论文已在 Hugging Face 上线。

  2. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Iris-3B:用像素空间扩散训练、转换与微调超越潜空间

    Iris-3B 提出在像素空间进行扩散训练、转换与微调的方法,试图超越潜空间扩散路线。相关论文已发布在 Hugging Face Papers(编号 2610.09)。

  3. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    面向世界动作模型的视频原生动作先验学习论文发布

    一篇题为 Native Action-Prior Learning from Videos for World Action Models 的论文发布,提出从视频中直接学习动作先验,用于世界动作模型。论文页面可在 huggingface.co 查看。

  4. AK(@_akhaliq)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PAMI:面向文本到人-物交互生成的部分锚定运动方法

    论文提出 PAMI(Part Anchored Motion),用于文本到人-物交互(Human-Object Interaction)生成,论文页面已发布在 Hugging Face Papers(编号 2609.38…)。

  5. AK(@_akhaliq)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    《Old Ideas, Novel Problems:基于 LLM 的新颖性评估的不稳定性》

    一篇题为 "Old Ideas, Novel Problems" 的论文研究了基于 LLM 的新颖性评估的不稳定性。论文指出,让大语言模型判断研究想法是否新颖时会得到不稳定的结果,即"新想法、新问题"。论文原文已在 Hugging Face 上发布。

  6. Sundar Pichai(@sundarpichai)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 与 BIDMC 在《柳叶刀》发表 AMIE 前瞻性研究

    Google 与 BIDMC 在《柳叶刀》发表 AMIE 研究,这是首个在真实诊室开展的面向患者的对话式诊断前瞻性研究。AMIE 是供患者在就诊前聊天的研究系统,在真实急诊患者中测试用于安全采集病史;医生表示 75% 的情况下摘要帮助其为就诊做准备,超过一半的情况下影响了诊疗方式,AMIE 的鉴别诊断与医生最终诊断吻合率为 90%。

  7. The Keyword (blog.google)AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 与 BIDMC 在《柳叶刀》发表 AMIE 临床研究

    Google 与 Beth Israel Deaconess Medical Center(BIDMC)团队在《柳叶刀》发表研究,在 BIDMC 门诊开展真实临床研究,98 名患者在紧急就诊前先与 Google 研究型诊断 AI 聊天机器人 AMIE 对话。

  8. elvis(@omarsar0)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 提出 CI 程序修复智能体 FlowAgent,真实故障修复正确率 67.18%

    Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。

  9. elvis(@omarsar0)AI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RSIGym:Evolvent AI 发布 AI 研究智能体训练环境,Opus 5 在 SWE-bench Verified 提升至 50.33%

    Evolvent AI 推出 RSIGym,把训练、推理、评测与沙箱打包成研究智能体可调用的服务,并开源代码、实验配置、研究轨迹和评测日志。以 Opus 5 作为研究者,改进后的系统在 SWE-bench Verified 上从 17.67% 升至 50.33%。

10月8日周四
  1. AI科技大本营AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    多加 50% GPU,Rollout 只快 10.3%:Agent 训练的瓶颈开始从模型转向系统

    中科大、香港科技大学与阿里巴巴研究者发布 PEARL 论文,针对 Agentic RL 中 Rollout 占端到端时间 81.8% 的 GPU 调度瓶颈,提出动态调整 GPU 角色与 Prefill–Decode 配置的弹性方案。

  2. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 Pento 推出 miniCOIL EN-ES 双语稀疏神经检索模型

    Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。

  3. 硅星人ProAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    UniPat AI 推出 PaperBenchX:10 个前沿 Agent 复现论文集体翻车

    UniPat AI 推出 PaperBenchX(PBX)评测,让 AI 在真实科学软件中复现已发表论文的关键实验。在覆盖 12 个科学方向的 93 道题中,70 道没有被任何配置完全复现,表现最好的 GPT-6 Astra 仅有 14% 的任务过关,国产模型基本在 7% 左右。评测发现建模和执行平均得分都在六成以上,但科学验证仅约 43%,多轮交互难以弥补这一差距。

  4. NVIDIA AI(@NVIDIAAI)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 研究人员构建 PivotOPD,教 AI 智能体从早期错误中恢复

    NVIDIA 研究人员构建了 PivotOPD,用于教会 AI 智能体避免任务早期的错误,并在错误发生后恢复。训练时由教师模型向智能体展示更优动作,以及如何在后续步骤中回到正轨。论文与演示已在 research.nvidia.com/labs/lpr/pivot 发布。

  5. Stanford AI Lab(@StanfordAILab)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 本周在 COLM 展示 SAIL 项目

    Stanford AI Lab 本周在旧金山 COLM 上展示其 SAIL 项目,并在官网博客汇总了相关研究。

  6. Perplexity(@perplexity_ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GPT-OSS-120B 智能体在 BrowseComp+ 上达到 64.0%

    在智能体搜索任务中,一个使用 9B 模型的 GPT-OSS-120B 智能体正确回答了 64.0% 的 BrowseComp+ 问题,领先第二名 ColBERT 模型 4.9 个百分点,且搜索次数少于所有基线。

10月7日周三
  1. 新智元AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    2026年诺贝尔化学奖揭晓:95岁 Henri Kagan 与 Kenso Soai 破解生命同手性之谜

    2026年诺贝尔化学奖授予 Henri Kagan 和 Kenso Soai,表彰他们在不对称有机合成中发现非线性效应与自催化作用。Kagan 证明异手性催化剂配对会失活、实现手性放大,Soai 则发现 Soai 反应:起点仅 0.00005% 的手性偏差经三轮自催化放大至 99.5% 以上。

  2. 机器之心AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈工大(深圳)与 NUS 提出 QuantWM:免训练 2-bit KV Cache 量化,视频世界模型压缩最高 6.20 倍

    哈工大(深圳)iLearn-Lab 与新加坡国立大学 LV-Lab 提出免训练 2-bit KV Cache 量化框架 QuantWM,通过量化敏感性感知聚类(QSAC)和主子空间注意力补偿(PSAC)改善视频世界模型的时序闪烁与画质下降。

  3. Greg Brockman(@gdb)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布内部前沿模型产出的数学结果

    OpenAI 发布了一批由其内部前沿模型产出的数学结果,并在 GitHub 上公开(github.com/openai/math)。发布前 OpenAI 咨询了普林斯顿高等研究院数学与人工智能独立咨询组的意见,并参考其建议与公开推荐来确定发布方式。Greg Brockman 表示这是朝着加速科学发现、改善所有人生活质量的方向。

  4. Epoch AIAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 更新 EBR-bench:GPT-6 Astra 因利用单卡漏洞满分,官方禁用该卡

    Epoch AI 更新了其用桌游 Earthborne Rangers 测试模型长任务学习能力的 EBR-bench:GPT-6 Astra 曾多次拿到满分,但所有最高分都依赖一张可绕过游戏回合限制的卡牌,官方因此在该基准默认设置中禁用此卡。

  5. Epoch AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布 InnovationEval:AI 能自动完成 AI 研发吗?

    Epoch AI 发布 InnovationEval 评测,用一篇已发表的在线策略自蒸馏(SDPO)论文作基准,测试 AI 能否独立提出有同等效果的新后训练算法。

  6. The Rundown AI(@TheRundownAI)AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 用未公开内部模型发布 722 篇数学论文

    OpenAI 发布 722 篇由一款未公开内部前沿模型产出的数学论文,称这些结果解决或推进了数百个未解问题。该模型被输入约 4000 道题,每个结果平均消耗约三小时 ChatGPT Pro 级算力。OpenAI 表示曾咨询普林斯顿高等研究院数学与人工智能独立顾问组,并参考其公开建议决定发布方式,结果已上传至 github.com/openai/math。

  7. GitHub(@github)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub 发布 ReviewBench:基于 1.039 亿 PR 分析的开源代码审查评测基准

    GitHub 推出开源基准 ReviewBench,用于评测 AI 代码审查工具能否发现真正重要的问题而不引入噪音。该基准基于对 1.039 亿个 GitHub pull request 的分析构建,包含横跨 19 种语言的 219 个 PR,支持开发者自带代码审查智能体进行评测并提交结果。

  8. elvis(@omarsar0)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    每个智能体基准都应审计其验证器:Parsewave 修复 AutomationBench 206 个验证器 bug,发布 AutomationBench Verified

    Parsewave 审查了 Zapier AutomationBench 全部 600 个公开任务,用智能体写出逼真的错误答案来诱导验证器,人工复核确认 206 个真实 bug,并全部修复,发布 AutomationBench Verified。

  9. AK(@_akhaliq)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OmniReasoning:突破音视频联合推理的极限

    论文 OmniReasoning 提出突破音视频联合推理极限的方法,论文页面已发布在 Hugging Face。该推文获得 65 个点赞、11 条回复和 8 次转发。

  10. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ALoDLM:自适应循环扩散语言模型论文发布

    论文 ALoDLM(Adaptively Looped Diffusion Language Models)发布,提出面向扩散语言模型的自适应循环方法,论文页面已上线 Hugging Face。原文未披露参数量、benchmark 分数与开源情况等细节。

  11. The Keyword (blog.google)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 研究:AI 盲扫超声让基层卫生员8小时上手,妊娠龄与胎位判断媲美专业超声医师

    Google 与 Northwestern、Jacaranda Health 合作,在肯尼亚内罗毕和芝加哥各纳入 1000 名孕妇,用机器学习模型分析未经超声培训的卫生员按预设路径完成的"盲扫"超声视频,估测妊娠龄和胎位,准确度与受训超声医师相当。卫生员仅需 8 小时即可学会操作,且全部处理在设备端完成,无需供电或 Wi-Fi,可在资源匮乏地区提供产前关键信息。

  12. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Parsave 审计 Zapier AutomationBench:600 个任务查出 206 个验证器 bug,发布 AutomationBench Verified

    Parsave 对 Zapier AutomationBench 全部 600 个公开任务逐一审计验证器,智能体标记出 323 个可疑验证器,人工复核确认 206 个真实 bug,并已全部修复,发布 AutomationBench Verified。

  13. elvis(@omarsar0)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文提出 Harness-Aware Distillation:为小语言模型智能体做 harness 感知蒸馏

    一项新论文提出 Harness-Aware Distillation,用同一教师模型分别在带与不带 harness 信息下作答,训练学生模型偏好带 harness 时选择的动作,并用过滤器剔除与 harness 记录矛盾的配对,全程不使用任务奖励或成功标签。

10月6日周二
  1. The JetBrains BlogAI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    JetBrains 提出 AI 生成代码审查框架:核心问题是信任校准

    JetBrains 的 Human-AI eXperience 团队与隆德大学研究者合作,提出一套审查 AI 生成代码的概念框架,核心观点是审查 AI 生成代码的关键问题是"信任校准",而非传统的 diff 比对。

  2. Epoch AIAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谁最容易受到芯片供应冲击?Epoch AI 拆解半导体投入产出数据

    Epoch AI 将半导体从国际投入产出表的宽泛电子类别中拆分出来,测算各国对芯片供应链冲击的暴露程度。2022 年每 1000 美元中国最终需求为半导体生产商带来 15.2 美元收入,是美国的 2.7 倍(美国为 5.7 美元)。在台湾供应中断叠加中西脱钩的模拟情景中,中国先进处理器价格上涨 17 倍、实际国民总支出下降 3%,美国则约为 20% 涨幅和 0.6% 降幅。

  3. QdrantAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google EmbeddingGemma 2 能压到多小?1-bit 量化省 30 倍向量内存

    Google DeepMind 发布开源嵌入模型 EmbeddingGemma 2,基于 Gemma 4,把文本、代码、图像、视频、音频映射到同一 768 维空间,文本路径为 270M 参数,支持 8K token 上下文,代码检索较初代提升 14%。

  4. elvis(@omarsar0)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软提出 CorpusMap:为 LLM 智能体预建实体地图,检索准确率提升超 6 分

    微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。

  5. 大模型智能AI 评估 · 69/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hinton等22人发布首篇RSI论文,讨论AI研发自动化是否触发智能爆炸

    Geoffrey Hinton、Yoshua Bengio、Andrew Barto、Jakub Pachocki 等22位作者发布论文《What if automating AI R&D triggers an intelligence explosion?

10月5日周一
  1. elvis(@omarsar0)AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SelfSearch 让编码智能体改写自身 harness,成本 4.03 美元追平 Codex

    一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。

  2. clem 🤗(@ClementDelangue)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 用代理把 Claude Code、Codex 等 10 个编码 harness 变成 RL 训练环境

    Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。

  3. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rollout-Marginal Distillation:面向长时长自回归视频生成的论文发布

    论文《Rollout-Marginal Distillation for Long-Horizon Autoregressive Video Generation》已在 Hugging Face Papers 上线,提出用于长时长自回归视频生成的 rollout-marginal 蒸馏方法。原文未披露具体模型、参数规模或 benchmark 分数,仅给出论文链接与演示视频。

  4. 新智元AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Caltech 用物理信息神经网络求解无强迫三维欧拉方程奇点候选解

    Caltech 的 Anima Anandkumar 团队用物理信息神经网络(PINN),在无边界自由空间、无外加强迫项的条件下跑通了三维欧拉方程的自相似爆破奇点候选解,论文链接发布在 tensorlab.cms.caltech.edu。

  5. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    递归自改写实现复杂任务的扩展轨迹

    一篇题为《Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite》的论文已在 Hugging Face 上线,提出用递归自改写来扩展复杂任务的性能轨迹。论文页面已公开,具体方法与结果细节以原文为准。

  6. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Octrees as an Explicit 3D Language:用八叉树作为显式 3D 语言的论文

    论文《Octrees as an Explicit 3D Language》提出将八叉树作为显式的 3D 语言表示,论文页面已在 Hugging Face Papers 上线(huggingface.co/papers/2610.02…)。该工作由 AK 在 X 上分享,附带的演示视频因浏览器不支持 video 标签未能直接播放。

  7. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EditHero:面向长程部件级 3D 编辑与 Vibe Modeling 的基准

    EditHero 是一个面向长程部件级 3D 编辑与 Vibe Modeling 的基准,论文已在 Hugging Face Papers 发布(编号 2610.02)。该基准聚焦长时程、部件粒度的 3D 编辑任务,具体指标与数据未在原文披露。