跳到正文

全部动态

今日 12 条
9月27日周日
  1. METRAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 如何实现并评估面向安全评测的逐动作实时监控器

    METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。

  2. AK(@_akhaliq)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ProgramDistill:从交互式 Web 应用生成可验证的参考引导 SWE 任务

    ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。

  3. Thomas Wolf(@Thom_Wolf)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    不用 IMU 也能实现人形机器人抗推行走:Blind Dexterity 只用关节编码器

    Aditya Bhatt 等人的最新博士论文提出 Blind Dexterity,首次仅靠关节编码器实现抗推的人形机器人行走,无需 IMU 和力/力矩(F/T)传感器。该工作由 DFKI 与达姆施塔特工业大学(@ias_tudarmstadt)团队完成,论文已被 IROS 2026 接收。

9月26日周六
  1. Thomas Wolf(@Thom_Wolf)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 被教会在无人类引导下自主发现有趣数学定理

    Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。

  2. Kevin Weil 🇺🇸(@kevinweil)AI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude 完成 N=4 超对称杨-米尔斯九圈计算,打破八圈纪录

    Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈散射振幅计算,此前纪录是 SLAC 的 Lance Dixon 及合作者保持的八圈。

  3. Stanford AI Lab(@StanfordAILab)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Stanford AI Lab 新研究:Cowsik、Dolev、Li 共同领导

    Stanford AI Lab 发布了一项由 @AdityaCowsik、@KfirDolev 和 @michaelyli_ 共同领导的新研究,合著者包括 @gbruno_dl、@ANourya、@noahdgoodman 和 @YoavLevine。目前公开信息仅为作者署名,研究主题、方法与结果尚未披露。

  4. Stanford AI Lab(@StanfordAILab)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    零真实数据预训练:随机初始化模型通过自博弈生成全部训练数据

    斯坦福团队提出 Self-Play Pretraining with Zero Data:两个模型从随机初始化出发,一个生成器为通用图灵机提出程序,一个学习器只在这些输出上训练,全程不接触真实数据。该设置下模型在图像、文本、音频和旋律上的零样本验证损失随自博弈算力可预测地下降,且学习器涌现出上下文学习能力。

  5. Anthropic(@AnthropicAI)AI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 科学博客:Claude 完成九圈散射振幅计算

    Anthropic 科学博客发布消息称,Claude 在 Claude Science 中接收一个描述九圈问题的提示词后,基本无监督运行数天,用 Dixon 及同事发展的方法解决了九圈散射振幅计算,总成本为几千美元。

  6. AK(@_akhaliq)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    世界模型中的客体永久性训练:论文与 Hugging Face 链接

    一篇题为 Training Object Permanence in World Models 的论文发布,聚焦在世界模型中训练客体永久性,论文可在 Hugging Face 上查阅。

  7. clem 🤗(@ClementDelangue)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace 开源 SmolDataEnvs:5,000 个可验证 RL 环境任务

    HuggingFace 开源 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,面向代码和数据科学领域的小模型能力爬坡,环境、评测与训练全部开源。该数据集由 @adithya_s_k 贡献,已在 HuggingFace 上发布。

9月25日周五
  1. AK(@_akhaliq)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    论文《On the Diffusibility of High-Dimensional Latents》发布

    论文《On the Diffusibility of High-Dimensional Latents》已在 Hugging Face Papers 上线,聚焦高维潜变量的可扩散性问题。原文未披露模型、参数规模或 benchmark 数据等具体信息。

  2. DeepLearning.AI(@DeepLearningAI)AI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Meta AI 用专用记忆智能体缓解长上下文遗忘,Claude Sonnet 4.5 基准从 37.6% 升至 45.9%

    Meta AI 将主行动智能体与专用记忆智能体配对,以解决长上下文导致 AI 智能体忘记早期错误的问题。记忆智能体保存关于工具和过往错误的结构化笔记,只在关键时机注入简短提醒。该方案把 Claude Sonnet 4.5 的基准从 37.6% 提升到 45.9%。

9月24日周四
  1. NVIDIA Technical BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA 谈生物基础模型的高效 MoE 训练

    NVIDIA 技术博客讨论了如何为生物基础模型高效训练 MoE 架构。相比每个 token 都经过全部层的稠密 Transformer,MoE 使用多个专家子网络、每个 token 只激活其中一小部分,从而在大模型扩展时降低训练与推理算力开销。

  2. Hunyuan(@TXhunyuan)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元研究:LLM 强化学习批次规模扩展,PPO 生成吞吐提升至 2.29 倍

    腾讯混元(Hunyuan)将经典临界批次规模理论扩展到在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重调学习率可在一定批次规模范围内保持每条回复的学习效果。在固定硬件下,扩大批次规模使 PPO 生成阶段吞吐最高提升 2.29 倍,其最佳 GRPO 配置则以少 29% 的时间达到相同验证目标。

  3. Hunyuan(@TXhunyuan)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元研究:LLM 强化学习批大小与训练效率新发现

    腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。

  4. AK(@_akhaliq)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Contrastive Language Models 上线 Hugging Face

    Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。

  5. 山行AIAI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 研究:Claude Code 中真正拉开差距的是领域专长

    Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。

  6. OpenAI(@OpenAI)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 MentalHealthBench,覆盖从日常支持到急性危机全谱系心理健康对话

    MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。

  7. OpenAI(@OpenAI)AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 发布 MentalHealthBench:前沿模型心理健康对话能力持续提升

    OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。

  8. Microsoft Research(@MSFTResearch)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Microsoft Research 新发现:把 AI 推理移出机器人本体可提升任务成功率

    Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。

  9. Microsoft Research BlogAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软研究:把物理 AI 推理卸载到边缘或云端,可提升机器人成功率与续航

    微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。

  10. NVIDIA Technical BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    SWE-Serve 如何揭示本地测试与线上推理服务之间的差距

    NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。

9月23日周三
  1. vivo互联网技术AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    vivo BlueImage Lab 提出妆容迁移框架 ART,入选 ECCV 2026

    vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。

  2. 字节跳动技术团队AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    TWIST 入选 ACM CCS 2026:面向云上大模型服务的隐私保护新方案

    字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。

  3. Epoch AIAI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Epoch AI 发布宜家组装基准 FAB:GPT-6 Astra 得分 80%

    Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。

  4. Aravind Srinivas(@AravSrinivas)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 发布后训练新研究:让 Computer 智能体从真实会话的错误中学习

    Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。

  5. Perplexity(@perplexity_ai)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 用提示引导自蒸馏后训练 Computer 模型,工具调用失败率降低 21.2%

    Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一项实时 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。

  6. AK(@_akhaliq)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    将 VLM 的智能迁移到机器人控制

    一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。

  7. AK(@_akhaliq)AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    onPanda:通过 Token 级纠正高效标注 LLM 与智能体的 on-policy 对齐数据

    onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。

  8. Taranjeet(@taranjeetio)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DolphinBench 发布:面向智能体记忆的动作评测基准,同时衡量准确率、成本与延迟

    DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。

  9. AK(@_akhaliq)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RRSI:Agent Harness 的正则化递归自我改进论文发布

    论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》已在 Hugging Face 论文页发布,提出对 Agent Harness 进行正则化递归自我改进的方法。该工作由 AK(@_akhaliq) 分享,发布当日在社交平台获得 8 条回复、21 次转发和 80 次点赞。

  10. mem0(@mem0ai)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 发布 DolphinBench 基准测试

    mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。

  11. mem0(@mem0ai)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Agent Memory Benchmarks 对比:智能体记忆评测的三个关键属性

    一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。

  12. mem0(@mem0ai)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    DolphinBench 公布 Hermes 与 Claude Code 两套测试框架下 GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5 的官方结果

    DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。

  13. mem0(@mem0ai)AI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    mem0 发布 DolphinBench:绘制智能体记忆的帕累托前沿

    mem0 发布 DolphinBench,用于评测长历史之后的智能体行动,并将准确率、成本与延迟放在同一张榜上。现有公开基准多把记忆当作问答测验,只看答案对错和 precision、recall,忽略了选型时真正关心的成本与延迟。DolphinBench 认为关键事实往往不在请求里,而要靠工具调用体现。

  14. Anthropic NewsAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Anthropic 用 Claude 发现类 CRISPR 的新型酶系统 ART

    Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。

9月22日周二
  1. DeepLearning.AI(@DeepLearningAI)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    10,000 个 AI 智能体用 88 小时在 Lean 中攻关 Navier-Stokes 方程,引发的争议给 AI 开发者上了重要一课

    10,000 个 AI 智能体耗时 88 小时在 Lean 中形式化 Navier-Stokes 方程相关证明,由此引发的争议给 AI 开发者带来关键启示。智能体已能大规模形式化复杂数学证明,但人类评估对解释证明为何成立仍不可替代。企业数据隐私与零数据保留设置也属必需。

  2. Hunyuan(@TXhunyuan)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    腾讯混元推出 WebCraftBench:用真机探索评测 AI 生成网站

    腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。

  3. METRAI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    METR 发布 Claude Opus 5.5 部署前评估摘要

    METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。

  4. AK(@_akhaliq)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorldCrafter:带隐式 3D 感知记忆的一致性视频世界模型

    WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。