METR 如何实现并评估面向安全评测的逐动作实时监控器
METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。
METR 开发并部署了一个基础的实时逐动作监控器,用 LLM judge 在智能体每次动作执行前审查,超过阈值即转人工审核并暂停评测,专注识别可能造成现实危害或试图绕过监控的行为。
ProgramDistill 提出从交互式 Web 应用出发,构建可验证、参考引导的软件工程(SWE)任务。论文已发布在 Hugging Face Papers(编号 2609.18…),原始公告由 AK 在 X 上分享。
Aditya Bhatt 等人的最新博士论文提出 Blind Dexterity,首次仅靠关节编码器实现抗推的人形机器人行走,无需 IMU 和力/力矩(F/T)传感器。该工作由 DFKI 与达姆施塔特工业大学(@ias_tudarmstadt)团队完成,论文已被 IROS 2026 接收。
Niket Patel 展示了一种教 LLM 自主发现有趣定理的方法,提出可量化的"有趣度"指标,使发现结果的有趣度提升 4.3×,并形成自我扩展的发现循环。研究者指出,LLM 已能证明困扰数学家数十年的结果,而无需人类引导地找到有趣定理正成为新的瓶颈。
Anthropic 科学博客称 Claude 在平面 N=4 超对称杨-米尔斯模型中完成了九圈散射振幅计算,此前纪录是 SLAC 的 Lance Dixon 及合作者保持的八圈。
Stanford AI Lab 发布了一项由 @AdityaCowsik、@KfirDolev 和 @michaelyli_ 共同领导的新研究,合著者包括 @gbruno_dl、@ANourya、@noahdgoodman 和 @YoavLevine。目前公开信息仅为作者署名,研究主题、方法与结果尚未披露。
斯坦福团队提出 Self-Play Pretraining with Zero Data:两个模型从随机初始化出发,一个生成器为通用图灵机提出程序,一个学习器只在这些输出上训练,全程不接触真实数据。该设置下模型在图像、文本、音频和旋律上的零样本验证损失随自博弈算力可预测地下降,且学习器涌现出上下文学习能力。
Anthropic 科学博客发布消息称,Claude 在 Claude Science 中接收一个描述九圈问题的提示词后,基本无监督运行数天,用 Dixon 及同事发展的方法解决了九圈散射振幅计算,总成本为几千美元。
一篇题为 Training Object Permanence in World Models 的论文发布,聚焦在世界模型中训练客体永久性,论文可在 Hugging Face 上查阅。
HuggingFace 开源 SmolDataEnvs,包含 5,000 个可验证的 RL 环境任务,面向代码和数据科学领域的小模型能力爬坡,环境、评测与训练全部开源。该数据集由 @adithya_s_k 贡献,已在 HuggingFace 上发布。
论文《On the Diffusibility of High-Dimensional Latents》已在 Hugging Face Papers 上线,聚焦高维潜变量的可扩散性问题。原文未披露模型、参数规模或 benchmark 数据等具体信息。
Meta AI 将主行动智能体与专用记忆智能体配对,以解决长上下文导致 AI 智能体忘记早期错误的问题。记忆智能体保存关于工具和过往错误的结构化笔记,只在关键时机注入简短提醒。该方案把 Claude Sonnet 4.5 的基准从 37.6% 提升到 45.9%。
NVIDIA 技术博客讨论了如何为生物基础模型高效训练 MoE 架构。相比每个 token 都经过全部层的稠密 Transformer,MoE 使用多个专家子网络、每个 token 只激活其中一小部分,从而在大模型扩展时降低训练与推理算力开销。
腾讯混元(Hunyuan)将经典临界批次规模理论扩展到在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重调学习率可在一定批次规模范围内保持每条回复的学习效果。在固定硬件下,扩大批次规模使 PPO 生成阶段吞吐最高提升 2.29 倍,其最佳 GRPO 配置则以少 29% 的时间达到相同验证目标。
腾讯混元(Hunyuan)将经典临界批大小理论扩展至在线 LLM 强化学习,在 GRPO 和 PPO 上发现,重新调整学习率可在一定批大小范围内保持每个响应的学习效果。在固定硬件上,扩大批大小使 PPO 生成阶段吞吐量最高提升 2.29×,最佳 GRPO 配置以少 29% 的时间达到相同验证目标。
Contrastive Language Models 已在 Hugging Face 发布,项目主页为 huggingface.co/Contrastive-LM。该发布帖获得 549 点赞、49 次转发和 17 条回复,浏览量约 57860。
Anthropic 发布研究《How Claude Code is used in practice》,基于 2025 年 10 月至 2026 年 4 月约 40 万次 Claude Code 会话、约 23.5 万名用户,分析人机决策分工与专长对结果的影响。
MentalHealthBench 是 OpenAI 推出的心理健康评测基准,覆盖人们向 AI 提出的各类心理健康对话,从日常支持到更急性的危机场景,而不像多数同类基准只聚焦紧急情况。
OpenAI 发布开放基准 MentalHealthBench,用于评测前沿模型在真实心理健康对话中的表现,该基准由 80 多位心理健康临床医生参与构建。OpenAI 将其公开,供其他研究者审查方法、自行评测并在此基础上继续研究。
Microsoft Research 新研究显示,将 AI 推理从机器人本体移出可提升任务成功率、提高效率,并支撑更先进的物理 AI 工作负载。该结论指向机器人硬件与智能增长不匹配的问题,即算力从机器人端外移是可行路径。
微软研究发现,将物理 AI 推理从机器人板载 GPU 卸载到边缘或云端 GPU,可显著提升移动操作任务的成功率、响应速度与电池续航。测试显示,较轻 GPU 下建图与规划最多变慢 383%,导航障碍及时检测下降 30%,VLA 模型准确率下降 50%;用树莓派 5 替代板载 GPU 后,Jetson Thor 一类板载 GPU 曾使续航最多减少 160%。
NVIDIA 联合 SGLang 团队推出 SWE-Serve,用于评测推理服务软件变更:AI 编程智能体的补丁能通过测试,却可能在服务器加载真实模型并处理请求时失败。该基准包含 53 个任务,要求检查完整服务链路,包括系统能否通过公开接口返回正确结果。
vivo BlueImage Lab 提出妆容迁移框架 ART,通过两阶段训练把监督信号从合成伪目标逐步锚定到真实参考图像,解决复杂妆容迁移中的细节丢失与身份漂移问题。该方法在 MT、LADN、MT-Wild、MF2K 四个测试集上 MSimG 全部第一,MF2K 艺术妆测试集 MSimG 达 9.22,并发布首个 2K 妆容数据集 MF2K(8,573 张 2048×2048 人像)。
字节跳动安全研究团队与香港城市大学联合研究的 TWIST 被 ACM CCS 2026 接收,该方案用密钥将输入 Token 与模型权重映射到同一变换空间,使云端可沿用标准推理流程处理混淆态数据。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一项实时 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
一篇论文提出把视觉语言模型(VLM)的智能迁移到机器人控制中,论文页面已发布在 Hugging Face Papers(编号 2609.22…)。原帖未披露所用模型、参数规模或评测结果。
onPanda 提出通过 Token 级纠正实现 LLM 与智能体的 on-policy 对齐数据高效标注,论文已发布在 Hugging Face Papers。该工作面向对齐训练数据的标注环节,具体方法与实验结果可查阅论文原文。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》已在 Hugging Face 论文页发布,提出对 Agent Harness 进行正则化递归自我改进的方法。该工作由 AK(@_akhaliq) 分享,发布当日在社交平台获得 8 条回复、21 次转发和 80 次点赞。
mem0 发布 DolphinBench 基准测试,配套上线官网、排行榜与数据集,并开放运行与提交入口,代码仓库和论文同步公开。
一个智能体记忆基准需满足三项属性:按行动评分、在准确率之外同时衡量成本与延迟、以及可解性认证(带历史能通过、不带历史则失败)。该观点用于对比现有的 Agent Memory Benchmarks。
DolphinBench 公布了两套测试框架(Hermes、Claude Code)与三个智能体模型(GPT-5.6-Luna、MiniMax M3、Claude Sonnet 5)的官方测试结果,实时榜单已在 dolphinbench.ai/leaderboard/ 上线。
mem0 发布 DolphinBench,用于评测长历史之后的智能体行动,并将准确率、成本与延迟放在同一张榜上。现有公开基准多把记忆当作问答测验,只看答案对错和 precision、recall,忽略了选型时真正关心的成本与延迟。DolphinBench 认为关键事实往往不在请求里,而要靠工具调用体现。
Anthropic 成立生命科学实验室,让 Claude 智能体在 DNA 数据库中自主搜索,发现了一种与重复序列关联的新型逆转录酶系统 ART,相关预印本已发布。
10,000 个 AI 智能体耗时 88 小时在 Lean 中形式化 Navier-Stokes 方程相关证明,由此引发的争议给 AI 开发者带来关键启示。智能体已能大规模形式化复杂数学证明,但人类评估对解释证明为何成立仍不可替代。企业数据隐私与零数据保留设置也属必需。
腾讯混元发布 WebCraftBench,让智能体实际操作运行中的网页应用,通过覆盖率引导探索发现未被触达的页面,再对美观度、可用性及是否满足原始需求打分。在 197 组人工校验样本上,该评测与人类偏好的一致率为 85.3%。
METR 发布对 Claude Opus 5.5 的部署前评估摘要,认为该模型对 AI 研发的加速略高于 Fable 5.1,但不太可能完全自动化 AI 研发。
WorldCrafter 是一个一致性视频世界模型,通过隐式 3D 感知记忆提升生成视频的时空一致性。相关论文已发布在 HuggingFace Papers。