跳到正文
原文
METR·· 2025-10-14AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

METR 发布 MALT 数据集:用于检测威胁评估完整性的自然与诱导行为

MALT: A Dataset of Natural and Prompted Behaviors That Threaten Eval Integrity

AI 导读

METR 发布 MALT 数据集,包含 10,919 条智能体转录记录,覆盖 403 个任务、86 个任务家族和 21 个模型,聚焦 reward hacking 与 sandbagging 等威胁评估完整性的行为。

来源:METR · metr.org