METR·· 2025-06-27AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
METR 发布 DeepSeek 与 Qwen 模型评测结果
DeepSeek and Qwen Evaluation Results
AI 导读
METR 对六个 DeepSeek 与 Qwen 模型做了初步自主能力评测,结果显示 2025 年中的 DeepSeek 模型能力接近 2024 年末的前沿模型。
来源:METR · metr.org