跳到正文
原文
Binyuan Hui(@huybery)· Binyuan Hui (@huybery)·· 2025-11-13AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

SWE-fficiency 发布:评估 LM 能否加速真实 GitHub 仓库

cool

AI 导读

SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。

来源:Binyuan Hui(@huybery) · x.com