Suhail(@Suhail)· Suhail (@Suhail)·· 2026-09-03AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Proximal 发布 FrontierSWE v2 超长程编程基准,Claude Fable 5.1 大幅领先
Excited to see benchmarks headed in this direction and getting better!
AI 导读
Proximal 发布超长程编程基准 FrontierSWE v2,新版本扩展了任务集并改进评测方法。各前沿模型在该基准上存在明显性能差距,Claude Fable 5.1 以较大优势领先。
来源:Suhail(@Suhail) · x.com