跳到正文
原文
Cognition(@cognition_labs)· Cognition (@cognition)·· 18 天前AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Opus 5.5 在 FrontierCode 1.1 以 65.3% 登顶 Extended 榜

On FrontierCode 1.1, our benchmark for real-world engineering tasks that grades mergeability and qua...

AI 导读

Opus 5.5 在 Cognition 的 FrontierCode 1.1 基准上取得 Extended 65.3% 的成绩,超越 Fable 5 登顶,且成本仅为后者的一小部分。该基准针对真实工程任务,评估代码的可合并性与质量。

来源:Cognition(@cognition_labs) · x.com