跳到正文
原文
Cognition(@cognition_labs)· Cognition (@cognition)·· 19 天前AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Grok 4.7 在 FrontierCode 1.1 上得分略低于 Grok 4.6

On FrontierCode 1.1, our benchmark for real-world engineering tasks, Grok 4.7 scores slightly below ...

AI 导读

Cognition 的 FrontierCode 1.1 真实工程任务基准显示,Grok 4.7 综合得分略低于 Grok 4.6。Grok 4.7 在许多难题上表现强劲,但在部分任务上倾向于过度扩大范围,导致整体成绩落后于 Grok 4.6。

来源:Cognition(@cognition_labs) · x.com