跳到正文
原文
Cognition(@cognition_labs)· Cognition (@cognition)·· 18 天前AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Cognition 评测:GPT-6 Sol 比 GPT-5.6 Sol 少读约 17% 上下文

In our evaluations, we see that GPT-6 Sol reads about 17% less context than GPT-5.6 Sol to reach the...

AI 导读

Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。

来源:Cognition(@cognition_labs) · x.com