跳到正文
原文
Browser Use(@browser_use)· Browser Use (@browser_use)·· 19 天前AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Grok 4.7 发布,Long Horizon Browser Use Benchmark v2 得分 39.9 仍落后 DeepSeek

Grok 4.7 just dropped. Still chasing DeepSeek 👀 Long Horizon Browser Use Benchmark v2 > GPT-6 ...

AI 导读

Grok 4.7 发布,在 Long Horizon Browser Use Benchmark v2 上得分 39.9,高于 Grok 4.6 的 31.2,但仍不及 DeepSeek V4.1 Flash 的 47.9 和 GPT-6 Astra 的 80.6。其得分不到 Astra 的一半。

来源:Browser Use(@browser_use) · x.com