Browser Use(@browser_use)· Browser Use (@browser_use)·· 18 天前AI 评估 · 46/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Browser Use Bench v2 帕累托前沿被重画:Claude Opus 5.5 与 GPT-6 系列上榜
Browser Use Bench v2 Pareto frontier got completely redrawn today > Claude Opus 5.5: 59.4 > G...
AI 导读
Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。
来源:Browser Use(@browser_use) · x.com