lmarena.ai(@lmarena_ai)· Arena.ai (@arena)·· 5 天前AI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Agent Arena 智能体能力排名:Anthropic 与 OpenAI 领跑各领域
The Agent Arena ranks agentic ability to solve problems across domains. U.S. labs lead across ever...
AI 导读
Agent Arena 按解决跨领域实际任务的智能体能力对模型排名,美国实验室在所有领域领先:Anthropic 模型在 Code、Work、Chat 均居第一,OpenAI 的 GPT 6 Astra(Max)在三个类别都进入前四,Code 第 2、Work 与 Chat 均第 4。
来源:lmarena.ai(@lmarena_ai) · x.com