跳到正文
原文
THE DECODER· Matthias Bastian·· 3 小时前AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

研究显示 AI 智能体团队耗费大量 token 却几乎带不来质量提升

AI agent teams waste massive tokens for barely measurable quality gains, research finds

AI 导读

评测公司 Vals AI 在 Vibe Code Bench 上测试 GPT-6 Sol 和 Claude Opus 5.5,分别以单智能体和团队形式在中等与最高推理强度下运行,团队成本是单智能体的 1.8 倍到 5.1 倍。

来源:THE DECODER · the-decoder.com