lmarena.ai(@lmarena_ai)· Arena.ai (@arena)·· 2 天前AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
LMArena 研究 AI 智能体的错误归因:GPT-6 Luna、Astra 与 Sol 表现各异
We also looked into False Attribution, where the agent attributes a statement, request, choice, appr...
AI 导读
LMArena 研究了 AI 智能体的“错误归因”问题,即智能体把某句话、请求或事实安到用户头上,却与用户提供的证据相矛盾。GPT-6 Luna 和 Astra 很少错误引用用户(分别为 15.6% 和 28.6%),但错误归因率较高(53.1% 和 48.2%);同系列的 GPT-6 Sol 误记用户历史的比例最高,达 23.5%。
来源:lmarena.ai(@lmarena_ai) · x.com