lmarena.ai(@lmarena_ai)· Arena.ai (@arena)·· 5 天前AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
MTS Arena CEO 呼吁建立中立评估平台,OpenAI 与 Anthropic 不能自评模型安全
Independent evaluation is essential.
AI 导读
MTS Arena CEO @ml_angelopoulos 认为,随着智能体能力增强到足以突破沙箱,OpenAI 和 Anthropic 不应是唯一决定自身模型是否安全的一方。他表示建立中立评估平台"不是是否的问题,而是何时的问题",因为模型实验室本身缺乏自我评估的激励。他还指出,这些实验室虽热衷安全并已呼吁建立此类系统,但护栏不能只由它们制定。
来源:lmarena.ai(@lmarena_ai) · x.com