跳到正文

#xAI

今日 0 条
10月9日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 发布 Alignment Index:GPT-6.1-Sol 以 87.9 分居首

    Arena.ai 推出 Arena Alignment Index,这是一个衡量 AI 智能体在真实使用中安全与对齐表现的基准,数据来自 27 个模型的 90K+ 真实智能体会话。

  2. lmarena.ai(@lmarena_ai)AI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Arena 发布 Alignment Index,基于 2.7 万个模型会话评测 AI 智能体安全与对齐

    Arena.ai 发布 Arena Alignment Index,一个衡量 AI 智能体真实使用中安全与对齐表现的新基准,基于 27 个模型的 90K+ 真实智能体会话构建,衡量未授权操作(UA)、错误归因(FA)和虚假完成(DC)三类信号。

6月22日周一
  1. Import AI — Jack ClarkAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    牛津等机构研究:AI 在说服力上超过专家人类

    牛津大学、英国 AI 安全研究所、斯坦福和伦敦政治经济学院的研究者通过四项实验、18978 场对话和 6923 名参与者发现,AI 系统在文本说服上比专家人类更有效,即使在专家自选议题、提前研究并接受训练后依然如此。