跳到正文
原文
Thomas Wolf(@Thom_Wolf)· Thomas Wolf (@Thom_Wolf)·· 23 天前AI 评估 · 73/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

OpenAI 发布模型失准追踪与披露框架

a step in the good direction

AI 导读

OpenAI 发布一套用于追踪、调查和披露模型失准(misalignment)实例的新框架。该框架设定了公开披露的标准和时间线,包括尚未完全解释或缓解行为的情形,复杂案例可能需要更长的调查或与第三方协调。OpenAI 同时发布六份报告,记录过去六个月在模型训练或评估中观察到的失准行为,并称这是起点,将根据经验和公众反馈持续完善并定期分享更多报告。

来源:Thomas Wolf(@Thom_Wolf) · x.com