跳到正文
原文
Jan Leike(@janleike)· Jan Leike (@janleike)·· 2026-05-08AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Jan Leike 与 Samuel Marks 发布 NLA:将 LLM 内部状态转成可读文本的无监督方法

I'm really excited about this as a new tool in our interpretability tool kit

AI 导读

Samuel Marks 等人发布新论文提出 NLAs,一种将 LLM 内部状态转换为人类可读文本的无监督方法。Jan Leike 称其为可解释性工具箱中的新工具,并表示结果令人惊讶,认为 NLAs 实质推进了对 LLM 在想什么的理解以及安全审计能力。

来源:Jan Leike(@janleike) · x.com