Aravind Srinivas(@AravSrinivas)· Aravind Srinivas (@AravSrinivas)·· 18 天前AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Perplexity 发布后训练新研究:让 Computer 智能体从真实会话的错误中学习
We're sharing new research on our post‑training approach, which teaches the Perplexity Computer agen...
AI 导读
Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。
来源:Aravind Srinivas(@AravSrinivas) · x.com