Stanford AI Lab(@StanfordAILab)· Stanford AI Lab (@StanfordAILab)·· 2026-06-25AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
OpenThoughts-Agent-v2 在所有训练集规模上领先,跨七个 Agentic benchmark 泛化
Most open agentic datasets target one benchmark. In compute-controlled comparisons, OpenThoughts-Age...
AI 导读
OpenThoughts-Agent-v2 在算力受控对比中于每个训练集规模上均领先,并跨七个 agentic benchmark 实现泛化。同系列还发布 OpenThinkerAgent-32B,号称基于 Qwen-3 的最强开放数据 agentic 模型,在 7 个 agentic benchmark 上平均得分 44.8%。
来源:Stanford AI Lab(@StanfordAILab) · x.com