跳到正文
原文
Richard Socher(@RichardSocher)· Richard Socher (@RichardSocher)·· 2026-09-01AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Braintrust 评测:加入搜索后模型差距从 47.9 分缩小到 5.6 分

Incredible result.. With better search the different between models becomes much much smaller!

AI 导读

Braintrust 评测了 1329 道时事问题,覆盖 4 个模型和 14 种条件,对比 You.com、模型自带搜索和无搜索三种配置。结果显示搜索把模型间差距从 47.9 分缩小到 5.6 分,检索增益随事件变旧从约 45 分降到约 24 分,而 5 次以上搜索的运行得分仅 19%–49%。Richard Socher 转评称更好的搜索让模型之间的差异变得小得多。

来源:Richard Socher(@RichardSocher) · x.com