美团开源 LoHoSearch 搜索智能体评测基准,用知识图谱让机器自动出题
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
美团 LongCat 团队开源 LoHoSearch,一个基于覆盖 762 万维基百科实体知识图谱自动生成题目的搜索智能体评测基准,含 544 道经人工核验题目、覆盖 11 个领域。
在智能体搜索中,GPT-OSS-120B 智能体调用 9B 模型正确回答了 BrowseComp+ 上 64.0% 的问题,比次优的 ColBERT 模型高出 4.9 个百分点,且搜索次数少于所有基线。
微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。
Q2D-Web 采用三套相关性集合:agent 引用、生产环境网页排名,以及用 LLM 判断扩充的合并集合。这三套集合旨在降低漏判、减少对单一标注流程的依赖,同时测试相关性定义如何影响模型表现。
Perplexity 披露其检索语料构建方式:每个查询取 top 5,000 条生产检索结果,用 MinHash-LSH 去重。每篇文档至少与一个查询构成看似合理的匹配,其中包含主题相关但缺少所需日期、实体或版本的困难干扰项。
Q2D-Web 数据集来自 23,000 条无 PII 的生产搜索,覆盖十种语言、数十个领域,历时九个月收集。其中 Agent 将用户请求改写为主查询与支持查询,每条查询独立评估并各自给出相关性判断。
Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。
Firecrawl 开源 DevDex,一个用于评估搜索工具能否可靠找到编码智能体所需信息的 benchmark。该基准针对编码智能体高度依赖搜索工具获取答案的场景,衡量各工具找到正确来源的可靠性。
Braintrust 评测了 1329 道时事问题,覆盖 4 个模型和 14 种条件,对比 You.com、模型自带搜索和无搜索三种配置。结果显示搜索把模型间差距从 47.9 分缩小到 5.6 分,检索增益随事件变旧从约 45 分降到约 24 分,而 5 次以上搜索的运行得分仅 19%–49%。Richard Socher 转评称更好的搜索让模型之间的差异变得小得多。
Jina AI 的 jina-reranker-v3 在 AAAI Frontier IR Workshop 获得最佳论文。该模型是首个 listwise reranker,将所有文档放入同一上下文窗口,通过 self-attention 让文档相互竞争,而非像传统 reranker 那样循环处理 ⟨q,d⟩ 文档对,这种机制被称为 "last but not late" interaction。