OpenViking 团队三篇论文拆解其上下文数据库核心技术
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。
微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。
Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。
IBM Research 在八款模型上发现,智能体记忆的合适"剂量"随模型能力变化:能力强的模型能从完整指南集中获益,较弱模型更适合精简核心加任务相关检索,已饱和的模型则无明显提升。
Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。
Perplexity 披露其检索语料构建方式:每个查询取 top 5,000 条生产检索结果,用 MinHash-LSH 去重。每篇文档至少与一个查询构成看似合理的匹配,其中包含主题相关但缺少所需日期、实体或版本的困难干扰项。
Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。
一篇新论文提出 It Takes Two to Match,用强化学习让生成式检索器协同演化,论文已上传至 Hugging Face Papers(编号 2609.00…)。该工作聚焦生成式检索与 RL 训练的结合,具体方法与实验数据需查阅原文。
LlamaIndex 的 ExtractBench 已在 Kaggle 上线,针对最容易击溃下游智能体与工作流的长记录列表、噪声扫描件、手写体和复杂表格,评测 schema 引导的文档抽取。该基准覆盖 8 个业务领域、67 种文档类型、共 370 份企业文档,并对比 LlamaParse、Codex、Claude Code 等方案的表现。
LlamaIndex 尝试了三种方法改进静态嵌入的检索效果:对逐 token 嵌入做原始 maxsim 打分、训练小型 adapter 模型、调整蒸馏训练目标与教师模型,均未取得预期结果。静态嵌入吞吐量无可匹敌,但相比传统嵌入模型存在精度损失。相关探索已发布在 LlamaIndex 博客。
LlamaIndex 推出 ExtractBench,对文档抽取的“依据”严格打分:字段值与其引文都正确才算对,词级框需 IoU 0.5。VLMs 和编码智能体均未返回任何证据,两级得分均为零;能返回框的系统中词级 F1 仍不足 50%。
Jina AI 发布两项研究:用约 80 万参数的小模型仅看向量即可识别生成模型,在 68 个模型与任务组合上准确率 87%;用掩码扩散模型直接从向量还原原始文本,Token 级还原准确率 81%,在 Qwen3-Embedding-0.6B 上达 81.3%、jina-embeddings-v3 上为 76.0%。
Jina AI 推出 0.6B 参数的重排模型,在 MTEB 重排任务上进入前三,体积比生成式 listwise 重排器小 10 倍。相关工作获 AAAI Frontier IR 最佳论文,论文见 arxiv.org/abs/2509.25085。
Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。