LangChain 与 Amazon Bedrock Knowledge Bases 的智能体检索实践
Amazon Bedrock Managed Knowledge Bases 现已支持 agentic retrieval,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环检索并判断证据是否充分,而 Retrieve API 只做一次混合搜索。
Amazon Bedrock Managed Knowledge Bases 现已支持 agentic retrieval,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环检索并判断证据是否充分,而 Retrieve API 只做一次混合搜索。
Milvus 为 HNSW 提供 HNSW_SQ、HNSW_PQ 和 HNSW_PRQ 三种向量压缩索引,用于降低图构建与距离计算中的内存占用。SQ 对每一维量化,SQ8 与 SQ6 分别用 8 位和 6 位,SQ4U 用 4 位无符号值并共享统一范围;PQ 将向量切分为子向量并以码本索引表示;PRQ 在 PQ 基础上分阶段编码残差,代价是额外训练、构建与距离计算开销。
JayAlammar 与 MaartenGr 合著的《Hands-On Large Language Models》全书绘制近 300 张自制图,作者称之为 "The Illustrated LLM Book"。
法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。
Reducto 的 Adit Abraham 指出,文本摘要有利于检索,结构化表格则有利于推理,因此智能体能否"找到"表格与能否"读"表格是两回事。该观点来自其在 World's Fair 2026 的演讲,AI Engineer NYC 将于 10 月 12 日至 14 日举行。
LlamaIndex 推出 Extract v2.5 系列文档抽取智能体,分 cost-effective、agentic、agentic plus 三档,在价值准确率与溯源上优于 Claude Opus 5.5 和 GPT-6 Sol,且便宜 30%-4x。
Lucy 基于 Qdrant 构建了覆盖 2.8M+ SEC 与韩国 DART 文件的可信数据源检索层,采用四条混合检索通道,并将 payload filters 下推到查询内部而非查询后过滤。在 FinanceBench 上达到 94.7% Recall @10,仅靠检索就带来 +0.160 的答案准确率提升,且答案模型保持不变。Lucy RAG 上的开源权重模型表现超过了搜索网页的前沿模型。
阿里「AI Native 研发范式实践手册」指出,企业级 AI 研发基础设施中最容易被忽略、也最容易自以为没问题的一环是企业知识库。多数企业只是把文档攒下来,存在目录混乱、部门规则不一、关键证据缺失、权限各异等问题,同一实时多篇文档难以确定以哪个为准。作者建议由公司牵头做知识整理、知识加工与知识供给,再输入 Agent 使用并反馈,形成闭环,并在质量、版本、权限、责任四方面持续治理。
斯坦福 2026 秋季课程 CS 329Z: Engineering AI Agents 前三讲讲义已统一发布在课程官网,主题分别为 Intro to Agentic Systems、LLMs for Builders 和 RAG + Agents。
LlamaIndex 发布 Extract v2.5,一组面向文档抽取的前沿智能体,覆盖 cost-effective、agentic、agentic plus 三档,强调取值准确率与溯源。
Jerry Liu(@jerryjliu0)在 World's Fair 2026 的演讲中探讨智能体如何解析、搜索企业业务所依赖的文档并给出来源引用。相关录播已发布,配套活动将于 10 月 12 日至 14 日在纽约举行。
Cohere 将于 10 月 8 日(周四)在 X Live 举办网络研讨会,由其搜索建模团队负责人主讲。议题包括 RCP-nDCG @10、Embed 5 以及搜索与检索的未来,报名链接已在 cohere.com 开放。
Cohere 的 Embed 5 成为首个使用 RCP-nDCG @10 评测的模型家族。这一最新评测方法改进了对真实检索质量的评估,因此 Embed 5 的基准分数看起来与以往不同。
LlamaIndex 发布 Extract v2.5 系列文档抽取智能体,主推在长列表抽取任务上达到 93%-96% 以上准确率,而在同一基准上 astra 约为 30%。
Milvus 3.0 推出 StructArray Hybrid Search 演示,可在视频级别理解"路口"场景,同时在嵌套子记录中定位"白色卡车"等具体对象,并将两级信号合并为一个排序结果。StructArray 将父记录与其子元素保存在一起,嵌套元素内的向量仍可直接检索,减少数据建模复杂度并保留更多上下文。该模式适用于多模态数据集、含章节的文档以及带变体的商品等父子结构数据。
turbopuffer CTO Nikhil Benesch 将在 AI Engineer New York 发表演讲《Can Your AI Analyst Keep a Secret?》,主题是企业规模下的安全检索。演讲针对数百万文档且权限重叠、频繁变更的场景,活动时间为 10 月 12–14 日。
在 ConTEB 基准上,该预览版模型取得所测模型中最高的平均 nDCG@10,但并非每个任务都领先。它在 chunk retrieval 上超过 voyage-context-4,且每个向量仅占 1 KB(1024 维、int8),相比后者的 8 KB(2048 维、float32)存储占用降低 8 倍。
Perplexity 构建了新的上下文嵌入模型训练方法,让每个文档分块的编码都能看到完整文档。其 pplx-embed-v2-context-9b-preview 在 ConTEB 和 turbopuffer 新近私有的 context-bench 上均创下新的 SOTA。
Stack Overflow 宣布将 Stack Internal 平台开放给更多人和团队,把组织内部知识汇入共享层,并通过 chat、API 和 MCP 提供。该平台强调"决策级知识"的五个要素:来源可追溯、适用条件明确、权限受控、冲突可见、有人能裁决,人类专家负责验证和修正知识,AI 负责检索、比对来源并发现缺口。
Milvus 先用向量检索和元数据过滤召回候选段落,再由 Jev 判断这些段落是否真正有助于任务,形成「查询 → Milvus 检索 → Jev 判定 → 应用执行」的流程。
Cohere 发布高吞吐、高速选项 Embed 5 Fast,在 fast-tier 模型中领先 6 分以上,成本比 Pro 低三分之一。Embed 5 也是首个采用 RCP-nDCG @10 检索评测方法评估的模型家族。
Voyage AI by MongoDB 的 Rerank 3 和 Rerank 3 Lite 已在 AI Gateway 上线,两款模型在把文档传给大语言模型之前按相关性重排搜索结果。
Weaviate 的 Query Agent Search Mode 新增 effort 参数,提供 medium、high、ultrahigh 三档,用于控制每次请求的检索投入程度。更高档位会在两处增加计算:查询编写阶段花更长时间拆解请求并转为结构化搜索,重排阶段对召回文档做更充分评估后再返回最终排序。官方建议按自身准确率、延迟和成本要求选择合适档位。
Qdrant 的 Constella 仍处于研究预览(research preview)阶段。团队表示,围绕质量与时延的权衡以及真实工作负载,还有大量内容值得进一步探索。
Constella 采用文档与查询分离的向量化路径:文档经 Stella 转成文档向量写入 Qdrant,查询侧则可换用 Stella、Nano 或 Zero 生成查询向量。该做法与常规同模型编码两侧的方式不同。
在 Qdrant 中,文档经嵌入模型转为向量存储,用户查询也需转成同一向量空间的向量才能比对。问题在于更换嵌入模型通常意味着必须重新嵌入已有文档。
Qdrant 发布研究预览项目 Constella,目标是在不重新嵌入全部文档的前提下更换查询嵌入模型。该方案目前以 research preview 形式公开,具体参数、基准分数与可用性细节未披露。
Qdrant 发布 Constella 研究预览,这是一组围绕 400M 参数英文嵌入模型 Stella 构建的模型家族,文档向量由 Stella 编码,查询可由 Zero、Nano 或 Stella 本身编码,均搜索同一个 Qdrant 集合,因此查询编码器可按请求热插拔,无需重新嵌入。
Elastic Cloud Serverless 于 9 月 29 日起在 Microsoft Azure 美国中部(Iowa)区域上线,Azure 区域增至 12 个,全球覆盖达 34 个区域。
研究团队提出名为 PageIndex 的 RAG 新方法,跳过向量数据库、数据嵌入、分块和相似度检索,改为构建树索引让 LLM 像人读书一样推理文档。引用称其在 FinanceBench 上取得 98.7%,超过榜单上所有向量 RAG,且免费开源。Jerry Liu 转发并感叹如果这套方法流行,自己四年前就做得太早了。
生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。
Harrison Chase 转发 Assaf Elovic 的实验:在 GPT Researcher 的 RAG 管线中用 Jev 替换嵌入向量,并在 SimpleQA 的 28 个研究任务上对比测试。
LangChain 在 Interrupt NYC 上发布 LangSmith 多项更新:Engine v2 加入 Red Teaming 主动排查问题、扩展问题类型识别,并可在人工审核前自动验证修复方案;Engine 自 5 月上线以来已分析超过 60M traces,诊断数万个问题。
Milvus 社区将于 10 月 7 日在 Criteo 巴黎办公室举办线下活动,主题是向量搜索在生产环境中的难点。
LlamaIndex 指出,表格中的空白单元格会让 Agent 决策出错,许多文档 OCR 工具读取多个空白单元格时会把数值错移行列,导致下游数值解读错误。官方用 LlamaParse 解析美联储 2026 年 9 月预测表第 2 页,GDP 中位数摘录的九个数字与原始 PDF 全部一致,且在返回的 HTML 中保持对齐。该表因含 2029 年列而对比行留空,正是文档解析器的常见隐性失效点。
Qdrant 在 Hugging Face 上免费开源了嵌入向量生成工具 Supernova 和 10B 数据集 Qdrant-FineWeb-10B,可用于评估、测试和配置向量搜索基础设施。BetterStackHQ 还发布了讲解这些资源的高质量视频。
jina-ocr-v1 现已在 Elastic Inference Service 上线,单模型完成版式感知文档解析,支持表格、数学公式、手写体和 100+ 语言,总参数 3.4B、推理仅激活 570M,olmOCR-bench 得分 83.4、OmniDocBench 得分 91.14。
Qdrant 用 Rust 重写 cross-encoder 推理并开源为 cross-encode-rs,在小型 reranking 模型上中位延迟仅比 Python 快 1.1x,较大模型上约 1.4x。
Perplexity 的 Photon 将新索引构建与处理实时查询的服务器分离,版本就绪后逐个更新 serving group。每次更新会用真实搜索查询预热缓存并检查就绪状态,再将其重新纳入路由,其余 serving group 持续提供查询服务。
Qdrant 与 DeepLearning.AI 合作推出新课程 Building AI Assistants with On-Device Memory,由 Qdrant 开发者关系负责人 Dylan Couzon 讲授。