LangChain 谈 Wiki Memory:用文件为 AI 智能体构建记忆层
LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。
LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。
基于 Perplexity Agent API 与 LangGraph 构建的投资备忘录智能体,约 90 秒、约 0.40 美元 API 成本即可生成含七大板块的初稿,每条引用均可回溯到原始信源。
LangChain 开源了用于评估 LLM 问答链的自动评估器,并发布免费托管的开源应用与 API 以扩大可用性。该工具结合 Anthropic 的模型生成评估集与 OpenAI 的模型评分评估思路,自动为输入文档生成 QA 测试集并对指定 QA 链自动打分;测试显示 TF-IDF 与 SVM 检索在该场景下略优于 k-NN,且评分结果随打分提示词变化(如 OpenAI 评分最严格)。
LangChain 梳理了 OpenAI 在 demo day 上分享的客户 RAG 实验,把各项方法按 RAG stack 归类并给出对应的 LangChain 实现方式。
得物技术披露其 MultiAgent 平台的记忆模块实现,采用 Working、Session、User、Agent 四层记忆模型,短期记忆以 MySQL 持久化、Redis 作热点缓存并做 Token 窗口裁剪,会话结束后异步沉淀到长期层。
前端岗位需求因 AI 技术快速发展断崖式下跌,63% 的企业正转型做 AI 产品,"AI+前端"复合能力成为招聘刚需,要求掌握微调、Agent、RAG 三项技术。字节、腾讯资深项目负责人称正大量招聘有 AI 项目能力的前端,面试优先且涨薪 40-60%。陈旸推出「转型AI前端开发实战营」2 节直播课,0 元报名,限 100 人。
Milvus 开源了 DeepSeek Harness(DSH)插件,DSH 已获 192K+ GitHub stars。安装插件并连接 Milvus 或 Zilliz Cloud 后,DSH 智能体可列出 collection、查看 schema,并执行标量查询、语义搜索、BM25 搜索和混合搜索。
hermes 的记忆配置推荐选 mem0,内置的 MEMORY.md 和 USER.md 默认继续与其并行运行。mem0 提供三种模式:Mem0 Cloud、通过 Docker 自托管服务器,以及用自有 LLM、embedder 和向量库的完全开源进程内方案。
Weaviate 联合 Google DeepMind 的 Gemini Embedding 2 推出原生多模态 RAG,文本、图像、音频、视频可嵌入同一共享向量空间,一次查询即可检索 PDF 页面、音频片段或视频中的对应片段,跳过了转录、OCR、字幕等文本转换步骤。
Weaviate 发布三份 Notebooks,分别演示 Audio RAG、Video RAG 和多模态 PDF RAG,代码托管在 weaviate/recipes 仓库。三条链接均指向 GitHub 对应示例,覆盖音频、视频与多模态 PDF 三类检索增强生成场景。
Qdrant 自 v1.13 起在自托管实例支持 GPU 加速 HNSW 索引,Qdrant Cloud 也在今年 4 月将其作为托管选项上线。GPU 擅长大规模并行处理,能同时写入大量 HNSW 图的节点与边,从而缓解切换嵌入模型时全量重建索引的耗时与成本。
LinkedIn 为招聘智能体打造认知记忆智能体,提供深度个性化。其记忆分四层,含会话记忆与跨会话聚合的语义记忆,并已从 GraphRAG 转向树状结构记忆,以实现更快的增量更新,同时兼顾检索新鲜度、延迟预算与访问控制。
Qdrant 在 X 上分享了一篇教程,介绍如何在不引入外部重排服务的情况下把 RAG 的 token 成本降低 67%。@cappybaradeploy 的做法是把 Qdrant 原生的 ColBERT 重排、二值量化和句子级检索结合起来,只把文档中最相关的部分送给 LLM。
Qdrant 的混合搜索对同一 query 同时跑 dense 和 sparse 检索,再用 RRF 或 DBSF 融合两份候选列表,前者只看向量排名、后者按平均分与分数分布重新缩放。
大型企业AI项目验收后常出现使用率不及预期的情况,核心原因是AI系统未能有效利用企业自身知识。文章指出,企业AI真正落地取决于知识工程是否扎实,需在入库前完成知识准入、清洗、预标注与抽取,并覆盖版本管理、权限控制和持续优化。金融、高端制造和大型集团的AI应用至少要具备知识准入、知识治理、权限控制和持续优化能力。
Qdrant 发布五篇系列文章,介绍如何不靠猜测地调优向量检索,实测覆盖 5,183 到 460 万文档的五个公开数据集。文章指出七个集合设置会悄悄限制搜索质量,例如稀疏向量缺少 IDF 修饰符、BM25 平均长度用默认值;在其实测中,25 条标注查询不足以区分融合调优带来的增益。
Qdrant 发布技术分析,给出集合超出 RAM 时的量化配置方法:先在 bits4(约 8 倍压缩)起步,用公式 vectors × dimensions × 4 bytes × 1.5 估算常驻内存,并固定量化副本、让原始向量保持 cold。
Qdrant 提出用候选排序上限与 nDCG@10 基线之差来判断是否值得引入重排序:在 200 个候选的深度下,五个数据集的 nDCG@10 差距介于 0.247 至 0.487。
Qdrant 在五个数据集上对比了默认 RRF(k=2)与 DBSF 两种融合策略,其中四个数据集上融合优于单一最优检索,DBPedia-entity 是例外,融合反而落后稠密检索 0.0039。
Milvus 3.0 新增 =~ 和 !~ 过滤器,可在向量检索、全文检索和标量过滤之外匹配或排除结构化字符串模式。其分层执行路径先用 RE2 做线性时间校验并拒绝非法模式,再将 ^ERROR$ 等简单模式改写为等值或前后缀检查,并在 sealed segment 上复用编译后的模式、优先检查必需字面量,必要时用 NGRAM 收窄候选集,否则回退到原始验证。
Milvus 3.0 将全文搜索与语义检索合并进同一个引擎,可在单次查询中同时使用原生 BM25 与向量检索。Zilliz EMEA 解决方案架构师 Simon Hearne 在线上分享中演示了混合检索、分组、schema 灵活性与搜索效率等能力,并与 Elasticsearch 在相同数据集、嵌入向量、分析器和计算资源下做了对比。团队可在单一引擎内完成关键词搜索、语义检索、过滤、分组与排序。
Qdrant v1.17.1 新增实验性写入路径设置 prevent_unoptimized,让正在优化的 segment 中新写入的点进入 deferred 状态、暂不参与检索,直到优化完成;配合已有的 indexed_only 读路径参数,可减少批量上传后落在未索引 segment 上的全量扫描。
Qdrant 1.19 支持 turbo4 数据类型,将稠密向量以每维度 4-bit 存盘,仅为 float32 存储量的八分之一。
Qdrant 发文给出候选深度的调优方法:把 limit 设在 100 到 200 作为起点,再用自己的标注数据测试更大取值。在五个数据集上,从 limit=10 提到 500,理想上限(best possible nDCG@10)提升 0.103 至 0.282,而融合实际得分变化仅 0.002 至 0.010。
可靠的 agentic RAG 不靠写更好的提示词,而取决于控制哪些信息、何时、以何种形式到达模型。Weaviate 引用 @victorialslocum 的视频,把上下文工程拆成查询增强、检索、记忆、工具、智能体 5 个相互关联的系统。其中分块存在精度与上下文窗口的真实权衡,长期记忆应放在模型之外并按需检索,暴露 100 个描述不清的工具只会让相关工具更难找。
Milvus 3.0 将 regex 过滤下推到查询路径,可与向量搜索、全文搜索和标量过滤同时执行,不再需要先取回 top-K 再用 re.match() 逐条过滤。
Tina Sharma 用 Qdrant 构建了一套 AI Agent 语义缓存,可识别表述不同但含义相同的问题并复用已有回答,避免重复调用 LLM。实测缓存命中率 57.1%、token 消耗减少 55.7%,命中时响应时间约 15ms,文中还对相似度阈值做了调优并对比了单向量与多向量检索。
IDC 受 Elastic 委托调研 11 家大型企业后发现,使用 Elasticsearch 平台的组织三年 ROI 达 517%,平均回本周期 11 个月,每家年均收益 1340 万美元。这些企业将最低可用 AI 产品的落地时间缩短 40%,AI 产品更新提速 35%,搜索相关性提升 44%。研究覆盖金融服务、医疗、零售与政府行业,用例包括客服机器人、欺诈检测与智能体工作流。
调优 Qdrant 集合前应先确认前置状态:用 GET /collections/{collection_name} 比对 indexed_vectors_count 与 points_count,未建索引的向量走精确扫描,结果有效但延迟更高,且 hnsw_ef 在索引建立前不起作用。
Milvus 3.0 新增 Search Aggregation,把保留的 ANN 候选按 doc_id、租户、产品线或内容类型分桶,返回桶计数、指标与代表性命中,用于判断 RAG 检索结果是集中还是分散。
Qdrant 对比了 ACORN 与 filterable HNSW 两种过滤搜索方案:过滤器会把 HNSW 图切成不连通的孤岛,ACORN 在查询时绕过被过滤的邻居,filterable HNSW 则在索引中为共享 payload 值的点补边以保持图连通。
作者通过 AIS-Skill 把 Codex 与 TorchV AIS 知识引擎连接,让 Codex 从单次任务执行转向跨会话的长期协作。接通后 Codex 可定位知识库、关键词与语义检索、读写文档、上传下载文件并返回文档链接,形成"读取上下文→执行任务→人工确认→回写知识→持续复用"的循环。作者计划用 AIS 建立 common 公共资料库、项目长期上下文、Skill 资产库和自动日报四套体系。
Weaviate 的 Query Agent 迎来更新,在检索前会先探索数据集合,自动识别可用于过滤的全部取值,以及数值属性的均值、中位数、最小值和最大值。这意味着用户无需手动描述数据结构或硬编码过滤选项,可以直接提出"显示价格低于平均水平的产品""按最常见的类别过滤"这类请求。官方称该更新带来更智能的过滤和更好的搜索质量。
LlamaIndex 的 LlamaParse 新增修订追踪支持,可输出文档最终状态的干净 markdown,并把编辑、删除、评论等每次修订连同作者、内容和位置以结构化数据返回。
LlamaIndex 推出 ExtractBench,对文档抽取的“依据”严格打分:字段值与其引文都正确才算对,词级框需 IoU 0.5。VLMs 和编码智能体均未返回任何证据,两级得分均为零;能返回框的系统中词级 F1 仍不足 50%。
Zilliz 解决方案架构师 Simon Hearne 将于 8 月 19 日 11:00 AM PDT 主讲 Milvus 3.0 全文检索网络研讨会,演示与 Elasticsearch 的实时并排查询对比。内容涵盖 Milvus 3.0 的 BM25 与稀疏检索、过滤排序聚合与分面搜索、混合检索及 RRF 排序方法,并给出生产环境示例。无法实时参加者可注册获取回放与演示。
Alejandro AO 对 Mem0 架构做了完整拆解,涵盖持久化记忆存储、基于 LLM 的摄入、语义与 BM25 混合检索、实体加权以及本地开源模型等环节。内容按章节形式呈现,从智能体记忆的基本概念讲到具体检索实现。
Milvus 3.0 把商品搜索的结构化二次处理搬进检索引擎,新增 Query Aggregation、Search Aggregation 和 Server-side ORDER BY 三项能力。
LlamaIndex 推出限时活动,升级至 LlamaParse Pro 计划可将首月 credits 提升三倍,从 400K 增至 1.2M,相当于价值 $1,000(约 80k 页)的解析额度免费使用。该优惠无需代码,自动生效。
拜耳(Bayer)在 Qdrant Hybrid Cloud 上为 116,000 名员工构建企业搜索引擎,4 个节点承载 3500 万向量点,已生产运行三年。该系统采用混合搜索支撑深度智能体,并用语义缓存控制智能体成本,实测效率提升 20%。