让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem v1.1 的设计与取舍
大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。
大淘宝技术直播技术团队开源了本地长期记忆系统 HL-Mem(Apache-2.0),对应 v1.1 系列,采用事实与经验双通道架构,用不可变 Event 加可更新 Claim 实现证据可追溯、有效时间与记录时间双时间可解释,以及记忆的修正与遗忘。系统默认仅依赖 SQLite 单文件部署,配后台异步 Worker 处理去重、冲突消解与生命周期管理,运行时独立、本地优先,并支持中文检索。
Milvus 官方给出常规 Collection 与 External Collection 的选用边界:应用需持续 insert/upsert、删除须经在线写入路径可搜。
mem0 提出一条经验法则:只为需要过滤、校验或聚合的内容创建字段,其余内容保持为文本。这本质上是在写入时的灵活性与查询时的可靠性之间做权衡。
超级小爱基于 Xiaomi MiMo 模型引入 RAG-Planning 并将推理从 think 模式切换为 no-think 模式,模型耗时平均下降约 35%,端到端最快快出 3 到 6 秒。全双工升级把拒识、判停和打断统一决策,配合三级 Session 压缩体系使上下文 Token 量下降 60%—86%,支持边听边说与随时插话。小米澎程 SkyNomad 已搭载专家版超级小爱。
Perplexity 开放检索模型评测申请,开发者可通过 Google 表单提交公开可用的 Hugging Face 检索模型参与评估,包含评测方法与结果的完整技术报告已发布在 arXiv(2609.08887)。
Perplexity 用 Recall@1000 为主要指标,在三个相关性数据集上评测了 13 个检索模型。pplx-embed-v1-4b 以 65.73 和 69.11 分别在 Web Ranking 与 Combined 上领先,Nemotron-3-Embed-8B 则在 Citation 上以 61.68 居首。
Perplexity 披露其检索语料构建方式:每个查询取 top 5,000 条生产检索结果,用 MinHash-LSH 去重。每篇文档至少与一个查询构成看似合理的匹配,其中包含主题相关但缺少所需日期、实体或版本的困难干扰项。
Perplexity 推出 Q2D-Web(Query2Doc-Web),用于评测 agentic RAG 系统检索能力的基准和公开榜单。该基准测试嵌入模型在使用 AI 智能体重写搜索查询时,在大规模网页搜索上的表现。
Qdrant 上线面向零基础学习者的 Beginner Course,从传统搜索的局限、嵌入向量表意和相似度原理讲起,带学员搭建第一个 Qdrant collection,并理解向量、payload、HNSW 以及 dense、sparse、hybrid 搜索的差异。
Milvus 3.0 External Collection 通过显式 Refresh 边界避免生产搜索暴露未就绪索引。新文件、元数据或嵌入更新到达数据湖时,Refresh 只识别变更的源片段,未变更分片复用已有 segment 和索引,期间查询继续使用上一发布版本,完成后新版本整体生效。
Weaviate 介绍其磁盘向量索引 HFresh:用紧凑 HNSW 索引将查询路由到最相关的质心,再检索存于磁盘的压缩倒排数据。其中 RQ8 让质心向量缩小约 4 倍,RQ1 使存储的倒排向量数据较 32 位浮点最多减少 32 倍,后台拆分、合并与重分配操作让索引持续保持平衡。它面向更低堆内存占用、可控查询 I/O 和大型可变数据集,无需周期性全量重建;追求峰值查询性能仍应选 HNSW。
AI 时代下,美团、阿里等大厂已跳过原型图和设计稿,由产品经理用 AI coding 直接生成前端页面,纯执行型 UI 设计岗位持续收缩。文章认为 UI 设计师的需求分析、用户调研、原型设计与竞品拆解能力,正是 AI 产品经理岗位的核心要求,并推荐了一门主打 Agent、RAG、Function Calling 与 Vibe Coding 的「零基础入门AI产品岗」课程。
Weaviate《Building Foundry》最后一集演示如何在不移动或重命名原文件的前提下,为创意素材库搭建可搜索层,结合描述、标签、提取文本与元数据补充上下文。该搜索层支持关键词、语义与混合搜索,搜索“white rabbit in a grassy landscape”可同时召回参考图、预告片片段及相关景观素材,即使文件名完全不含这些词。
Qdrant 在五个公开数据集上测试了向量检索的调参策略,发现该调哪个参数取决于问题出在哪里。将候选深度从 10 提升到 500,最佳可达分数最多提高 0.28,但最终分数提升至多只有 0.01,因为相关文档已被召回、只是排名不够高。Qdrant 因此建议先定位失败环节,再调整与之对应的 `hnsw_ef`、候选深度、RRF `k`、量化或重排序等参数,而非反复试参数。
AI 落地实施正越来越像咨询工作:项目起点从明确需求变成"建企业级 AI 平台、知识库、智能问答、智能体"这类大方向,前半程的重点转为与客户一起发现价值。作者认为可复制的是方法和经验而非项目答案,总体设计须先回答"为什么建、先建什么、怎样证明值得继续建"。企业级知识库的长期有效还需同时解决知识生命周期、知识质量与知识价值,软件则内化运营管理方法。
双曲嵌入用负曲率几何匹配树状层级结构,空间随半径指数增长,因而能用更少维度表达分支关系。在 WordNet 名词层级重建任务中,5 维 Poincaré 嵌入取得 0.823 的平均精度,而 200 维欧氏嵌入仅为 0.168。
Qdrant 将在 9 月 16-17 日举办 3 场免费社区活动。9 月 16 日为 Discord Office Hours 与柏林 Bring Your Own Demo Night(联合 cognee。
LlamaIndex 评测了 14 个前沿系统在 370 份企业文档上的表现,将准确率与每页成本对照后发现,成本更高并不等于抽取更准。Agentic Plus 以不到第二名 1/3 的成本取得最高准确率,Agentic 与 Cost Effective 也常胜过每页贵数倍的系统。注册 LlamaParse 可获 10,000 免费额度试用 Extract。
GPT-6 Astra 拥有 1.05M token 上下文窗口,在 OpenAI 的 MRCR v2 8-needle 测试中于 512K–1M 上下文下得分 96.3%,而 GPT-5.6 Sol 为 73.8%。
淘宝百亿补贴团队上线 bybt-data-analysis-assistant 数据分析智能体,用自然语言提问即可完成找表、写 SQL、执行到深度归因的全流程。
一篇新论文提出 It Takes Two to Match,用强化学习让生成式检索器协同演化,论文已上传至 Hugging Face Papers(编号 2609.00…)。该工作聚焦生成式检索与 RL 训练的结合,具体方法与实验数据需查阅原文。
Milvus 3.0 的 External Collection 支持直接连接存储在 Parquet、Apache Iceberg、Lance、Vortex 或受支持的 Milvus 快照中的数据,无需先把源数据行搬进 Milvus。
Weaviate 1.38 新增 Boost API,在主检索之后对结果重新排序打散。它支持 filter 条件、数值属性、时间衰减和目标值附近的数值衰减,最多可混合 20 个条件,还能调整权重或用负权重降权而不排除结果;设置 depth 参数可控制候选文档规模。
LlamaIndex 的 ExtractBench 已在 Kaggle 上线,针对最容易击溃下游智能体与工作流的长记录列表、噪声扫描件、手写体和复杂表格,评测 schema 引导的文档抽取。该基准覆盖 8 个业务领域、67 种文档类型、共 370 份企业文档,并对比 LlamaParse、Codex、Claude Code 等方案的表现。
Weaviate Cloud 的 Ask Mode 新增 result_evaluation 参数,默认 "none" 跳过答案评估,直接检索数据并生成答案,更快更省;设为 "llm" 则额外调用一次模型,用检索上下文评估答案并筛选相关来源,同时返回 is_partial_answer 和 missing_information 字段。
Milvus 3.0 推出 StructArray,允许在一个父实体下用 ARRAY 字段存放视频片段、商品图片、文档段落等元素,每个元素带独立向量和 metadata。
Weaviate 提出用晚交互多向量检索把 PDF 每页作为图像嵌入,直接搜索文本提取遗漏的图表、表格和版式,无需 OCR 和分块。在 92 页 NVIDIA 投资者材料上测试,一条关于汽车营收的查询准确召回了那张五季度柱状图,尽管页面上并未出现 "change" 和 "over time" 字样。用户可直接将 PDF 拖入 Weaviate Cloud 开始提问。
Agent“忘事”的根因在于记忆并非模型原生能力,而是应用层围绕上下文构建的工程系统,核心问题是每轮请求该把哪些历史信息带给模型。文章将记忆分为工作记忆、情节记忆、语义记忆和过程记忆四层,对应上下文、文档库与向量索引、KV/关系库、版本化配置等不同载体,并比较截断滑动窗口、滚动摘要、RAG 式记忆、事实抽取、知识图谱与主动调页等实现方式。
2026 上海开源软件应用创新大赛启动,Dify 作为企业合作伙伴参与,赛事以「开源向实」为主题设置 AI+工业软件、智算云、开源 AI 工具三大赛道。报名及作品提交截止 2026 年 10 月 11 日,线下总决赛于 10 月 24 日在上海举行,总奖池累计 100 万元,含现金、算力与 Token、大模型 API 等资源。
腾讯升级 WorkBuddy 并推出企业版 AI 工作台,阿里把多条产品线整合为千问办公并接入钉钉,字节发布豆包工作并与飞书打通,AI 办公竞争进入由 Agent 接收目标、拆解任务、调用工具并交付结果的阶段。但员工个人提效不等于企业提效,组织、流程、知识与协同四类问题仍待解决,这类市场更重、更难标准化,也并非大厂优先级最高的生意。
Milvus 3.0 Backfill 面向嵌入模型升级场景,当 Spark 已把新嵌入生成为 Parquet 文件时,无需通过在线写入路径重写全部记录。它只读取更新所需的现有数据,仅写入发生变化的目标字段,未变字段保持不变;对向量字段还可校验并归一化维度与稀疏向量格式。
LlamaIndex 尝试了三种方法改进静态嵌入的检索效果:对逐 token 嵌入做原始 maxsim 打分、训练小型 adapter 模型、调整蒸馏训练目标与教师模型,均未取得预期结果。静态嵌入吞吐量无可匹敌,但相比传统嵌入模型存在精度损失。相关探索已发布在 LlamaIndex 博客。
Qdrant 支持把 dense vectors、HNSW 图、量化向量和 payload 分别放到 Pinned、Cached、Cold 三种内存层级,Dense vectors 和 payload 无法 pinned。
LlamaIndex 在 LlamaParse 平台中加入原生电子表格提取功能,直接读取原始单元格并按用户 schema 映射数据,而非像多数提取工具那样把表格拍平成文本或 markdown 再让模型推断结构。该功能已在 agentic_plus 档位开放 beta,支持 .xlsx、.xls 和 .csv 文件。
Milvus 3.0 推出 StructArray,可在单个实体内完成多向量搜索,视频、文档、商品各自的片段嵌入无需拆成独立数据库行,元素与父实体保持关联并携带自身向量和标量元数据。
Weaviate 1.39 发布,Boost API 和 MMR 多样性选择两个搜索功能转为 GA,前者可在查询时上调或下调结果排序且不丢弃任何结果,后者用于混合搜索和向量搜索中避免首页结果重复。
Gallup 基于 Amazon Bedrock 构建生成式 AI 助手 Gallup AI,将其 90 余年职场研究转化为实时个性化教练,直接嵌入 Gallup Access 应用。
LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。
越南本土搜索引擎与浏览器 Cốc Cốc 采用 Milvus 作为自托管检索底座,支撑其搜索、广告、推荐、定向与内部 RAG 共 5 个生产系统。其生产环境已部署 7 亿向量,规划容量约 15 亿,峰值流量下语义搜索 P90 延迟为 19.8 ms。此前 FAISS 与 USearch 无法跨机分布数亿向量或支持持续生产更新。
LangChain 发布开源项目 data-driven-characters,可从任意语料库生成角色定义并与之对话,支持导出到 character.ai、命令行或 Streamlit 界面本地调试,以及部署自包含的 Streamlit 应用。