把几十万份企业文档塞进知识库,为什么“导进去”只是最容易的一步
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。
AI产品经理的技术门槛不是会训练大模型,而是能否用技术知识改变产品决策。文章以售后客服助手为例,拆解政策解释、订单查询、退款执行三类任务在模型边界、API与权限、数据流上的差异,并给出评估分层与上线边界。作者认为,产品经理不必补齐程序员训练路径,而应学会判断任务该交给生成、检索、工具还是人工。
Uber 法务红线 Agent 从朴素 RAG 起步失败,历经反馈闭环、语气分层、Agentic 修改草拟四版架构,把合同决策准确率做到 91%、平均审核时间下降 20%+。
Alteryx One Live Query 与 Google Cloud BigQuery 集成,可在浏览器中以无代码方式构建数据管道,并通过安全 SQL 下推在 BigQuery 内直接执行转换逻辑。
Milvus 3.0 发布演示,针对图表、箭头、空间关系密集的 PDF,改用查询 token 嵌入与页面视觉 patch 嵌入的 late interaction 检索,打分公式为 score(Q, P) = Σᵢ maxⱼ cosine(qᵢ, pⱼ),为每个查询 token 匹配页面最相关区域后再合成页面级得分,保留细粒度视觉信号到比较时刻。
LlamaIndex 展示 LlamaParse 处理嵌套表格的能力:即使表格中包含表格,输出依然干净。本周文档选用 Micron 最新财报 PPT,其中含两个业务单元且行名重复,LlamaParse 仍将全部 18 个数值归入正确表头下。用户可通过 llamaindex.ai/llamaparse 上传自己的财报测试。
OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。
文章指出,2025 年 5 月 Anthropic 把向量搜索从 Claude Code 中移除,改用 grep,作者 Boris Cherny 称结果全面胜出且优势很大;此后 Cursor、Windsurf、Cline、Devin、Sourcegraph Amp 相继转向工具驱动的 agentic 检索。
面对大型企业几十万份文档入库的需求,AIS 团队认为难点不在导入,而在知识源分散、版本冲突、权限与持续更新。其客户中文档最多的已突破 550 万份,AIS 通过 Connector 自动同步、检索前权限过滤,以及解析—清洗—结构化—切片—抽取—分类—打标签—校验的知识工程流程,并区分 MCP 的 readonly、write、admin 权限等级来管理知识供应链。
Qdrant 推出新的 memory store 集成,可作为 LangGraph 长期记忆的存储层,让 AI 智能体跨会话保存并召回信息。该集成把 Qdrant 的向量原生存储与语义搜索带入 LangGraph 记忆系统,智能体可按语义而非精确匹配检索相关记忆,用于存放用户偏好、过往交互等上下文。
LangGraph 更新官方文档,并发布 Qdrant 集成包。该集成已在 PyPI 上线,可通过 pip 安装使用,文档同步提供 Python 版使用说明。
Perplexity 开源 pplx-embed-v2-late,这是面向文本与图像的多向量嵌入模型,提供 9B 和 0.6B 两个版本并共享同一嵌入空间。其中 9B 可用于索引多模态数据,0.6B 可用于端侧查询,还支持无需 OCR 直接搜索 PDF 页面。官方称其在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%,权重已在 Hugging Face 发布。
InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?
Cohere 的搜索与检索平台 Compass 将推出云端版本 Compass Cloud,目前处于私有测试阶段,面向希望以更低开销获得优质检索能力的企业团队开放早期访问申请。
Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答。其 Discovery Agent 上线以来为客户发现超过 100,000 条异常与离群点,Lintech International 索引了 17,000 多份技术文档,响应速度提升 75%,业务经理每周节省最多 7 小时。
Baseten 基于 Notion Agents 搭建了一个内部答疑系统,问题进入 Slack 后自动发布答案;当系统不知道答案时,它会学习并更新所有来源,供下次使用。Baseten 工程师与 Notion 团队合作推进模型训练与推理,其 GTM 团队则用 Notion Agents 维护 wiki 的完整与更新。
DeepLearning.AI 与 Qdrant 合作推出由 Dylan Couzon 讲授的免费课程,教你亲手构建一个能记住钥匙放在哪里的本地助手,无需网络连接,也不依赖远程服务器。
LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。
LlamaIndex 将 Markdown 作为解析的默认输出格式,因为 Markdown 能保留标题、列表和表格结构,避免解析器读对每个词却丢失数字所属列、迫使模型猜测的问题,且调试错误答案时仍可读。对于存在合并表头的表格,则改用 HTML 输出。
Cohere 正在举办线上研讨会,讨论搜索与检索的未来,涉及 Embed 5、Parse 5 以及其新的检索评估方法 RCP-nDCG。活动通过 X 平台直播。
Cohere 发布一场关于搜索与检索未来的分享。正文仅提供直播链接,未披露具体模型、版本或数据。
张佳宣布《AI产品经理转型特训营-2026版》课纲开始更新,共14大模块、76章节、330+知识点、24小时课程时长,计划每周更新一轮、争取2个月内更完全部内容。新版融合2025版技能特训课、项目实训课、线下课、AI编程课与智能体课程内容,增加Agent、Skill的篇幅和颗粒度,并重构教学方式以适应零散时间学习。更新期间报名按2025版早鸟价2999元,更新完成后涨价至3999元。
谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。
Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。
TypeSafe 推出的决策模型 Jev 经由 OpenRouter 提供服务,无需任务特定训练即可输出受限于候选标签的数值分数。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 采用实时 ACL 校验,在查询时直接向 Google Drive 等权威来源核实权限,作为预检索过滤之外的第二层防护。该两阶段架构先用索引中缓存的 ACL 做语义检索,再实时验证候选文档,未授权的文档不会传入 LLM。AWS 称权限一旦被撤销,AI 响应可在数秒内而非数小时内反映变化。
在 MADQA 基准上,该检索器处理 800 份 PDF 上的 500 个问题,准确率达到 92.4%,在所有检索器中排名第一。
Perplexity 发布 pplx-embed-v2-late,包含两个延迟交互嵌入模型,可在共享嵌入空间中检索文本、图像和页面,实现跨模态查询;两个模型均达到前沿性能,并已在 Hugging Face 公开可用。
LlamaIndex 发布 OpenDocRouter,把文档解析模型统一到一个 API 下,同一请求即可切换模型并输出相同 markdown,无需改提示词或集成。
Milvus 面向题库检索提出一套五步架构,将语义检索、BM25 关键词搜索和标量过滤结合:用教育领域微调的嵌入向量做语义匹配,用内置 BM25 函数做关键词检索,再以 HNSW/COSINE 稠密向量索引、稀疏索引和标量索引组合,通过 WeightedRanker 或 RRFRanker 合并结果,最后用 Cross-Encoder 重排,支持组卷、错题复习推荐和题目搜索。
Qdrant 提前拿到 Google EmbeddingGemma 2 并测试其 Matryoshka 兼容嵌入在 Qdrant 中可压缩到何种程度。通过更短向量、量化与重打分组合,向量内存占用降低约 77 倍,同时保留基线 94.5% 的检索质量。Google 在 EmbeddingGemma 2 发布公告中也提到了这项工作。
Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。
Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。
DeepLearning.AI 推出与 Qdrant 合作、由 Dylan Couzon 讲授的免费课程,教你亲手搭建一个能记住物品位置(如钥匙放在哪)的 AI 助手,无需网络连接、不依赖远程服务器。课程现已开放免费注册。
Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。
Weaviate 的 query profiling 现已正式可用,在请求 metadata 中设置 query_profile 即可随响应返回按分片和节点组织的耗时拆解,协调节点会汇总各分片的计时,免去手动拼合多节点日志。官方举例中一个耗时 48.2ms 的分片里,向量搜索占 8.4ms、过滤解析占 2.1ms,而对象加载占 36.8ms,说明瓶颈不在 HNSW,盲目扩容会错过真正的问题。
LlamaIndex 开源负责人 Logan Markewich 撰文讨论从传统 OCR 向 agentic OCR 的转变:传统 OCR 单次扫描直接输出文本,表格被压平、图表消失、多栏排版错乱,且无人校验结果。
微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。
Amazon Bedrock Managed Knowledge Bases 现已支持 agentic retrieval,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环检索并判断证据是否充分,而 Retrieve API 只做一次混合搜索。
Milvus 为 HNSW 提供 HNSW_SQ、HNSW_PQ 和 HNSW_PRQ 三种向量压缩索引,用于降低图构建与距离计算中的内存占用。SQ 对每一维量化,SQ8 与 SQ6 分别用 8 位和 6 位,SQ4U 用 4 位无符号值并共享统一范围;PQ 将向量切分为子向量并以码本索引表示;PRQ 在 PQ 基础上分阶段编码残差,代价是额外训练、构建与距离计算开销。