跳到正文

#RAG

今日 6 条
今天10月10日周六
  1. 土猛的员外AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    把几十万份企业文档塞进知识库,为什么“导进去”只是最容易的一步

    帮上海一家大型国企把几十万份文档导入知识库时发现,真正的难点在导入之后:资料散落在OA、ERP、企业微信和NAS,同一制度存在三个版本,扫描PDF、数百页长文与带合并单元格的Excel混在一起,解析出错或机械切断就会让模型对着碎片胡猜。AI精准召回一份过期差旅标准比找不到更危险,Agent时代还可能越权拼出薪酬信息或直接写回知识库。企业需要的是持续供应可信知识的流水线,而非更大的知识库。

  2. 人人都是产品经理AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI产品经理到底要学哪些技术?别把时间浪费在这3件事上

    AI产品经理的技术门槛不是会训练大模型,而是能否用技术知识改变产品决策。文章以售后客服助手为例,拆解政策解释、订单查询、退款执行三类任务在模型边界、API与权限、数据流上的差异,并给出评估分层与上线边界。作者认为,产品经理不必补齐程序员训练路径,而应学会判断任务该交给生成、检索、工具还是人工。

  3. meng shao(@shao__meng)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Uber 法务红线 Agent 的四次架构演进:从 RAG 失败到 91% 准确率

    Uber 法务红线 Agent 从朴素 RAG 起步失败,历经反馈闭环、语气分层、Agentic 修改草拟四版架构,把合同决策准确率做到 91%、平均审核时间下降 20%+。

  4. Google Cloud BlogAI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Alteryx Live Query 集成 Google Cloud BigQuery,用 AI 处理非结构化数据

    Alteryx One Live Query 与 Google Cloud BigQuery 集成,可在浏览器中以无代码方式构建数据管道,并通过安全 SQL 下推在 BigQuery 内直接执行转换逻辑。

  5. Milvus(@milvusio)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 演示用 late interaction 做视觉密集 PDF 检索

    Milvus 3.0 发布演示,针对图表、箭头、空间关系密集的 PDF,改用查询 token 嵌入与页面视觉 patch 嵌入的 late interaction 检索,打分公式为 score(Q, P) = Σᵢ maxⱼ cosine(qᵢ, pⱼ),为每个查询 token 匹配页面最相关区域后再合成页面级得分,保留细粒度视觉信号到比较时刻。

  6. LlamaIndex 🦙(@llama_index)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaParse 如何处理表格套表格:Micron 财报 PPT 解析演示

    LlamaIndex 展示 LlamaParse 处理嵌套表格的能力:即使表格中包含表格,输出依然干净。本周文档选用 Micron 最新财报 PPT,其中含两个业务单元且行名重复,LlamaParse 仍将全部 18 个数值归入正确表头下。用户可通过 llamaindex.ai/llamaparse 上传自己的财报测试。

10月9日周五
  1. 字节跳动技术团队AI 评估 · 59/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenViking 团队三篇论文拆解其上下文数据库核心技术

    OpenViking 团队围绕 Agent 的上下文管理发布三项研究:VikingMem(VLDB 收录)把记忆分为事件与实体两层并维护最新档案,在 LoCoMo 长期记忆评测上得 88.83。

  2. dbaplus社群AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向量数据库凉了?Claude Code、Cursor 为何集体抛弃 RAG?

    文章指出,2025 年 5 月 Anthropic 把向量搜索从 Claude Code 中移除,改用 grep,作者 Boris Cherny 称结果全面胜出且优势很大;此后 Cursor、Windsurf、Cline、Devin、Sourcegraph Amp 相继转向工具驱动的 agentic 检索。

  3. 土猛的员外AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    大型企业几十万份文档,究竟应该怎样交给AI?

    面对大型企业几十万份文档入库的需求,AIS 团队认为难点不在导入,而在知识源分散、版本冲突、权限与持续更新。其客户中文档最多的已突破 550 万份,AIS 通过 Connector 自动同步、检索前权限过滤,以及解析—清洗—结构化—切片—抽取—分类—打标签—校验的知识工程流程,并区分 MCP 的 readonly、write、admin 权限等级来管理知识供应链。

  4. Qdrant(@qdrant_engine)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangGraph 长期记忆接入 Qdrant:智能体跨会话记忆改用向量语义检索

    Qdrant 推出新的 memory store 集成,可作为 LangGraph 长期记忆的存储层,让 AI 智能体跨会话保存并召回信息。该集成把 Qdrant 的向量原生存储与语义搜索带入 LangGraph 记忆系统,智能体可按语义而非精确匹配检索相关记忆,用于存放用户偏好、过往交互等上下文。

  5. Qdrant(@qdrant_engine)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangGraph 文档更新并推出 Qdrant 集成

    LangGraph 更新官方文档,并发布 Qdrant 集成包。该集成已在 PyPI 上线,可通过 pip 安装使用,文档同步提供 Python 版使用说明。

  6. Aravind Srinivas(@AravSrinivas)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 开源 pplx-embed-v2-late 多向量嵌入模型,含 9B 与 0.6B 两个版本

    Perplexity 开源 pplx-embed-v2-late,这是面向文本与图像的多向量嵌入模型,提供 9B 和 0.6B 两个版本并共享同一嵌入空间。其中 9B 可用于索引多模态数据,0.6B 可用于端侧查询,还支持无需 OCR 直接搜索 PDF 页面。官方称其在 MADQA 上得分 92.4%,在 BrowseComp+ 上得分 64%,权重已在 Hugging Face 发布。

  7. InfoQAI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    InfoQ 网络研讨会:AI 进入生产环境,什么会崩、什么可行、谁来把关?

    InfoQ 将于 10 月 14 日举办免费 60 分钟线上研讨会"AI in Production: What Breaks, What Works, and Who Approves It?

  8. cohere(@cohere)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere Compass Cloud 进入私有测试阶段,开放企业团队申请

    Cohere 的搜索与检索平台 Compass 将推出云端版本 Compass Cloud,目前处于私有测试阶段,面向希望以更低开销获得优质检索能力的企业团队开放早期访问申请。

  9. AWS Machine Learning BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qlik 如何用 Amazon Bedrock 构建可溯源的企业级 AI

    Qlik 基于 Amazon Bedrock 打造 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答。其 Discovery Agent 上线以来为客户发现超过 100,000 条异常与离群点,Lintech International 索引了 17,000 多份技术文档,响应速度提升 75%,业务经理每周节省最多 7 小时。

  10. Notion(@NotionHQ)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Baseten 用 Notion Agents 搭建自动答疑知识库,答不上来还能自我更新

    Baseten 基于 Notion Agents 搭建了一个内部答疑系统,问题进入 Slack 后自动发布答案;当系统不知道答案时,它会学习并更新所有来源,供下次使用。Baseten 工程师与 Notion 团队合作推进模型训练与推理,其 GTM 团队则用 Notion Agents 维护 wiki 的完整与更新。

  11. DeepLearning.AI(@DeepLearningAI)AI 评估 · 12/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与 Qdrant 合作推出本地记忆助手课程:无需联网和远程服务器

    DeepLearning.AI 与 Qdrant 合作推出由 Dylan Couzon 讲授的免费课程,教你亲手构建一个能记住钥匙放在哪里的本地助手,无需网络连接,也不依赖远程服务器。

  12. Jerry Liu(@jerryjliu0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex:Markdown 成为人与智能体之间的通用信息表示,并推出非结构化文档转 Markdown 模型

    LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。

  13. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 解析默认输出 Markdown,合并表头场景改用 HTML

    LlamaIndex 将 Markdown 作为解析的默认输出格式,因为 Markdown 能保留标题、列表和表格结构,避免解析器读对每个词却丢失数字所属列、迫使模型猜测的问题,且调试错误答案时仍可读。对于存在合并表头的表格,则改用 HTML 输出。

10月8日周四
  1. cohere(@cohere)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 举办线上研讨会,探讨搜索与检索的未来,含 Embed 5、Parse 5 与 RCP-nDCG

    Cohere 正在举办线上研讨会,讨论搜索与检索的未来,涉及 Embed 5、Parse 5 以及其新的检索评估方法 RCP-nDCG。活动通过 X 平台直播。

  2. cohere(@cohere)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cohere 谈搜索与检索的未来

    Cohere 发布一场关于搜索与检索未来的分享。正文仅提供直播链接,未披露具体模型、版本或数据。

  3. 人人都是产品经理AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI产品经理转型特训营2026版开始更新:14模块76章节24小时课程

    张佳宣布《AI产品经理转型特训营-2026版》课纲开始更新,共14大模块、76章节、330+知识点、24小时课程时长,计划每周更新一轮、争取2个月内更完全部内容。新版融合2025版技能特训课、项目实训课、线下课、AI编程课与智能体课程内容,增加Agent、Skill的篇幅和颗粒度,并重构教学方式以适应零散时间学习。更新期间报名按2025版早鸟价2999元,更新完成后涨价至3999元。

  4. 国际大厂AI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    谷歌开源 EmbeddingGemma 2:740M 参数支持本地多模态检索

    谷歌于 10 月 6 日开源 EmbeddingGemma 2,这是其首个原生多模态开源嵌入模型,可把文字、代码、图片、视频、音频放进同一个 768 维空间并用一句话检索。

  5. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 与 Pento 推出 miniCOIL EN-ES 双语稀疏神经检索模型

    Qdrant 与 Pento 合作推出 miniCOIL EN-ES,一个英西双语稀疏神经检索器,让 "home" 与 "casa"、"bat" 与 "murciélago" 映射到稀疏向量的同一单元格,单个倒排索引即可同时服务英语和西班牙语查询与文档,无需翻译步骤。

  6. QdrantAI 评估 · 33/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测 Jev:把通用分类器用在重排序、去重等任务上

    TypeSafe 推出的决策模型 Jev 经由 OpenRouter 提供服务,无需任务特定训练即可输出受限于候选标签的数值分数。

  7. AWS Machine Learning BlogAI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Amazon Quick 与 Amazon Bedrock 如何用实时 ACL 重塑 RAG 访问控制

    Amazon Quick 与 Amazon Bedrock Knowledge Bases 采用实时 ACL 校验,在查询时直接向 Google Drive 等权威来源核实权限,作为预检索过滤之外的第二层防护。该两阶段架构先用索引中缓存的 ACL 做语义检索,再实时验证候选文档,未授权的文档不会传入 LLM。AWS 称权限一旦被撤销,AI 响应可在数秒内而非数小时内反映变化。

  8. Perplexity(@perplexity_ai)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    检索器在 MADQA 上达到 92.4%,位居第一

    在 MADQA 基准上,该检索器处理 800 份 PDF 上的 500 个问题,准确率达到 92.4%,在所有检索器中排名第一。

  9. Perplexity(@perplexity_ai)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Perplexity 发布 pplx-embed-v2-late 延迟交互嵌入模型,文本图像页面统一检索

    Perplexity 发布 pplx-embed-v2-late,包含两个延迟交互嵌入模型,可在共享嵌入空间中检索文本、图像和页面,实现跨模态查询;两个模型均达到前沿性能,并已在 Hugging Face 公开可用。

  10. LlamaIndex 🦙(@llama_index)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 发布 OpenDocRouter,用一套 API 统一文档解析模型

    LlamaIndex 发布 OpenDocRouter,把文档解析模型统一到一个 API 下,同一请求即可切换模型并输出相同 markdown,无需改提示词或集成。

10月7日周三
  1. Milvus(@milvusio)AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 如何用语义检索、BM25 与标量过滤帮教育场景找对题目

    Milvus 面向题库检索提出一套五步架构,将语义检索、BM25 关键词搜索和标量过滤结合:用教育领域微调的嵌入向量做语义匹配,用内置 BM25 函数做关键词检索,再以 HNSW/COSINE 稠密向量索引、稀疏索引和标量索引组合,通过 WeightedRanker 或 RRFRanker 合并结果,最后用 Cross-Encoder 重排,支持组卷、错题复习推荐和题目搜索。

  2. Qdrant(@qdrant_engine)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测 Google EmbeddingGemma 2:向量内存降 77 倍,保留 94.5% 检索质量

    Qdrant 提前拿到 Google EmbeddingGemma 2 并测试其 Matryoshka 兼容嵌入在 Qdrant 中可压缩到何种程度。通过更短向量、量化与重打分组合,向量内存占用降低约 77 倍,同时保留基线 94.5% 的检索质量。Google 在 EmbeddingGemma 2 发布公告中也提到了这项工作。

  3. meng shao(@shao__meng)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 开源 EmbeddingGemma 2 端侧多模态嵌入模型

    Google DeepMind 开源发布原生多模态、专为端侧设计的 740M 参数嵌入模型 EmbeddingGemma 2,把文本、代码、图像、视频、音频映射进同一个 768 维向量空间。

  4. 宝玉(@dotey)AI 评估 · 75/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google 开源 EmbeddingGemma 2 多模态嵌入模型,可在手机本地运行

    Google 开源 EmbeddingGemma 2,这是一个可在手机和电脑本地运行的多模态嵌入模型,文字、图片、视频、音频和代码可放进同一套坐标系,不联网也能用一句话检索内容。

  5. DeepLearning.AI(@DeepLearningAI)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    与 Qdrant 合作课程:本地构建无需联网的 AI 助手,记住你的钥匙放在哪

    DeepLearning.AI 推出与 Qdrant 合作、由 Dylan Couzon 讲授的免费课程,教你亲手搭建一个能记住物品位置(如钥匙放在哪)的 AI 助手,无需网络连接、不依赖远程服务器。课程现已开放免费注册。

  6. Google DeepMind(@GoogleDeepMind)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google DeepMind 发布 EmbeddingGemma 2,740M 参数以 Apache 2.0 开源

    Google DeepMind 发布 EmbeddingGemma 2,参数量 740M,在多项基准上具有竞争力,甚至超过部分参数量两倍以上的专用模型。开发者可用它为应用加入多模态搜索,例如用语音备忘录在视频中定位片段,也可与 Gemma 4 搭配实现私密的端侧 RAG。该模型以 Apache 2.0 许可发布,权重已在 Hugging Face 和 Kaggle 上线。

10月6日周二
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 查询性能分析正式可用:逐分片拆解慢查询耗时

    Weaviate 的 query profiling 现已正式可用,在请求 metadata 中设置 query_profile 即可随响应返回按分片和节点组织的耗时拆解,协调节点会汇总各分片的计时,免去手动拼合多节点日志。官方举例中一个耗时 48.2ms 的分片里,向量搜索占 8.4ms、过滤解析占 2.1ms,而对象加载占 36.8ms,说明瓶颈不在 HNSW,盲目扩容会错过真正的问题。

  2. LlamaIndex 🦙(@llama_index)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 谈 agentic OCR:传统 OCR 一次成稿,智能体式解析改为循环校验

    LlamaIndex 开源负责人 Logan Markewich 撰文讨论从传统 OCR 向 agentic OCR 的转变:传统 OCR 单次扫描直接输出文本,表格被压平、图表消失、多栏排版错乱,且无人校验结果。

  3. elvis(@omarsar0)AI 评估 · 35/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微软提出 CorpusMap:为 LLM 智能体预建实体地图,检索准确率提升超 6 分

    微软及合作者提出 CorpusMap,预先解析文档集合中的重复实体,为每个实体生成链接全部相关文档的页面,原始文档保持原位,智能体可沿实体跳转到相关文档而无需重复检索同一证据。在 7 个模型和三个基准上,答案质量提升 6.4 至 11.7 分,输入 token 减少 34% 至 57%,并优于 LLM Wiki 层等三种导航层。该地图无需调用 LLM 即可构建,并随新文档到来更新。

10月5日周一
  1. AWS Machine Learning BlogAI 评估 · 39/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 与 Amazon Bedrock Knowledge Bases 的智能体检索实践

    Amazon Bedrock Managed Knowledge Bases 现已支持 agentic retrieval,通过 AgenticRetrieveStream API 把多部分问题拆成子查询、循环检索并判断证据是否充分,而 Retrieve API 只做一次混合搜索。

  2. Milvus(@milvusio)AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus HNSW 的 SQ、PQ 与 PRQ:向量压缩方式对比

    Milvus 为 HNSW 提供 HNSW_SQ、HNSW_PQ 和 HNSW_PRQ 三种向量压缩索引,用于降低图构建与距离计算中的内存占用。SQ 对每一维量化,SQ8 与 SQ6 分别用 8 位和 6 位,SQ4U 用 4 位无符号值并共享统一范围;PQ 将向量切分为子向量并以码本索引表示;PRQ 在 PQ 基础上分阶段编码残差,代价是额外训练、构建与距离计算开销。