在 Qdrant 上构建电商搜索的经验教训
Qdrant 用 580 万条真实 Amazon 服饰商品搭建了 Qdrant Shopping 演示店铺,每次文本搜索都是对 Query API 的单次请求,约 40 毫秒返回排序货架,代码已开源于 GitHub。
Qdrant 用 580 万条真实 Amazon 服饰商品搭建了 Qdrant Shopping 演示店铺,每次文本搜索都是对 Query API 的单次请求,约 40 毫秒返回排序货架,代码已开源于 GitHub。
Weaviate 指出,更大的上下文窗口无法修复有问题的智能体 RAG 流程,长上下文会引入矛盾信息、淹没相关工具并导致后续输入被忽略。其视频将智能体 RAG 流程拆解为查询增强、检索、记忆、工具、智能体五个系统,强调生产级智能体 RAG 本质是上下文工程问题。
Firecrawl 上线了一个新的自研模型,用于从每条抓取结果中提取最相关的上下文。该模型会针对用户查询为每个段落、列表和表格打分,让智能体直接拿到关键摘录,无需消耗 token 处理充满噪声的页面。
Weaviate 的 Engram 通过后台异步 pipeline 为多智能体系统提供持续学习记忆,无需阻塞、不产生重复。向 Engram 添加数据后,pipeline 会按配置的 topics 提取记忆、检索并调和已有记忆(去重、处理偏好变化、更新事实),再提交结构化记忆到 Weaviate。
Qdrant 发布增量嵌入更新教程,提供一套从第一天就能部署的流水线,检测文本数据变更并只重新嵌入改动的分块:未变的分块保持不动、文本移动时复用向量、新增与删除同步处理。
NotebookLM 上线 Collections,以全新标签页形式整理笔记本,类似相册或播放列表,不设固定文件夹结构。笔记本可加入任意多个 Collection,也可跳过并继续使用"My Notebooks"标签页。该功能即日起向所有用户推送。
托管版 Weaviate 现已在 DigitalOcean 上开启公开预览,由 DigitalOcean 负责基础设施:资源开通与安全、每日自动备份、补丁与版本升级、高可用与存储自动扩缩容、时间点集群分叉,以及控制面板中的性能洞察与日志。
Character.AI 的 Lorebooks 功能上线,附带 Lore 的角色现已出现在 Discover 和 Search 信息流中,可通过 +Lore 标签识别。已发布的 Lorebooks 可在角色主页和创作者资料页找到,点击即可探索其世界观。
Weaviate 发布 Engram 演示,用异步流水线主动维护记忆,替代把整段对话塞进上下文或存储每条消息两种做法。Engram 从对话中提取匹配配置主题的信息,与已有记忆调和去重、更新偏好与事实,再将结构化的分域记忆存入 Weaviate 供语义检索,使智能体随交互持续改进而不被上下文污染。
TorchV 的 AIS 知识引擎把企业文档解析拆成解析引擎、解析实例、解析策略三层,策略按文件类型路由,PDF 可走 MinerU 并开启公式、表格、图片理解,Word 走 TorchV 默认解析,Excel 走 TextIn,音频走 Qwen ASR。
Weaviate Playground 新增电商演示 WeCommerce,可将关键词、心情或氛围查询自动路由至 BM25、语义向量搜索或混合检索,并支持按类别、品牌、价格实时分面过滤。商品页通过近邻对象向量搜索展示相似商品,同一集合同时驱动发现与推荐,无需额外基础设施。该演示可在 Weaviate Cloud 免费层部署。
Weaviate 在 Playground 上线关键词、向量与混合三种搜索的并排对比演示,支持在 landmarks、movies、science、games、Pokemon 等真实数据集上测试查询。BM25 按 TF-IDF 式评分匹配精确词句,向量搜索用稠密嵌入捕捉语义,混合搜索并行运行两者并用 reciprocal rank fusion 合并结果。演示也支持粘贴自己的数据。
Weaviate Playground 上线一个新闻主题演示,每 2 小时抓取 general、world、business、technology、sports、health 六个类目的新闻头条,将其转为 1,536 维向量存入 Weaviate,再用 Leiden 算法聚类并由 LLM 为每个聚类生成标签,读者可在语义、关键词与混合搜索间切换。该演示附带 copy prompt,支持自行搭建。
Weaviate 在 Weaviate Playground 上线欺诈检测演示,由 Weaviate Query Agent 驱动,可将自然语言问题自动转成带过滤和聚合的结构化数据库查询,并同时检索 Transactions、Customers、PhoneProducts 三个关联集合,实时返回结果。
Qdrant 提出分支感知的语义代码搜索方法,用向量索引按语义检索代码,并让每次查询只作用于某一分支的实时视图:包含该分支自身的提交及其从祖先继承的内容,排除后续提交已替换的版本。
Weaviate 在 Playground 上线交互式演示,让用户在同一批数据上对比 BM25 关键词搜索、向量语义搜索和混合搜索的返回结果差异。其中混合搜索并行运行关键词与向量两种方式,再用倒数排名融合或加权组合合并结果列表。演示提供地标、电影、科学、游戏、宝可梦等数据集,也可用自己的数据尝试。
Weaviate 在 Playground 中搭建了电商搜索演示 WeCommerce,把关键词、语义与混合检索整合进同一套产品发现流程。用户输入关键词、情绪或氛围后,查询会分别走 BM25 关键词检索、向量语义检索和混合检索,并支持按品类、品牌、价格的实时分面筛选;商品页还用近邻向量检索自动推荐相似商品。
Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。
Weaviate 1.38 发布,磁盘向量索引 HFresh 与 MCP Server 两大能力正式 GA,前者面向十亿级频繁变动数据,低内存、延迟可预测且无需周期性全量重建,后者可让 LLM、IDE 和 AI 智能体直连 Weaviate;1.38 还支持运行时开关 MCP Server 及写权限,无需重启。
Weaviate 的 Engram 在新信息到达时不只做存储,而是主动协调记忆:用户从机器学习工程师晋升为 CEO 后,它提取新事实、从 Weaviate 检索相关记忆,并通过 LLM 工具调用改写旧记忆为"曾任职工程师、现已晋升 CEO",同时删除重复的新记忆,避免矛盾事实堆积污染智能体上下文。
Qdrant 于 6 月 11 日在旧金山 The Midway 举办首届美国 Vector Space Day,350 余名开发者参会,设 Agent 与记忆、搜索与检索、边缘与机器人三个分轨。
Qdrant 提出用廉价信号在检索路径上提前识别弱检索,避免为每个查询都调用 LLM 判断。这些信号读取检索器已返回的结果,至多增加一次复用查询向量的 Qdrant 查询,包括 max_score、dense_variance、evidence_coverage、retriever_divergence 和 dense_agreement 等。
MongoDB 提出一套从 POC 走向生产的 Agentic AI 四步信任框架,涵盖基础层、验证层、治理层等环节。框架以客户退款为例,用 RAG 和运行数据减少模型幻觉,并将可观测性作为"黑匣子记录仪"记录每一步推理、工具调用与 token 开销。验证层引入 Agent 置信度分数(ACS)与业务风险分数(BRS),治理层则用 ADS = ACS x (1 - BRS) 决定智能体的自主程度。
Weaviate 在 Playground 上线欺诈检测演示,用户用自然语言提问,Weaviate Query Agent 自动生成带过滤和聚合的结构化查询,跨 Transactions、Customers、PhoneProducts 三个集合检索,并实时流式返回结果。演示可即时识别可疑支付方式、不匹配地址与品牌级欺诈率,还展示智能体构建的完整查询语句,全程无需 SQL 或查询构建器。
Mistral OCR 4 为每个版面区块给出边界框定位,并分类为标题、表格、公式、签名等类型,同时逐区域输出置信度分数。这一结构是溯源引用、内容脱敏、RAG 分块和人工审核的基础。
Weaviate 针对向量数据库试点常在数据导入阶段就失败的问题,给出几条最佳实践:服务端 collection.batch.stream 自动设定导入速率,无需调 batch size;用确定性 UUID 实现幂等重试,避免重复写入和重复计费;blobHash 只保留对象嵌入向量、丢弃已另存的大对象,可从 10 TB 降到几 GB 且搜索质量不变。
Weaviate 在 Playground 上线了报纸主题演示 Weaviate Chronicles,把每 2 小时涌入的新闻标题自动聚类成同一事件。该演示先将报道嵌入为向量,再结合混合语义搜索、字符 n-gram 相似度和 Leiden 社区检测(一种图算法)完成聚类,并附带可复制提示词让用户搭建自己的版本。Weaviate Cloud 同时推出免费永久套餐。
Martin Fowler 与 Bayer 合作,用 AI 让制药研究员查询埋藏在 PDF 报告里数十年的信息。Sarang Sanjay Kulkarni 描述了从关键词搜索演进为可起草监管报告的研究助手的过程。
Qdrant 发布 Qdrant Edge,把其 Rust 向量检索引擎做成嵌入式的进程内库,在本地磁盘打开 shard 即可写入和查询嵌入向量,全程离线,安装体积约 11 MB,目前处于 beta 阶段,可通过 pip install qdrant-edge-py 或 cargo add qdrant-edge 安装。
Weaviate 推出全新 playground,内含 7 个可运行示例项目,覆盖搜索、RAG、智能体、记忆等场景,每个 demo 都附带可复制粘贴的提示词。
Weaviate 推出 Engram,将 AI 记忆按 groups、topics、scopes 三层结构组织,而非堆进一个共享记忆池。groups 用 topics 加处理管线划定用例边界,topics 决定哪些信息会被提取为记忆,scopes 区分项目级、用户级与属性级归属;异步管线负责提取、调和并提交记忆,配合 Weaviate 多租户保持边界隔离。
Weaviate 推出托管记忆服务 Engram,不再把记忆当作不断增长的提示词,而是作为基础设施处理。Engram 接收对话、字符串或预抽取事实等原始输入,通过异步流水线抽取信号、与已有记忆比对转换,并把干净状态写入数据库,供 Agent 后续可靠检索。该服务面向用户偏好记忆、跨任务学习、过期事实更新以及按用户、团队、工作流限定记忆范围等场景。
MongoDB 提出用 MongoDB Atlas、Voyage AI 与多模态搜索构建智能体供应商管理方案,把分散在遗留系统、PDF、表格和邮件里的供应商数据统一起来,并叠加 AI copilot 提升供应链可见性与韧性。方案针对的是 ERP 系统批处理延迟造成的实时响应瓶颈,原文未给出具体模型版本、参数或 benchmark 数据。
Weaviate 宣布其智能体记忆服务 Engram 正式 GA,该服务构建在 Weaviate 之上,通过异步流水线从原始数据提取信息、与已有记忆做去重和偏好变更的对账,再以结构化状态持久化供检索。
Sunny Health 基于 Qdrant 构建 AI 医疗礼宾服务,通过支付方或护理机构的 SSO 登录,为会员完成福利导航、网络内医生匹配和预约挂号三项任务。其检索层需在 300 万到 400 万条医生数据上同时执行硬性过滤(网络内、执照、语言)与语义相似度排序,因此从 Postgres 迁移到 Qdrant 向量搜索,并采用 Rust 客户端和 MCP 工具辅助开发。
GoPerfect 基于 Qdrant Cloud 搭建智能体招聘平台,用混合搜索、多向量表示加 LLM 编排,在内部基准中把候选人接受率从行业约 30% 提升到 99.993%,大客户实测稳定在 95–100%,约为行业基线的四倍。单个候选人不再用单一嵌入向量表示,而是拆成结构化向量集合,查询时由智能体拆分意图并并行发起多路子查询,复杂多条件搜索可在 10 秒内端到端完成。
Qdrant 1.18 上线了来自 Google Research 的旋转向量量化方法 TurboQuant,提供 8x(4 位/维)、16x(2 位/维)、约 21x(1.5 位/维)和 32x(1 位/维)四种压缩档位。
Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。
Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。
Ali Aoun Mehdi 在 Gen AI Zürich 黑客松上开发出 Sentinel,一个监测 20 个全球新闻源的 AI 预警系统,每 30 分钟抓取一次数据,可在 30 秒内识别事实矛盾并给出虚假信息风险评分。它用 Qdrant Cloud 做语义检索、Mistral-7B(经 Featherless AI)提取事实并计算矛盾分,已获 Qdrant Challenge 冠军。