Qdrant Cloud 上线 GPU 索引、Multi-AZ 与审计日志
Qdrant Cloud 新增 GPU 加速索引、Multi-AZ 部署和审计日志三项能力。GPU 索引基于 NVIDIA T4,HNSW 索引构建最高提速 4 倍,已在 AWS 集群开放。Multi-AZ 面向 Premium 层级,故障时集群仍可运行,对应 SLA 为 99.95%;审计日志覆盖查询、upsert、删除等 API 操作,所有付费集群可用。
Qdrant Cloud 新增 GPU 加速索引、Multi-AZ 部署和审计日志三项能力。GPU 索引基于 NVIDIA T4,HNSW 索引构建最高提速 4 倍,已在 AWS 集群开放。Multi-AZ 面向 Premium 层级,故障时集群仍可运行,对应 SLA 为 99.95%;审计日志覆盖查询、upsert、删除等 API 操作,所有付费集群可用。
Elastic 全球副总裁、原 Jina AI 创始人兼 CEO 肖涵在 Elastic 中国 AI 搜索技术大会上演讲,认为 2026 年做 AI 搜索基本就是在做智能体记忆,并指出记忆表征、选择性遗忘和跨模型迁移是当前未解决的问题。
Data Graphs 基于自研图数据库引擎,结合 Qdrant 向量检索构建混合 Graph RAG 平台,由 Agentic AI 根据查询动态选择图查询或向量检索路径。
Karpathy 把自己用 LLM 构建个人知识库的推文整理成一份 gist 形式的 idea file,读者可以交给自己的 agent,让它搭建专属 LLM wiki 并指导使用。
Andrej Karpathy 分享近期常用做法:把文章、论文、代码库、数据集、图片等源文档索引进 raw/ 目录,再用 LLM 增量编译成一个由 .md 文件组成的 wiki,包含摘要、反向链接,并按概念分类写文章、互相链接。
Lex Fridman 分享了自己的知识库方案:用 Obsidian、Cursor(处理 md)配合 vibe-coded 网页终端做前端,应对播客所需的大量研究兴趣。他常让系统生成带 js 的动态 html 以便排序筛选和交互式可视化,还会为特定主题生成临时聚焦的迷你知识库,载入 LLM 后在 7-10 英里长跑中用语音模式提问互动。
Andrej Karpathy 分享用 LLM 构建个人知识库的做法:把文章、论文、repo、数据集等源文档索引进 raw/ 目录,再由 LLM 增量“编译”成由 .md 文件组成的 wiki,包含摘要、反向链接和概念文章。
Qdrant 发布 Qdrant skills,把向量检索中的部署选型、搜索质量排查、内存优化、扩缩容等解决方案架构师经验编码成面向 AI 智能体的技能包,可与 Cursor。
Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。
Jina AI 将于 4 月 18 日在北京 Elastic AI Tech Day 做今年首次系统公开技术分享,Jina Embeddings 已迭代至 v5 并成为 Elasticsearch 语义检索的默认向量模型,Jina Reranker v3 获 AAAI-2026 FrontierIR Workshop Best Paper。
Andrej Karpathy 指出,他陆续使用过的所有 LLM 都表现出过度依赖上下文信息的倾向,因此这不是某个具体实现的问题,而是更深层的原因。他推测,训练时上下文窗口中大量信息与任务相关,使模型形成“优先使用给定内容”的偏好,进而在测试时对通过记忆功能 RAG 进来的内容过拟合。
Qdrant 上线免费进阶课程 Multi-Vector Search Course,由 Kacper Łukawski 设计,面向已掌握向量搜索基础的 ML、后端与搜索工程师。
OpenAI 的 GPT-5.4-Nano 和 GPT-5.4-Mini 已在 Poe 上线。GPT-5.4-Nano 适合摘要转录、工单标注、内容改写、快速 RAG 问答和运行 @openclaw 流程等对延迟与成本敏感的高频任务;GPT-5.4-Mini 更擅长把杂乱邮件或笔记转成规范 JSON、修复函数、处理异常支持工单,以及需要规划、检查结果并推进下一步的智能体任务。
基于对 Hacker News 和 Reddit 上 110+ 社区讨论的分析,多数应用会比预期更早触达 pgvector 的极限。维持 pgvector 舒适运行需同时满足六个条件:向量数据低于约 1M、不需要精确的元数据过滤、嵌入向量与关系数据紧耦合、不需要混合搜索、Postgres 已承担核心业务逻辑、团队小且 SQL 搜索逻辑可控。
Qdrant 宣布完成 5000 万美元 B 轮融资,由 AVP 领投,Bosch Ventures、Unusual Ventures、Spark Capital 和 42CAP 参投。
Google 发布 Gemini Embedding 2 公开预览版,这是 Gemini 家族首个全多模态嵌入模型,可将文本、图像、视频、音频与 PDF 映射到统一向量空间,Qdrant 在发布首日即提供支持。
Jina AI 发布两项研究:用约 80 万参数的小模型仅看向量即可识别生成模型,在 68 个模型与任务组合上准确率 87%;用掩码扩散模型直接从向量还原原始文本,Token 级还原准确率 81%,在 Qwen3-Embedding-0.6B 上达 81.3%、jina-embeddings-v3 上为 76.0%。
该系列第二部分展示了在 Modal 无服务器 GPU 上训练 SPLADE 稀疏嵌入模型的完整流程,训练数据为 Amazon ESCI 数据集,包含 120 万+查询-商品对及四级相关性标注。
微调稀疏嵌入在 Amazon ESCI 数据集上比 BM25 提升 28%,这是五部分系列的第一篇。SPLADE 通过 MLM 头加 log saturation 与 max pooling 生成约 30,522 维中仅 100-300 个非零值的稀疏向量,并自动扩展查询词、抑制噪声,而 BM25 只能匹配字面出现的词。
哥大休学创业者赵一霖、蒋若涵推出通用学习智能体 Hyperknow,2025 年 11 月发布,三个月后上线 Hyperknow 3.0,从去年 9 月至今已完成五个大版本迭代。
Jina AI 的 v5-text 改用 decoder-only 骨干网络与 last-token pooling,取代此前的 mean pooling。每一层 Transformer 注入四个轻量 LoRA adapter,分别独立处理检索、文本匹配、分类和聚类,用户在推理时按需选择;检索场景下 query 加 "Query:" 前缀、文档加 "Document:" 前缀。
教程演示如何用 voyage-4-nano 嵌入模型、Hugging Face 与 MongoDB Atlas Vector Search 搭建基于情绪的语义电影推荐引擎,实现「下班后想看点什么治愈的」这类按心情检索。系统通过理解语义而非关键词,将用户情绪与电影剧情描述匹配,绕开类型、演员等传统筛选的粗略标签。
Jina AI 推出 0.6B 参数的重排模型,在 MTEB 重排任务上进入前三,体积比生成式 listwise 重排器小 10 倍。相关工作获 AAAI Frontier IR 最佳论文,论文见 arxiv.org/abs/2509.25085。
MongoDB 在 MongoDB.local San Francisco 2026 上发布 Voyage 4 系列嵌入模型,全部正式可用,共享同一嵌入空间以兼容跨模型调用。
MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。
Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。
播客「牛油果烤面包」本期邀请 AI 专家 Mengdi 讲解 AI Agent 智能体,内容涵盖智能体的定义、基本架构、技术难点与解决方案,并讨论修改提示词是否比微调模型更有效、RAG(检索增强生成)、自演化 AI 以及普通人构建智能体的门槛。节目还谈及大模型领域近期研究方向和智能体在未来科学研究上的发展方向。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
Modal 与 Datalab 合作,让开发者可在 5 分钟内于 Modal 上部署 Datalab 的 Marker 文档解析流水线和 Surya OCR 工具包,模型权重缓存进 Modal Volume 以缩短冷启动。
MongoDB Atlas 与 Pureinsights Discovery Platform 的集成已正式 GA,提供关键词、向量与生成式 AI 驱动的搜索体验。该方案先用 Atlas Search 做关键词检索,再通过 Atlas Vector Search 与 Voyage AI 的嵌入和重排序理解查询意图,并可跨博客、论坛和技术文档合成带引用的生成式答案。
混合搜索将传统关键词搜索的精确性与向量搜索的上下文理解能力结合,成为满足当前用户期望的关键方案。随着 RAG 等生成式 AI 用例兴起,高质量检索需求推动向量搜索与词汇搜索走向融合,主要融合技术包括倒数排名融合(RRF)和相对分数融合(RSF),二者无需依赖可直接比较的分数尺度即可合并结果。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并推出 Voyage AI 的嵌入与重排序模型,同时为 Community Edition 和 Enterprise Server 带来搜索与向量搜索公开预览。
MongoDB 在 MongoDB.local NYC 2025 发布 MongoDB 8.2,称其为功能最丰富、性能最强的版本。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最高的版本;同时推出应用现代化平台 AMP,企业从旧系统迁移到 MongoDB 的速度提高两到三倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其是迄今功能最丰富、性能最强的版本。
MongoDB 在 MongoDB.local NYC 活动上发布 MongoDB 8.2,官方称这是其功能最丰富、性能最强的一个版本。同期公布的还有 Voyage AI 嵌入模型与重排器,以及 MongoDB Community Edition 和 Enterprise Server 上进入公开预览的 Search 与 Vector Search。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并公布 Voyage AI 嵌入模型与 reranker 的进展,Search 和 Vector Search 已在 Community Edition 与 Enterprise Server 进入 public preview。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为史上功能最丰富、性能最强的版本。大会还推出 Voyage AI 嵌入模型与重排器,并宣布搜索与向量搜索在 Community Edition 和 Enterprise Server 上开放公开预览。
MongoDB 公布 2025 年度全球合作伙伴奖,Microsoft 获年度全球云合作伙伴,AWS 获年度全球 AI 云合作伙伴,Google Cloud 获年度全球云 GTM 合作伙伴,Accenture 同时拿下全球系统集成商和全球公共部门两个奖项。