MongoDB.local NYC 2025:MongoDB 8.2 与 AMP 平台定义 AI 时代的理想数据库
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并公布 Voyage AI 嵌入模型与 reranker 的进展,Search 和 Vector Search 已在 Community Edition 与 Enterprise Server 进入 public preview。
MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为史上功能最丰富、性能最强的版本。大会还推出 Voyage AI 嵌入模型与重排器,并宣布搜索与向量搜索在 Community Edition 和 Enterprise Server 上开放公开预览。
MongoDB 公布 2025 年度全球合作伙伴奖,Microsoft 获年度全球云合作伙伴,AWS 获年度全球 AI 云合作伙伴,Google Cloud 获年度全球云 GTM 合作伙伴,Accenture 同时拿下全球系统集成商和全球公共部门两个奖项。
MongoDB 公布 2025 年度全球合作伙伴奖,Microsoft 获年度全球云合作伙伴,AWS 获年度全球 AI 云合作伙伴,Google Cloud 获云市场拓展奖。阿里巴巴获云认证数据库即服务(DBaaS)合作伙伴奖,LangChain 获年度全球 AI 技术合作伙伴,Confluent 已与 MongoDB 有逾 550 个联合客户部署。
作者用 Semantic IDs 将商品编码进语言模型词表,在 Amazon Reviews 2023 视频游戏数据上训练出一个能在英文与 item ID 间"双语"对话的 LLM-推荐混合模型。数据经筛选后保留 66k 商品、737k 条行为记录,构建出 79k 条用户购买序列,平均长度 6.5 个商品。该模型推荐精度不及专门的多阶段推荐系统,但支持用自然语言操控推荐并对其选择给出推理与解释。
长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。
Eugene Yan 在旧金山 AI Engineer World's Fair 2025 主持了 RecSys track,并公开了开场 slides 与整场 YouTube 录像。该 track 聚焦如何用 LLM 技术改进推荐系统与搜索。
OpenAI 展示了 ChatGPT 连接 Google Drive 的能力,可调用企业内部知识、结合相关上下文回答问题。该功能让 ChatGPT 在企业内部资料上完成检索与问答。
有开发者公开致谢 turbopuffer 提供的真正无服务器向量搜索,并透露其团队已用 aurora limitless 处理元数据,目前承载超过 1M txn/s。两条信息均指向 AWS 生态下的无服务器基础设施组合。
LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。
Hamel Husain 基于为 30 多家公司提供咨询的经验,总结出快速改进 AI 产品的方法:核心不是选工具和框架,而是测量与迭代。
Elastic、Comcast 和 Adobe 的 IT 高管分享 AI 采用经验:先从高价值业务问题出发,而非为 AI 而 AI,并鼓励员工在创新中心实验。要用 RAG 接入自有高质量数据,持续量化 NPS、响应时间等指标,同时警惕多供应商点状方案带来的技术债与数据孤岛。
Eugene Yan 受 Andrej Karpathy 与 Patrick Collison 讨论启发,用 Claude 辅助开发了 AI 阅读应用 AI Reading Club,其核心是 AI 阅读伴侣 Dewey。
OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。
Jina AI 发布了一份 Meta-Prompt,让 LLM 理解其 Reader、Embeddings、Reranker 和 Classifier API,从而改进代码生成。
LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。
Elastic 正式发布 Support Assistant,面向所有拥有试用或正式订阅的客户及试用用户在 Support Hub 上线,提供覆盖全部 Elastic 产品的生成式 AI 聊天问答。该工具基于检索增强(RAG)架构,可访问 Elastic 博客、114 个主次版本的产品文档、技术支持文章与入门指南,无需依赖部署版本或订阅等级;Elastic 内部已有 200 多名员工每日使用。
Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。
Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。
Eugene Yan 在首届 AI Engineer Summit 上提出构建 LLM 系统与产品的四大模式:评估、检索增强生成(RAG)、Guardrails 与反馈收集。他认为评估是基础,可用于指导提示工程、检索增强和微调;针对特定任务手工构建约 40 条评测集即可起步,并需警惕 MMLU 等学术基准与自身任务不匹配。
作者继此前 LLM patterns 文章后,梳理使用 LLM 时可能遇到的各类问题及其对应的缓解模式。文中先区分外部与内部 LLM,并按数据在模式中的作用划分:evals 和微调依赖数据,缓存、防御式 UX、guardrails 偏基础设施与界面,RAG 和收集用户反馈居中。
Eugene Yan 总结出构建 LLM 系统与产品的七种关键模式:Evals 衡量性能、RAG 注入外部知识、微调提升特定任务表现、缓存降低延迟与成本、Guardrails 保障输出质量、防御式 UX 优雅处理错误、收集用户反馈形成数据飞轮。
Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。
Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。
作者用 gpt-3.5-turbo 和 gpt-4 配合 LangChain、Pinecone 与 Discord 搭建了一套个人助理,实现 /summarize、/sql-agent、/search、/board 等工具,用于摘要、查询与提供建议。
Lilian Weng 在 Lil'Log 发布 Prompt Engineering 综述,将提示工程定义为在不更新模型权重的前提下通过 In-Context Prompting 引导 LLM 行为,并指出其效果因模型差异很大、需要大量实验。
Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。
开放域问答(ODQA)要求模型在无相关上下文的情况下回答事实型问题,可分为开放书与闭卷两类。基于 DrQA 的 retriever-reader 框架先用 TF-IDF 等检索器从 Wikipedia 取回相关文档,再由 reader 抽取答案;Lewis 等人发现公开 QA 数据集训练集与测试集重叠严重,58-71% 的测试答案曾出现在训练集中。
Lilian Weng 在 Lil'Log 发布《Generalized Language Models》综述,按时间顺序梳理了从 CoVe、ELMo、CVT、ULMFiT 到 GPT、BERT、ALBERT、GPT-2、RoBERTa、T5、GPT-3、XLNet、BART、ELECTRA 等模型的上下文词表征与预训练方法。