跳到正文

#RAG

今日 6 条
9月18日周四
  1. MongoDB BlogAI 评估 · 23/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 8.2 与 AMP 平台定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为迄今功能最丰富、性能最强的版本。同时推出 MongoDB 应用现代化平台(AMP),可将企业从旧系统迁移到 MongoDB 的速度提升两到三倍,代码重写等任务提速数倍。

  2. MongoDB BlogAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 发布 8.2、Voyage AI 嵌入模型与 AMP 平台,定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,并公布 Voyage AI 嵌入模型与 reranker 的进展,Search 和 Vector Search 已在 Community Edition 与 Enterprise Server 进入 public preview。

  3. MongoDB BlogAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB.local NYC 2025:MongoDB 8.2 发布,定义 AI 时代的理想数据库

    MongoDB 在 MongoDB.local NYC 2025 上发布 MongoDB 8.2,称其为史上功能最丰富、性能最强的版本。大会还推出 Voyage AI 嵌入模型与重排器,并宣布搜索与向量搜索在 Community Edition 和 Enterprise Server 上开放公开预览。

  4. MongoDB BlogAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 公布 2025 全球合作伙伴奖,Microsoft、AWS、Google Cloud、LangChain 等获奖

    MongoDB 公布 2025 年度全球合作伙伴奖,Microsoft 获年度全球云合作伙伴,AWS 获年度全球 AI 云合作伙伴,Google Cloud 获年度全球云 GTM 合作伙伴,Accenture 同时拿下全球系统集成商和全球公共部门两个奖项。

  5. MongoDB BlogAI 评估 · 8/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    MongoDB 公布 2025 全球合作伙伴奖,Microsoft、AWS、Google Cloud、阿里巴巴等获奖

    MongoDB 公布 2025 年度全球合作伙伴奖,Microsoft 获年度全球云合作伙伴,AWS 获年度全球 AI 云合作伙伴,Google Cloud 获云市场拓展奖。阿里巴巴获云认证数据库即服务(DBaaS)合作伙伴奖,LangChain 获年度全球 AI 技术合作伙伴,Confluent 已与 MongoDB 有逾 550 个联合客户部署。

9月14日周日
  1. Eugene YanAI 评估 · 49/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Semantic IDs 训练 LLM-推荐混合模型,实现可操控推荐

    作者用 Semantic IDs 将商品编码进语言模型词表,在 Amazon Reviews 2023 视频游戏数据上训练出一个能在英文与 item ID 间"双语"对话的 LLM-推荐混合模型。数据经筛选后保留 66k 商品、737k 条行为记录,构建出 79k 条用户购买序列,平均长度 6.5 个商品。该模型推荐精度不及专门的多阶段推荐系统,但支持用自然语言操控推荐并对其选择给出推理与解释。

6月22日周日
  1. Eugene YanAI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何评估长上下文问答系统

    长上下文问答评估面临信息过载、位置偏差、"lost in the middle"、多跳推理与幻觉放大等挑战,评估需兼顾忠实性(答案仅依据原文、避免幻觉、正确说"不知道")与有用性(相关、全面且简洁)。忠实性对法律合同、医疗保险表单等场景尤为关键,QASPER 等基准还评估引用准确性;Xu et al.(2023)发现领域专家更偏好既忠实又全面的长回答,而众包工作者更看重简洁。

6月4日周三
  1. Eugene YanAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer 2025:用 LLM 技术改进推荐系统与搜索

    Eugene Yan 在旧金山 AI Engineer World's Fair 2025 主持了 RecSys track,并公开了开场 slides 与整场 YouTube 录像。该 track 聚焦如何用 LLM 技术改进推荐系统与搜索。

5月8日周四
  1. OpenAI NewsAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 让 ChatGPT 接入 Google Drive 内部知识

    OpenAI 展示了 ChatGPT 连接 Google Drive 的能力,可调用企业内部知识、结合相关上下文回答问题。该功能让 ChatGPT 在企业内部资料上完成检索与问答。

5月1日周四
  1. Sualeh Asif(@sualehasif996)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    turbopuffer 无服务器向量搜索与 aurora limitless 处理超 1M txn/s

    有开发者公开致谢 turbopuffer 提供的真正无服务器向量搜索,并透露其团队已用 aurora limitless 处理元数据,目前承载超过 1M txn/s。两条信息均指向 AWS 生态下的无服务器基础设施组合。

4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

3月24日周一
  1. Hamel HusainAI 评估 · 64/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    快速改进 AI 产品的实战指南

    Hamel Husain 基于为 30 多家公司提供咨询的经验,总结出快速改进 AI 产品的方法:核心不是选工具和框架,而是测量与迭代。

2月18日周二
  1. Elastic BlogAI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    IT 领导者 AI 采用之旅的 7 条经验

    Elastic、Comcast 和 Adobe 的 IT 高管分享 AI 采用经验:先从高价值业务问题出发,而非为 AI 而 AI,并鼓励员工在创新中心实验。要用 RAG 接入自有高质量数据,持续量化 NPS、响应时间等指标,同时警惕多供应商点状方案带来的技术债与数据孤岛。

1月12日周日
  1. Eugene YanAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Reading Club:Dewey 伴读功能与幕后设计

    Eugene Yan 受 Andrej Karpathy 与 Patrick Collison 讨论启发,用 Claude 辅助开发了 AI 阅读应用 AI Reading Club,其核心是 AI 阅读伴侣 Dewey。

12月17日周二
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直播回放:什么是开发大模型应用的新一代底层技术栈?对谈贾扬清、PingCAP 黄东旭和 AWS Bedrock 核心成员

    OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。

10月30日周三
  1. Jina AI(@JinaAI_)AI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 发布 Reader 等 API 的 Meta-Prompt

    Jina AI 发布了一份 Meta-Prompt,让 LLM 理解其 Reader、Embeddings、Reranker 和 Classifier API,从而改进代码生成。

9月13日周五
  1. OnBoard!AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全英文对话 CRV 投资人与 LanceDB 创始人:向量数据库下半场,大模型和多模态需要怎样的数据基建?

    LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。

9月4日周三
  1. Elastic BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 推出生成式 AI 客服工具 Support Assistant

    Elastic 正式发布 Support Assistant,面向所有拥有试用或正式订阅的客户及试用用户在 Support Hub 上线,提供覆盖全部 Elastic 产品的生成式 AI 聊天问答。该工具基于检索增强(RAG)架构,可访问 Elastic 博客、114 个主次版本的产品文档、技术支持文章与入门指南,无需依赖部署版本或订阅等级;Elastic 内部已有 200 多名员工每日使用。

7月29日周一
  1. Hamel HusainAI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hamel Husain 等人发布开源 LLM 课程 Mastering LLMs

    Hamel Husain 等人发布 Mastering LLMs,把此前付费课程的讲座整理成免费开放的课程,内容覆盖评测、RAG、微调、应用构建和提示工程,由 25 位以上从业者讲授,含 40 多小时内容,并按主题、章节摘要和讲义资源做了组织。课程面向有一定 LLM 经验、想改进 AI 产品的工程师和数据科学家,官方建议把所学应用到个人项目中巩固理解。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。

10月9日周一
  1. Eugene YanAI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Eugene Yan 谈 LLM 系统构建模块:评估、RAG、Guardrails 与反馈收集

    Eugene Yan 在首届 AI Engineer Summit 上提出构建 LLM 系统与产品的四大模式:评估、检索增强生成(RAG)、Guardrails 与反馈收集。他认为评估是基础,可用于指导提示工程、检索增强和微调;针对特定任务手工构建约 40 条评测集即可起步,并需警惕 MMLU 等学术基准与自身任务不匹配。

8月13日周日
  1. Eugene YanAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何为不同 LLM 问题匹配相应模式

    作者继此前 LLM patterns 文章后,梳理使用 LLM 时可能遇到的各类问题及其对应的缓解模式。文中先区分外部与内部 LLM,并按数据在模式中的作用划分:evals 和微调依赖数据,缓存、防御式 UX、guardrails 偏基础设施与界面,RAG 和收集用户反馈居中。

7月30日周日
  1. Eugene YanAI 评估 · 71/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    构建 LLM 系统与产品的七种关键模式

    Eugene Yan 总结出构建 LLM 系统与产品的七种关键模式:Evals 衡量性能、RAG 注入外部知识、微调提升特定任务表现、缓存降低延迟与成本、Guardrails 保障输出质量、防御式 UX 优雅处理错误、收集用户反馈形成数据飞轮。

6月23日周五
  1. Lilian Weng — Lil’LogAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 驱动的自主智能体:规划、记忆与工具调用

    Lilian Weng 在这篇 Lil'Log 长文中梳理了 LLM 驱动的自主智能体系统的三大组件:规划、记忆与工具调用。

6月11日周日
  1. Eugene YanAI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Obsidian-Copilot:一款辅助写作与反思的助手

    Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。

4月9日周日
  1. Eugene YanAI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 LLM 做研究、反思与规划:LangChain + GPT 实践

    作者用 gpt-3.5-turbo 和 gpt-4 配合 LangChain、Pinecone 与 Discord 搭建了一套个人助理,实现 /summarize、/sql-agent、/search、/board 等工具,用于摘要、查询与提供建议。

3月15日周三
  1. Lilian Weng — Lil’LogAI 评估 · 63/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 长文梳理 Prompt Engineering:从少样本提示到 CoT 与工具调用

    Lilian Weng 在 Lil'Log 发布 Prompt Engineering 综述,将提示工程定义为在不更新模型权重的前提下通过 In-Context Prompting 引导 LLM 行为,并指出其效果因模型差异很大、需要大量实验。

6月10日周五
  1. Lilian Weng — Lil’LogAI 评估 · 51/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    广义视觉语言模型:四类视觉与语言融合方法综述

    Lilian Weng 在 Lil'Log 综述将视觉语言模型(VLM)归为四类:把图像转为可与 token 嵌入联合训练的嵌入向量、学习可作为冻结预训练语言模型前缀的图像嵌入、用专门设计的 cross-attention 机制把视觉信息融入语言模型各层,以及不做任何训练直接组合视觉与语言模型。

10月29日周四
  1. Lilian Weng — Lil’LogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    如何构建开放域问答系统?解析 Retriever-Reader 等三大框架

    开放域问答(ODQA)要求模型在无相关上下文的情况下回答事实型问题,可分为开放书与闭卷两类。基于 DrQA 的 retriever-reader 框架先用 TF-IDF 等检索器从 Wikipedia 取回相关文档,再由 reader 抽取答案;Lewis 等人发现公开 QA 数据集训练集与测试集重叠严重,58-71% 的测试答案曾出现在训练集中。

1月31日周四
  1. Lilian Weng — Lil’LogAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lilian Weng 综述广义语言模型:从 CoVe、ELMo 到 GPT-3 与 ELECTRA

    Lilian Weng 在 Lil'Log 发布《Generalized Language Models》综述,按时间顺序梳理了从 CoVe、ELMo、CVT、ULMFiT 到 GPT、BERT、ALBERT、GPT-2、RoBERTa、T5、GPT-3、XLNet、BART、ELECTRA 等模型的上下文词表征与预训练方法。