跳到正文

#RAG

今日 0 条
10月9日周五
  1. dbaplus社群AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    向量数据库凉了?Claude Code、Cursor 为何集体抛弃 RAG?

    文章指出,2025 年 5 月 Anthropic 把向量搜索从 Claude Code 中移除,改用 grep,作者 Boris Cherny 称结果全面胜出且优势很大;此后 Cursor、Windsurf、Cline、Devin、Sourcegraph Amp 相继转向工具驱动的 agentic 检索。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex:Markdown 成为人与智能体之间的通用信息表示,并推出非结构化文档转 Markdown 模型

    LlamaIndex 称 Markdown 已成为人与 AI 智能体之间的通用信息表示,它保留标题、列表等结构原语,让智能体能按语义读懂内容,并支持表格、图表,还可原生嵌入 HTML。由于多数非结构化数据尚不原生以 Markdown 存在,难点落在转换层,LlamaIndex 表示已打造最优模型,可将任意非结构化文档容器转为 Markdown,表格合并表头时改用 HTML。

10月5日周一
  1. Z PotentialsAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harvey 联创 Gabe Pereyra:应用公司如何借助开源与评测建立研究能力

    法律 AI 公司 Harvey 联合创始人兼总裁 Gabe Pereyra 在 Sequoia Capital 的“Own Your Intelligence”活动上,介绍了应用公司在资金、算力不及基础模型公司时建立研究能力的方法:先建评测标准与训练数据,再与外部研究团队合作完成后训练,最后搭建模型部署基础设施。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Reducto 的 Adit Abraham:文本摘要助检索,结构化表格助推理

    Reducto 的 Adit Abraham 指出,文本摘要有利于检索,结构化表格则有利于推理,因此智能体能否"找到"表格与能否"读"表格是两回事。该观点来自其在 World's Fair 2026 的演讲,AI Engineer NYC 将于 10 月 12 日至 14 日举行。

9月29日周二
  1. Jerry Liu(@jerryjliu0)AI 评估 · 61/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    PageIndex 提出无需向量库的 RAG 方案,称在 FinanceBench 达 98.7%

    研究团队提出名为 PageIndex 的 RAG 新方法,跳过向量数据库、数据嵌入、分块和相似度检索,改为构建树索引让 LLM 像人读书一样推理文档。引用称其在 FinanceBench 上取得 98.7%,超过榜单上所有向量 RAG,且免费开源。Jerry Liu 转发并感叹如果这套方法流行,自己四年前就做得太早了。

  2. Harrison Chase(@hwchase17)AI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Harrison Chase 转发实验:GPT Researcher 用 Jev 替换嵌入向量,相关上下文 73% 对 46%

    Harrison Chase 转发 Assaf Elovic 的实验:在 GPT Researcher 的 RAG 管线中用 Jev 替换嵌入向量,并在 SimpleQA 的 28 个研究任务上对比测试。

9月23日周三
  1. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Podcast 回应三大热门争议:AI 生成代码该不该审查、RAG 是否过时、Skills 是否让 MCP 淘汰

    GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。

9月21日周一
  1. 阿里研究院AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    安筱鹏:AI时代,数据如何构筑企业的护城河

    阿里云智能副总裁安筱鹏在中国国际大数据产业博览会上提出,AI时代企业护城河取决于数据从比特到Token的转化率,而非数据存量或模型强弱。他引用a16z报告称,今年2月AI智能体的Token消耗首次超过人类用户,到8月已达人类用户的5倍,前沿企业与一般企业的Token消耗差距从2.6倍扩大到8.3倍。企业需构建数据知识资产化、模型管理、智能体开发运营三大平台,以及智能体运营与模型训练两个飞轮。

9月15日周二
  1. 土猛的员外AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RAG问答和Agent的区别是什么?各自适合哪些应用场景

    RAG问答是"问什么答什么"的被动检索生成,平均消耗几千tokens、几秒到几十秒完成;Agent则是"给定目标自主完成",具备规划、记忆、工具调用与反思能力,简单任务消耗几万tokens、复杂任务可达千万级、耗时几分钟到几十分钟。企业获取知识应优先用RAG问答,写代码、改文档、订票等复杂任务再交给Agent,而非越高级越好。

9月9日周三
  1. Clip设计夹AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    设计岗面试变了:美团、阿里跳过设计稿,UI 设计师转型 AI 产品经理

    AI 时代下,美团、阿里等大厂已跳过原型图和设计稿,由产品经理用 AI coding 直接生成前端页面,纯执行型 UI 设计岗位持续收缩。文章认为 UI 设计师的需求分析、用户调研、原型设计与竞品拆解能力,正是 AI 产品经理岗位的核心要求,并推荐了一门主打 Agent、RAG、Function Calling 与 Vibe Coding 的「零基础入门AI产品岗」课程。

9月8日周二
  1. 土猛的员外AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    为什么 AI 落地实施越来越像一项咨询工作?

    AI 落地实施正越来越像咨询工作:项目起点从明确需求变成"建企业级 AI 平台、知识库、智能问答、智能体"这类大方向,前半程的重点转为与客户一起发现价值。作者认为可复制的是方法和经验而非项目答案,总体设计须先回答"为什么建、先建什么、怎样证明值得继续建"。企业级知识库的长期有效还需同时解决知识生命周期、知识质量与知识价值,软件则内化运营管理方法。

8月31日周一
  1. 土猛的员外AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    WorkBuddy、豆包工作、千问办公开战,企业 AI 的机会反而更清楚了

    腾讯升级 WorkBuddy 并推出企业版 AI 工作台,阿里把多条产品线整合为千问办公并接入钉钉,字节发布豆包工作并与飞书打通,AI 办公竞争进入由 Agent 接收目标、拆解任务、调用工具并交付结果的阶段。但员工个人提效不等于企业提效,组织、流程、知识与协同四类问题仍待解决,这类市场更重、更难标准化,也并非大厂优先级最高的生意。

8月26日周三
  1. LangChain BlogAI 评估 · 50/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 谈 Wiki Memory:用文件为 AI 智能体构建记忆层

    LangChain 提出 Wiki Memory 模式,即用智能体把日志、笔记、代码、文档等原始数据压缩成持久、结构化、可检查的文件知识层,供后续智能体直接读取。它与 RAG 的区别在于预计算并维护高阶综合结果,而非查询时检索原始分块。DeepWiki、Karpathy 的 LLM Wiki 与 Factory AutoWiki 是该模式的实例,适合持久领域知识而非短期对话状态。

  2. 前端充电宝AI 评估 · 3/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    曾经的王,Vue3倒下了。。。

    前端岗位需求因 AI 技术快速发展断崖式下跌,63% 的企业正转型做 AI 产品,"AI+前端"复合能力成为招聘刚需,要求掌握微调、Agent、RAG 三项技术。字节、腾讯资深项目负责人称正大量招聘有 AI 项目能力的前端,面试优先且涨薪 40-60%。陈旸推出「转型AI前端开发实战营」2 节直播课,0 元报名,限 100 人。

8月10日周一
  1. 土猛的员外AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    企业 AI 落地需要的不是知识库,而是一台"知识引擎"

    企业 AI 落地的竞争焦点正从模型能力转向企业上下文,真正需要的是能持续接入、加工、治理、调用知识的知识引擎,而非只存文件的传统知识库。文章给出八个自查问题,并拆解知识引擎的五项核心能力:知识接入、知识工程、知识治理、知识应用与反馈优化。文中指出,RAG 只是知识应用链路中的一个技术环节,Agent 时代对可信、可追溯、带权限的企业上下文需求更强。

8月4日周二
  1. QdrantAI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RAG 已死?长上下文窗口为何取代不了 RAG

    Qdrant 文章指出 RAG 并未因长上下文窗口而失效:文档小于 200,000 token 时可直接放进提示词,但 2026 年一项制造业安全培训案例中,长上下文问答准确率 73.1% 高于语义 RAG 的 65.4%,单次查询 token 成本却高 26 倍。

8月3日周一
  1. 土猛的员外AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    企业Agent好不好用,关键不是模型,而是上下文

    企业Agent的有效性被拆解为大模型能力、企业上下文、工具能力与治理评测四者相乘,其中企业上下文被视为最难被复制、也最可能拉开差距的差异。企业上下文分为规则、事实、经验、任务、组织与用户五类,需按任务动态装配最小充分上下文,而非把文件一股脑塞给模型。作者认为,企业Agent的竞争最终是知识管理、流程与组织治理能力的竞争。

4月22日周三
  1. Jina AIAI 评估 · 52/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jina AI 创始人肖涵:2026 年做搜索就是做 Agent Memory

    Elastic 全球副总裁、原 Jina AI 创始人兼 CEO 肖涵在 Elastic 中国 AI 搜索技术大会上演讲,认为 2026 年做 AI 搜索基本就是在做智能体记忆,并指出记忆表征、选择性遗忘和跨模型迁移是当前未解决的问题。

4月5日周日
  1. Andrej Karpathy(@karpathy)AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 分享用 LLM 构建个人知识库的 idea file

    Karpathy 把自己用 LLM 构建个人知识库的推文整理成一份 gist 形式的 idea file,读者可以交给自己的 agent,让它搭建专属 LLM wiki 并指导使用。

4月4日周六
  1. Taranjeet(@taranjeetio)AI 评估 · 54/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Karpathy 分享用 LLM 搭建个人知识库的流程

    Andrej Karpathy 分享近期常用做法:把文章、论文、代码库、数据集、图片等源文档索引进 raw/ 目录,再用 LLM 增量编译成一个由 .md 文件组成的 wiki,包含摘要、反向链接,并按概念分类写文章、互相链接。

3月26日周四
  1. Hamel HusainAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    数据科学家的复仇:Hamel Husain 谈 LLM 时代的五类评测陷阱

    Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。

  2. Andrej Karpathy(@karpathy)AI 评估 · 17/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Andrej Karpathy:所有 LLM 都会过度依赖上下文信息,或与训练方式有关

    Andrej Karpathy 指出,他陆续使用过的所有 LLM 都表现出过度依赖上下文信息的倾向,因此这不是某个具体实现的问题,而是更深层的原因。他推测,训练时上下文窗口中大量信息与任务相关,使模型形成“优先使用给定内容”的偏好,进而在测试时对通过记忆功能 RAG 进来的内容过拟合。

3月17日周二
  1. QdrantAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    从 pgvector 起步:为什么你会比预想更快地遇到瓶颈

    基于对 Hacker News 和 Reddit 上 110+ 社区讨论的分析,多数应用会比预期更早触达 pgvector 的极限。维持 pgvector 舒适运行需同时满足六个条件:向量数据低于约 1M、不需要精确的元数据过滤、嵌入向量与关系数据紧耦合、不需要混合搜索、Postgres 已承担核心业务逻辑、团队小且 SQL 搜索逻辑可控。

6月4日周三
  1. Eugene YanAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer 2025:用 LLM 技术改进推荐系统与搜索

    Eugene Yan 在旧金山 AI Engineer World's Fair 2025 主持了 RecSys track,并公开了开场 slides 与整场 YouTube 录像。该 track 聚焦如何用 LLM 技术改进推荐系统与搜索。

4月20日周日
  1. Eugene YanAI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM-as-Judge 救不了产品,修复流程才行

    LLM-as-Judge 等自动化评估工具无法拯救 AI 产品,真正的解法是把产品评估当成一套持续实践。它本质上是科学方法:观察数据、标注 50:50 的通过/失败样本、提出假设、设计实验并量化结果,即 eval-driven development。自动化评估虽能扩展监控,但仍需人工定期抽样标注,否则产品依然会失败。

12月17日周二
  1. OnBoard!AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    直播回放:什么是开发大模型应用的新一代底层技术栈?对谈贾扬清、PingCAP 黄东旭和 AWS Bedrock 核心成员

    OnBoard! 第 63 期回放一场直播,Lepton AI 创始人贾扬清、PingCAP 联合创始人兼 CTO 黄东旭与 AWS Bedrock 核心成员 Andy Peng 讨论 AI 应用开发的新一代技术栈。

9月13日周五
  1. OnBoard!AI 评估 · 19/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    全英文对话 CRV 投资人与 LanceDB 创始人:向量数据库下半场,大模型和多模态需要怎样的数据基建?

    LanceDB 联合创始人兼 CEO Chang She 与 CRV 投资人 Brian Zhan 在本期 OnBoard! 全英文访谈中探讨向量数据库的竞争格局演变,以及多模态数据增长给 data infra 带来的挑战与机遇。

10月15日周日
  1. Eugene YanAI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Engineer Summit 2023 回顾:LLM 部署的评估与成本难题

    Amplify Partners 对 AI Engineering 的调研显示,在已收到的 800 多份回复中,评估(evals)与服务成本是 LLM 部署的最大痛点,而目前仍没有好的评估方法,介于确定但脆弱的断言检查和昂贵的三方 LLM 打分之间。