跳到正文

#RAG

今日 6 条
9月24日周四
  1. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 3.0 Function Chain 重排演示:向量检索内融合 XGBoost 业务打分

    Milvus 3.0 Function Chain 重排演示展示了如何在一条检索链路内完成商品重排:BGE-M3 将查询转为嵌入向量,Milvus 执行 COSINE 向量检索召回 top 20 商品,服务端 Function Chain 计算热度、价格亲和度、新鲜度与归一化语义分,再由 XGBoost 模型融合成新的业务分数并返回重排结果。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 11/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bridgewater Associates 产品工程负责人 Aaron Linsky 将在 AI Engineer New York 分享生产级 AI 分析师的检索层权限实践

    Bridgewater Associates 产品工程负责人 Aaron Linsky 将在 AI Engineer New York 带来演讲《Can Your AI Analyst Keep a Secret?》,深入生产级 AI 分析师的检索层,讲解 Bridgewater 与 turbopuffer 如何在数百万份机密文档上实施动态的行级权限控制。大会时间为 10 月 12–14 日。

  3. Weaviate • vector database(@weaviate_io)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 1.39 正式支持 MMR 多样性检索,覆盖全部 near_* 与混合搜索

    Weaviate 1.39 正式上线 MMR 多样性选择,覆盖全部 near_* 搜索与混合搜索,无需改动 schema 或重建索引,完全在查询时运行。该机制逐个贪心挑选结果,在查询相似度与已选结果相似度之间权衡:balance=1.0 时排序仍以纯相关性为主,balance=0.5 时首页可分散到富士山、列车、猴子、拉面和鸟居等不同内容。

  4. 京东技术AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    拆解京东海博 AI-Native 落地保障:海博团队 AI 知识库能力建设

    京东海博团队把大模型“读不懂业务全貌”重新定义为“经营好上下文”,采用 OKF 规范将知识编译从运行时前移到维护期,构建项目知识×领域知识矩阵、角色化知识层与 Skill 能力层三层结构,并用 AB 实验验证带知识库“更快更全”。以 40w 行代码的 yzt-erp-wms 仓库为例,共沉淀约 1051 篇知识文档,其中 flows/ 接口与流程 1001 篇、chains/ 业务链路 41 篇。

  5. Qdrant(@qdrant_engine)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Kaivid Labs 将 40 万+文档向量从 Milvus 迁移至 Qdrant

    Kaivid Labs 团队将 40 万+文档向量从 Milvus 迁移到 Qdrant,并记录了整个过程。他们说明了迁移的处理方式、验证数据完整性,并对比了两套系统在延迟、吞吐量和内存占用上的表现。完整记录已发布在 kaivid.com 博客。

  6. Jerry Liu(@jerryjliu0)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 推出 LlamaExtract Agentic Plus 文档提取引擎

    LlamaIndex 发布 LlamaExtract Agentic Plus,号称全球最强的复杂文档提取引擎,支持长表格、大型表单、校准置信度评分与有据可依的提取。该功能已在 LlamaParse 上线,用户可通过 cloud.llamaindex.ai 注册使用。

  7. Elastic BlogAI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic 如何用原子化断言核查对抗 LLM 幻觉

    Elastic 工程师 Toby Sutor 分享了用原子化断言核查(atomic claim checking)把 LLM 合并知识库文章变得可控的做法:合并与验证分成两遍,第二遍把每篇源文章拆成最小的可核查断言,逐条比对合并结果并标记为 present、partial 或 missing,同时记录两篇文章的冲突。

  8. NotebookLM(@NotebookLM)AI 评估 · 42/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NotebookLM 接入 Google Docs:可上传笔记本作为上下文来源

    NotebookLM 现可通过 Workspace Intelligence 将笔记本上传至 Google Docs,作为写作的上下文来源。用户可将 NotebookLM 的深度研究与其他来源(邮件、聊天、文件)结合,直接在文档草稿中个性化写作流程。

9月23日周三
  1. Weaviate • vector database(@weaviate_io)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 发布 Engram 记忆指南:四个决策决定 AI 智能体记得对不对

    Weaviate 发布新指南,梳理配置 Engram 记忆时的四个关键决策:记住哪些内容、记忆如何划分作用域与更新、用哪种检索模式读回、以及放在提示词的哪个位置。指南用真实输出和测试运行展示调整每项决策后的变化,包括过滤掉过程噪声、避免动态记忆破坏 prompt caching。全文见 weaviate.io/blog/engram-me。

  2. 得物技术AI 评估 · 32/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    得物交易搜索如何用生成式召回实现范式跃迁

    得物交易搜索团队过去一年将召回从判别式检索改为生成式建模,让模型主动生成候选商品而非从商品池中找最相似的。方案覆盖基于LLM的文本索引语义增强、基于MLMM的多模态向量表征、基于HLLM的深度语义表征、基于HSTU的生成式行为序列建模及基于语义ID的统一生成式召回,并推进召粗一体架构。

  3. 字节跳动技术团队AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenViking × LLM-Wiki:让团队文档不再"各说各话"

    OpenViking 上线 Compile 功能,可基于自定义或预置的 LLM-Wiki skill,把本地文件、GitHub 仓库、飞书文档等导入的原始资料编译成相互链接、带出处的团队 Wiki。

  4. GitHub(@github)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    GitHub Podcast 回应三大热门争议:AI 生成代码该不该审查、RAG 是否过时、Skills 是否让 MCP 淘汰

    GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。

  5. Jerry Liu(@jerryjliu0)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 发布开源文档分类与切分库 DocJev

    Jerry Liu 发布开源库 DocJev,用于按自然语言类别规则对文档进行分类或切分子文档边界,默认完全免费且开源。作者称其比 gpt-5.6-luna 快 6 倍且准确率相当,并提供 liteparse 与 LlamaParse 两种 OCR 后端,其中 liteparse 免费开源、速度最快,LlamaParse 面向复杂文档。

  6. Milvus(@milvusio)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 团队将 Jev 集成进 DeepSearcher、MemSearch 与 Vector Graph RAG 三个开源项目

    Milvus 团队把 Jev 集成进 DeepSearcher、MemSearch 和 Vector Graph RAG 三个开源项目做验证。在 DeepSearcher 的 100 道多跳问题上,Jev 以 93.25% Recall@5 追平 DeepSeek V4 Flash,中位决策延迟从 2.23s 降至 0.55s,API 成本约为其七分之一。

9月22日周二
  1. Qdrant(@qdrant_engine)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 分享 SPLADE 与神经搜索,无需查询时推理

    Qdrant 的 KShivendu 在 Retrieval Augmented Gathering 活动上分享如何用 SPLADE 做神经搜索,且无需查询时推理,活动时间为美东时间当天下午 1 点。Doug Turnbull 推荐对 SPLADE 和神经搜索感兴趣的人关注。

  2. Jerry Liu(@jerryjliu0)AI 评估 · 47/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jerry Liu 推出 DocJev:比 gpt-5.6-luna 快 6 倍的文档分类与切分开源库

    Jerry Liu 发布开源库 DocJev,用于文档分类与切分,速度比 gpt-5.6-luna 快 6 倍且精度相当。用户只需给出文档和自然语言类别规则,Jev 即可预测文档类别或子文档边界,并支持 liteparse 与 LlamaParse 两种 OCR 后端。

9月21日周一
  1. Milvus(@milvusio)AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Jev 能否替代 RAG 中的 reranker?在 Milvus 短名单上实测三种方案

    在 Milvus 短名单上对 80 条 SciFact 查询实测三种方案:qwen3.7-text-rerank 将 nDCG@10 提升 0.0446,Jev 提升 0.0778,排名最优。但 Jev 的 P50 重排延迟是 qwen 的 10.2 倍,单次运行成本约为 6.7 倍。以 0.5 为阈值直接按概率过滤时,top-5 精确率 49.4%,但有 18.8% 的金标准相关文档被滤除。

  2. Qdrant(@qdrant_engine)AI 评估 · 44/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实验:向量检索候选深度如何影响重排序效果

    Qdrant 在五个公开数据集上实验了向量检索的候选深度:若最终只要 5 条结果,先召回 100 个候选能给重排序或融合阶段更多素材。把 limit 从 10 提到 500,最优可能的 nDCG@10 最多提升 0.28,但实际得分变化不超过 0.01——有时文档已被召回,只是排名不够高。

  3. 阿里研究院AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    安筱鹏:AI时代,数据如何构筑企业的护城河

    阿里云智能副总裁安筱鹏在中国国际大数据产业博览会上提出,AI时代企业护城河取决于数据从比特到Token的转化率,而非数据存量或模型强弱。他引用a16z报告称,今年2月AI智能体的Token消耗首次超过人类用户,到8月已达人类用户的5倍,前沿企业与一般企业的Token消耗差距从2.6倍扩大到8.3倍。企业需构建数据知识资产化、模型管理、智能体开发运营三大平台,以及智能体运营与模型训练两个飞轮。

  4. QdrantAI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Lucy 如何用 Qdrant 为 280 万份 SEC 与 DART 文件构建可信检索层

    Lucy 基于 Qdrant 为超 280 万份 SEC 与 DART 监管文件构建检索层,混合检索加 RRF 后 FinanceBench Recall@5 达 93.4%、Recall@10 达 94.7%。

9月19日周六
  1. AI产品黄叔(@PMbackttfuture)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Google Notebook 从上传资料提取信息为何强过 Codex 提问

    有用户对比发现,Google Notebook 从上传资料中提取信息的能力依然很强,明显优于直接在 Codex 里提问。该用户查到的解释以配图形式给出,并向网友求证这一说法是否成立。

  2. Dify(@dify_ai)AI 评估 · 15/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Dify New Agent 如何为电商家居店打造售前体验

    Dify 用 New Agent 在一家真实家居电商店铺上落地售前场景,从商品发现这一个任务起步,再通过对话持续迭代同一个 Agent。随着业务需求增长,该 Agent 扩展为能力更强的售前体验。完整过程已发布在 Dify 官方博客。

9月18日周五
  1. LlamaIndex 🦙(@llama_index)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaParse 系列首篇:解析错误如何影响关键文档数据

    LlamaIndex 推出 Parsed by LlamaParse 系列,首篇以美国能源信息署 2026 年 9 月短期能源展望报告为例,说明解析错误如何影响关键文档。

  2. Hamel HusainAI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AI Evals 常见问题大全:从错误分析到评估器验证

    Hamel Husain 整理了他与 Shreya 在向 5000+ 名工程师和 PM 讲授 AI Evals 时收到的最常见问题,组成一份按主题分类的 FAQ。

  3. QdrantAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Himalayas 如何用 Qdrant 为 10 万+远程职位构建语义职位匹配

    Himalayas 已用 Qdrant Cloud 支撑其远程职位平台的语义职位匹配,覆盖 10 万+在招职位与 30 万+公开人才档案,当前每天处理数十万次请求、每月超 2500 万次,约 300 万个 point,Qdrant 内耗时中位数约 30 ms、p95 约 200 ms。

  4. OpenAI(@OpenAI)AI 评估 · 57/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    OpenAI 推出 Astra for Law,结合 GPT-6 Astra 与法律检索索引

    OpenAI 发布 Astra for Law,将 GPT-6 Astra 与法律分析与写作指令、适合深入工作的设置以及新的 Legal Search Index 搭配使用。该索引检索美国判例法、成文法、法规、法院规则和行政决定,覆盖超过 2.3 亿个 URL,来源每日新增,帮助律师从案件事实找到可自行查看的相关法律依据与支撑段落。

  5. LangChain BlogAI 评估 · 58/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 发布面向生命科学的开源智能体 Deep Life Sci

    LangChain 发布开源智能体助手 Deep Life Sci,面向临床与实验室科学家,基于其 Deep Agents harness 构建。

9月17日周四
  1. Milvus(@milvusio)AI 评估 · 43/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    EverOS 如何用 Milvus 作为搜索后端,为 AI 智能体提供长期记忆

    EverOS 在 GitHub 已获 13,000+ stars,通过 LLM 从对话中提取记忆并以 Markdown 文件保存,让 AI 智能体跨会话拥有长期记忆。

  2. Weaviate • vector database(@weaviate_io)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Weaviate 1.39 新增 4-bit Rotational Quantization,8-bit RQ 导入提速 16%

    Weaviate 1.39 推出 4-bit Rotational Quantization(RQ),在压缩向量内存占用的同时保持较强召回,并提升导入与搜索性能。

  3. LlamaIndex 🦙(@llama_index)AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 网络研讨会:如何为保险智能体构建文档处理流水线

    LlamaIndex 将举办网络研讨会,由解决方案架构师 Abrar Mahi 讲解如何用 LlamaParse 和 Extract 把保险文档转为结构化数据,用于核保、保单审查和理赔流程。内容涵盖解析保单等复杂表单、按既定 schema 抽取保单与财产信息及理赔历史,并用引用和边界框校验抽取结果。还会结合置信度分数与验证规则,决定哪些环节自动放行、哪些需人工复核。

9月16日周三
  1. Milvus(@milvusio)AI 评估 · 29/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 支撑全球最大音乐流媒体之一:1 亿+曲目、数十亿向量、约 10ms P99 检索

    一家覆盖 100+ 国家、服务数亿听众的音乐流媒体平台用自托管 Milvus 搭建了音频与歌词的统一检索层,将 1 亿+曲目编码为数十亿向量,实现每秒数百次查询下约 10ms 的 P99 数据库检索延迟。该基础设施同时支撑歌曲识别、歌词搜索、推荐和版权匹配,支持播放短片段、哼唱旋律或输入模糊歌词等检索方式,并通过地域与版权过滤结合语义与全文搜索。

  2. QdrantAI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 测试 SHIFT:无需训练缓解多语言 RAG 的语言偏置

    Qdrant 复现 SHIFT 论文方法,通过从嵌入向量中减去按语言估计的偏移,把非枢纽语言文档映射到枢纽语言空间,无需训练即可缓解多语言 RAG 的语言偏置。

  3. Elastic BlogAI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Elastic Cloud Serverless 跨项目搜索正式 GA,单条查询跨最多 100 个项目且数据零迁移

    Elastic 宣布 Elastic Cloud Serverless 跨项目搜索(CPS)正式 GA,用户可在多个 serverless 项目间执行单条查询,覆盖所有区域、项目类型与云厂商,数据原地查询、无需迁移。

9月15日周二
  1. Qdrant(@qdrant_engine)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 实测金融检索:dense embeddings、BM25 与 SPLADE 混合搜索对比 47 份 SEC 文件

    Satyam Sahu 用 Qdrant 对 10 家科技公司的 47 份 SEC 文件做了混合检索实验,对比 dense embeddings、BM25 与 SPLADE 三种方式在金融搜索中的表现,考察各自适用的场景与短板。金融检索同时要求语义理解和精确匹配,因此混合搜索成为关注方向。

  2. Qdrant(@qdrant_engine)AI 评估 · 28/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Qdrant 将在 n8n in the loop 2026 分享无需微调的自愈研究智能体

    Qdrant DevRel 工程师 @itsclelia 将在 n8n in the loop 2026 上演示如何构建无需微调、从自身运行历史中学习的研究智能体。

  3. Yangyi(@Yangyixxxx)AI 评估 · 55/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Yangyi 评腾讯微信团队开源知识库 WeKnora:形态更像基座,应开放给其他场景接入

    Yangyi 认为知识库是企业刚需,但当前形态更像一个基座,实际调用场景不应局限在基座内部,建议开放出来给其他场景做接入。

  4. 土猛的员外AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    RAG问答和Agent的区别是什么?各自适合哪些应用场景

    RAG问答是"问什么答什么"的被动检索生成,平均消耗几千tokens、几秒到几十秒完成;Agent则是"给定目标自主完成",具备规划、记忆、工具调用与反思能力,简单任务消耗几万tokens、复杂任务可达千万级、耗时几分钟到几十分钟。企业获取知识应优先用RAG问答,写代码、改文档、订票等复杂任务再交给Agent,而非越高级越好。

  5. LlamaIndex 🦙(@llama_index)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LlamaIndex 提出两遍式即时 OCR:LiteParse 快速首扫,LlamaParse 按需精解

    LlamaIndex 提出两遍式 just-in-time OCR 方案,替代先解析全部页面的传统管线。第一遍由免费开源的 Rust 工具 LiteParse(支持 50+ 格式)做布局感知快速扫描,输出空间文本、边界框、标题、表格及每页复杂度标记,整个数据房间 32 秒完成;第二遍由 LlamaParse 按页码只精解需要的页面,返回单元格级表格、边界框和置信度分数。

9月14日周一
  1. Milvus(@milvusio)AI 评估 · 38/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Milvus 教程:用 MemPalace 为编码智能体搭建项目记忆宫殿

    MemPalace 把项目知识按"宫殿"结构组织:wing 对应项目或知识库,room 归类相关主题,drawer 将原始内容切成可检索的小块,Milvus 在背后存储文本、嵌入向量和元数据。

  2. 腾讯技术工程AI 评估 · 53/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    别再只卷 Prompt 了,真正拉开 Agent 差距的是 Context Engineering

    腾讯技术工程发布长文,梳理 AI 工程从 Prompt Engineering 到 ReAct 再到 Context Engineering 的三阶段演进,并以 Anthropic《Effective Context Engineering for AI Agents》为主要参考构建实践体系。