AI 原生组织转型 02:用 AI 推进流程、闭环迭代
AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。
AI 原生组织转型第二期讲完传导与检查,并提出闭环:让公司自己变强,再让市场来教公司。安克用项目容器与 21 个智能体编排,让 agent 推动人,48 小时从亚马逊销量下跌走到修正。检查须在干净上下文做对抗性验证,沉淀写进 CLAUDE.md,Block 则把公司本身做成推荐引擎。
Factory 借助自托管 LangSmith 为其 Droids 构建可观测性与反馈闭环,将提示词迭代速度提升 2 倍。其反馈流程由 Droid 发布评论收集正负反馈,经 LangSmith Feedback API 导出为数据集并用自定义 LangChain 工具优化提示词。
Podium 借助 LangSmith 优化其 AI Employee 智能体,将工程介入减少 90%。团队用 LangSmith 追踪每次交互中 20-30 次 LLM 调用,构建数据集并微调模型,使判断对话自然结束的 F1 分数从 91.7% 提升至 98.6%,超过 98% 的质量阈值。
LangChain 官方复盘了 chat.langchain.com 聊天机器人的重构过程。团队原本用文档切块、生成嵌入向量并存进向量数据库的方式,但发现内部支持工程师并不爱用,他们真正的流程是查文档、查知识库、再用 Claude Code 核验代码实现。
LangChain 提出加速 AI 智能体的五类做法:先用 LangSmith 的 waterfall 视图定位延迟瓶颈,再通过流式返回中间步骤或后台运行降低用户感知延迟。减少 LLM 调用可用 LangGraph 替代 ReAct、多智能体等架构,实测能显著减少调用次数、更快更省;提速 LLM 调用可换 Gemini Flash 等更小更快的模型,或缩短输入上下文。
LangChain 发布开源项目 data-driven-characters,可从任意语料库生成角色定义并与之对话,支持导出到 character.ai、命令行或 Streamlit 界面本地调试,以及部署自包含的 Streamlit 应用。
Candidly 在 LangSmith 中为 AI 财务助手 Cait 构建了状态感知的 agent harness,用混合标注流水线(确定性规则加 LLM-as-judge)标记生产对话结果,与人工标注数据集达到 92.3% 一致率。
LangChain 开源了用于评估 LLM 问答链的自动评估器,并发布免费托管的开源应用与 API 以扩大可用性。该工具结合 Anthropic 的模型生成评估集与 OpenAI 的模型评分评估思路,自动为输入文档生成 QA 测试集并对指定 QA 链自动打分;测试显示 TF-IDF 与 SVM 检索在该场景下略优于 k-NN,且评分结果随打分提示词变化(如 OpenAI 评分最严格)。
LangChain 与 Pay-i 联合发文,讲解金融机构如何用量化 KPI 证明智能体 AI 的投资回报,并结合 RFP 处理与反洗钱(AML)合规监控两个真实场景拆解方法。
LangChain 详述上周发布的 LangSmith Engine 的技术实现,它基于 Deep Agents 构建,读取 agent traces 找出反复出现的失败并生成 issue、评估器和数据集样例。
LangChain 发布 cookbook,用 Deep Agents 编排、Parallel Task API 做网络研究,构建自动化公司尽职调查 Agent。
LangChain 梳理了 OpenAI 在 demo day 上分享的客户 RAG 实验,把各项方法按 RAG stack 归类并给出对应的 LangChain 实现方式。
LangChain 发文指出,Agent 可观测性不该只当调试工具,其更深层的价值在于驱动学习,而单靠 trace 无法形成闭环。学习可发生在模型、harness 和上下文三个层面,既可由人工审查 trace 完成,也可通过在线评测等自动化方式发现值得关注的轨迹。反馈形式包括用户显式评分、间接用户行为、LLM-as-a-judge 和确定性规则,核心要求是把反馈与 trace 一起存储。
mem0 解释了程序性记忆,即存储"部署流程""新增 API endpoint 所需的五个步骤"这类可重复执行的操作步骤。它指出这类记忆的失效模式不同:为旧系统设计的流程会在系统更替后继续运行,且不再重新验证。
mem0 指出,多数 AI 智能体把记忆当作一个扁平桶,不做区分。它引用《记忆碎片》中 Leonard 的三套系统,认为记忆必须分别回答三个问题:什么是真的、发生了什么、该怎么做。若三者用同一方式处理,智能体会随时间悄然变差。
vivo 互联网前端团队推出基于 Web 的 AI 游戏开发平台 vGame,用结构化场景描述加 AI Agent 取代手工编码,将广告小游戏开发效率提升一个数量级。平台技术选型为 Vue 3 + Vite、Koa + OpenCode SDK + Claude Agent,游戏运行时基于 Galacean Engine,并把游戏开发知识封装为 17 个 Agent Skill。
得物技术披露其 MultiAgent 平台的记忆模块实现,采用 Working、Session、User、Agent 四层记忆模型,短期记忆以 MySQL 持久化、Redis 作热点缓存并做 Token 窗口裁剪,会话结束后异步沉淀到长期层。
个人提效不等于组织提效,团队吞吐被三类卡点挡住:个人经验难以复制、跨角色背景对齐成本高、工具生态各自为政,换更强的模型也不会消失。作者给出解法 Workspace——面向 Agent 的组织资产基座,把知识库、代码库、iCafe 空间和 skill 收进一个代码库,Agent 可访问并自行验证产出。它只存摘要与索引而非知识快照,工作模式不变。
Kimi K3 是一个有效扩展到 2.8T 总参数并全量开源的 MoE 模型,本期播客由清华大学计算机系博士候选人孙宇涛领读其技术报告。
前端岗位需求因 AI 技术快速发展断崖式下跌,63% 的企业正转型做 AI 产品,"AI+前端"复合能力成为招聘刚需,要求掌握微调、Agent、RAG 三项技术。字节、腾讯资深项目负责人称正大量招聘有 AI 项目能力的前端,面试优先且涨薪 40-60%。陈旸推出「转型AI前端开发实战营」2 节直播课,0 元报名,限 100 人。
吴恩达(Andrew Ng)发布 AI 工程技能图谱(AI Engineering Skills Map)第一支柱"构建与部署 AI 应用",涵盖 LLM 基础、用数据为模型提供依据、构建智能体系统、评估驱动开发、生产环境运维和机器学习基础六个方向。
Weaviate 联合 Google DeepMind 的 Gemini Embedding 2 推出原生多模态 RAG,文本、图像、音频、视频可嵌入同一共享向量空间,一次查询即可检索 PDF 页面、音频片段或视频中的对应片段,跳过了转录、OCR、字幕等文本转换步骤。
Weaviate 发布三份 Notebooks,分别演示 Audio RAG、Video RAG 和多模态 PDF RAG,代码托管在 weaviate/recipes 仓库。三条链接均指向 GitHub 对应示例,覆盖音频、视频与多模态 PDF 三类检索增强生成场景。
Qdrant 自 v1.13 起在自托管实例支持 GPU 加速 HNSW 索引,Qdrant Cloud 也在今年 4 月将其作为托管选项上线。GPU 擅长大规模并行处理,能同时写入大量 HNSW 图的节点与边,从而缓解切换嵌入模型时全量重建索引的耗时与成本。
京东科技蔡欣彤独立开发了端到端智能播客平台 Smart Podcast Platform,用户上传视频或音频后,由 AI 自动完成内容理解、音色设计、语音合成与专业混音,全程无需人工干预。
用 176 万条 Cohere 嵌入的 MS MARCO 向量、13 种优化器配置实测 Qdrant 搜索延迟:持续建索引期间排空中位延迟 780 ms、p95 2.0 s,索引完成后中位延迟降 180 倍至 4.3 ms。
LinkedIn 为招聘智能体打造认知记忆智能体,提供深度个性化。其记忆分四层,含会话记忆与跨会话聚合的语义记忆,并已从 GraphRAG 转向树状结构记忆,以实现更快的增量更新,同时兼顾检索新鲜度、延迟预算与访问控制。
NotebookLM 放出 8 个 Notebook 提示词,被用户称为可像 150 美元/小时的顶级大学私教一样免费辅导。官方账号邀请用户分享自己喜欢的提示词。
屠龙之术主播庄明浩用千问抓取、整理并分析了36氪"资情留言板"5年183期的5032条交易线索,数据看板和PPT也由千问执行完成。该栏目信息覆盖乐聚机器人、字节跳动老股份额求购等一级半市场交易,需求从"转让"转向"求购"。千问已上线工作助理和思考研究功能,可操作本地文件,手机和电脑端均可从官网下载体验。
Qdrant 在 X 上分享了一篇教程,介绍如何在不引入外部重排服务的情况下把 RAG 的 token 成本降低 67%。@cappybaradeploy 的做法是把 Qdrant 原生的 ColBERT 重排、二值量化和句子级检索结合起来,只把文档中最相关的部分送给 LLM。
XMind 联合创始人 Mango 披露,这家二十年老牌软件公司已把五十多人的部门制重装为三十人左右的「圈子制」:解散测试团队,打散增长和市场部门,一人拆成 0.2、0.5 的人力到处内部兼职。绩效由 agent 记账、agent 按共同评分标准打分,圈长拥有打分和分钱权利,职能部门退化为只管技能等级认证的 community。转型后约两个月补齐了二十年没有的多语言用户手册和教程。
Qdrant 的混合搜索对同一 query 同时跑 dense 和 sparse 检索,再用 RRF 或 DBSF 融合两份候选列表,前者只看向量排名、后者按平均分与分数分布重新缩放。
大型企业AI项目验收后常出现使用率不及预期的情况,核心原因是AI系统未能有效利用企业自身知识。文章指出,企业AI真正落地取决于知识工程是否扎实,需在入库前完成知识准入、清洗、预标注与抽取,并覆盖版本管理、权限控制和持续优化。金融、高端制造和大型集团的AI应用至少要具备知识准入、知识治理、权限控制和持续优化能力。
作者用 Claude Code 给字幕转录翻译 App BaoCut 加远程转录功能,把可行性分析、设计文档、高精度原型、编码、测试五个环节全部交给 Agent 执行,人只在关键节点确认和拍板。
Qdrant 发布五篇系列文章,介绍如何不靠猜测地调优向量检索,实测覆盖 5,183 到 460 万文档的五个公开数据集。文章指出七个集合设置会悄悄限制搜索质量,例如稀疏向量缺少 IDF 修饰符、BM25 平均长度用默认值;在其实测中,25 条标注查询不足以区分融合调优带来的增益。
Qdrant 发布技术分析,给出集合超出 RAM 时的量化配置方法:先在 bits4(约 8 倍压缩)起步,用公式 vectors × dimensions × 4 bytes × 1.5 估算常驻内存,并固定量化副本、让原始向量保持 cold。
Qdrant 提出用候选排序上限与 nDCG@10 基线之差来判断是否值得引入重排序:在 200 个候选的深度下,五个数据集的 nDCG@10 差距介于 0.247 至 0.487。
Anthropic 宣布将为 Claude 模型的文本输出加水印,该水印对用户不可见,只有 Anthropic 能解码并判断文本是否由其模型生成。Sebastian Raschka 用 52 张幻灯片、48 分钟视频讲解了这一机制,并附有讲义文字稿,还讨论了水印可能失效或被移除的情况。
Qdrant 在五个数据集上对比了默认 RRF(k=2)与 DBSF 两种融合策略,其中四个数据集上融合优于单一最优检索,DBPedia-entity 是例外,融合反而落后稠密检索 0.0039。
Qdrant v1.17.1 新增实验性写入路径设置 prevent_unoptimized,让正在优化的 segment 中新写入的点进入 deferred 状态、暂不参与检索,直到优化完成;配合已有的 indexed_only 读路径参数,可减少批量上传后落在未索引 segment 上的全量扫描。