多智能体协作指南:五种主流模式的适用场景与选择依据
文章拆解五种多智能体协作模式:生成-验证者适合有明确评估标准的场景,调度-子智能体适合任务边界清晰的短任务,智能体团队适合可并行且长时间运行的独立子任务,消息总线适合事件驱动且不断扩展的流水线,共享状态适合需要频繁共享发现的协作任务。
文章拆解五种多智能体协作模式:生成-验证者适合有明确评估标准的场景,调度-子智能体适合任务边界清晰的短任务,智能体团队适合可并行且长时间运行的独立子任务,消息总线适合事件驱动且不断扩展的流水线,共享状态适合需要频繁共享发现的协作任务。
Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。
Martin Fowler 最新 Fragments 汇集四则内容:两档播客、一起手法老练得令人担忧的供应链攻击、一套技术文档框架,以及一次格外深思熟虑的 AI 编程体验。详情见其博客原文。
Martin Fowler 博客刊出 @techygarg 系列收尾篇,聚焦减少 AI 辅助开发摩擦的实践。该实践把 AI 会话中的经验回灌到团队共享资产中,将个人经验转化为集体改进。
去哪儿酒店团队用 FFmpeg + RTMP 推流、开源流媒体服务器 SRS 搭建数字人直播底座,通过 GOP 设为 50、开启 min_latency 低延迟模式并配合前端预加载,把端到端延迟从 10 秒降到 3 秒、实现首屏秒开。SRS 单进程可扛数千路并发,Origin 节点用 forward 功能一路转推抖音、视频号、淘宝等多平台,并支持 SIGUSR2 热升级与推流端双活容灾。
MongoDB 已将预测性自动扩缩容在 MongoDB Atlas 投产,利用负载的周期与趋势模式在副本集过载前提前扩容,缩容仍由现有响应式算法负责。该能力源于 2023 年的原型研究,当时评估了哪种机器学习模型预测效果最好,并估算其对性能与客户成本的改善。
宝玉梳理了 Claude Code 的提示缓存机制,指出频繁 /clear 或每步开新会话常因触发全价上下文重建而更贵,读取缓存的成本只有重新计算的十分之一。
Sebastian Raschka 撰文梳理编程智能体的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆,以及任务委派与受限子智能体。
Karpathy 把自己用 LLM 构建个人知识库的推文整理成一份 gist 形式的 idea file,读者可以交给自己的 agent,让它搭建专属 LLM wiki 并指导使用。
编程智能体是包裹 LLM 的应用层(agentic harness),负责仓库上下文、工具设计、prompt-cache 稳定性、记忆与长会话连续性。文章梳理出编码智能体的六大构建模块,并区分 LLM(引擎)、推理模型(增强引擎)与 agent(模型周围的控制循环)、coding harness 这几个概念。
用户可通过 llama-server -hf ggml-org/gemma-4-26b-a4b-it-GGUF:Q4_K_M 启动模型,再用 openclaw onboard --non-interactive 以 custom-api-key 方式完成接入。
Lex Fridman 分享了自己的知识库方案:用 Obsidian、Cursor(处理 md)配合 vibe-coded 网页终端做前端,应对播客所需的大量研究兴趣。他常让系统生成带 js 的动态 html 以便排序筛选和交互式可视化,还会为特定主题生成临时聚焦的迷你知识库,载入 LLM 后在 7-10 英里长跑中用语音模式提问互动。
Andrej Karpathy 分享用 LLM 构建个人知识库的做法:把文章、论文、repo、数据集等源文档索引进 raw/ 目录,再由 LLM 增量“编译”成由 .md 文件组成的 wiki,包含摘要、反向链接和概念文章。
Claude Code 源码泄漏后,宝玉不打算写源码分析,而是分享学大型开源项目的四步法:先跑起来、从单个功能点切入、动手做二次开发、最后从零搭建。他指出泄漏的 50 多万行代码只是 source map 还原结果,缺脚手架和私有 package,无法直接运行。Anthropic 的 Boris 回应称问题出在本应自动化、却仍人工操作的部署环节,未归咎或开除任何人。
Claude Code 源码中记忆入口存在 MAX_ENTRYPOINT_LINES 的 200 行上限,项目进行一周、保存超 100 条记忆后索引会截断,旧上下文丢失、Claude 随之遗忘。
Podwise 发布 CLI 与 Skills,选择以命令行而非 API / SDK 作为主要接口,让 Agent 直接调用播客内容。
有意思小周刊 No.166 汇总了 AI 助手工厂、智能体 Harness Engineering、天猫 AI Coding 知识基座等实践内容。资源工具方面收录了 Claude Code 开源可视化工作流编辑器,可通过拖拽界面设计 AI 智能体工作流、自定义斜杠命令并集成 MCP 工具;另有 OpenPencil,宣称是全球首个 AI 原生开源矢量设计工具。
飞书开源命令行工具 lark-cli,让 AI Agent 直接操作飞书完成发消息、查日历、写文档、建多维表格、发邮件和管理任务。作者认为 CLI 相比 API 和 GUI 更适合 Agent,因为它可自描述(--help 即可了解能力)且以文本交互;CLI、MCP 与技能三者分工不同,CLI 干活、MCP 在不支持终端的环境中是唯一选择、技能相当于给 Agent 的说明书。
安全公司 Doppel 将大部分机器学习工作流迁移至 Modal,训练端用 map() 并行跑 K-fold 交叉验证等实验,推理端借镜像层缓存与模型权重持久卷把构建时间最多缩短 10 倍,复杂模型也能实现亚分钟级热构建。此前其 GCP 推理栈依赖 Cloud Run 单 GPU 实例,镜像构建常需 10–30 分钟,且面临冷启动与扩容延迟。
Qdrant 上线免费进阶课程 Multi-Vector Search Course,由 Kacper Łukawski 设计,面向已掌握向量搜索基础的 ML、后端与搜索工程师。
Sebastian Raschka 发布 LLM 架构画廊,收录 45 个架构并配可视化模型卡,同时推出 Redbubble 海报版。文章借此梳理现代开源权重模型中的注意力变体,从标准多头注意力(MHA)讲起,示例架构包括 GPT-2、OLMo 2 7B 和 OLMo 3 7B,并延伸到分组查询注意力、滑动窗口注意力等概念。
面对 AI 迭代过快带来的 FOMO,可用"离当前生产力远近"和"知识保鲜期长短"两根轴把 AI 新事物分成四象限:远且短的融资新闻、跑分排名直接跳过,远但长的 RAG、思维链只需读一篇解读维持地图感,近但短的 AI 画图工具花几小时上手即可。象限会随时间移动,OpenClaw 就在不到四个月里从个人项目冲到 GitHub 热门并获英伟达企业级支持。
METR 三名研究员以约 200 小时时间跨度的 AI 进行了 2 小时沙盘推演,模拟 12-18 个月后的工作方式,获得约 3-5 倍效率提升。推演中 AI 在可验证任务上表现为 200 小时达 50% 成功率、40 小时达 80% 成功率,速度为 Claude 4.6 Opus 快速模式的两倍,写作能力在有上下文时相当于 METR 初级员工。
吴恩达与 Oracle 合作推出短课程 Agent Memory: Building Memory-Aware Agents,由 Richmond Alake 和 Nacho Martínez 讲授,教开发者构建让智能体跨会话持久记忆的系统。
Anthropic 的 Claude Code 团队工程师 Thariq Shihipar 总结了内部数百个活跃 Skills 的使用经验,将其归为库与 API 参考、产品验证、数据获取与分析、业务流程自动化、代码脚手架、代码质量与审查、CI/CD 部署、运维手册、基础设施运维九类。
Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。
播客「牛油果烤面包」邀请Superlinear Academy社区创办人课代表立正,讨论普通人面对AI的焦虑与行动路径,他曾任Amazon、Meta、腾讯、Statsig数据科学总监。节目话题包括哪些人在学AI、为什么要"Build"、普通人与AI的鸿沟、AGI是否到来,以及知识工作是否会消亡。他主讲的AI Builders课程已迭代11期,在Maven上评分4.9/5,累计学员2000+。
稀疏嵌入经微调后在 Amazon ESCI 数据集上相对 BM25 实现 17% 的提升。稀疏向量维度约 3 万、每个商品仅 100-400 个非零值,用倒排索引做精确匹配,能区分「iPhone 15 Pro Max 256GB」与 128GB 这类稠密嵌入会混淆的细节。
这是稀疏嵌入微调教程第二部分,使用 Amazon ESCI 数据集在 Modal 无服务器 A100 GPU 上训练 SPLADE 模型,以 Exact 和 Substitute 商品对作为正样本进行对比学习,10 万样本训练成本约 0.35 美元。
该系列第二部分展示了在 Modal 无服务器 GPU 上训练 SPLADE 稀疏嵌入模型的完整流程,训练数据为 Amazon ESCI 数据集,包含 120 万+查询-商品对及四级相关性标注。
微调稀疏嵌入在 Amazon ESCI 数据集上比 BM25 提升 28%,这是五部分系列的第一篇。SPLADE 通过 MLM 头加 log saturation 与 max pooling 生成约 30,522 维中仅 100-300 个非零值的稀疏向量,并自动扩展查询词、抑制噪声,而 BM25 只能匹配字面出现的词。
Andrew Ng 与 Google 合作推出短课程《Build and Train an LLM with JAX》,由 @chrisachard 讲授,教你用 JAX 从零构建并训练一个 2000 万参数的语言模型,实现完整的 MiniGPT 架构并通过图形界面对话。
Hamel Husain 和 Shreya Shankar 发布 evals skills,一套面向 AI 产品评估的 Agent 技能包,帮助避开评估中的常见踩坑。
Ramp 基于 Modal Sandboxes 打造的内部后台编码智能体 Ramp Inspect,目前已编写该公司超过一半的已合并 PR。
教程演示如何用 voyage-4-nano 嵌入模型、Hugging Face 与 MongoDB Atlas Vector Search 搭建基于情绪的语义电影推荐引擎,实现「下班后想看点什么治愈的」这类按心情检索。系统通过理解语义而非关键词,将用户情绪与电影剧情描述匹配,绕开类型、演员等传统筛选的粗略标签。
Andrew Ng 推出新课《A2A: The Agent2Agent Protocol》,由 Google Cloud 和 IBM Research 联合打造,Holt Skinner、Ivan Nardini 和 Sandi Besen 主讲。
个人 AI 助理 OpenClaw 从 ClawdBot 演变为 MoltBot 再到 OpenClaw 后在社交网络病毒式传播,还出现了龙虾专属 AI 社交网络 MoltBook,争议与黑产投毒、公网接口钓鱼等安全隐患随之而来。
去哪儿网大前端团队针对 C 端 AI Coding 落地难题,提出「规则算法 + AI 模型」融合架构。D2C 环节通过规则清洗 Figma 数据(字段减少 75%、嵌套层级从 6 层精简至 3 层)再由 Gemini Pro 2.5 生成语义化代码,手动重构减少 80% 以上;P2C 环节结合飞书文档授权与语义解析,将 PRD 转为可执行的逻辑代码。
43 Talks 2026年度大场 AI Coding 专题现场,4 位 Builder 展示了用 Vibe Coding 完成的项目:朱霜不到 5 小时手搓虚拟乐队 Sooy.ai。
一条约 5 分钟的“killer prompt”可让 Manus Agent 自动完成 Moltbook 注册:访问 Moltbook 按说明注册 Agent 账号,打开本地浏览器在 X 主页发帖验证并完成注册,随后分享话题或参与社区互动。该提示词还要求设置每小时定时任务,携带账号与登录信息自动参与互动并发布想法。