有意思小周刊No.168:Codex团队使用SOP
Codex团队发布了一份使用SOP,将可复用的项目上下文结构化为OpenSpec记录、高频复杂操作封装为Superpowers,并通过Codex自动化和验证执行过程,适用于开发、产品、测试、设计等多个业务团队。同期刊物还收录了Codex官方团队分享的持久对话流、语音输入、任务干预与排队等进阶用法,以及得物基于Harness工程的Claude Code数仓落地方案。
Codex团队发布了一份使用SOP,将可复用的项目上下文结构化为OpenSpec记录、高频复杂操作封装为Superpowers,并通过Codex自动化和验证执行过程,适用于开发、产品、测试、设计等多个业务团队。同期刊物还收录了Codex官方团队分享的持久对话流、语音输入、任务干预与排队等进阶用法,以及得物基于Harness工程的Claude Code数仓落地方案。
Sunny Health 基于 Qdrant 构建 AI 医疗礼宾服务,通过支付方或护理机构的 SSO 登录,为会员完成福利导航、网络内医生匹配和预约挂号三项任务。其检索层需在 300 万到 400 万条医生数据上同时执行硬性过滤(网络内、执照、语言)与语义相似度排序,因此从 Postgres 迁移到 Qdrant 向量搜索,并采用 Rust 客户端和 MCP 工具辅助开发。
吴恩达联合 Google Cloud Tech 推出新课,教你构建生成图像和视频的 AI 智能体,核心是让智能体自我评估输出并迭代提升质量。课程讲解三种评估技术:图文相似度评分校验输出与提示词是否匹配、LLM 裁判按品牌一致性等自定义标准打分、结构化量规把提示词拆成"主体是否在画面内"等可验证的 yes/no 问题。
Codex 官方团队的 jason(@jxnlco)分享了把 Codex 用到极致的组合用法,核心是从写代码延伸到终端命令、浏览网页、调用 API 等各类电脑工作。
Birgitta Böckeler 在 Martin Fowler 博客发文,记录她在 agent harness 中使用传感器的经验。文章第一部分聚焦静态分析,从基础代码 linting 入手。
GoPerfect 基于 Qdrant Cloud 搭建智能体招聘平台,用混合搜索、多向量表示加 LLM 编排,在内部基准中把候选人接受率从行业约 30% 提升到 99.993%,大客户实测稳定在 95–100%,约为行业基线的四倍。单个候选人不再用单一嵌入向量表示,而是拆成结构化向量集合,查询时由智能体拆分意图并并行发起多路子查询,复杂多条件搜索可在 10 秒内端到端完成。
资深开发者 Jacob Harris 撰文解释自己为何拒绝"凭感觉编程"(Vibe Coding)。他因不愿为 Token 持续付费而卸载集成 LLM 的 IDE、回归 Emacs,并认为 LLM 只能解决编写代码本身的"偶然复杂性",无法应对架构设计等"本质复杂性",且无法解释自身选择的路径。
Anthropic 发布《创始人手册》,按构思、MVP、发布、扩展四阶段梳理 2026 年 AI 原生初创公司的做法:创始人变成指挥 AI 智能体的角色,用 Claude 的 Chat、Claude Cowork 和 Claude Code 完成研究调研、智能体编程与流程自动化。
哔哩哔哩技术团队将 prompt 工程演进为 Harness Engineering,做出一系列智能开发工作流,让 AI 执行跨越整个研发生命周期的长任务。该工作流以 `.workflow` 结构化项目知识库为基础,包含 workflow-init、knowledge-update、prd-preprocess 等命令,并分成视觉驱动的 D2C 与逻辑驱动的 Dev 两条 Skill 路径。
Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。
Martin Fowler 提出一种为 LLM 准备大量上下文的方法:与其自己动手写,不如让一个 LLM 来访谈自己,把访谈内容整理成可用上下文。相关文章发布在 martinfowler.com 的 Interrog 页面。
随着 UI 被商品化,竞争优势上移至问题定义、押注排序与结果负责,产品设计正从界面绘制转向系统、token 与代码。作者把 Miro、Figma、VS Code 配合 Codex 和 GitHub、Jira 串成一条从想法到上线的链路,并嵌入设计思维、系统思维与会议纪要三类智能体。
AI 智能体等待时间与下载延迟不同,二十秒的停顿是在思考和权衡方案,用 spinner 会让用户误以为卡死或崩溃。
同一个模型放进 Claude Code、Codex、OpenCode 里就能读文件、改代码、跑测试,放进聊天框却只能给建议,差别在于 Agent Harness。这期播客把 Harness 定义为模型之外决定 AI 能否干活的工程系统,负责工具、权限、上下文、执行环境和结果验证,并讨论 AI Coding 作为大模型工程化练兵场,以及模型能力与 Harness 生态的未来演进。
Modal 介绍其五年工程积累,通过云缓冲、自定义文件系统 ImageFS、CPU 检查点/恢复和 CUDA 检查点/恢复四项优化,把推理服务副本的启动时间从约 2 千秒降到约 50 秒。
Sapu 将 PubMed 全部 2800 万条摘要索引进单个 Qdrant collection,此前研究人员只能分批上传摘要子集查询。该平台采用 OpenAI text-embedding-3-large(3072 维)配合 LangChain 写入 Qdrant Cloud,并支持将 1000 篇文档拆成 1000 个独立并行查询。
Andrej Karpathy 建议在提问末尾让 LLM「structure your response as HTML」,再把生成的文件用浏览器打开查看,效果很好,他也试过让模型以幻灯片等形式呈现输出。他认为 AI 输出正从原始文本、markdown 走向 HTML,最终可能演化为扩散神经网直接生成的交互式视频,同时输入端仍需加入指点、手势等交互方式。
Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。
本文拆解了包裹大语言模型的 Agent Harness 架构,涵盖编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等 12 个组件,并说明提示词工程、上下文工程与 Harness 工程三个层次的区别。
Claude Code 团队成员 Thariq 提出用 HTML 取代 Markdown 作为 AI 智能体的输出格式,理由是 HTML 信息密度更高、支持表格与 SVG 图表、便于分享和双向交互。
Andrew Ng 推出与 CopilotKit 合作的新短期课程,教你构建在聊天中按需生成图表、表单、白板等自定义 UI 的智能体。课程由 CopilotKit 联合创始人 @ataiiam 讲授,涵盖三种方法:从自建组件中挑选、用行/卡片/文本等积木组合新布局,以及把白板、日历等第三方应用嵌入对话。
作者曾把本地优先视作学术概念而拒绝多年,如今已用该模式上线三款生产应用,也曾在两个项目中将其拆除。他澄清本地优先是数据架构而非 offline-first、PWA 或 service worker 缓存,其核心是用户设备持有主数据副本、服务端只作为带特殊权限的同步节点;同时指出数据分析面板、银行支付、简单 CRUD 和无离线协作需求的应用都不适合采用,并建议从一个功能开始渐进引入。
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
Eugene Yan 总结自己与 AI 协作的方法,提出五条原则:提供好的上下文、把个人偏好编码成配置、让验证变简单、委派更大的任务、并闭环沉淀。具体做法包括把代码和知识库分层组织、为每个项目维护带注释的 INDEX.md、用 CLAUDE.md 当作行为契约并按目录分级加载、把高频操作做成按需加载的 skill,以及在会话中纠正输出而非直接改文件,让转录成为配置更新的输入。
流式 UI 在内容生成过程中持续变化,带来三类问题:视口被强制固定在底部、新内容导致布局位移、渲染频率高于浏览器每秒约 60 次的刷新。文章用聊天气泡、日志流和实时指标三个演示复现这些问题,并提出用 60px 阈值标记用户是否主动上滚,仅在用户处于底部时恢复自动滚动。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。
吴恩达开设新课程《AI Prompting for Everyone》,面向各水平用户,教授适用于 ChatGPT、Gemini、Claude 等 AI 工具的通用提示技能。课程涵盖深度研究模式、为 AI 提供充足上下文与文件图像、在买车择业等重要决策时让 AI 深度思考,以及生成图像、分析数据、搭建简单游戏和网站。他同时讲解模型底层直觉,帮助判断何时该信任回答。
Martin Fowler 更新了 AI 编程指南,发布了一期关于 harness engineering 的视频,并讨论了函数应该多长、Software Brain 的问题以及 AI 为何不受欢迎。相关链接收录在其 Fragments 合集中。
B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。
AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。
Hermes Agent 采用四套记忆系统:MEMORY.md(2,200 字符)与 USER.md(1,375 字符)构成提示词记忆,session_search 调用 SQLite 历史会话存档,技能(Skills)充当程序记忆,另有可选的 Honcho 层做用户建模。
Thoughtworks 内部 IT 采用名为 Structured-Prompt-Driven Development(SPDD)的智能体编程工作流。Wei Zhang 和 Jessie Jie Xia 通过一个简单示例讲解其运作方式,并在 GitHub 项目中给出细节。
纵横四海播客EP80围绕 Cal Newport 的《深度工作》与其新书《慢生产力》展开,讨论为什么在AI时代"深度"反而成为最昂贵、最不可替代的职业资本。节目援引微软职场报告探讨AI是否真在取代人类工作,并提出禁欲主义、双峰、节奏、新闻记者四种深度工作哲学,以及"第一勺冰淇淋原则"、可视化计分板等实践方法。
播客「硬地骇客」EP125 中,三位主播 Saito、一啸、归归围绕独立开发者最焦虑的 12 个问题逐一解答,包括没收入怎么熬、有 idea 却停在纸上、产品没人用、AI 时代工程师该练什么能力,以及 Vibe Coding 爆火是否意味着人人都能做产品。他们结合做 Podwise 的真实经历给出解答,不鸡汤、不画饼。
作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。
Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。
让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。
Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。
Anthropic 员工 Thariq 撰文讲解 Claude Code 的会话管理方法,围绕上下文窗口升级到 100 万 Token 后,如何在继续、回溯、清空(/clear)、压缩(/compact)和子智能体五种选择间做决策。
Modal 发布教程,演示如何在 OpenAI Agents SDK 之上从零搭建自定义编码智能体框架,通过 SandboxAgent 和 ShellTool 把智能体放进带 GPU 的 Modal 沙箱中执行任务。