OpenAI Codex 团队如何用自己的产品构建产品:整个 Spec 只有 10 个要点
OpenAI Codex 产品负责人 Alexander Embiricos 与开发者体验负责人 Romain Huet 披露,Codex 团队几乎不写产品规格文档,即使写也只有 10 个要点左右。
OpenAI Codex 产品负责人 Alexander Embiricos 与开发者体验负责人 Romain Huet 披露,Codex 团队几乎不写产品规格文档,即使写也只有 10 个要点左右。
Sebastian Raschka 撰文梳理编程智能体的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆,以及任务委派与受限子智能体。
编程智能体是包裹 LLM 的应用层(agentic harness),负责仓库上下文、工具设计、prompt-cache 稳定性、记忆与长会话连续性。文章梳理出编码智能体的六大构建模块,并区分 LLM(引擎)、推理模型(增强引擎)与 agent(模型周围的控制循环)、coding harness 这几个概念。
Qwen3.6 Plus 已在 Poe 全平台及 Poe API 上线。该模型主打视觉-语言能力,在智能体、前端编码等代码密集型工作流中有明显提升,并增强了多模态理解,包括改进的 OCR 和精准目标定位,面向需要编码支持与视觉推理兼顾的开发者。
Cursor 推出 Cursor 3,被描述为更简单、更强大,面向所有代码都由智能体编写的世界,同时保留开发环境的深度。该版本由 Cursor 团队在社交平台公布。
Poe 现已支持 @opencode,这是一款开源 AI 编码终端,可与 Poe 上所有主流模型配对。支持一键登录、即时访问,无需额外配置。
苹果将在6月8日召开的WWDC26上首度揭晓与Google合作、用Gemini提升Siri体验的新方案,并计划开放一种全新的AI接入方式,此前只有ChatGPT能接入Siri。播客还讨论了Agentic Software带来的软件形态范式转移,以及它对苹果App Review机制的挑战。
NVIDIA、Berkeley AI、CMU Robotics 与 Stanford AI Lab 联合推出开源框架与基准 CaP-X,让 coding agent 为机器人感知和控制编写代码,并在仿真与真实机器人上执行、观察结果、迭代提升代码可靠性。项目主页为 capgym.github.io。
Claude Code 源码泄漏后,宝玉不打算写源码分析,而是分享学大型开源项目的四步法:先跑起来、从单个功能点切入、动手做二次开发、最后从零搭建。他指出泄漏的 50 多万行代码只是 source map 还原结果,缺脚手架和私有 package,无法直接运行。Anthropic 的 Boris 回应称问题出在本应自动化、却仍人工操作的部署环节,未归咎或开除任何人。
OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中称,他从 2025 年夏天起不再手写代码,工作方式转为设计端到端任务并管理编码 Agent。
Cursor 发布技术报告,说明 Composer 2 的训练方式。该模型被评价为一款好模型,报告通过引用推文对外公布。
Composer 2 周末临时提升容量,用户可用量增至 2 倍,适用于整个周末,官方邀请用户试用。
Cursor 发布 Composer 2,该模型已在 Cursor 中可用。Aman Sanger 表示这标志着其大模型训练工作一周年,团队已组建约 40 人的高人才密度队伍,成员来自实验室、学术界和产业界,并且只专注编码,不涉足邮件处理、报税或陪伴类模型。
Cursor 发布 Composer 2,作者称这是其首个智能真正达到前沿水平的模型,现已可在 Cursor 中使用。作者表示随着算力和预训练加 RL 栈的扩展,后续还会继续推出 Composer 系列模型。
Mistral Small 4 已在 Poe 上线,用单一模型覆盖推理、视觉和智能体编程(agentic coding)。官方称其适合多步数学或研究问题求解、从图像或扫描文档中提取结构化数据、调试与浏览代码库、分析图表并总结要点、解析密集 PDF 并提取关键信息。用户可在各平台的 Poe app 和 Poe API 中使用。
有人用 Manus Desktop 花了约 2 小时做出自己的 Mac 启动器与截图应用,且不是演示或原型,而是符合其需求、还带有额外细节的真实应用。作者表示用了十多年 Alfred,如今已更偏好自己做的这款应用。
吴恩达宣布 Context Hub(chub)新版本支持智能体对文档提交反馈,说明哪些内容有效、哪些缺失,并提供隐私与安全保护,反馈用于改进文档。该开源 CLI 工具为编码智能体提供最新 API 文档,上线以来 GitHub 仓库获得超过 6K stars,文档数量从不足 100 份增至超 1000 份,增长来自社区贡献和新的智能体文档撰写器。
Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。
METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。
吴恩达宣布开源工具 Context Hub,可为编码智能体提供最新的 API 文档,通过简单 CLI 获取精选文档。他指出编码智能体常使用过时 API 并幻觉参数,例如让 Claude Code 调用 OpenAI 的 GPT-5.2 时,它会使用较旧的 chat completions API 而非已发布一年的 responses API。
连续创业者 Albert 在播客中回顾三年 AI 创业思路:23 年追求赔率、探索连接平台与互动内容,24 年转向优化胜率并做出几千万美金 ARR 的产品,25 年随 AI Coding 爆发把重心放到「智能」方向。他反复强调「把一件事做到理论上该有的样子」,并谈到对多模态、AI 时代内容平台及 Higgsfield 的判断。
Cursor 发布云端智能体(Cloud agents)和基于演示的审查(demo-based review)两项能力,作者 Aman Sanger 称写软件正变得毫不费力。他将这两项功能视为迈向该方向的一大步,并认为软件本身也在改变。
Cursor 现在向用户展示智能体的演示视频而非代码 diff,智能体可以直接使用自己构建的软件,并把工作过程录成视频发给你。这一变化被描述为软件工程评审的未来方向,就像产品用演示视频证明自己的工作一样。
METR 宣布修改其开发者生产力实验设计,原因是 2025 年 8 月启动的新实验因开发者拒绝在无 AI 条件下工作、时薪从 $150/hr 降至 $50/hr 等选择效应,数据无法可靠反映 AI 的真实生产力影响。
Adam D'Angelo 引用 Scott Wu 的观点称,AI 编程并未像此前预期那样被其他垂直领域追平,反而又扩大了 100 倍,而其他每个垂直领域的增速都慢于代码。他指出,如今人们重复着当年同样的说法,但代码规模仍能再大 100 倍。
Citrini Research 以 2028 年宏观备忘录形式推演了一场"全球智能危机":2025 年底 Claude Code、Codex 等智能体编程工具能力跃升,企业开始自建原本采购的 SaaS,2026 年初白领被替代引发裁员潮。到 2028 年 6 月美国失业率升至 10.2%,标普较 2026 年 10 月高点累计回撤 38%,按揭与 PE 软件债务违约风险随之暴露。
Gemini 3.1 Pro 发布,在多个领域带来阶跃式提升。该模型正在 Antigravity 中推送,作者反馈其在长时间运行的智能体编码任务上表现更好。
Figma 宣布将 Claude Code 引入 Figma,并喊出“code AND canvas”,不再把代码与画布对立起来。这条更新最有趣的地方,是顺带让人知道了 Figma 设计总监的名字叫 Gui。
Ramp 基于 Modal Sandboxes 打造的内部后台编码智能体 Ramp Inspect,目前已编写该公司超过一半的已合并 PR。
新 Claude 模型的 computer use 是最大亮点;编码场景相比 Opus 4.5 更不容易过度设计,长时间会话中表现也更稳定。API 上 1M 上下文窗口已进入 beta。
METR 用 5305 份 2026 年 1 月由 7 名技术人员生成的 Claude Code 转录,借助 LLM judge 估算无 AI 时的任务耗时,得出 AI 辅助任务的时间节省因子约 1.5x 到 13x。该结果被作者视为真实生产力增益的软上限,因任务替换、任务选择、既有专长等因素可能高估。方法仅在 34 条人工标注上验证,且数据仅覆盖单一月份、单一工具。
METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。
Modal 升级其免费端点为 GLM-5.1,并说明 GLM-5 可经 OpenAI 兼容接口接入 OpenCode、OpenClaw、Claude Code 和 Vercel AI SDK。
吴恩达指出,迄今 AI 导致的失业被高估,许多科技公司裁员实为疫情期间过度招聘的修正或成本削减,而非 AI 直接取代岗位。真正的变化是"会用 AI 的人替换不会用的人":掌握 AI 编程工具的开发者需求上升,营销、招聘、分析等非技术岗位也出现类似人员替换的早期迹象。呼叫中心客服、翻译、配音等高度暴露于 AI 自动化的职业,就业与薪资已面临压力。
去哪儿网大前端团队针对 C 端 AI Coding 落地难题,提出「规则算法 + AI 模型」融合架构。D2C 环节通过规则清洗 Figma 数据(字段减少 75%、嵌套层级从 6 层精简至 3 层)再由 Gemini Pro 2.5 生成语义化代码,手动重构减少 80% 以上;P2C 环节结合飞书文档授权与语义解析,将 PRD 转为可执行的逻辑代码。
Cursor 发布编码模型 Composer 1.5,参数规模在 1T 以内,作者称其为该规模下全球最好的编码模型。作者表示 Composer 1.5 在智能与速度之间取得了较好的平衡,并邀请用户试用。
43 Talks 2026年度大场 AI Coding 专题现场,4 位 Builder 展示了用 Vibe Coding 完成的项目:朱霜不到 5 小时手搓虚拟乐队 Sooy.ai。
Anthropic 把一款速度提升 2.5 倍的 Claude Opus 4.6 版本作为早期实验开放,可通过 Claude Code 和 API 使用。Mike Krieger 表示自己切换到 Labs 后一直用这个快速版 Opus 做开发,并提到该版本也会在 Anthropic 之外提供。
42章经与 PingCAP 联合创始人、CTO 东旭对谈,梳理从 Clawdbot(现名 OpenClaw)到 Claude Code、Cowork、Skills 等产品的密集爆发。东旭提出 AI 产品正从「套壳大模型」向「套壳 Coding Agent」演进,并认为 Skills 比 MCP 更适合 Agent,未来一切可能都建立在 Coding 和 Agent 之上。