OpenAI Codex 团队如何用自己的产品构建产品:整个 Spec 只有 10 个要点
OpenAI Codex 产品负责人 Alexander Embiricos 与开发者体验负责人 Romain Huet 披露,Codex 团队几乎不写产品规格文档,即使写也只有 10 个要点左右。
OpenAI Codex 产品负责人 Alexander Embiricos 与开发者体验负责人 Romain Huet 披露,Codex 团队几乎不写产品规格文档,即使写也只有 10 个要点左右。
Andrej Karpathy 转述 Peter Steinberger 的说法:他希望把 PR 重新理解为 "prompt request",因为其智能体已能实现大多数想法。他认为没必要先把想法用免费版 ChatGPT 扩写成一团 vibe coded 的乱码再提交成 PR,而这已成为当前大多数 PR 的形态。
编程智能体是包裹 LLM 的应用层(agentic harness),负责仓库上下文、工具设计、prompt-cache 稳定性、记忆与长会话连续性。文章梳理出编码智能体的六大构建模块,并区分 LLM(引擎)、推理模型(增强引擎)与 agent(模型周围的控制循环)、coding harness 这几个概念。
Kimi-K2.5-FW 现已在 Poe 上限时免费开放,Poe 官方强调这不是愚人节玩笑。该消息未披露免费截止时间、模型参数规模或开放地区等具体细节。
Kevin Weil 引用 Mehtaab Sawhney 的推文称,一篇新论文解决了三个 Erdős 问题,每个解均由 OpenAI 内部模型找到,且证明简短优雅,论文见 arxiv.org/pdf/2603.29961。他表示不仅 AI 正在解决更多开放问题,随着模型改进其证明也变得更优雅。
OpenAI 总裁 Greg Brockman 在 Big Technology Podcast 中证实下一代预训练基础模型 Spud 已完成预训练,凝聚约两年研究成果,同时将 ChatGPT、编程 Agent Codex 和浏览器 Atlas 合并为统一 Super App,预计未来几个月内交付。
Notion 联合创始人 Simon Last 在 No Priors 播客访谈中称,他从 2025 年夏天起不再手写代码,工作方式转为设计端到端任务并管理编码 Agent。
Paul 用 ChatGPT 结合 AlphaFold 为患癌的爱犬设计出一套个性化 mRNA 疫苗方案,被视为 AI 加速个性化医疗的一个缩影。Kevin Weil 借此呼吁,应让这套流程更容易被用于人类,而不只是狗。
Hamel Husain 在 PyAI Conf 的演讲《The Revenge of the Data Scientist》中提出,LLM 时代数据科学的基本功并未过时,他以五类常见评测陷阱说明缺失这些基本功的后果:直接用现成通用指标、未经验证的 LLM 评委、糟糕的实验设计、劣质数据与标注、过度自动化。
Delphi Ventures 创始合伙人 José Maria Macedo 在走访中国 AI 创始人、VC 和上市公司 CEO 两周后,表示自己更看好中国硬件、更看衰软件。
针对 William Shen 发布的 UNI-1,林俊旸表示"做得不错,如果能开源会更好"。据 William Shen 介绍,UNI-1 具备智能、可控、有文化感的特点,能力范围极广,团队正面对 Deepmind、OpenAI、Bytedance 等巨头的竞争,后续还将推出 API、技术报告和 model card。
Aman Sanger 表示,团队在基于 perplexity 的评测中评估了大量基座模型,Kimi k2.5 表现最强。此后他们进行持续预训练(CPT)和 4 倍规模扩展的高算力 RL,配合 Fireworks 的推理与 RL 采样器,使 Composer-2 达到前沿水平;他承认最初博客未提及 Kimi 基座是个疏漏,下个模型会修正。
OpenAI 的 GPT-5.4-Nano 和 GPT-5.4-Mini 已在 Poe 上线。GPT-5.4-Nano 适合摘要转录、工单标注、内容改写、快速 RAG 问答和运行 @openclaw 流程等对延迟与成本敏感的高频任务;GPT-5.4-Mini 更擅长把杂乱邮件或笔记转成规范 JSON、修复函数、处理异常支持工单,以及需要规划、检查结果并推进下一步的智能体任务。
Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。
METR 让 3 个 SWE-bench Verified 仓库的 4 位维护者复核 296 个 AI 生成的 PR,发现在用 golden baseline 归一化后,维护者合并决定比自动评测器平均低约 24.2 个百分点。研究还指出,这一差距主要来自代码质量、破坏其他代码和核心功能失败等原因,作者强调这不代表模型存在根本能力上限,而是提示不应把基准分数直接等同于现实可用性。
一项招募 153 名新手、为期 8 周的 AI-生物学随机对照试验发现,LLM 虽在单个实验步骤上显示帮助,但在三项核心湿实验任务的整体成功率上没有显著提升,这一结果出乎多数专家预料。
Barsee 汇总了近日 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等公司的 11 项 AI 进展,其中 SeeDance 2.0 热度持续攀升,用户可在一天内生成好莱坞级 AI 影片。
AI 领域近几天出现 11 项重要进展,涉及 OpenAI、Apple、Anthropic、OpenClaw、Kimi 等。其中 SeeDance 2.0 热度持续攀升,用户能在一天内生成好莱坞级别的 AI 电影。
Manus 联合创始人澄清,Manus 个人智能体模式完全基于自研架构,并非构建于 OpenClaw 之上,但仍需向 OpenClaw 项目致意,因其进一步试验并塑造了用户与智能体之间的"安全边界"。
METR 用 Claude Code 和 Codex 分别测试 Opus 4.5 与 GPT-5 的时间跨度,发现两者均未显著优于其默认脚手架 ReAct 和 Triframe:Opus 4.5 用 Claude Code 仅在 50.7% 的 bootstrap 采样中胜过 ReAct,GPT-5 用 Codex 胜过 Triframe 的比例仅 14.5%。
Lex Fridman 与 OpenClaw 创作者 Peter Steinberger 展开对话,这款开源 AI 智能体在 GitHub 上已获得超过 18 万 stars。节目还谈及 OpenClaw 的爆红原因、自我修改式 AI 智能体、安全顾虑、GPT Codex 5.3 与 Claude Opus 4.6 的编程对比,以及 OpenAI 和 Meta 的收购意向。
Nick St. Pierre 用一条时间线调侃 AI 怀疑论者(Doomers):2023 至 2026 年他们坚持「fuck AI」,2029 年改口称「显然已经停滞」,2030 年自称「其实我一直谨慎乐观」,2031 年则受雇于 OpenAI,负责管理机器人清洁车队。
Claude Opus 4.6 与 GPT Codex 5.3 于当日发布,OpenClaw 也在近期推出,Lex Fridman 预计 xAI/Grok 与 Google/Gemini 很快会跟进新版本。他透露将围绕 OpenClaw 与创作者 steipete 录制一期深度播客,并征集听众问题。他还计划下周前往旧金山湾区待一段时间,聚焦编程并参与工程团队工作。
David Heinemeier Hansson 分享用 OpenClaw 给 AI 分配独立机器、长期记忆和持续执行能力的实验,他在 Proxmox 虚拟机上隔离部署智能体 Kef,未安装任何技能、MCP 或 API 接入,仅凭一条提示词就让其自行在 hey.com 注册邮箱、完成 Fizzy 注册并创建看板卡片,随后通过邮件邀请加入 Basecamp 并在聊天室打招呼。
METR 发布前沿 AI 安全法规参考文档,梳理加州 SB 53、纽约 RAISE Act、伊利诺伊 SB 315 及欧盟 AI Act 前沿 AI 部分对 OpenAI、Google、Anthropic、xAI 等开发者的安全与安保义务。
METR 发布面向前沿 AI 实验室人员的合规参考,梳理加州 SB 53、纽约 RAISE 法案、伊利诺伊 SB 315 及欧盟 AI 法案中前沿 AI 部分的义务。
METR 发布指南梳理前沿 AI 开发者已需遵守的安全法规,涵盖加州 SB 53、纽约 RAISE 法案、伊利诺伊州 SB 315 和欧盟《人工智能法》,适用对象为训练算力超 10^25 或 10^26 FLOPs 的模型开发者。
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
OpenAI 发布小团队使用 ChatGPT 的实践指南,覆盖数据分析、营销素材制作、预算管理、会议组织和决策支持等场景。内容为操作方法层面的指引,未披露新模型、版本号或性能数据。
METR 公布监控能力评估原型 SHUSHCAST 的早期结果,测试监控器能否发现 AI 智能体秘密执行副任务。GPT-5 作为智能体时,获取推理轨迹使监控器捕获率提升超 50 个百分点,而 Claude Sonnet 4.5 效果小得多,部分原因可能是其推理轨迹经过摘要处理。该工作与 OpenAI 合作完成,任务集规模小、缺乏智能体与监控器诱导是主要局限。
Jan Leike 指出,2025 年模型对齐程度大幅提升,自动审计发现的不对齐行为比例不仅在 Anthropic 下降,在 GDM 和 OpenAI 也同样走低。
OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。
OpenAI 发布面向初创企业的 GPT-5 系列模型实用指南,讲解如何迁移到 Responses API、设计 Agent、调优提示词、引导 GPT-5 模型并构建可靠的 AI 工作流。
GPT-5 被用于营销、工程、财务、战略、法律和 IT 等真实业务工作流,OpenAI 发布了一份简明指南,说明其如何支撑这些流程,并介绍团队应如何评估它。
OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。
Citrini Research 宏观备忘录判断美国经济正在重新加速:2025 年最担忧的关税与就业并未拖垮整体,Q2、Q3 实际 GDP 分别年化增长 3.8% 和 4.3%,Atlanta Fed 的 GDPNow 模型预测 Q4 增速达 5.1%。
DHH 认为 AI 智能体已从辅助工具升级为可自主产出生产级代码的团队成员,Claude Opus 4.5、Codex 5、Gemini 3、MiniMax M2.1、GLM-4.7 等模型配合终端工具已能自主运行测试、搜索文档。
一项对比测试显示,Manus 能一次提示词并行生成整本 200 页书籍,耗时 20 分钟;ChatGPT 虽能完美写出大纲,但只能逐章生成、需手动复制粘贴 10 次。Gemini 则在第 1 章受阻,因限制无法写出单章 5k 字内容。测试者认为这体现了消费级聊天机器人与 AI 智能体体验的差异。
2025 年 LLM 发展由推理模型主导,DeepSeek R1 证明推理行为可通过强化学习培养,并以开放权重达到当时顶级专有模型水平。其采用的 RLVR 与 GRPO 成为年度核心训练方法,此后各主要厂商纷纷推出推理变体;DeepSeek V3 的 671B 参数训练成本估算约 500 万美元,R1 在其之上再训约 29.4 万美元。
Manus 在 8 个月内实现 1 亿美元 ARR,并被 Meta 收购。作者回忆 OpenAI 发布 Agent Mode 当天,Manus 在活动舞台上用实时演示对比自家智能体与 OpenAI 的发布,并称 Manus 的智能体胜出;他认为凭借更强的智能体架构和上下文工程,应用公司也能跑赢前沿实验室。