OpenAI 如何用 Codex 加速工程研发
OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。
OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。
Linus Torvalds 被发现在其最新项目的部分开发工作中使用了 Antigravity。该消息由 Varun Mohan 在社交平台分享,称看到自己的编程偶像使用 Antigravity 倍感荣幸。
DHH 认为 AI 智能体已从辅助工具升级为可自主产出生产级代码的团队成员,Claude Opus 4.5、Codex 5、Gemini 3、MiniMax M2.1、GLM-4.7 等模型配合终端工具已能自主运行测试、搜索文档。
Cursor 宣布 Graphite 加入 Cursor,后者是一款代码审查工具。Aman Sanger 指出,当 AI 智能体帮我们写出多一个数量级的代码时,软件工程的瓶颈就变成了审查环节。目前 Cursor 已发布相关博客文章。
Theo(t3.gg)将默认模型改为 Kimi K2,称其写作表现出色,是自己用过明显更好的聊天模型,甚至担心会拉低付费转化。
Coding agents 正从 vibe coding 转向真实世界的企业级软件工程,关注点从前端 demo 和孤立 bug 修复移向重构大型代码库、提升复杂系统效率与处理长周期任务。最难的已不是写代码,而是赢得测试工程师信任、回应开发者对长期维护的担忧,一种新的图灵测试正在出现。
Mistral AI 发布 Devstral 2 编码模型家族,提供两个尺寸版本,均为开源。同时推出原生 CLI 工具 Mistral Vibe,用于端到端自动化。作者称其支持在家进行 SOTA 开源 vibe coding。
NeurIPS 2025 的 Deep Learning for Code in the Agentic Era(DL4C)workshop 在 Hall G-H 于 09:00–17:00 举行,距开场还有十小时。
FlowiseAI 3.0.12 发布,支持在 Gemini 3 上搭配 Nano Banana Pro 进行多轮对话。同时新增内置 Gemini Code Interpreter,可让模型生成并运行 Python 代码;Agent 节点现支持返回结构化 JSON 输出。
豆包月活已过亿,硬地骇客这期播客讨论阿里此时再造「千问」入场 C 端是否太晚。节目聚焦通义千问如何借淘宝、高德、飞猪等阿里生态实现「有手有脚」的履约能力,以及内部夸克与千问的左右互搏;同时聊到腾讯的连接器困境和 Kimi、MiniMax 抢滩 AI Coding。
OpenAI 发布一场网络研讨会,讲解如何将 Codex 应用于软件开发生命周期的各个环节。
METR 对 OpenAI GPT-5.1-Codex-Max 的评估显示,其 50% 时间跨度为 75 分钟至 350 分钟(点估计 2 小时 42 分),较 GPT-5-Thinking 呈符合趋势的提升,未发现风险关键性的能力、架构或训练激励变化。
Qwen Code v0.2.1 发布,开发团队在 17 天内连发 8 个版本(v0.1.0 到 v0.2.1),重心放在修复用户反馈的 bug 而非添加新功能。
Cursor 宣布完成 23 亿美元 D 轮融资,投资方包括 Accel、Andreessen Horowitz、Coatue、Thrive、Nvidia 和 Google。Cursor 还表示年化收入已超过 10 亿美元,其产出的代码量超过世界上任何其他智能体;作者本人称正在全力开发 composer-2。
SWE-fficiency 旨在评估语言模型能否在真实工作负载上加速真实 GitHub 仓库,包含跨 9 个数据科学、ML 和 HPC 仓库的 498 个优化任务,每个任务都配有真实工作负载。现有智能体难以达到专家级优化水平。
Cursor 的语义搜索能提升智能体在所有前沿模型上的准确率,在大型代码库中尤为明显,仅靠 grep 难以应对。其思路是在索引阶段投入大量算力,复用这部分计算来提升效果,而不增加推理期算力开销,嵌入向量是实现这一目标最简单的机制。Cursor 还训练了专用嵌入模型用于代码检索。
John Yang 推出新评测 CodeClash,让大模型在代码库中通过多轮锦标赛相互竞争,以实现最大化收入、削减成本、赢得用户等高层目标。该评测不同于现有针对“修 bug”“写测试”等具体任务的测试方式,转而在目标层面考察模型的编码能力。
Cursor 2.0 在 LSP 性能上做了大量优化工作,官方称效果出色。同时 Cursor 还上线了多项体验改进。
Cursor 构建的 Composer-1 是一款通过 RL 训练的大型 MoE 模型,主打真实场景编程能力且速度极快。该模型由一支小而精的 RL 团队完成,背后涉及大量科学、基础设施、ML 性能及数据/奖励工作。团队目前正在扩招,以继续塑造编程的未来。
Next.js 16 正式发布,Turbopack 成为所有应用的默认打包工具,官方称生产构建快 2-5 倍、Fast Refresh 快至 10 倍。新版本加入基于 PPR 和 use cache 的 Cache Components、面向 AI 辅助调试的 Next.js Devtools MCP,以及取代 middleware.ts 的 proxy.ts。
Anthropic 正扩展印度市场,Dario Amodei 与印度总理 @narendramodi 会面讨论了此事,其中 Claude Code 在印度的使用量自 6 月以来增长了 5 倍。双方还谈及印度如何在教育、医疗和农业等关键领域为超过十亿人部署 AI。
Monica AI 新增 Claude 4.5 Sonnet,主打复杂推理与编码的自主能力,同时上线 Google Nano Banana,定位超轻量、超快速的图像编辑并保持创作一致性。两款模型现已在 monica.im 开放试用。
伯克利 AI 研究团队给出 word2vec 的定量学习理论,证明在实际可实现的训练条件下,其学习问题可归约为无权重最小二乘矩阵分解,最终学到的嵌入等价于对矩阵 M* 做 PCA,该矩阵仅由词共现统计和超参数决定。梯度流动力学有闭式解:从小初始化出发,word2vec 按离散步骤逐个学出正交线性子空间,每步提升嵌入矩阵的秩并阶梯式降低损失,各特征即 M* 的顶层特征向量。
METR 在一项研究更新中对比了算法评分与人工整体评审两种方式:在来自 stdlib-js 和 hypothesis 两个开源仓库的 18 个真实任务上,使用 Claude 3.7 Sonnet 的 Inspect ReAct 智能体按人工编写的测试用例衡量平均成功率为 38%(±19%,95% CI),但人工评审的 15 个 PR 没有一个可以直接合并。
OpenAI 发布一段 GPT-5 工作场景演示,展示该模型分析用户反馈、制定产品计划并制作原型,以及总结后续步骤。演示面向办公与业务流程,具体能力细节以官方视频内容为准。
OpenAI 官方展示 GPT-5 在真实工作流中的多步任务处理,可据此判断其在业务流程中的落地位置。
牛油果烤面包播客几位主播圆桌闲聊各自用 AI 工具的感受,覆盖文本润色、心理咨询、知识学习、图像生成、育儿辅助、编程辅助、播客与音视频制作、工作流自动化、AI Agent、多层次搜索与内容整合、AI 导游、旅行规划、写段子与小说创作等场景,也谈到 AI 的另一面。
METR 分析 9 个现有 benchmark 发现,软件与推理类任务(GPQA、MATH、Mock AIME、METR-HRS、LiveCodeBench)的 50% 时间跨度在 50-200+ 分钟,每 2-6 个月翻倍;视觉电脑操作(OSWorld、WebArena)时间跨度短 40-100 倍但增速相近,特斯拉 FSD 自驾驶约每年翻倍 0.6 次。
METR 招募 16 名来自大型开源仓库的资深开发者,对 246 个真实 issue 随机分配是否允许使用 AI,结果允许用 AI 时完成任务耗时反而增加 19%,而开发者预期 AI 提速 24%,实际经历放慢后仍自认为提速 20%。
OpenAI 展示如何用 ChatGPT 的 canvas 从产品需求文档(PRD)直接生成可运行的 HTML/React 原型。演示覆盖从需求文档到可交互原型的完整流程,帮助用户快速验证产品想法。
ChatGPT 现在可以把生成的代码直接送入 IDE,以加速开发流程。官方展示了这一能力如何衔接生成与本地开发环节。
ChatGPT 的 canvas 功能可将笔记、转录文本和草稿打磨成完整文稿。OpenAI 展示了这一写作场景的实际用法。
DeepSeek 发布 DeepSeek-V3-0324,在推理性能、前端开发能力和工具调用能力上均有提升。官方建议非复杂推理任务直接使用 V3 并关闭 DeepThink,API 用法保持不变。该版本模型已在 Hugging Face 开源,采用与 DeepSeek-R1 相同的 MIT License。
官方一次给出推理、前端开发与工具调用三项能力变化,并说明 API 不变、改用 MIT 许可,读者可据此判断接入成本。
DeepSeek R1 已在 Monica AI 上线,官方称其在数学与编程任务上表现出色,Codeforces 得分 96.3%,支持 128K 上下文窗口,并展现出涌现推理能力。该模型被描述为可与 OpenAI 最新模型匹敌,现已通过 Monica AI 开放使用。
OnBoard! 第 66 期邀请 Replit Agent 核心成员、OpenHands 联合创始人、阿里通义实验室科学家与真格基金投资人,围绕 Coding Agent 与 OpenAI o3 展开三个多小时讨论。
OnBoard! 与播客「十字路口」串台,盘点华人创办、分布在国内、硅谷、新加坡、日本等地的 AI 产品,包括 PictureThis、Speak、UMU、HeyGen、Opus Clip、Monica.im、Devin 等。
本地运行的 Codestral 能实时生成 scikit-learn 和 Keras 代码,用于医学影像预测。该演示借助 Open Interpreter 新版本实现,这一工具让 LLM 在本地运行 Python、JavaScript、Shell 等代码,安装后执行 `interpreter --local` 即可在终端通过类 ChatGPT 界面调用本地 LLM。
Copilot++ 发布,号称是首个也是唯一能对你的代码给出编辑建议的 copilot。原文未披露模型参数、benchmark 分数或开放方式等细节,仅附有演示视频。 (说明:原文信息极简,除“首个也是唯一能给出代码编辑建议的 copilot”这一核心宣称外无其他可核验事实,故摘要按防幻觉规则保持简短,未补写任何原文未提及的功能、数字或可用性信息。)
Eugene Yan 构建了 Obsidian-Copilot 原型,可根据章节标题借助检索增强生成(RAG)起草段落,并帮助用户回顾过去一周日记、规划下周。其检索结合 OpenSearch 的 BM25 与语义检索,嵌入模型选用 e5-small-v2(384 维、最大序列长度 512),以 TypeScript 插件形式集成到 Obsidian,代码已开源。