Cognition 的 Scott Wu 谈与 Anthropic 的深度合作及构建于 Claude 的 Devin
Cognition 的 Scott Wu 表示珍视与 Anthropic 团队的合作,并调侃自己中学数学视频的梗挥之不去。Cognition 是 AI 软件工程师 Devin 背后的团队,Devin 构建于 Claude。Scott Wu 希望让每个工程团队构建软件的速度提升 10 倍。
Cognition 的 Scott Wu 表示珍视与 Anthropic 团队的合作,并调侃自己中学数学视频的梗挥之不去。Cognition 是 AI 软件工程师 Devin 背后的团队,Devin 构建于 Claude。Scott Wu 希望让每个工程团队构建软件的速度提升 10 倍。
Cursor 宣布与 SpaceXAI 合作,从头训练一个规模显著更大的模型,总算力用量提升 10 倍。该训练依托 Colossus 2 的百万 H100 等效算力,并结合双方的数据与训练技术,官方预期这将带来模型能力的重大跃升。
Cursor 发布其迄今最强模型 Composer 2.5,称其在智能程度、长时间连续任务的持续工作能力以及遵循复杂指令的可靠性上都有提升。作者 Sualeh Asif 表示团队在 RL 上取得明显进展,Composer 2.5 表现超出其体量,并期待与 SpaceXAI 一起扩大模型规模和 FLOPs 后的下一版本。发布后一周内该模型的包含使用额度翻倍。
Google DeepMind 发布 Gemini 3.5 系列首个模型 Gemini 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1、GDPval-AA、MCP Atlas 等基准上超过 Gemini 3.1 Pro,输出 token 速度是其他前沿模型的 4 倍。
原文给出了 Gemini 3.5 Flash 的基准成绩、开放入口与 3.5 Pro 的推进节奏,可据此判断其在智能体与编码任务上的定位。
这期访谈对话 Shopify 前基础设施负责人 Simon Eskildsen,聊了他扩展 Shopify 应对闪购与宕机的经历、打造 turbopuffer 的经过,以及数据库的未来。对话还涉及 Napkin Math 博客、新数据库公司为何持续胜出、AI 编程与智能体目前仍失败的地方,以及 AI 时代招聘 P99 工程师。
随着 UI 被商品化,竞争优势上移至问题定义、押注排序与结果负责,产品设计正从界面绘制转向系统、token 与代码。作者把 Miro、Figma、VS Code 配合 Codex 和 GitHub、Jira 串成一条从想法到上线的链路,并嵌入设计思维、系统思维与会议纪要三类智能体。
同一个模型放进 Claude Code、Codex、OpenCode 里就能读文件、改代码、跑测试,放进聊天框却只能给建议,差别在于 Agent Harness。这期播客把 Harness 定义为模型之外决定 AI 能否干活的工程系统,负责工具、权限、上下文、执行环境和结果验证,并讨论 AI Coding 作为大模型工程化练兵场,以及模型能力与 Harness 生态的未来演进。
Cognition AI 联合创始人 Scott Wu 回应 Colossus 杂志文章中他与 Mango 的对战传闻,称当时在 Founders Fund 游戏之夜打了多局《任天堂明星大乱斗》,设备延迟严重,他只赢下一局,且 Mango 用的是 Falcon 并未尽全力,因此不认同"beat him to a pulp"的说法。
Anthropic 旗下 Claude Code 和 Cowork 产品线的工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上用不到三十分钟分享了 AI 时代管理工程团队的实践。
资深开发者沟通失败,是因为用"复杂性管理"的逻辑表达苦衷,而业务端真正焦虑的是"不确定性"。作者用两个循环圈解释:业务团队追求快速试错消除不确定性,资深开发者负责控制复杂性以维持服务稳定,两者认知框架不同。开发者可用"我们能不能试个更快的办法?"把精简、复用代码的能力包装成业务要的速度。
Fellou 认为 vibe coding 浪潮没有造出更多构建者,只造出更多"离放弃只差一次部署"的人。Cursor 和 Claude 降低了原型开发的门槛,但没人降低上线的门槛,这才是 2025 年真正的缺口。
Alex Albert 今日全天出席 Code with Claude 活动,并将在太平洋时间下午 5:30 主舞台发表演讲,该演讲将在 livestream 播出。活动议程包括 9:00 主题演讲、10:30 的 Claude Code 新功能、11:15 的 GitHub 规模构建 Claude、12:00 的 Managed Agents 加速生产(均为 PT)。
Google DeepMind 发布 AlphaEvolve 一年进展汇总,展示这款 Gemini 驱动的编码智能体从数学与计算机科学开放问题扩展至多个领域。
吴恩达指出,编码智能体对软件工作的加速按前端、后端、基础设施、研究依次递减。其中前端因智能体熟悉 TypeScript、JavaScript 及 React、Angular 等框架,且能借助浏览器验证结果自我迭代,提速最明显;后端因需人工引导处理边界情况、潜在 bug 和安全漏洞,加速幅度较小;基础设施任务中智能体效果最弱,其知识仍相对有限。
Claude Security 现已进入公开测试,内置于网页版 Claude Code 中。用户将仓库指向该功能后,可获得经过验证的漏洞发现结果,并在同一处代码编写环境中完成修复。
Andrej Karpathy 回应网友时自称其编程风格为 "cozy coding",并给出示例用法"这个情人节,和你爱的人一起 cozy code"。该帖获 2332 个点赞、89 条回复、47 次转发和约 13 万次浏览。
Martin Fowler 更新了 AI 编程指南,发布了一期关于 harness engineering 的视频,并讨论了函数应该多长、Software Brain 的问题以及 AI 为何不受欢迎。相关链接收录在其 Fragments 合集中。
Andrej Karpathy 在 Sequoia Capital 的 AI Ascent 访谈中表示,2025 年 12 月后最新模型生成的代码已开始直接可用,他进入凭感觉让 AI 写代码的状态。
Thoughtworks 内部 IT 采用名为 Structured-Prompt-Driven Development(SPDD)的智能体编程工作流。Wei Zhang 和 Jessie Jie Xia 通过一个简单示例讲解其运作方式,并在 GitHub 项目中给出细节。
Cognition 宣布与 Mercedes-Benz 合作,加速其全球工程团队的软件工程,这是迄今汽车行业规模最大的 AI 软件工程部署之一。Cognition 的 Scott Wu 与 Mercedes-Benz CIO Katrin Lehmann 就此进行了对话。
Andrew Ng 指出,AI 原生软件团队用 coding agent 加速开发后,瓶颈从写代码转移到决定做什么,部分团队把工程师与 PM 比例从 8:1 压到 1:1,而沟通本身又成新瓶颈。他认为最快团队是懂产品决策的工程师和会写代码的 PM,并建议工程师学产品管理、PM 学写代码。他还提到设计、市场、法律合规等环节因编码提速 10x 或 100x 而显得更慢。
DeepSeek 发布 DeepSeek-V4-Pro。官方称其在智能体编码(Agentic Coding)基准上达到开源 SOTA,世界知识在所有开源模型中领先、仅次于 Gemini-3.1-Pro,在数学、STEM 与编码推理上超过所有现有开源模型,可对标头部闭源模型。
Slock.ai 创始人、Kimi CLI 作者 RC 离开 Kimi 后创业,把公司运行在 Slock 上,团队从 OPC 拓展成「40 个 Agents + 7 个人」,目标是为多 Agents 和人提供协作环境。
Anthropic Claude Code 产品负责人 Cat Wu 在 Lenny's Podcast 中称,面试几百名 PM 候选人后发现,大多数人仍在用 6-12 个月路线图思维找工作,而 Claude Code 团队已把功能交付周期从半年压缩到一周甚至一天。
Cursor 联合创始人 Sualeh Asif 宣布与 SpaceX 合作,在后者百万 H100 等效的 Colossus 训练超算上训练前沿模型,Composer 3 及后续模型的训练 flops 将是此前的 10-100 倍。
Martin Fowler 发布 Fragments 更新,涉及第 34 期 Thoughtworks 技术雷达、开发者不阅读 LLM 生成代码的后果、DirectFile 以及大型组织中的技术等话题。
月之暗面发布 Kimi K2.6,称其在多项基准上刷新开源 SOTA,包括 HLE w/ tools 54.0、SWE-Bench Pro 58.6、SWE-bench Multilingual 76.7、BrowseComp 83.2、Toolathlon 50.0、Charxiv w/ python 86.7 和 Math Vision w/ python 93.2。
K2.6 的多个基准分数和长时程执行、Agent 集群参数一并给出,可对照 K2.5 看开源编码模型的能力变化。
作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。
让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。
Poe 引用数据显示,Opus 4.7 在编码任务上较 Opus 4.6 有明显提升,SWE-Bench Pro 为 64.3%,SWE-Bench Verified 为 87.6%,TerminalBench 为 69.4%。该帖称这些数字共同表明编码性能出现了有意义的改善。
Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。
AI 对很多中年男人来说像钓鱼一样,是一种合法且体面的独处方式:深夜打开电脑,对 AI 说一句"帮我做个能查天气的小工具",看着代码滚动、项目跑起来,快感如同鱼竿猛地一沉。他们未必在乎最终产品,真正稀缺的是过程中"我说了算"的自我主宰感,凌晨在社交媒体晒 AI 小产品的人往往不是年轻程序员,而是三四十岁的中年人。
吴恩达(Andrew Ng)认为"AI 导致大规模失业"的判断被夸大,AI 对软件工程的加速最明显,但 Citadel Research 新报告显示软件工程岗位招聘正在快速上升。他将此视为 AI 影响其他职业的风向标,并以 4 月 28-29 日在旧金山举行的 AI Developer Conference 主题"软件工程的未来"展开讨论,同时提到"产品管理瓶颈"——决定做什么比实际构建更受限。
CREAO 25 人团队(10 名工程师)实现 99% 生产代码由 AI 编写,新功能当天上线、A/B 测试后当天砍掉。其核心是用统一 Monorepo、六阶段 GitHub Actions 流水线和 Claude Opus 4.6 三轮 AI 代码审查重构工程流程,并以 Claude Sonnet 4.6 每日扫描 CloudWatch 构建自愈闭环。
METR 发布 MirrorCode 相关证据,显示 AI 已能完成部分长达数周的编程任务。该机构同期还发布了对 349 名技术工作者的调查,自报 AI 工具带来的工作价值变化中位数为 1.4–2x;另有研究分析 9 个科学推理、数学、机器人、计算机使用和自动驾驶 benchmark 的时间跨度趋势,改进速率与原始时间跨度工作中 7 个月翻倍大致相似。
Andrej Karpathy 指出,公众对 AI 能力的理解存在日益扩大的鸿沟:许多人仍以去年免费版 ChatGPT 的幻觉和怪癖来判断 AI 水平,而这类旧模型并不反映今年最新一代智能体模型(尤其 OpenAI Codex 和 Claude Code)的能力。
Martin Fowler 最新 Fragments 汇集四则内容:两档播客、一起手法老练得令人担忧的供应链攻击、一套技术文档框架,以及一次格外深思熟虑的 AI 编程体验。详情见其博客原文。
Poe 平台现已上线 Z.ai 的旗舰模型 GLM-5.1,主打智能体工程,在 SWE-Bench Pro 上取得 state-of-the-art 结果,并在仓库生成和真实终端任务中表现领先。
OpenAI 的 Prism 新增 Paper Review 功能,用 AI 审阅技术与科学论文,目标是提升科学严谨性、正确性与可复现性。该功能由 @hemal 在数小时内以简单 skill 形式构建,因为 Prism 由 Codex 驱动。OpenAI 正为 Prism 招聘一名首席设计师。
《枫言枫语》主播 Justin 做客《声东击西》,与豌豆荚联合创始人 Junyu、声动活泼联合创始人徐涛从工程师、产品设计和写过代码的普通人三种视角,讨论 OpenClaw「龙虾」与 vibe coding 如何改变写代码和思维方式。