Addy Osmani 拆解工程师对 AI Coding Agent 的两极感受:创造、知晓与重要三种喜悦
Addy Osmani 认为「爱写代码 vs 爱交付」的划分过于简单,工程师面对 AI Coding Agent 的喜悦可分三种来源:创造的喜悦(心流,最安全)、知晓的喜悦(心智模型,最危险,可能让构想能力退化)、重要的喜悦(判断力权重不降反升)。他拒绝把对 AI Agent 的失落感病理化,认为悲伤是对工作有真实依恋的证明,建议主动守护构成职业认同的核心。
Addy Osmani 认为「爱写代码 vs 爱交付」的划分过于简单,工程师面对 AI Coding Agent 的喜悦可分三种来源:创造的喜悦(心流,最安全)、知晓的喜悦(心智模型,最危险,可能让构想能力退化)、重要的喜悦(判断力权重不降反升)。他拒绝把对 AI Agent 的失落感病理化,认为悲伤是对工作有真实依恋的证明,建议主动守护构成职业认同的核心。
联想天禧 AI 自研的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一,并通过官方 Verified 核验。TianxiCode 具备跨文件多跳检索、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大能力,未来将落地联想 AI 硬件产品。
TRAE 将 TraeCode 和 TraeWork 双端融合升级为新 TRAE,提供 Agent 模式和 IDE 模式两种工作方式,切换入口在右上角。Agent 模式作为全局工作台,可在同一窗口管理项目并把写代码、出文档、准备交付材料分给多个 Agent 并行推进;IDE 模式保留 SOLO 和 IDE 玩法,用于逐行细改代码。
Meshy.ai 创始人、CEO 胡渊鸣在公司 ARR 突破1亿美元后,写下48条创业反思,分"温度与原则""时间与 Founder Mode""AI 与人""团队与管理""战略与执行"五个板块。他提出管理者不能"惩罚责任心",创始人不应向下属索取情绪价值;并称公司几乎无限 Token,但面试仍要求手写代码。
开发者 makevoid 在 X 上发帖,表示不理解人们为何对 Opus 生成的 vi 内容如此痴迷,并附上了一段视频。该帖引用了另一条推文,帖文数据为 635 次浏览。
阶跃星辰(StepFun)的 Step 5 Preview 已在 OpenRouter 上线,官方称其为面向智能体任务的新旗舰模型。该模型采用稀疏 MoE 架构,激活参数 27B、总参数 600B,支持 1M 上下文以及文本、图像和视频输入,官方称其在编码和专业领域知识工作上表现较强,尤其是金融场景。
在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上超过 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。该结果由 StepFun 自家评测给出。
OpenAI 开发者账号展示了一段用 dot 打造游戏的经历:Nicholas Runcie 在自动驾驶汽车里用 Codex 安装了一款 dot 在他睡觉时为他做的游戏。该推文由 OpenAI Developers 转发,附带原推链接与互动数据。
Thomas Sohmers 用 Codex GPT 6 Astra 一次性把街机游戏 Discs of Tron 完整实现在 OpenAI DevDay 版 ModRetro Chromatic 的可重编程 FPGA 逻辑上。该项目为 100% one shot 完成,运行于 Chromatic 掌机。
一种"邪修"用法是在 Agent 的云电脑里安装 Pi 或 DeepSeek Harness 这类编程 Agent,并把其他 Code plan 用不完的额度配置进去。之后让 Grok Bot 调用这些 token 来写代码、渲染视频,从而避免闲置额度被浪费。
歸藏(guizang.ai)分享了一种「邪修」用法:在 Agent 的云电脑里装上 Pi 或 DeepSeek Harness 这类编程 Agent,把其他 Code plan 用不完的额度配置进去,再让 Grok Bot 调用这些 token 写代码、渲染视频,从而不浪费闲置额度。
Anthropic 发布 Claude Haiku 5.5,官方称其在编码、computer use 和知识工作方面较 Haiku 4.5 有显著提升。目前可获取的信息仅为这一结论,官方未在原文中给出具体评测数据、价格或可用范围。
T3 Stack 作者 @theo 开源了 TypeScript 编译器、类型检查器和 LSP 的 Rust 完整移植 tsc-rs,它是微软官方 TypeScript 7(typescript-go,Go 原生版)的逐行为移植,锁定上游提交 typescript-go @673a5f17,采用 MIT 协议并保留上游 Apache-2.0 / BSD-3 声明。
宝玉披露,Lauren 30 天 Token 消耗达 1.5T,用得最多的模型是 Opus 5.5,Cloud 是消耗大头。Cloud 上每个任务可用独立虚拟机并行,但改动验证不如本机方便。他同时提醒,不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最好模型且有充足 Token;AI 验证只能替代一部分,方向仍需人自己把握。
针对"都用 AI 写代码了为何还纠结 C/C++ 还是 Rust"的提问,该观点认为 AI 让写代码变便宜,不代表出错代价变低,Rust 编译器能提前拦住部分错误,而 C/C++ 的生态、平台支持和历史项目仍需 Rust 花时间追赶。即便未来 AI 直接生成机器码,如何确认 AI 做对了、需求是否理解正确与权限边界是否合理仍需可审查的依据,因此相当长一段时间内仍需编程语言和源代码。
在 Claude Code 里用 `/advisor fable` 把 Fable 设为顾问,Opus 执行时遇事请教它,任务则先由 Fable 出方案、Opus 实施后自动请 Advisor 验收并循环修复。
dair_ai 发布 MCP 工具,可接入 Codex/Claude/Grok Bot,用于发现和探索精选 AI 论文。该索引收录了作者近两年在 X 上推荐过的论文,支持查找与总结论文、探索 harness engineering 集合、生成文献综述与可视化论文等。官方称未来几周将发布配套 benchmark,并持续更新改进。
OpenAI 10 月 7 日起向 ChatGPT Plus、Pro、Business 和 Enterprise 用户推送 GPT-6,新增可组合图形、按钮、表单的「Intelligent UI」,内部评测中 GPT-6 Instant 比 GPT-5.6 Instant 提前 44% 开始回答需联网搜索的问题。
Hannah Foxwell 在演讲中指出,Cursor 中智能体请求数已超过 tab 补全接受量,智能体驱动的开发成为主流工作方式。她认为开发团队需围绕三个不变锚点重塑:构建有价值的东西、速度需要安全、人很重要。多数组织尚未准备好让智能体团队向生产环境交付,但应尽早尝试。
有开发者发帖提问:用完 Opus5.5 之后,工程师和程序员接下来的职业发展路径需要如何调整,并强调希望认真讨论而非吐槽。该帖获 171 条回复、21 次转发、403 个点赞和 200939 次浏览。
Mistral Large 4 预览版在 Code Arena: WebDev 以 1534 分位列第 45 名,比 Mistral Large 3 提升 304 分,使 MistralAI 进入该榜前 15 实验室,是唯一上榜的欧洲实验室。
Arena.ai 公布 Claude Haiku 5.5 (High) 在 Code Arena: WebDev 的真实评测结果,首秀以 1587 分排在第 30 位,略在帕累托前沿之外,但仍然具备很强的成本效率。
微软宣布为 Windows 带来不计量使用的智能能力,让每台 PC 成为智能体可安全代劳的场所。亮点包括 137B 参数、256K 上下文窗口的编码模型 MAI-Code-1.1 Flash。
微软把编码模型放到 PC 本地运行,并让 Copilot 在设备上接管工作,读者可据此判断端侧智能体的落地方式。
开发者 @blended_jpeg 开源的 badclaude 已发布,可通过 `npm install -g badclaude` 全局安装。项目托管于 GitHub(GitFrog1111/badclaude),作者同步给出了 yaml 配置示例。
AI Will(@FinanceYF5)提出,营销人只需掌握 Claude Code 和 GitHub 两个基础工具,学会"营销工程"并搭建自己的 Agent,就能为公司创造真正的收入。该帖列出 11 个练习方向,并引导关注账号、点赞转发首条帖子。
营销人只需掌握 Claude Code 和 GitHub 两个基础工具,就能学会"营销工程"这套能力,甚至搭建自己的 Agent。真正会用它们并自建 Agent 的营销人,能为公司创造真正的收入。原文列出 11 个练习方向。
斯坦福大学 CS146S「The Modern Software Developer」第三周课程已公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,内容涵盖 SKILL.md 与脚本编码工作流、Web skills 扩展 Agent 能力边界及 CLI 高效工作方式。
Skills For Real Engineers 开源项目作者 Matt Pocock 分享了 AI Coding Agent 该用多重流程的决策框架:小改动不要用 /grill-with-docs。
GhosttyEXTREME 是 Ghostty 1.3.1 的 macOS 分支,用来解决在 macOS 上同时跑 Claude Code、Codex 等多个 AI 编码代理时原版 Ghostty 看不到实时状态的问题。它通过侧边栏、跟随编辑的代码编辑器和代码地图把这些过程可视化,并提供权限应答、回合撤销和变更审查。项目已在 GitHub 开源。
在整仓库迁移任务上,同一模型和相同 effort 设置下,把 Codex 换成 HERMES harness 后 GPT-5.6 Sol 的成绩从 6.5% 提升到 31.0%,增益来自 harness 本身。
AlixPartners 的 Natalia Connolly 和 Kevin Madura 将在 AI Engineer New York 分享如何用 Claude Code 分析合同与支出数据,识别智能体发现的节省是否被重复计算。该议题将于 10 月 14 日举行。
Databricks 发文介绍 Lakebase 与 Agentic SDLC,提出用数据库分支支撑编码智能体工作流。其思路是让编码智能体像操作代码分支一样对数据库进行分支,从而在开发流程中隔离和并行推进变更。
OpenRouter 宣布 OpenAI GPT-6.1 Sol 的 Ultrafast 模式已在其平台上线,链接指向 openrouter.ai/openai/gpt-6.1。
Google 提出 CI 内的程序修复智能体 FlowAgent,针对提交前测试失败运行 ReAct 式生成-验证循环,并在代码审查工具中展示修复建议,其前置与后置两道弃权过滤器会拦下薄弱建议。对 195 个真实故障的人工评审显示,67.18% 的修复正确。Google 全公司上线后,它在 295,508 次变更上给出建议,开发者预览 65,069 次、采纳 28,554 次。
OpenAI 为 GPT-6.1 Sol 推出 Ultrafast 模式,API、Codex 和 ChatGPT Work 同步上线。官方称其具备接近 Astra 的智能水平,速度最高可达 Sol Standard 的 8 倍。
GitHub 推出新的上下文感知分类器,可在 2 毫秒内检查候选密钥,有望让推送保护在密钥进入仓库历史前拦截的数量增加一倍以上。面对开发者和 AI 智能体越来越快的操作速度,该能力用于跟上密钥防护需求。
a16z 认为 CFO 角色已从会计师、银行家转向"构建者",整个财务职能正围绕 AI 重建:AI 跨系统抓取并对账数据,AI 原生工具数天内上线并把月度结账变成每日;精通 Claude Code 或 Codex 的财务人员开始自建工具,最精简团队中财务占员工比例从 5% 走向 2%。
Oracle 在招聘、工程和运营环节用 ChatGPT Work 与 Codex 把专家知识转化为快速、可复用的工作流,将原本数天的工作压缩到几分钟。
编程智能体提交 PR 后由谁判定能否安全合并,成为 AI Engineer New York 一场对谈的主题。SonarSource 的 @kapmani 与 @addyosmani 将讨论"Who verifies the software factory?"中的人工审查与测试,活动定于 10 月 14 日举行,Sonar 为白金赞助商。
LegalOn 将每日 Codex 预估成本降低 65%,同时保持开发速度。其做法是按任务匹配 Astra、Sol 和 Luna,并对预算进行策略性管理。