和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。
刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。
向阳乔木用三天 AI Coding 做出并开源了一款 AI 设计工具,输入一句话即可生成适配不同平台的 7 个模版。选中任意元素后用自然语言描述即可修改,如选中标题说“改成红色”。工具支持 Codex Cli 生图、即梦、Gemini 等模型以及数千个 emoji 和 unsplash 图库,当晚将上线 Obsidian 官方插件库。
据 Business Insider 看到的内部文件与聊天记录,Google 正在测试 Argon、Barium、Carbon 三个 Gemini 4 变体,其中 Carbon 已部署在内部编码平台 Jetski 上,被认为在编程任务上强于 Argon,有员工将其比作 Anthropic 最强的编码模型 Opus 5.5,但仍需更多测试。
OpenAI 的 Tibo 回应 Codex 上下文长度选择问题,称团队测算后认为 300K 是更好的默认值。Codex 实际也能跑 1M 上下文,但那样只会消耗更多用量。
多位用户反馈 Codex 出现明显降智,体验下滑严重。该用户实测两天后认为,选择 GPT-61 Sol High 档位表现相对更好,并向其他用户征询当前使用的模型与档位。
英伟达 CEO 黄仁勋的长女 Madison Huang 与 35 岁的 Nico Caprez 结婚,后者今年 1 月升任英伟达全球 AI 基础设施增长副总裁,负责数据中心运营和"Neocloud"服务,并参与推进目标超 5000 亿美元的 AI 计算融资平台。
以修改 UI 为主的功能不必先写技术方案,可以直接从改原型开始;原型改好后用 Agent 内置浏览器的“标记”工具在要改的地方标注并写评论。原型完成后,可在同一会话里让它把原型修改同步到正式代码中。作者通常用 Fable 做设计、Opus 执行、再由 Fable 验收。
Eazo 是一款以 App 为中心的 Personal Agent,支持用自然语言开发 App 和小游戏,并带登录、调用 AI 以及接入 Stripe 全球收款。
Google 内部正在测试新模型 Carbon,部署在内部 AI 编程工具 Jetski 上,有员工称其编码能力“感觉像 Opus 5.5”。Carbon 是在 9 月 30 日发布的 Gemini 4 Argon(内部版本 Barium-B)之后训练出的新版本,将作为 Argon 升级还是独立发布尚不清楚。
人类工程师与 AI 编程系统配合的效率已超过纯人类或纯 AI 单独作业,且这一“半人马时代”可能像国际象棋那样持续约二十年甚至更久。
原字节 AI 编程产品 TRAE 负责人石扬于国庆前夕离职,与前字节 AI 数据与安全负责人傅越联手创办 AI 办公公司,已敲定首轮融资,投后估值约 2 亿美元。石扬此前在字节操盘豆包 MarsCode 与 TRAE,傅越曾组建字节 Global Data 团队;新公司目前仍处于 Stealth Mode。
宝玉描述自己的功能开发和 bug 修复都跑在一个 loop 循环里,Agent 和自己都能快速拿到反馈,loop 转得越快效率越高。Loop 跑通后可尝试多任务并行,因为大部分时间由 Agent 生成和验证,人可以专注定义问题和验证。当前主要瓶颈是电脑设备不够多和 Token 不够用,他计划多在云端开任务来缓解设备不足。
宝玉建议 Claude Code 用户删除 ~/.claude/settings.json 中的 CLAUDE_CODE_DISABLE_1M_CONTEXT 配置,该设置已无必要,保留会导致上下文最多只能到 200k。同时他建议将 autocompact 自动压缩上下文长度设为 300-400K,自己设置的是 300k,通过 /autocompact 400k 命令调整。
OpenRouter 指出,Luna 和 Astra 正带动 Codex 用量大幅增长。该帖互动数据显示 11 条回复、1 次转发、123 次点赞、10861 次浏览,未披露具体增幅或使用数据。
宝玉将文章中的开发方法论完整应用于开源项目 baocut,流程涵盖技术方案文档、原型与 UI 设计、编码实现和测试验收。他让 Agent 先做调研并撰写技术方案文档,反复沟通定稿后再产出接近正式 UI 的高保真原型,最后才实现代码。验收阶段 Agent 借助 Electron 的浏览器能力自行测试,多数活由 Agent 完成,人只负责定义问题和验收。
宝玉将其文章方法论完整应用于开源项目 baocut,流程分四步:先让 Agent 写技术方案文档并反复修改定稿,再做高保真原型与 UI 设计,然后实现代码,最后由 Agent 自行测试验收、人工复测收尾。他把技术栈改回 Electron,Agent 通过浏览器即可验证绝大部分功能,仅复杂场景才用 Computer Use 辅助。人主要负责定义问题和验收两端。
OpenAI Codex 面向 Pro 用户上线 beta 版 composer 预测,可根据对话内容和你与它的交流方式预测你的下一条消息。OpenAI 称这是其内部测试中最受欢迎的新功能之一。
OpenAI 在 Codex 桌面应用中面向 Pro 用户推出编辑器预测功能 beta 版,仅适用于本地任务。用户按“Tab”接受建议、按需编辑后发送,也可在 Settings 中关闭 composer predictions。
ChatGPT 的 dot 现在能在 Codex 中启动工作、跟进已有线程,并调用你的 ChatGPT 对话、Codex 线程和自动化任务,还能判断何时续用线程、何时新开。dot 也可在 ChatGPT Work 中查看和编辑 Scheduled Tasks,支持查询已排期任务或随计划变化更新重复任务。
阶跃星辰的 Step 5 Preview 发布一天后登上 OpenRouter Trending 第一名,并已在 Kilo Code、Cline、Hermes Agent 和 OpenCode 中可用。
有用户表示,遇到对前端审美好一点的工作时只能切换到 Claude 和 Kimi K3 来完成,认为 Kimi 表现不错,但不清楚 Kimi 何时发布新模型。
Google 发布 Android Bench 2.0,新增长周期任务(LHT)、智能体评测与连续评分,从原先的二元通过/失败改为按功能、视觉保真度和回归情况计算完成率。其中将跨平台应用移植到 Android 的最佳模型完成率仅 80%,被列为公开难题。榜单显示 Claude Opus 5.5 以 32% 的 LHT 通过率居首,GPT 6 Astra 以 28% 次之。
Surge 推出新基准 sudo L7,用于衡量 AI 在资深(staff 级)软件工程上的能力。该基准包含 60 个任务,大多来自真实企业私有生产仓库,由实际负责过这些系统的工程师编写,评分涵盖功能正确性、工程技艺、架构判断、协作能力与不必要的复杂度。表现最好的智能体仅约 45% 任务通过,作者认为 coding agent 目前仍停留在 L3 水平。
一个节约 Token 的 Claude Design 原型流程:先在 Claude 网站把设计稿迭代到满意,导出为 HTML 下载到本地,之后让 Claude Code 把它当作本地网页更新维护,不再依赖 Claude Design 网站。有用户反馈深度使用后,一个产品设计基本会耗尽一周的 token 用量。示例原型见 github.com/JimLiu/baocut。
GitHub 将 GitHub Copilot CLI、Copilot 应用和 Copilot SDK 背后的运行时从 TypeScript 和 Node.js 迁移到 Rust,通过 AI 辅助重写替换了超过 80 万行生产代码。
Simon Willison 用 ChatGPT 桌面版 Codex 标签页的语音对话模式,在做饭的半小时里边聊边让 GPT-6 Astra High 为博客搭出 Newsletters 页面,包括新 Django 模型与迁移、四个导入脚本、/newsletters/ 归档页和站内搜索集成。
15 支 10 秒短片全部由 Claude Opus 5.5 写代码产出,画面、动画、音乐和音效均由代码生成,每支短片对应一种风格。相关项目已在 GitHub 上发布。
Simon Willison 全程用语音、通过 Codex Desktop 给自己的博客开发了一个新功能,过程中他正在做晚饭。相关记录发布在其博客 simonwillison.net 上。
作者用腾讯游戏游点灵几句话搭出一个跳跃盖楼小游戏,玩家给不会飞的红衣超级英雄造楼当支点,第一关仅给9格泥土,游戏已公开可玩。作者还去了游点灵·湖南马栏山集团AI游戏训练营,试玩了在读大学生做的海鸥偷薯条、海岛求生等游戏,这些作品AI纯度100%、自带4万多个游戏资产,并支持可视化调参和二创。
字节跳动的 TRAE 将 TraeWork 和 TraeCode 两条产品线合并,统一称 TRAE,作者称其体验是所用 Agent Harness 中最接近 Codex 的。
Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。
2024 年诺贝尔经济学奖得主、MIT 经济学家达龙·阿西莫格鲁在 Silicon Valley Girl 访谈中表示,编程成为 AI 最早取得明显进展的职业领域之一,原因是代码有明确反馈、结果容易检查,而客服、医疗、现场维修缺少这种"测试通过"信号。
豆包工作配合 GitHub 上的 Remotion 技能,可在云端自动编写 React 代码并渲染动效视频,全程不占本地内存。实测将《Attention Is All You Need》论文做成 2 分半成片,并把《OpenAI DevDay 2026 回顾》飞书文档转为 120 秒、1080P、30 帧视频,自动按配乐能量峰值对齐镜头。该流程还可沉淀为名为「SR动态视频」的自定义技能复用。
谷歌下一代模型 Gemini 4 Argon 尚未官宣,已被曝密集现身多个平台,最快将于本周甚至数小时内发布。爆料称其发布卡片已上线谷歌内部系统及部分 Pro 用户界面,并已进入 Google Cloud 控制台,在编程工具 Antigravity 中被设为默认模型,还出现了真实的代码提交记录。
Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。
Addy Osmani 认为「爱写代码 vs 爱交付」的划分过于简单,工程师面对 AI Coding Agent 的喜悦可分三种来源:创造的喜悦(心流,最安全)、知晓的喜悦(心智模型,最危险,可能让构想能力退化)、重要的喜悦(判断力权重不降反升)。他拒绝把对 AI Agent 的失落感病理化,认为悲伤是对工作有真实依恋的证明,建议主动守护构成职业认同的核心。
联想天禧 AI 自研的专业代码智能体框架 TianxiCode 配合 DeepSeek-v4.1-Flash,在 SWE-bench-Live(Lite 分榜)中以 71% 的问题解决率登顶全球第一,并通过官方 Verified 核验。TianxiCode 具备跨文件多跳检索、自驱动规划与多轮工具调用、闭环补丁生成与测试驱动自愈三大能力,未来将落地联想 AI 硬件产品。
TRAE 将 TraeCode 和 TraeWork 双端融合升级为新 TRAE,提供 Agent 模式和 IDE 模式两种工作方式,切换入口在右上角。Agent 模式作为全局工作台,可在同一窗口管理项目并把写代码、出文档、准备交付材料分给多个 Agent 并行推进;IDE 模式保留 SOLO 和 IDE 玩法,用于逐行细改代码。