和 ColaOS 橘子聊个人 Agent 这半年:时代追上了他,他却打了转向灯
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
ColaOS 创始人橘子复盘个人 Agent 半年变化:DeepSeek Flash、Haiku 5.5 等便宜模型让单用户月成本从 Opus 4.6 时代的几百美金降到约十美金,Muse、Dot、Instinct 免费且完成度接近 90 分,云上 Agent 成共识。他放弃卷办公,转做「996 之外」的个人项目,今年目标盈亏平衡。
刘润进入第六届年度演讲第一轮闭关,10天写首稿,期间用 Codex、Claude、Grok、CodeBuddy 四个 AI 并行开发软件,两小时完成同事数周未写出的部分。
刘润提出未来一两年职场大概率发生的8个变化:语音输入逐渐取代键盘打字,办公室出现隔音"小仓",为低声说话设计的语音输入设备(如喉麦)兴起,公司将新增"Token费"这一基础设施开支,中层因"上传下达"价值被AI消解而批量消失,程序员屏幕从竖屏转回横屏、大量非职业程序员涌现,35岁危机转为35岁红利(衍生ITBP新职位),手写代码、文章、PPT等"手搓技能"变成非遗。
有用户反馈 Codex 现在表现拉胯,不少朋友称其降智严重。该用户这两天使用下来,认为选择 GPT-61 Sol High 是一个相对好的档位,并向其他人询问目前在用哪个模型和档位。
人类工程师与 AI 编程系统配合的效率已超过纯人类或纯 AI 单独作业,且这一“半人马时代”可能像国际象棋那样持续约二十年甚至更久。
用户体感 Codex Pro 200 美元套餐额度不足 Claude Max 200 美元账号的 1/4,前者使用 GPT-6 Astra Medium,后者使用 opus 5.5 high。正常使用下几乎一天就能用掉一个 Codex 重置周额度,约 2 天可将赠送的 62500 积分(约 2500 美元 Credits)用完。
Opus 5.5 发布并被指代码能力再次飞跃,深度和广度已超越 99% 的程序员,完成同样任务所需生成的代码输出反而更少。有开发者用它直接反编译二进制、几十分钟做出可玩游戏 demo,也有人靠 AI 重写代码绕开 GPL 传染;Muse 为 ESP32 提供 Agent Ready 通用固件,模型推理成本最近一周大幅下降,Strata 可把推理速度提升数倍。
2024 年诺贝尔经济学奖得主、MIT 经济学家达龙·阿西莫格鲁在 Silicon Valley Girl 访谈中表示,编程成为 AI 最早取得明显进展的职业领域之一,原因是代码有明确反馈、结果容易检查,而客服、医疗、现场维修缺少这种"测试通过"信号。
Anthropic 工程师 Thariq Shihipar 在播客中谈 Claude Code,认为 Agent 写代码已成许多人的默认方式,真正拉开差距的是能否把需求讲清楚。
Addy Osmani 认为「爱写代码 vs 爱交付」的划分过于简单,工程师面对 AI Coding Agent 的喜悦可分三种来源:创造的喜悦(心流,最安全)、知晓的喜悦(心智模型,最危险,可能让构想能力退化)、重要的喜悦(判断力权重不降反升)。他拒绝把对 AI Agent 的失落感病理化,认为悲伤是对工作有真实依恋的证明,建议主动守护构成职业认同的核心。
Meshy.ai 创始人、CEO 胡渊鸣在公司 ARR 突破1亿美元后,写下48条创业反思,分"温度与原则""时间与 Founder Mode""AI 与人""团队与管理""战略与执行"五个板块。他提出管理者不能"惩罚责任心",创始人不应向下属索取情绪价值;并称公司几乎无限 Token,但面试仍要求手写代码。
开发者 makevoid 在 X 上发帖,表示不理解人们为何对 Opus 生成的 vi 内容如此痴迷,并附上了一段视频。该帖引用了另一条推文,帖文数据为 635 次浏览。
OpenAI 开发者账号展示了一段用 dot 打造游戏的经历:Nicholas Runcie 在自动驾驶汽车里用 Codex 安装了一款 dot 在他睡觉时为他做的游戏。该推文由 OpenAI Developers 转发,附带原推链接与互动数据。
针对"都用 AI 写代码了为何还纠结 C/C++ 还是 Rust"的提问,该观点认为 AI 让写代码变便宜,不代表出错代价变低,Rust 编译器能提前拦住部分错误,而 C/C++ 的生态、平台支持和历史项目仍需 Rust 花时间追赶。即便未来 AI 直接生成机器码,如何确认 AI 做对了、需求是否理解正确与权限边界是否合理仍需可审查的依据,因此相当长一段时间内仍需编程语言和源代码。
Hannah Foxwell 在演讲中指出,Cursor 中智能体请求数已超过 tab 补全接受量,智能体驱动的开发成为主流工作方式。她认为开发团队需围绕三个不变锚点重塑:构建有价值的东西、速度需要安全、人很重要。多数组织尚未准备好让智能体团队向生产环境交付,但应尽早尝试。
有开发者发帖提问:用完 Opus5.5 之后,工程师和程序员接下来的职业发展路径需要如何调整,并强调希望认真讨论而非吐槽。该帖获 171 条回复、21 次转发、403 个点赞和 200939 次浏览。
a16z 认为 CFO 角色已从会计师、银行家转向"构建者",整个财务职能正围绕 AI 重建:AI 跨系统抓取并对账数据,AI 原生工具数天内上线并把月度结账变成每日;精通 Claude Code 或 Codex 的财务人员开始自建工具,最精简团队中财务占员工比例从 5% 走向 2%。
AI 编码工具能让代码交付效率提升 25%-35%,但代价会在 1-3 个月后集中爆发:Faros AI 数据显示规模化使用 AI 编码的团队代码审核时长平均增加 91%,安全漏洞数量达传统开发的 3 倍,开发者 42% 的工作时间用于修复漏洞和清理技术债务。文章提出 AI 代码审查作为补齐验证环节的核心抓手,并给出以 50 人团队每月节省 800 工时为例的 ROI 测算方法。
Kent Beck 在 Prodacity 大会演讲中称,自己写的三本编程手艺书如今"基本可以扔进垃圾桶"。他批评大模型是"神灯里的精灵":几秒吐出成千上万行语法正确、看似合情合理的代码,却往往无法真正跑通,只会以极低资本开销制造出不可维护的"屎山"。他主张工程师在 AI 交差后踩死刹车,于特性间隙重构,并以"未来期权"视角权衡特性产出与系统可修改性。
开发者吐槽 Claude、GPT 等模型在 Coding 场景输出"15/15全绿""单腿哑火"等黑话,语言能力明显倒退。Coding 过拟合与 CoT 压缩是主因:为省 Token,模型思维链被简化成"穴居语",Token 消耗量比白话文少 70%,Claude 自 Opus 4.6 后也改为非自然语言思维链。
Claude Code 团队公开向用户征集改进意见,邀请用户提出希望 Claude Code 改进的方向。该帖获得 39 条回复、57 次点赞和 7612 次浏览。
文章《You're Already a Meat Proxy》引发讨论,作者认为人类工程师的真正价值在于高阶品味与判断力,而非亲自敲代码。文中给出两条路径:想要薪水与生活平衡的人可用 AI 高效完成本职工作,想获得职业主导权的人则应放下亲自编码的执念,把 AI 当作杠杆去解决真正重要的现实问题,该观点让不少对着一堆 agent 打回车的开发者感到释然。
OpenClaw 之父 Peter Steinberger 与 GitHub 联合创始人 Tom Preston-Werner 对谈,主张 AI 批量生成样板代码的时代应废掉传统 Pull Request,转向附带思考链路与脱敏 Prompt 的「Prompt Request」。
Linear 工程负责人 tommoor 将在 AI Engineer New York 分享"Your Coding Agent Has a Context Problem",探讨编程智能体有了代码之后是否具备足够上下文。活动时间为 Oct 14,需购票参加。
有用户反映 ChatGPT 现在几次对话就会出现「Selected model is at capacity」,等待时间翻倍,还有 case 从 sol 直接切换到 luna。该用户称 Sol 6 慢、幻觉、忽略指令,Luna 档位也出现没做完就说提前完成、服务重启失败等问题,并表示想念 Opus 5.5、只能通过 Cursor 使用。
Rails 创始人 DHH 在 Rails World 上呼吁程序员放下铅笔,不再手写绝大部分代码,因为编程智能体已经足够强大,继续手写 Ruby、Rust、C++ 在经济上已不可行。现场调查显示,只有少数人每周仍大量手写代码。他认为 AI 更像新同事而非工具,拒绝协作的人才会被淘汰。
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
在 NYC 听证会上,@DKokotajlo 呼应 @hilbertspaess 的观点,指出如今大部分代码由 AI 编写,且审查不够仔细,Gary Marcus 称这令人担忧。
Gary Marcus 引用并认同 @hilbertspaess 的观点:如今多数代码由 AI 编写,人们已不再仔细检查这些代码,把如此多的内容交给 AI 是不负责任的。
有用户抱怨近期 ChatGPT 体验灾难性:Astra 太贵用不起,Sol 6 速度慢且出现幻觉、忽略指令;Luna 档也明显退步,指令明确的小任务频繁崩,没做完就称提前完成,服务重启失败后直接放弃修复。原本用它搭档 Coding 很顺畅,如今需频繁检查实现,稍复杂任务就来回搞不定。
宝玉认为,Lauren 敢不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最强模型且不用考虑 Token 成本,而 GPT-6 操作电脑的水平虽已超过真人,也只能替代一部分验证工作。他建议从自己日常开发流程出发,把手动重复的环节交给 Agent,再沉淀成 Skill 反复迭代,同时方向仍要靠专业判断来指。
红杉资本合伙人 Konstantine Buhler 提出,脑力劳动正沿着体力劳动的老路机械化:约两百年间体力劳动从 99% 由生物完成变为 99.9% 由机器完成,而不远的未来 99.9% 的脑力劳动也将由机器完成,认知革命规模更大、速度更快。
开发者正在做一个 YouTube 学习辅助插件,支持读取字幕、跟随时间轴查看、中文翻译和 AI 对话。实测中 GPT 6.1 Sol 远不如 Opus 5.5 靠谱,界面和功能越改越糟、Bug 越来越多,目前正交给 Opus 5.5 收拾烂摊子。
Vercel CEO Guillermo Rauch 提出用客户反馈的修复响应时间来衡量一家公司有多 Agent 化,认为能在 30 分钟内修好所有问题的企业会打败需要 2 天的企业。他强调快不等于方向正确,工程师不必逐行读代码,但要懂系统边界与取舍,否则模型会把项目带偏。他还主张把开发流程放进云端沙箱以隔离供应链攻击,同时保留本地选项。
针对 GPT 生成代码,有观点认为其强化学习过度奖励“测试通过、能跑、无报错”这类易量化结果,导致模型倾向用捷径快速交付,却忽视架构设计与可维护性。作者还指出训练视野过短、缺少写完后自我审查,并推测评测器与训练数据质量会放大“工程品味”缺失,Anthropic 在高质量数据上的投入可能让 Claude 代码结构更好。
Varun Mohan 表示,Gemini 4 Argon 搭配 Antigravity harness 在 AA Coding Agent Index 上表现不错,并强调真实世界使用更重要,后续还有更多进展。他同时回复网友称竞争相当激烈。
Perplexity 的 Aravind Srinivas 演示了 Computer(Standard Mode 搭配 Opus 5.5)端到端设计并构建一款浏览器端开放世界游戏,过程中自行租用 GPU、运行 headless Blender、做程序化设计、联网下载素材并设计音频,成本约 2000 美元额度。
Sebastian Raschka 以 Jev 引发的热度为切入点,回顾文本分类从词袋加朴素贝叶斯、逻辑回归、RNN、CNN 到 BERT、GPT、T5 的技术演进,并实测 Jev 在 IMDb 电影评论数据集上的表现。
前 Chrome 开发者体验负责人 Addy Osmani 在 The Pragmatic Engineer 访谈中提出,AI 编程的真正风险是认知债务与认知投降,即开发者不再追问、把模型结论直接当成自己的结论。
Opus 5.5 在 Coding 和视频创作上表现"打爆",被评价为绝对跨过了一个奇点。在 AgentWork 付费社群里,Claude Code 的 Token 用量最近提升了一倍多,排名即将冲上第二。渠道合作伙伴正加紧做防封方案,预计方案出来后用量会进一步上升。