去哪儿网:AI Coding 驱动 15 万行核心系统重构实践
去哪儿旅行国内机票团队用 AI Coding 完成约 15 万行高并发核心系统重构,总工时从约 100PD 降至 30PD,搜索主流程 P50 / P90 耗时均下降约 70%,机器资源成本节省约 45%,且无 QA 介入顺利上线无故障。
去哪儿旅行国内机票团队用 AI Coding 完成约 15 万行高并发核心系统重构,总工时从约 100PD 降至 30PD,搜索主流程 P50 / P90 耗时均下降约 70%,机器资源成本节省约 45%,且无 QA 介入顺利上线无故障。
枫言枫语最新一期播客讨论两位主播沉迷 AI 编程后人类反而成为开发循环瓶颈的现状,提到 Tibo 频繁给 Codex reset、Anthropic 给 Fable 5 解禁,两家 frontier model 的 $200 plan 都嫌 token 不够用。
Windsurf 将 SWE-1.7 和 GLM-5.2 两款模型免费开放一个月,Pro、Max 和 Teams 用户可在 Devin Desktop 与 Devin CLI 中继续使用这两个模型。
Z.ai 发布 GLM-5.3,目前仅在编码套餐中提供,之后将上线 API,两周后登陆 Hugging Face 开放权重。
以 Z.ai 被称为仅靠后训练扩展的小参数模型为切口,拆解中国实验室贴近前沿的发布节奏与数据产业因素。
Augment Code 从零重建 Auggie CLI 工具链,在 SWE-bench Pro 通过率不变的前提下,将单任务成本从 Claude Code 的 $2.70 降至 $1.27,降幅 53%。
智谱发布 GLM-5.3,基座模型与 GLM-5.2 相同,提升全部来自后训练 Scaling,官方称其为编程能力最强的开源模型。内部体感评测较 GLM-5.2 提升 50%,Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9,Agents' Last Exam 从 23.8 升至 28.5。
官方给出后训练Scaling带来的编程与安全能力实测对比,可据此判断开源模型在编程和安全任务上的位置。
Ouraca 两位联合创始人张栖铭与吴俊东复盘一年多创业踩坑:全员用 AI 后流程没变、只是旧流程被加速,真正耗时的开会对齐一分钟没省,AI 写的「先变小再播放」这类隐藏坏逻辑还让团队间歇性想退回古法编程。他们改按上下文而非职能分工、全员出原型、把公司长在 GitHub 上,会压缩到每天十分钟站会,并称一周能写十几万行代码。
Gemini 3.7 Flash 现已在 Devin Desktop 和 Devin CLI 上线,8 月 27 日前享 50% 折扣。在 FrontierCode 1.1 上,它达到 Claude Sonnet 5 级别的性能,成本不到后者一半,并具备 Flash 系列一贯的低延迟。
Windsurf 发布推文推广 Devin Desktop,附上 devin.ai/desktop 下载链接。该条内容互动量很低,仅获 6 个点赞、2964 次浏览。
Google 的 Gemini 3.7 Flash 已在 Poe 上线,官方称其为 GoogleAI 最智能的主力模型,具备快速且强大的推理能力,面向编程与智能体场景。该模型支持 100 万 token 上下文窗口,可处理文本、图像、音频和视频。
Gemini 3.7 Flash 在 @antigravity 中可依据一份架构规格,直接生成覆盖 Flutter、SwiftUI、Jetpack Compose、React Native 和 NativeScript 五个移动框架的原生生产级代码,无需样板代码。
Google Antigravity 宣布 Gemini 3.7 Flash 上线,称其为面向编码和智能体任务的最强主力模型,可下载或升级 Antigravity 试用。原推作者(Varun Mohan)转发时评价能力大幅提升且 API 成本减半。
Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体任务最智能的主力模型,带来更高的指令遵循、首轮代码准确率和智能体任务执行质量。
Google DeepMind 发布 Gemini 3.7 Flash,在软件工程、网页开发和知识工作方面带来较大升级。该版本的首发价格为原 Gemini 3.6 Flash 成本的一半。Demis Hassabis 表示这一版本在编码、知识工作和网页开发上更强。
Google 发布 Gemini 3.7 Flash,称其为面向编码和智能体的最智能主力模型,Gemini App 中的 Gemini Spark 已改用 3.7 Flash。
Google 发布面向编码与智能体的 Gemini 3.7 Flash,给出多步规划改进与限时半价,读者可据此判断工作流成本变化。
Google 宣布 Gemini Spark 从今天起改用 Gemini 3.7 Flash,该服务面向 160 多个国家的 Google AI Pro 和 Ultra 订阅用户开放。官方称 Gemini 3.7 Flash 是面向编码和智能体任务的最强主力模型,详情见其博客。
Google 在 3.6 Flash 发布仅三周后推出 3.7 Flash,称其在编码和智能体任务上有显著提升,并在软件工程、知识工作和网页开发方面带来改进,首发价格为 3.6 Flash 原价的一半。该模型已在 Antigravity 中供 Google 内部工程师使用,同时通过 Gemini API 在 Google AI Studio、Gemini Enterprise 等渠道提供。
Google DeepMind 发布 Gemini 3.7 Flash,距离 Gemini 3.6 Flash 仅三周,定位为面向编码和智能体的主力模型。
Google DeepMind 发布 3.7 Flash,相比 3.6 Flash 在调试、问题解决等关键编码任务上有明显提升,并能用更少提示词设计更实用的网页布局和应用,在真实业务工作流中的推理与准确率也有改善。
Ouraca 联合创始人张栖铭和吴俊东复盘一年多的 AI 提效踩坑:每个节点都在用 AI,版本却没快多少,因为真正写代码的时间本来就不长,大头是开会、评审、对齐,这些一分钟都没省。
Poe 宣布 Grok 4.6 已在其平台上线,该模型由 SpaceXAI 推出,面向长时间运行的智能体、编码和知识工作,提供 500K token 上下文窗口,用户可通过 poe.com/Grok-4.6 试用。
Hamel Husain 在个人站点汇总了其 AI 产品与评测(Evals)主题的长文清单,最新一篇为 9/30/26 的 Claude's new auto eval tool。
v0 上线新侧边栏,对话可按项目分组,并加入 streaming、waiting、ready 三种状态的实时指示。悬停卡片会显示网站预览、变更文件和 git 分支。
Mustafa Suleyman 在 X 上分享了 MAI-Code 的更多细节,并附上微软 AI 博客链接 microsoft.ai/news/mai-code-…。该帖未披露模型版本、参数规模或可用性信息。
Mustafa Suleyman 宣布最新代码模型上线 GitHub Copilot,相比 6 月发布的模型效率提升 25%、质量更高、成本仅为四分之一。他邀请用户在 GitHub Copilot 中试用该模型。
Martin Fowler 提出疑问:让编程智能体自行执行 TDD 是否真的有效,还是属于"对人类有益、对智能体却无益甚至有害"的罕见情形。Birgitta Böckeler 对此开展实验并在 martinfowler.com 分享了她的思考。
智谱针对 GLM 深度优化的 Coding Harness ZCode 迎来重大升级,Goal、Subagents、Remote Control 与闲时任务四大功能正式上线。
李继刚用一句话概括 AI 编程现状的转变:以前是 read-only 权限,现在是 write-only 代码。该帖获得 5 条评论、4 次点赞和 6658 次浏览。
作者用 Zig+Python 从零构建了 Coding Agent "Violin",架构借鉴 Pi 的三层分离与 EventBus 设计,核心是 Agent Loop(在"问模型"与"执行工具"间循环直至得到最终答案)。
Bolt 官方账号提出 7 个可直接通过提示词在 Bolt 站点上完成的 SEO 修复,无需插件、无需猜测,站点排名不取决于外观是否好看。
Cursor 发布博客披露其自身构建方式,官方在 X 上以「Here's how we built it」配文引流至 cursor.com/blog/how-curso…。正文仅给出博客链接与互动数据,未披露模型版本、参数或性能数字。
Cursor 指出没有模型能主导所有任务类型:Grok 4.5 在日常任务上性价比突出,GPT-5.6 Sol 擅长规划与代码库理解,Opus 5 适合执行密集型工作,Fable 5 则在调试和视觉实现上表现优异。
Vercel 在 Next.js 16.3 中引入即时导航能力,并将其应用于自家全栈编码平台 v0,使登录与未登录首页、会话详情页和设置下各子页面从阻塞变为即时。
Sahil Lavingia 发帖称,18,000 行代码曾经算是很多代码。该帖获得 35 条回复、2 次转发、100 次点赞和 14160 次浏览。
Yann LeCun 回应质疑称,其言论针对的是纯 LLM 所做的自回归 token 预测,而优秀的代码生成系统并非纯 LLM,也不只是在做自回归 token 预测。
Next.js 16.3 正式发布,Turbopack 在 next dev 下最高减少 90% 内存占用,磁盘缓存默认启用于 next build,部分项目 CI 构建提速 5.5 倍,App Router 改用原生 Node.js 流后负载下请求处理量提升 22%。
Anthropic 发布 Claude Opus 5,Google 推出 Gemini 3.6/3.5 Flash 等多款新模型,Black Forest Labs 发布可生成图像与 20 秒带音频视频的 FLUX 3。
前端开发者 Tapir 借助 Codex 在 ESP32-S3 开发板 LILYGO T-Embed 上做出名为 CadenzaOS 的操作系统,随后尝试让 AI 用 kicad-happy 画 PCB,却在嘉立创 SMT 环节因大量报错崩溃。他退回做 PCB Art 艺术板跑通闭环,并新开项目 PCB Atelier,可像 PS 一样操作图层并导出嘉立创 EDA 工程直接下单。
Binyuan Hui 转发 Andrej Karpathy 的观点并评论,认为做游戏能同时检验 LLM 的推理、规划、编码、工具库使用和多模态理解等能力,但社区仍缺少做游戏的标准化基准。
一位用户用 Claude 构建的工作流替代了每月 38 美元的 QuickBooks 订阅,该工作流可解析银行对账单、为每笔支出分类,并接入一个消费看板。该案例由 Michael Saif 分享。