Java Annotated Monthly 2026 年 9 月刊:JDK 27 发布与 AI 专题
JDK 27 正式发布,包含九个 JEP,默认启用的紧凑对象头(JEP 534)将对象头从 96 位压缩到 64 位,堆占用降低 10%–20%、吞吐量提升 5%–10%,G1 也成为所有环境下的默认垃圾回收器(JEP 523)。
JDK 27 正式发布,包含九个 JEP,默认启用的紧凑对象头(JEP 534)将对象头从 96 位压缩到 64 位,堆占用降低 10%–20%、吞吐量提升 5%–10%,G1 也成为所有环境下的默认垃圾回收器(JEP 523)。
Genspark 宣布 Muse Spark 1.3 已在其平台上线,覆盖 AI Chat、Code Agent 和 Claw。该模型被描述为 Meta 面向智能体时代的最强模型,在内部对比中比 Muse Spark 1.2 减少约 20% 工具调用和约 25% token 消耗。
作者 lencx 介绍了自己新项目采用的围绕 AI 反馈闭环的技术栈,包括 pnpm v12、TypeScript v7、Vite v8、Oxlint、Oxfmt、React 与基于 StyleX 的 Astryx,目标是缩短 AI agent 从修改代码到获得有效反馈的周期。
脉脉创始人兼 CEO 林凡走访 OpenAI、Anthropic、Google、Meta 后判断,AI 岗位需求已连续两年同比 10 倍增长,非 AI 岗位普遍缩招。他提出 AI 人才分基座技术、应用开发、业务效能三类,核心门槛是让 agent 自主运行超过 1 小时。企业内部 AI 落地需开放文档库、代码库等数据,OpenAI 用 9 个月完成全员 AI 覆盖。
Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。
吴恩达指出,让编码智能体长时间自主运行既昂贵又往往低效。他总结顶尖 AI 从业者的真实工作流:依靠娴熟的人类判断、高度迭代的规划和频繁的输出验证,开发者应学会引导智能体工作流、校准其自主程度并建立稳健的测试机制,把时间花在架构与规格撰写而非逐行写代码上。
Mind Lab 研究员逯雨鑫以个人开发者身份,用约两周时间、一张 5090 显卡和数百美元成本(含 200 美元的 Claude Max Plan)后训练出两个登顶 Hugging Face Model Trending 榜的模型,把 agentic 场景的 benchmark 从底座模型的 15 分提升到 55-60 分。
在 X 工作近 7 年的 ML Infra 工程师赵迪已加入 OpenAI,他称马斯克是"the biggest asshole"但仍然敬佩,认为马斯克裁员、按第一性原理做事能让人做到不可能的事。他自研的 Rust 推理引擎 Navi 曾将 X 推理性能提升一个数量级,为平台省下几百万美元。他还表示 OpenAI 内部 Codex 使用量年初至今增长 8 到 10 倍,亚太地区涨幅达 12 倍。
OpenAI 迄今最强的模型 GPT-6 Astra 已在 Cosmos 上线,在长程编码和多步智能体任务上有显著提升。用户可通过 augmentcode.com 提交高难度任务,该模型适合在假期周末长时间运行。
GPT-6 Astra 已在 Devin Desktop 和 Devin CLI 上线。在 FrontierCode 1.1 上,Astra 的成绩与 Fable 5 相差 0.4 分以内,成本却低 64%,并在内部测试基准上刷新 SOTA,能生成更全面的测试、更清晰的报告和更好的视频证据。
DeepLearning.AI 的 The Batch 本周汇总多条动态:OpenAI 与 Anthropic 公布新的企业数据留存政策,Zai 发布高性价比开放权重多模态系统 GLM-5.3-Flash,Thomson Reuters 推出 397B 参数、专为法律金融新闻工作训练的模型。Andrew Ng 则解释使用编程智能体需要一套自己的基础技能。
Satya Nadella 在推文中分享了一个 GitHub 官方博客链接,指向 github.blog 的 AI and ML 板块内容,并附上"Try it out"邀请读者试用。推文未透露具体产品、模型或功能名称。
GitHub Copilot 引入 HydraFusion,通过多模型协同完成规划、构建、批评与补全等编码任务,最高可降低 67% 成本。Satya Nadella 称其体现了异构模型生态的价值,标志着行业从模型选择转向模型编排,并推动成本与成果边界的持续优化。
Andrew Ng 发布 AI Engineering Skills Map,用于指导如何高效使用 AI 编程智能体。该技能图谱聚焦使用编程智能体所需的最重要技能,完整内容以 X 文章形式发布。
作者用千问办公对阿里 Qwen3.8-Max-0902 做了七个场景实测,涵盖投行报告转滚动网页与 PPT、烹饪知识网站、3D 迷宫寻宝、8-bit 横版过关、声控游戏、在线德州扑克和骑自行车 SVG 动画。
OpenClaw 发布 2.0 版,共有 933 位贡献者、合并 16000 个 PR,作者据此判断这些 PR 几乎都未经代码审查、由 AI 直接合并,并再次建议不要在办公电脑上运行它。文章还提到 SolidJS 创始人 Ryan Carniato 感叹 AI 推动技术栈向 React、Rust 等主流方案迁移,担忧软件生态走向单一化。
GPT-6 Astra 用一周时间在 Unreal Engine 中构建出一座曼哈顿城市场景,并能逐条街道精细打磨每个细节。这条演示由 Matt Shumer 发布,被评论者称为「GTA7 is gonna be sick」。
快手电商商家与运营赋能中心构建了覆盖需求、Spec、Dev、Test、Oncall 全生命周期的自动化交付流水线(Harness Engineering),目标需求吞吐率提升 30%、平均交付时长下降 40%。
DeepSeek 发布第四代两款模型中较大那款的正式版 DeepSeek-V4-Pro-0813,采用总参数 1.6 万亿、每 token 激活 490 亿的 MoE 架构,支持 100 万 tokens 输入与最高 384,000 tokens 输出,并提供可调推理、工具调用和上下文缓存,权重以 MIT 许可证开放。
Gemini-3.8-Flash 已在 Genspark 上线,接入 AI Chat、Code Agent 和 Claw。Google 同步推出 Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber 两个变体,称其为迄今最强的推理与编码模型,并借助长时运行的智能体循环,在 3.7 Flash 发布三周后继续迭代。
Varun Mohan 公开回应 Theo 的评论,称其部分说法不实,要求对方了解实际情况并修改帖子澄清。他提到团队正在讨论把 harness 和订阅开放到其他界面,但需谨慎,因为这会带来新的滥用途径。
歸藏开源了 Skill「Yingzao·营造」(github.com/op7418/guizang-yingzao-skill),可将旅行照片重排为带字体设计和文化信息的海报。
bolt.new 官方演示:只需对 bolt.new 说“为这个网站生成 Open Graph 图像和 favicon 并加入项目”,即可让分享链接在短信、私信和帖子中显示自定义图片,之后重新发布(Republish)即可生效。
Replit 上线免费模式(Free Mode),用户可在不担心 token 成本的情况下持续迭代并原地构建。构建过程中 Replit 会自动为任务挑选最合适的模型,避免为简单任务多付费用。作者认为 token 成本下降、模型变强、人人都能自动化构建,成本效益型模型比前沿模型更值得看好。
Proximal 发布超长程编程基准 FrontierSWE v2,新版本扩展了任务集并改进评测方法。各前沿模型在该基准上存在明显性能差距,Claude Fable 5.1 以较大优势领先。
Cursor 发布 CursorBench 完整评测结果,详情见 cursor.com/cursorbench。官方未在推文中披露具体模型版本、分数或价格等信息。
Google 的 Gemini 3.8 Flash 已在 Poe 上线,主打快速、低成本,面向编程和智能体场景,可在 Flash 速度下提供较强推理能力。该模型支持 1M token 上下文窗口、网页搜索和可调节的思考等级。
Google DeepMind 的模型在 CyberGym 等基准测试中领先,能自主发现软件弱点,同时保持快速高效。在 Google Chrome 代码库的真实测试中,它产出的有效修复数量是此前的 2.6 倍,帮助更快保护软件。
Gemini 3.8 Flash 发布,这是 Gemini 在不到一个月内的又一次升级,也是 6 周内第 3 个更新的 Flash 模型,智能体与编程能力再度提升。同时推出的 Gemini 3.8 Flash Cyber 面向网络安全防御前沿。更多模型与网络安全工作细节见官方博客。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,称前者在软件工程、智能体任务和多步推理上有明显提升,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
官方披露了两款新模型的基准表现、定价与访问渠道,可用于对比 Flash 系列在编码与网络安全能力上的迭代节奏。
AI SDK 宣布支持使用 Gemini 3.8 Flash。Google 发布 Gemini 3.8,称其为目前推理与编码能力最强的模型,并基于 3.7 Flash 推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个新变体,依托长时间运行的智能体循环构建。
Firecrawl 的 Developer Index 在仓库检索评测中以 63.1% 平均分位居整体第一,拿下 issues/PRs 和 docs 两个赛道。原生网页搜索在查找仓库上表现良好,达 80.7%,但 docs 是最难的赛道,没有系统超过 50%,Developer Index 以 47.2% 领先该赛道。
Google 发布新 3.8 Flash 模型,这是六周内的第三次 Flash 发布。官方称其在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升,在 DeepSWE v1.1 上能以更低成本自主端到端解决复杂工程问题,表现超过多数更大的前沿模型。
Google 发布 Gemini 3.8,称其为目前最强的推理与编码模型,并推出 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 两个变体,依托长时运行的智能体循环。
Google 发布 Gemini 3.8 Flash,在智能体与编码能力上较 3.7 Flash 有显著提升,且价格与 3.7 Flash 保持一致。
Google 最新 Gemini 3.8 Flash 模型今日起面向 Pro 和 Ultra 用户开放。该模型主打更可靠、更全面的回答,可处理日常话题的实用建议,以及文本分析、复杂编程等深度任务。
Google 发布 Gemini 3.8 Flash,官方称其在智能体与编码能力上又有提升。这是 Gemini 在六周内第三次更新 Flash 模型。
Google DeepMind 发布两款新 Gemini 模型。Gemini 3.8 Flash 官方称为目前最智能的模型,在软件工程、智能体任务和多步推理上较 3.7 Flash 有明显提升;Gemini 3.8 Flash Cyber 面向网络安全,具备前沿水平的漏洞检测与自动修复能力。
Martin Fowler 分享 Rachel 的文章提出,问题或许不在于 AI 破坏了代码审查,而在于我们一直用代码审查去解决错误的问题。
得物小摊从 0 到 1 孵化中由一人同时负责 H5、运营后台、Node 网关和 Go 服务,AI 并行参与多模块后,作者把重点从写 Prompt 转向 Delivery Harness,用 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件接管交付状态。