RemoveMacAI 开源工具可关闭 macOS 27 Apple Intelligence 并回收模型空间
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
开源工具 RemoveMacAI 面向 Apple Silicon Mac,通过系统配置描述文件关闭 macOS 27 的 Apple Intelligence 并调用苹果资源管理服务删除已下载的基础模型、图像生成等模型文件,作者称无需关闭 SIP,已测试 macOS 27.0。具体回收空间取决于设备上已有的模型,删除后统计可能延迟更新,且关闭开关并不必然释放空间。
智谱(Z.ai)的 GLM 5.3 现已在 Amazon Bedrock 上线,这是一个 753B 参数的 MoE 模型,面向编码与长时程智能体任务,Z.ai 报告其在 CyberGym 基准上取得 84.5 分。
OpenAI 演示了 Codex CLI 的用法:可用语音启动任务、跨项目管理和切换多个智能体,还能在单独的 worktree 中探索另一条实现方向。该演示面向长期在终端里工作的开发者。
据 The Information 10 月 5 日报道,Meta 和微软正在减少员工内部使用 Anthropic 的 Claude,转向自家模型和工具。Meta 内部使用 Claude Code 的员工从年初约 6 万人降至最近约 3 万人,同时推广自研 Muse Code(已有超 6000 名员工使用,8 月起对外部客户测试)和内部工具 MetaCode(用户超 3 万)。
有观点认为 Cursor Ultra 的性价比其实不错。原文未给出具体价格、功能或额度等细节。
宝玉给出 Debug Codex/ChatGPT Mac App UI 的步骤:退出正在运行的 Codex App,在命令行执行 open /Applications/ChatGPT.app --args --remote-debugging-port=8315 --remote-allow-origins= http。
Reflection 推出 Beam,一个总参数 501B、激活 23B 的高效智能体开放模型,主打前沿推理效率,并在编码与智能体任务上推进西方开源前沿,从零端到端训练。完整权重将于本月发布,详情见 reflection.ai/beam。
Reflection 发布首款模型 Beam,一款面向智能体的高效开源权重模型,总参数 501B、激活参数 23B,主打前沿推理效率,并在编码与智能体任务上推进西方开源前沿,从零端到端训练。完整权重将于本月发布,详情见 reflection.ai/beam。
NVIDIA 将 Nemotron-Labs-3-Competitive-Coding 发布到 Hugging Face,这是一个基于 Nemotron-3-Ultra 的竞赛编程专用模型。
Reflection AI 发布名为 Beam 的高效智能体开源模型,总参数 501B、激活参数 23B。官方称其在编码与智能体任务上推进了西方开源前沿,主打前沿推理效率,并从头端到端训练,完整权重将于本月发布。
Reflection AI 推出高效智能体开源模型 Beam,总参数 501B、激活参数 23B,从零端到端训练,主打前沿推理效率并推进西方开源模型在编程与智能体任务上的边界。Ollama 表示更多美国模型将接入,Beam 完整权重本月发布。
Mistral 的 Vibe 能把一个任务拆分给多个 subagents,每个 helper agent 各负责其中一部分,比如搜索代码库。新增的 subagent 管理视图支持在主对话中直接启动 subagents,并在它们执行任务时下发新指令,无需离开当前对话。
Mistral Vibe 终端编程智能体新增三项功能:智能批准模式、GLM 5.3 模型,以及新的子智能体管理方式。官方未披露三项功能的具体参数与可用范围。
Cursor SDK 新增对本地 TypeScript 智能体的 steering 与系统提示词支持,后台子智能体的结果可在 TypeScript 和 Python 中本地返回。更多更新详见官方 SDK 变更文档。
Cursor 允许用户用自己的 system prompt 替换内置提示词,Rules、skills 和 tool schemas 仍会正常加载。该功能正按账号逐步开放。
Fireworks AI 宣布 DeepSeek V4.1 Flash 现可在 Dedicated Training API 和 Managed Training 两个入口上训练。官方称它是智能体编码、终端自动化和工具调用的强基础模型,且服务成本很低,并给出了微调文档链接 docs.fireworks.ai/fine-tuning/mo…。
在 NYC 听证会上,@DKokotajlo 呼应 @hilbertspaess 的观点,指出如今大部分代码由 AI 编写,且审查不够仔细,Gary Marcus 称这令人担忧。
Gary Marcus 引用并认同 @hilbertspaess 的观点:如今多数代码由 AI 编写,人们已不再仔细检查这些代码,把如此多的内容交给 AI 是不负责任的。
一项名为 SelfSearch 的研究让 AI 智能体基于此前自我修改的记录来改写自己的指令、工具与流程,编码智能体借此在 DeepSeek V4 Flash 上以 4.03 美元的搜索成本解出 Terminal-Bench 2.1 的 82.0% 任务,无需搜索期间的任务奖励。
Hugging Face 的 Clement Delangue 介绍,团队在不改动 harness 和训练代码的前提下,把 Claude Code、Codex。
Guillermo Rauch 发布 gdp-ts,一个面向 TypeScript 的库、linter 和 AI 技能,用于更安全的 API 设计。按该约定,敏感函数需要调用方提供已执行授权检查的 proof,由类型检查器在编译期验证这些 proof,防止团队和智能体提交严重安全 bug。
ContextQA 推出自主质量工程师 Ship,可从 Slack 或 Linear 接收 bug 报告并复现,再把上下文交给 Claude Code 或 Codex 完成修复。该工具面向已部署的 PR 进行测试,用户可免费在 ship.contextqa.com 试用。作者指出,编码智能体需要这类反馈闭环,才能更好地修复自身 bug,而验证 agent 写的代码正成为软件工厂的一大瓶颈。
作者开源了一个「小说转漫画」skill,为 Codex 安排从读原文、写分镜到排版导出的完整制作顺序,并配合 ChatGPT 生图模型出图,最终提供离线阅读器、PDF 和 CBZ 漫画文件。
freeCodeCamp 发布教程,讲解 AI 编码智能体为何会陷入反复修复不成功的循环,并给出停止、回退、重新描述、单点修改、真实验证五步流程。文章以一次重复扣费 bug 为例,展示先写失败测试再向智能体提精确需求的做法,修复本身只有十几行代码,并附一份可复用的检查清单。作者指出该模式在 Lovable、Replit、Cursor、Claude Code、Base44 等工具上都会出现。
有用户抱怨近期 ChatGPT 体验灾难性:Astra 太贵用不起,Sol 6 速度慢且出现幻觉、忽略指令;Luna 档也明显退步,指令明确的小任务频繁崩,没做完就称提前完成,服务重启失败后直接放弃修复。原本用它搭档 Coding 很顺畅,如今需频繁检查实现,稍复杂任务就来回搞不定。
逛逛GitHub 盘点 9 月 GitHub 上 20 个热门开源项目,月增 Star 最高的是 Archify,约 3.34 万,用 Skill 把系统描述或代码仓库画成交互式架构图;Ponytail 以约 3.12 万 Star 教 Agent 优先复用现有代码。
Epoch AI 基于 OpenAI 2026 年 9 月发布的内部数据整理发现,OpenAI 研究人员的编码智能体使用量约每月翻倍。按 API 价格计价,中位数研究员的日均编码智能体支出从 2026 年 1 月的不足 1 美元升至 8 月中旬的 601 美元,第 90 百分位研究员同期超过 7000 美元。
OpenAI 给 Codex 用户立下 28 天规矩:每天要么上线一项对多数 codex/work 用户明显有用的改进,要么把用量额度整个重置一次。该承诺由 Tibo(@thsottiaux)在 X 上发布。
Matt 的 /codebase-design skill 不修改任何代码,只用一套词典把 module、interface、depth、seam、adapter、leverage、locality 等词定义死,禁用 component、service、API、boundary 等含糊替代。
乔木剪藏插件更新,为 B 站新增字幕条,支持复制、下载和进入学习模式,YouTube 工具条样式也做了优化,更接近官方插件风格。新增按三次 i 唤出输入框随时记录,内容写入 Obsidian 今日笔记。
宝玉认为,Lauren 敢不 Review PR 的前提是能用上 Fable、Opus 5.5 这类最强模型且不用考虑 Token 成本,而 GPT-6 操作电脑的水平虽已超过真人,也只能替代一部分验证工作。他建议从自己日常开发流程出发,把手动重复的环节交给 Agent,再沉淀成 Skill 反复迭代,同时方向仍要靠专业判断来指。
OpenAI 产品负责人 Tibo Sottiaux 预告下一代模型将更擅长删除和简化代码,并在评论中透露「6.1 coming soon」。负责 coding post-training 的研究员 Rajan Agarwal 同时向用户征集模型的 sloppy code 案例。
红杉资本合伙人 Konstantine Buhler 提出,脑力劳动正沿着体力劳动的老路机械化:约两百年间体力劳动从 99% 由生物完成变为 99.9% 由机器完成,而不远的未来 99.9% 的脑力劳动也将由机器完成,认知革命规模更大、速度更快。
Meta 分享了 Instagram Direct 迁移 Jetpack Compose 的经验:迁移后 UI 代码量减少 50%,AI Agent 执行时间下降 35%,工程师与 Agent 往返次数减少 32%,单次 Agent Session 的 Token 成本降低 33%。
GitHub Copilot 应用将 diff、终端和浏览器并排显示,让开发者在一个界面内检查、运行并预览智能体代码,无需在标签页之间来回切换。GitHub 在 X 上发布了这一演示视频,浏览量超过 9.2 万。
开发者正在做一个 YouTube 学习辅助插件,支持读取字幕、跟随时间轴查看、中文翻译和 AI 对话。实测中 GPT 6.1 Sol 远不如 Opus 5.5 靠谱,界面和功能越改越糟、Bug 越来越多,目前正交给 Opus 5.5 收拾烂摊子。
Viking 分享 matt 的 /codebase-design 对自己帮助很大,尤其在让 AI 重构大模块时。它不修改任何代码,而是一套词典,把 module、interface、depth、seam、adapter、leverage、locality 每个词定义死,禁止用 component、service、API、boundary 等含糊说法替代,规定后边界会很清楚。
Vercel CEO Guillermo Rauch 提出用客户反馈的修复响应时间来衡量一家公司有多 Agent 化,认为能在 30 分钟内修好所有问题的企业会打败需要 2 天的企业。他强调快不等于方向正确,工程师不必逐行读代码,但要懂系统边界与取舍,否则模型会把项目带偏。他还主张把开发流程放进云端沙箱以隔离供应链攻击,同时保留本地选项。
针对 GPT 生成代码,有观点认为其强化学习过度奖励“测试通过、能跑、无报错”这类易量化结果,导致模型倾向用捷径快速交付,却忽视架构设计与可维护性。作者还指出训练视野过短、缺少写完后自我审查,并推测评测器与训练数据质量会放大“工程品味”缺失,Anthropic 在高质量数据上的投入可能让 Claude 代码结构更好。
作者在 Claude Code 更新 Mod 功能后,自建了一个雨姐陪你写代码的 Mod,并公开在 github.com/CocoSgt/yujie-mod。