GitHub Podcast 回应三大热门争议:AI 生成代码该不该审查、RAG 是否过时、Skills 是否让 MCP 淘汰
GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。
GitHub Podcast 针对三个热门议题做出回应:AI 生成代码是否需要审查、RAG 是否已经过时、Skills 是否让 MCP 变得多余。相关讨论发布在 GitHub 博客的 AI 与 ML 栏目。
2026云栖大会首日,阿里公布大模型系列进展:基于新一代架构的Qwen4已在训练中,未来Qwen4.5、Qwen5等版本将扩展至5-10T参数;Qwen3.8-Max在人类零参与下自主迭代超1个月、完成33轮有效迭代,并在平头哥新款GPU上自主优化Qwen3.8-Flash推理框架,单实例推理吞吐量提升96%。
Boris Cherny 用 Opus 5.5 对 Claude Agent SDK 做形式化验证,几段简短提示词就产出 16 个 PR,修复多个 bug 和竞态条件,TLA+ 同样适用,他还常把 Lean 与 TLA+ 结合排查数据流、并发与状态管理问题。他表示自己并不熟悉这两门语言,但 Claude 都很擅长,认为这种方式能发现人眼难以察觉的 bug。
Browser Use Bench v2 的帕累托前沿被重画,Claude Opus 5.5 得分 59.4,GPT-6 Sol medium 得分 66.9 且成本低 3.5 倍,GPT-6 Luna xhigh 得分 57.6,比 Opus 便宜 22 倍。这些模型均可在其云端试用,横轴为对数刻度。
网易集团副总裁、网易智企 CEO 阮良在访谈中披露,网易内部统计个人用 AI coding 效率提升 300% 甚至 500%,但整个软件交付流程只从 20 天缩短到 17 天。
作者认为用 AI 写代码时记忆缺失、改完即停、会犯错是三个主要断点,因此给 AI 套上一层 Harness 系统。做法上先建两级索引知识库并只记阴性知识、代码位置索引和隐含关联关系,再用 hook 硬拦截让 AI 先读索引;随后用访问、提交、等待、本地验证四个 skill 补上手脚,并把排查到线上验证的步骤写死成 close-loop 等 command。
任鑫与徐文浩对谈认为,OPC(一人公司)降温的核心原因是找不到谁给你付钱,多数人只是失业后自我包装,重要的是赶紧卖而不是积累技能。徐文浩判断 FDE 与外包并无区别、只是填补企业渗透 AI 缝隙的阶段性职能,缝填完就会消亡;两人分歧在于他看终局、任鑫看窗口期。徐文浩表示国产模型已能胜任其日常约 80% 的开发工作,日常任务分不出与 GPT、Claude 的差别,但长程复杂大任务仍是例外。
Epoch AI 发布家具组装基准 FAB,用 60 张宜家家具组装照片(含故意设置的错误)测试模型能否识别装配错误并获得装配手册与查看工具。
Modal 分享了为 Moonshot AI 的 Kimi K2.6 模型优化推理服务以支撑编码智能体的实践,单副本每用户性能提升 2.8 倍、跨用户提升 5.6 倍。
Vercel Sandbox 的 Drives 持久化存储现已开放公测,Hobby、Pro、Enterprise 用户均可使用。Drive 可跨沙箱实例挂载复用,用于保存智能体工作区或复用数据集、模型和依赖树;每个沙箱最多挂载 4 个 Drive,默认上限 1 TiB(Hobby 为 1 GiB),可配置至 16 TiB。
Anthropic 更新 Opus 5.5,每百万 token 输入 4 美元、输出 20 美元,比 Opus 5 降 20%,缓存读取从 0.5 美元降到 0.2 美元,已在 Claude Code 2.1.280 中设为默认 Opus 模型,支持 1M 上下文。
作者用11道题横测Opus 5.5、Opus 5与Fable 5.1,给出真实账单与失败案例,可据此判断默认档位的取舍。
Anthropic 发布 Claude Opus 5.5,OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,两款 GPT-6 新模型已上线 Codex,但尚未在 ChatGPT 聊天中提供。
同一晚两家旗舰同代下放,对比价格、终端任务分数与实测体验,可看前沿能力下放的性价比取舍。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在一次线上 A/B 测试中,较晚训练的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
Augment Code 宣布 OpenAI 的 GPT-6 Sol 与 Luna 已在 Cosmos 中可用。该公司表示将在未来几天把全部工作流从 GPT-5.6 系列模型升级到新模型,并评估其对软件工厂的影响。
Perplexity 公布其 Computer 智能体后训练方法,结合拒绝采样微调(RFT)与提示引导自蒸馏,让模型模仿优质轨迹并显式纠正错误工具调用。在线 A/B 测试中,后训练 checkpoint 将工具调用失败率相对降低 21.2%。
Perplexity 通过提示引导自蒸馏(hint-guided self-distillation)对 Computer 模型进行后训练,让模型从自身错误中学习。在线 A/B 测试中,较晚训练出的 checkpoint 相比早期 checkpoint 将工具调用失败率相对降低 21.2%。
LangChain 发文介绍 Included Health 与 Abridge 如何用 LangSmith 将稀缺的临床专家评审转化为可复用资产,包括标注数据集、校准后的评估器和自动化发布门禁。
Sluicebox 构建了名为 Lucy 的 AI 供应商智能体,用于梳理零部件清单、文档和供应商邮件等数据,帮助工程师在设计阶段就了解数据中心碳足迹。Lucy 基于 NVIDIA Nemotron 3 Ultra,在 Sluicebox 测试中提升了准确率,成本降低 51–80%,响应速度最高提升 2 倍。
xAI 围绕 Grok Bot 重建客户支持体系,由其自主响应客户、解决工单并管理队列,从而在不增加人手的情况下扩展业务。团队回忆约 1.5 年前为应对巨大咨询量曾做出第一版粗糙实现,当时总结的「爬、走、跑」经验至今仍适用,并强调要找到持续改进的飞轮、保持系统运转。
Meta 消费级智能体 Muse 以每周 1 亿 token 免费额度上线,首日下载量超过 70 万并登上 App Store 榜首。Citrini Research 认为,Muse 的意义不在技术能力,而在于触达规模,标志着大众首次真正从消费级智能体中获益。该机构同时复盘其 2023 年 6 月提出的“AI 冲击”框架,认为由智能体消除摩擦带来的商业模式颠覆正在逐步被市场定价。
Anthropic 的 Claude Opus 5.5 现已在 Cosmos 上线,运行其上的智能体任务成本仅为 Opus 5 的 40%。官方称这是 Claude 重度用户的必选升级,并期待该模型为客户的软件工厂带来更好的结果。
LangSmith 更新了追踪视图,用于更清晰地展示 Jev 类决策模型的调用,呈现状态、问题、选项与输出等信息。这些 Jev 类调用出现在由大量 LLM 调用组成的 LangSmith 智能体复杂系统中。
Lovable 宣布其构建能力现由 Claude Opus 5.5 和 GPT-6 Sol 两个新模型驱动,用户无需自行选择用哪个模型。Lovable 会对每个新模型进行测试、调优并决定路由方式,以保证构建效果最佳,同时平台也已支持 Fable 5.1 构建。
GitHub 宣布 GitHub Copilot 的 GPT-6 系列新增两款模型并正式开放使用。GPT-6 Sol 定位为兼顾交互与智能体编码的均衡模型,GPT-6 Luna 则是面向较小任务的轻量低成本模型,为该系列中成本最低的选项。用户可在 GitHub Copilot 应用或 code 中使用。
Sam Altman 表示 GPT-6 Sol 和 Luna 相比 5.6 家族前代,在智能、对齐、工作产出、编码和计算机操作等方面都有大幅提升,每 token 价格减半,按任务计费则更低。他还称若按每任务价格这一应当关键的指标衡量,市场上没有可竞争的产品,并希望人们能大量使用 AI。
Sam Altman 称 GPT-6 Sol 和 Luna 在智能、对齐、工作产出、编程、计算机操作等方面均大幅超越 5.6 系列前代模型。两者每 token 价格为前代的一半,单任务成本更低。
Cognition 宣布 Devin Desktop 和 Devin CLI 现已开放使用,用户可通过 devin.ai/download 下载体验。
Cognition 表示,在其评测中 GPT-6 Sol 达到相同分数时读取的上下文比 GPT-5.6 Sol 少约 17%,且最后一次编辑后很少留下测试失败的仓库。GPT-6 Luna 的最大提升出现在低和中等推理强度下,会编写真实的回归测试而非基于 mock 的测试。更多内容见 devin.ai/blog/gpt-6-sol。
GPT-6 Sol 和 Luna 已在 Devin 上线。在 FrontierCode 1.1 上,GPT-6 Sol 与 GPT-5.6 Sol 得分持平,但每任务成本低 61%;GPT-6 Luna 得分高于 GPT-5.6 Luna,成本约为后者的四分之一,每任务低于 $0.10,是该榜单上最便宜的模型。
OpenAI 面向 Plus、Pro、Business、Enterprise 和 Edu 用户,在 ChatGPT Work 与 Codex 中上线 GPT-6 Sol 和 Luna,两款模型同时开放 API。Free 和 Go 用户可在桌面应用试用 GPT-6 Luna。
OpenAI 官方公布 GPT-6 Sol 与 Luna 的开放范围,读者可据此确认不同订阅档位和 API 的可用差异。
Lovable 披露其模型选型流程:每周测试新模型并调优,再决定路由方式,以保证构建效果最佳。文中提到 Lovable 现已支持 Fable 5.1,并附上官方博客对其模型理念的完整说明。
DolphinBench 是一个新的智能体记忆基准,在长历史对话后直接评测智能体的动作是否正确,而非问答式打分,并把准确率、成本与延迟放在同一张榜单上。它针对现有记忆评测已趋于饱和、且忽略选型时最关键的成本与延迟问题,主张关注工具调用中真正决定成败的事实。
Anthropic 的 Claude Cowork 和聊天将合并为一个统一的 Claude,用户既可以快速提问,也可以把一份报告交给 Claude 处理,即使合上笔记本它也会继续推进。遇到不清楚的地方 Claude 会主动询问,最终决定权仍归用户,该功能将在未来几周内向 Pro 和 Max 用户逐步推出。Alex Albert 提醒用户确认已更新到该版本,尚未更新的也即将全面推送。
Opus 5.5 现在能在 Claude.ai 中用单条提示词驱动 Blender 制作黏土动画。发布者 Alex Albert 展示了这一效果,相关推文获得 2639 次点赞和 26.6 万次浏览。
Firecrawl 完成 7500 万美元 B 轮融资,其 API 已服务超 150 万名开发者,用于把网页转成 AI 智能体可用的结构化数据。同时推出知识库 Alexandria,让智能体可搜索实时网页、官方数据源以及科学论文、开发者文档和政府记录等专用索引。数据提供方可在智能体使用其数据时获得付费,Firecrawl 计划向所有愿意共享知识的人开放这一机制。
论文《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》已在 Hugging Face 论文页发布,提出对 Agent Harness 进行正则化递归自我改进的方法。该工作由 AK(@_akhaliq) 分享,发布当日在社交平台获得 8 条回复、21 次转发和 80 次点赞。
Anthropic 的 Claude Opus 5.5 已在 GitHub Copilot 中正式可用。GitHub 称早期测试显示它在效率上表现突出,任务解决能力与 Claude Opus 5 相当,但所用步骤和 token 明显更少,在多步任务中还能快速从错误中恢复。
AI SDK 新增对 Anthropic Claude 的支持,相关提供方文档已在 ai-sdk.dev 上线。该条信息由 AI SDK 账号发布,并同时提及 Anthropic、Claude 与 Vercel。
Daniel Hunter 晒出自己当前的配置:4 个强大智能体共用一个家。该帖被 Akshay Kothari 转发引用,附带的引用推文显示互动量为 8 条回复、6 次转发、151 次点赞、16405 次浏览。
AICC2026 人工智能计算大会上,播客屠龙之术梳理出三条主线:从 Chat 到 Agent 的需求侧结构性跃迁、智能从概率拟合转向可信生产、以及算力与芯片在系统、器件、生态上的突围。会上 IDC 与浪潮信息联合发布《中国人工智能计算力发展评估报告》,并提到浪潮信息的智算系统双唯进化主张与新产品、芯算一体、让计算走进存储,以及 FlagOS 生态下的国产模型与国产芯片 Day 0 适配。