宝玉:SpaceXAI 的 Lauren Tan 月并 2500 个 PR 如何不逐个 Review
宝玉引用播客内容介绍,SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR,不逐个 Review,而是晚上让 AI 自检自合并、第二天早上抽查。
宝玉引用播客内容介绍,SpaceXAI 做 Grok Bot 的 Lauren Tan 一个月合并 2500 个 PR,不逐个 Review,而是晚上让 AI 自检自合并、第二天早上抽查。
PowerTokens/video-studio 是一款面向 Windows 的 Wan 3.0 视频批量生成工具,支持 Excel/CSV 导入镜头表、任务 ID 恢复、断点下载、Key 池、CLI 与 MCP,采用 MIT License,主要代码为 Python,截至 2026 年 10 月 1 日仓库约 1 Star。
有人开源了 oil-ui 项目,探索用 AI 生成高质量界面设计的边界。其做法是让 Agent 做界面设计时先按品类和品牌推出设计方向、产出多套可对比方案,再用实际截图迭代,避免直接套用模型的默认审美模板。项目地址为 github.com/oil-oil/oil-ui。
Meta 分享了 Instagram Direct 迁移 Jetpack Compose 的经验:迁移后 UI 代码量减少 50%,AI Agent 执行时间下降 35%,工程师与 Agent 往返次数减少 32%,单次 Agent Session 的 Token 成本降低 33%。
Build A Reasoning Model (From Scratch) 系列第 6 讲由 Sebastian Raschka 讲解用 GRPO 做可验证奖励的强化学习(RLVR),这是该系列首次真正更新模型权重。
W&B 的 Zubin Aysola 演示了把 ARIA 的一次生产 trace 转成 eval,并用它来基准测试修复效果。这是「智能体出错后能否变成测试」的实操分享,完整录播见 youtu.be/XyV6bSMyq-I。相关活动将于 10 月 12–14 日在纽约举行,报名入口 ai.engineer/nyc/2026。
Monzo 的 Francesco Galletta 与 Felippe Felisola Caso 将在 AI Engineer New York 工作坊上,讲解如何构建金融分析师 harness,用来核验 AI 解释表格时给出的数字是否可信。该工作坊时间为 Oct 12,属于会议通票的附加项目,报名入口为 ai.engineer/nyc/2026。
有作者提出软件抽象的四个判断原则:深度是接口的属性而非实现的属性;用"删除测试"判断某层是否该留——删掉后复杂度若消失说明它只是转发,若复杂度回到 N 个调用方则说明该保留;接口就是测试面;只有一个适配器时接缝还是假设性的,出现两个适配器才是真实接缝。
Viking 分享 matt 的 /codebase-design 对自己帮助很大,尤其在让 AI 重构大模块时。它不修改任何代码,而是一套词典,把 module、interface、depth、seam、adapter、leverage、locality 每个词定义死,禁止用 component、service、API、boundary 等含糊说法替代,规定后边界会很清楚。
斯坦福大学「AI 原生软件开发」课程 CS146S 第二周内容已公开,主题为高级上下文工程,由 Mihail 教授讲解,分为高级提示技巧与 RePPIT 框架、MCP 与工具调用两部分。
Lucy 基于 Qdrant 构建了覆盖 2.8M+ SEC 与韩国 DART 文件的可信数据源检索层,采用四条混合检索通道,并将 payload filters 下推到查询内部而非查询后过滤。在 FinanceBench 上达到 94.7% Recall @10,仅靠检索就带来 +0.160 的答案准确率提升,且答案模型保持不变。Lucy RAG 上的开源权重模型表现超过了搜索网页的前沿模型。
Hamel Husain 将于 2026 年 10 月 6 日美东时间上午 11:30 开播一门 60 分钟免费线上课程,主题是如何通过 AI Evals 面试,报名入口在 maven.com。
Tw93 称近期有朋友的 GitHub 账号被封,原因可能是自动化 Agent 模拟浏览器操作违反了官方规定。
作者在 Claude Code 更新 Mod 功能后,自建了一个雨姐陪你写代码的 Mod,并公开在 github.com/CocoSgt/yujie-mod。
花叔以Andrej Karpathy关于AI输出理解的四个方法为起点,指出直接照抄ASD-STE100到AGENTS.md或CLAUDE.md是误用,因为这类配置每次会话都会加载,会把所有任务都往航空维修手册方向拽。
阿里「AI Native 研发范式实践手册」指出,企业级 AI 研发基础设施中最容易被忽略、也最容易自以为没问题的一环是企业知识库。多数企业只是把文档攒下来,存在目录混乱、部门规则不一、关键证据缺失、权限各异等问题,同一实时多篇文档难以确定以哪个为准。作者建议由公司牵头做知识整理、知识加工与知识供给,再输入 Agent 使用并反馈,形成闭环,并在质量、版本、权限、责任四方面持续治理。
写好 Claude Code Skill 的关键在两点:description 不是摘要而是触发时机说明,需包含能力清单、具体场景和用户触发关键词;SKILL.md 正文则应是路由器而非知识仓库,用指针指向细节文件,并统一使用祈使句而非第二人称。Anthropic 内部最佳实践给出的正文骨架包括定位、流程、边界、坑点与参考表。
斯坦福 2026 秋季课程 CS 329Z: Engineering AI Agents 前三讲讲义已统一发布在课程官网,主题分别为 Intro to Agentic Systems、LLMs for Builders 和 RAG + Agents。
CMU 秋季课程 11-768《AI Agents》第 12 讲讲义公开,主题为强化学习系统(RL Systems),由 @gneubig 主讲,聚焦如何在真实多 GPU 集群上跑通 LLM Agent 的 RL 训练。
南京工业大学适配的校园 Agent 项目 CourseRaptor 把课表、成绩、考试、通知、待办、文档生成和日历订阅拆成 31 个可调用工具,终端 TUI、本地 Web UI(127.0.0.1:3210)、QQ 机器人和无头 CLI 共用同一个 ToolLoopAgent 内核。
Jerry Liu(@jerryjliu0)在 World's Fair 2026 的演讲中探讨智能体如何解析、搜索企业业务所依赖的文档并给出来源引用。相关录播已发布,配套活动将于 10 月 12 日至 14 日在纽约举行。
Stanford AI Lab 分享了一场关于语言模型 tokenization 的演讲,题为《Tokenizer 迷思与如何破除它们》,相关预印本即将发布。演讲由 Rylan Schaeffer 主讲,聚焦 tokenization 中一些有趣且可能出人意料的特性,并公开征集反馈。
微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。
4.6k Star 的 Paper-Writing-Tips 将论文写作经验整理成可供 Claude Code 调用的 paper-writing skill,可检查 LaTeX 排版、公式符号、图表、引用、英文表达和匿名信息。
一篇博客详解前沿文生图模型的后训练流程,涵盖 rubric 奖励的构建方式与完整离线评测方案。文章还给出可视化前后对比,展示作者发现并捕获的奖励攻击(reward hacking)失效模式。
Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。
Datawhale 开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,覆盖 State 状态表示与 Choice、Score、Noul 三种核心问题原语。
一篇 LLM 面试题整理,从 Transformer 架构讲起,覆盖 Self-Attention 数学原理、Multi-Head Attention 代码实现。
Mole 开发者用 AI 写的本地脚本,按月份和国家语言给开售至9月底所有未激活用户重新发送 license key。下个版本付款后会自动跳转官网激活页面,用户点击激活即可一键唤起 Mole 客户端并自动填充 Key,邮件填错或被拦截也能第一时间看到。
这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。
LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。
元宝内置 AI 创作上线 Hy Image3.5 preview,网页和手机端均可免费使用,提供 25 种 AI 修图玩法,并内置大量可直接套用的提示词模版。玩法覆盖人像、风景、美食三类旅行照,包括黑白漫画拼贴封面、MBTI 登机牌、美式复古贴纸海报、JRPG 任务界面和 3D 城市地图定位等。模型在多文字信息图中可保持文字稳定,半身照也能补全全身。
Skip Labs 正在开发一门面向响应式编程的编程语言,以及专为 AI 智能体设计的约束式工具。Stack Overflow Blog 与 Julien Verlaguet 就此进行了交流;同期 Populist 徽章由 s0nix 获得,其回答针对「Git through Visual Studio Code is unusably slow」。
Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。
Claude Code 可在输入框上方显示上下文读数,危险命令执行前先查看影响,再按步骤复核一轮修改。另有三个官方例子讲清 Mods 的作用与写法。
老照片修复可分三轮完成,每轮只处理一个目标:先清除划痕和污斑,再上色,最后调整为更清晰的现代摄影质感。上色不满意时容易定位到该轮重新调整,同时保留此前已完成的损伤修复成果。
阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。
Andrej Karpathy 提出,随着语言模型变强,人的工作会更多转向监督和理解模型输出,并分享了几条让输出更易读的技巧。他建议让 LLM 用航空维修文档领域的受控语言规范 ASD-STE100 来写作,或尝试放宽到 80% 的程度;相比文字,让 LLM 生成图表更易理解,进一步可以让它输出 HTML 交互网页。
Bolt.new 官方演示了如何构建一个根据 UTM 参数自动调整内容的自适应落地页站点,让不同来源和行为的访客看到匹配的页面,而非统一投放到同一落地页。该方案通过识别 URL 中的 UTM 参数来动态改变站点呈现。
LangChain Academy 更新了《Introduction to Deep Agents》课程,Deep Agents 让构建智能体更简单,Managed Deep Agents 则支持用单条 CLI 命令完成部署。课程还演示了如何把智能体部署到 Slack。