Andrew Ng 推出新课 Transformers in Practice,与 AMD 合作讲解 Transformer 推理
Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。
Andrew Ng 推出新课程 Transformers in Practice,与 AMD 合作、由 Sharon Zhou 讲授,面向实践理解 Transformer 大语言模型的工作方式。课程涵盖 token 逐个生成、注意力机制、量化加速 GPU 推理,以及模型幻觉、RAG 与链式推理等内容,并配有交互式可视化。
Martin Fowler 提出一种为 LLM 准备大量上下文的方法:与其自己动手写,不如让一个 LLM 来访谈自己,把访谈内容整理成可用上下文。相关文章发布在 martinfowler.com 的 Interrog 页面。
随着 UI 被商品化,竞争优势上移至问题定义、押注排序与结果负责,产品设计正从界面绘制转向系统、token 与代码。作者把 Miro、Figma、VS Code 配合 Codex 和 GitHub、Jira 串成一条从想法到上线的链路,并嵌入设计思维、系统思维与会议纪要三类智能体。
AI 智能体等待时间与下载延迟不同,二十秒的停顿是在思考和权衡方案,用 spinner 会让用户误以为卡死或崩溃。
同一个模型放进 Claude Code、Codex、OpenCode 里就能读文件、改代码、跑测试,放进聊天框却只能给建议,差别在于 Agent Harness。这期播客把 Harness 定义为模型之外决定 AI 能否干活的工程系统,负责工具、权限、上下文、执行环境和结果验证,并讨论 AI Coding 作为大模型工程化练兵场,以及模型能力与 Harness 生态的未来演进。
Modal 介绍其五年工程积累,通过云缓冲、自定义文件系统 ImageFS、CPU 检查点/恢复和 CUDA 检查点/恢复四项优化,把推理服务副本的启动时间从约 2 千秒降到约 50 秒。
Anthropic 旗下 Claude Code 和 Cowork 产品线的工程与产品负责人 Fiona Fung 在 Code with Claude 2026 大会上用不到三十分钟分享了 AI 时代管理工程团队的实践。
Andrej Karpathy 建议在提问末尾让 LLM「structure your response as HTML」,再把生成的文件用浏览器打开查看,效果很好,他也试过让模型以幻灯片等形式呈现输出。他认为 AI 输出正从原始文本、markdown 走向 HTML,最终可能演化为扩散神经网直接生成的交互式视频,同时输入端仍需加入指点、手势等交互方式。
Qdrant 发布检索相关性评估指南,介绍用带标注的 golden query set 计算 recall@k、MRR、NDCG@k 等指标。查询集可通过人工标注、日志采样或 LLM 合成生成,评估借助 Python 库 ranx,将 Qdrant 检索结果与 qrels 对比,并需按位置打分以规避欧氏距离排序问题。
本文拆解了包裹大语言模型的 Agent Harness 架构,涵盖编排循环、工具、记忆、上下文管理、状态持久化、错误处理和护栏等 12 个组件,并说明提示词工程、上下文工程与 Harness 工程三个层次的区别。
Claude Code 团队成员 Thariq 提出用 HTML 取代 Markdown 作为 AI 智能体的输出格式,理由是 HTML 信息密度更高、支持表格与 SVG 图表、便于分享和双向交互。
Andrew Ng 推出与 CopilotKit 合作的新短期课程,教你构建在聊天中按需生成图表、表单、白板等自定义 UI 的智能体。课程由 CopilotKit 联合创始人 @ataiiam 讲授,涵盖三种方法:从自建组件中挑选、用行/卡片/文本等积木组合新布局,以及把白板、日历等第三方应用嵌入对话。
作者曾把本地优先视作学术概念而拒绝多年,如今已用该模式上线三款生产应用,也曾在两个项目中将其拆除。他澄清本地优先是数据架构而非 offline-first、PWA 或 service worker 缓存,其核心是用户设备持有主数据副本、服务端只作为带特殊权限的同步节点;同时指出数据分析面板、银行支付、简单 CRUD 和无离线协作需求的应用都不适合采用,并建议从一个功能开始渐进引入。
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
Eugene Yan 总结自己与 AI 协作的方法,提出五条原则:提供好的上下文、把个人偏好编码成配置、让验证变简单、委派更大的任务、并闭环沉淀。具体做法包括把代码和知识库分层组织、为每个项目维护带注释的 INDEX.md、用 CLAUDE.md 当作行为契约并按目录分级加载、把高频操作做成按需加载的 skill,以及在会话中纠正输出而非直接改文件,让转录成为配置更新的输入。
播客「牛油果烤面包」第149期邀请C教授讲解量子计算,从量子、量子态、量子程序讲到Shor算法和无结构搜索问题,并讨论量子计算与AI的关系、为什么最近又火起来,以及什么是逻辑比特。节目还介绍了当前从业人员在做什么、未来5–10年的发展趋势和进入该领域的路径。
流式 UI 在内容生成过程中持续变化,带来三类问题:视口被强制固定在底部、新内容导致布局位移、渲染频率高于浏览器每秒约 60 次的刷新。文章用聊天气泡、日志流和实时指标三个演示复现这些问题,并提出用 60px 阈值标记用户是否主动上滚,仅在用户处于底部时恢复自动滚动。
俄亥俄州立大学计算机系教授、NeoCognition 创始人苏煜系统梳理了 Agent 技术演进史:从 Logical Agent(1960-90s)到 Neural Agent,再到 Semantic Parsing 与 Language Agent,并复盘最近三年 Language Agent 的关键工作。
吴恩达开设新课程《AI Prompting for Everyone》,面向各水平用户,教授适用于 ChatGPT、Gemini、Claude 等 AI 工具的通用提示技能。课程涵盖深度研究模式、为 AI 提供充足上下文与文件图像、在买车择业等重要决策时让 AI 深度思考,以及生成图像、分析数据、搭建简单游戏和网站。他同时讲解模型底层直觉,帮助判断何时该信任回答。
Martin Fowler 更新了 AI 编程指南,发布了一期关于 harness engineering 的视频,并讨论了函数应该多长、Software Brain 的问题以及 AI 为何不受欢迎。相关链接收录在其 Fragments 合集中。
B站推出bilibili GPU Manager(BGM)内核模块,联动cgroup子系统与显卡驱动实现GPU显存和算力隔离。显存侧由cgroup配置limit、驱动获取假显存总量并按left判断分配;算力侧用cgroup配置的slice替换TSG默认时间片,从而控制单次调度上限、降低高优任务等待。该方案基于NVIDIA开源驱动做参数修正,替代MPS、MIG及CUDA劫持等黑盒方案。
AE Studio 在 Modal 上搭建了用强化学习训练 LLM 证明数学定理的工作流,通过 vLLM 生成 Lean 证明代码、Lean 编译器在 CPU 上验证并给出奖励信号,对比了 GRPO 与 Evolution Strategies 两种更新规则。该工作流用独立镜像分离 GPU 生成、Lean 验证与编排三种运行时,并用 .map() 并行分发每次迭代的大量独立评估。
Hermes Agent 采用四套记忆系统:MEMORY.md(2,200 字符)与 USER.md(1,375 字符)构成提示词记忆,session_search 调用 SQLite 历史会话存档,技能(Skills)充当程序记忆,另有可选的 Honcho 层做用户建模。
Thoughtworks 内部 IT 采用名为 Structured-Prompt-Driven Development(SPDD)的智能体编程工作流。Wei Zhang 和 Jessie Jie Xia 通过一个简单示例讲解其运作方式,并在 GitHub 项目中给出细节。
HelloGitHub 第 121 期收录多个 AI 相关开源项目,包括为 Claude Code、Cursor 注入 Office 文件操作技能的 OfficeCLI,监控 Claude Code、Codex CLI 等 Agent 的 token 用量与上下文窗口的命令行工具 abtop,以及在一键切换 API 节点、自动故障转移的 cc-switch。
纵横四海播客EP80围绕 Cal Newport 的《深度工作》与其新书《慢生产力》展开,讨论为什么在AI时代"深度"反而成为最昂贵、最不可替代的职业资本。节目援引微软职场报告探讨AI是否真在取代人类工作,并提出禁欲主义、双峰、节奏、新闻记者四种深度工作哲学,以及"第一勺冰淇淋原则"、可视化计分板等实践方法。
作者系统实测了 OpenAI Codex 官方发布的12类典型工作流案例,验证其已从代码生成扩展到端到端软件工程执行,可自主调用 Shell/Git/API/MCP 等工具持续规划、执行与修正。
Sebastian Raschka 公开了自己绘制 LLM 架构图的工作流:从官方技术报告入手,再直接查阅 Hugging Face Model Hub 上的 config 文件与 transformers 参考实现来补齐架构细节,因为近年论文对开源权重模型的描述常不如代码详细。该方法主要适用于开源权重模型,不适用于 ChatGPT、Claude、Gemini 等闭源模型,且刻意保持手动操作。
让 Claude 自己验证改动的方法是把测试工作流写进 claude.md,或添加 /verify-app 技能。Opus 4.7 在验证自身工作方面表现更好;把难以发现的本地开发技巧一并写进去也有帮助。
Andrew Ng 与 JetBrains 合作推出短课程 Spec-Driven Development with Coding Agents,由 Paul Everitt 主讲。课程教授以详细规格文档定义需求、再让编码智能体据此实现的开发方式,可跨会话保留上下文并控制大型代码改动,工作流可打包为跨智能体与 IDE 的便携技能。
Anthropic 员工 Thariq 撰文讲解 Claude Code 的会话管理方法,围绕上下文窗口升级到 100 万 Token 后,如何在继续、回溯、清空(/clear)、压缩(/compact)和子智能体五种选择间做决策。
Modal 发布教程,演示如何在 OpenAI Agents SDK 之上从零搭建自定义编码智能体框架,通过 SandboxAgent 和 ShellTool 把智能体放进带 GPU 的 Modal 沙箱中执行任务。
Vocal Bridge 用双智能体架构解决语音交互难题:前台智能体负责实时对话,后台智能体负责推理、护栏和工具调用。吴恩达用它借助 Claude Code 在不到一小时内为自建数学测验应用加上语音功能,女儿口述答案,应用语音回应并同步更新屏幕题目和动画。Vocal Bridge 可免费试用。
文章拆解五种多智能体协作模式:生成-验证者适合有明确评估标准的场景,调度-子智能体适合任务边界清晰的短任务,智能体团队适合可并行且长时间运行的独立子任务,消息总线适合事件驱动且不断扩展的流水线,共享状态适合需要频繁共享发现的协作任务。
Andrew Ng 推出与 LMSys、RadixArk 合作的新短课程《Efficient Inference with SGLang:文本与图像生成》,由 RadixArk 技术团队成员 Richard Chen 授课。课程围绕开源推理框架 SGLang 的缓存复用机制展开,讲解如何用 RadixAttention 让共享上下文只处理一次,并借助缓存与多 GPU 并行加速扩散模型图像生成。
Martin Fowler 博客刊出 @techygarg 系列收尾篇,聚焦减少 AI 辅助开发摩擦的实践。该实践把 AI 会话中的经验回灌到团队共享资产中,将个人经验转化为集体改进。
去哪儿酒店团队用 FFmpeg + RTMP 推流、开源流媒体服务器 SRS 搭建数字人直播底座,通过 GOP 设为 50、开启 min_latency 低延迟模式并配合前端预加载,把端到端延迟从 10 秒降到 3 秒、实现首屏秒开。SRS 单进程可扛数千路并发,Origin 节点用 forward 功能一路转推抖音、视频号、淘宝等多平台,并支持 SIGUSR2 热升级与推流端双活容灾。
MongoDB 已将预测性自动扩缩容在 MongoDB Atlas 投产,利用负载的周期与趋势模式在副本集过载前提前扩容,缩容仍由现有响应式算法负责。该能力源于 2023 年的原型研究,当时评估了哪种机器学习模型预测效果最好,并估算其对性能与客户成本的改善。
宝玉梳理了 Claude Code 的提示缓存机制,指出频繁 /clear 或每步开新会话常因触发全价上下文重建而更贵,读取缓存的成本只有重新计算的十分之一。
Sebastian Raschka 撰文梳理编程智能体的六大核心组件:实时代码仓库上下文、提示词形态与缓存复用、工具接入与调用、上下文瘦身、结构化会话记忆,以及任务委派与受限子智能体。