Anthropic 团队分享 Claude Code Skills 的九类用法与编写技巧
Anthropic 的 Claude Code 团队工程师 Thariq Shihipar 总结了内部数百个活跃 Skills 的使用经验,将其归为库与 API 参考、产品验证、数据获取与分析、业务流程自动化、代码脚手架、代码质量与审查、CI/CD 部署、运维手册、基础设施运维九类。
Anthropic 的 Claude Code 团队工程师 Thariq Shihipar 总结了内部数百个活跃 Skills 的使用经验,将其归为库与 API 参考、产品验证、数据获取与分析、业务流程自动化、代码脚手架、代码质量与审查、CI/CD 部署、运维手册、基础设施运维九类。
Bassim Eledath 提出智能体工程从 Tab 补全、智能体 IDE 到上下文工程、复合工程、MCP 与技能、Harness Engineering、后台智能体直至自主智能体团队的 8 个等级路径。
Qdrant 发布一套边缘到云端视频异常检测架构,把异常检测重构为向量最近邻搜索,无需针对具体异常类型标注或重训。
稀疏嵌入经微调后在 Amazon ESCI 数据集上相对 BM25 实现 17% 的提升。稀疏向量维度约 3 万、每个商品仅 100-400 个非零值,用倒排索引做精确匹配,能区分「iPhone 15 Pro Max 256GB」与 128GB 这类稠密嵌入会混淆的细节。
这是稀疏嵌入微调教程第二部分,使用 Amazon ESCI 数据集在 Modal 无服务器 A100 GPU 上训练 SPLADE 模型,以 Exact 和 Substitute 商品对作为正样本进行对比学习,10 万样本训练成本约 0.35 美元。
该系列第二部分展示了在 Modal 无服务器 GPU 上训练 SPLADE 稀疏嵌入模型的完整流程,训练数据为 Amazon ESCI 数据集,包含 120 万+查询-商品对及四级相关性标注。
微调稀疏嵌入在 Amazon ESCI 数据集上比 BM25 提升 28%,这是五部分系列的第一篇。SPLADE 通过 MLM 头加 log saturation 与 max pooling 生成约 30,522 维中仅 100-300 个非零值的稀疏向量,并自动扩展查询词、抑制噪声,而 BM25 只能匹配字面出现的词。
Andrew Ng 与 Google 合作推出短课程《Build and Train an LLM with JAX》,由 @chrisachard 讲授,教你用 JAX 从零构建并训练一个 2000 万参数的语言模型,实现完整的 MiniGPT 架构并通过图形界面对话。
METR 让 Opus 4.6 在简单 ReAct 框架下从零实现《杀戮尖塔》和《小丑牌》的 CLI 版本,结果两款游戏都能基本可玩,但存在大量缺失或损坏的机制,作者估计自己达到同等质量需要 2 到 8 周。
Hamel Husain 和 Shreya Shankar 发布 evals skills,一套面向 AI 产品评估的 Agent 技能包,帮助避开评估中的常见踩坑。
Ramp 基于 Modal Sandboxes 打造的内部后台编码智能体 Ramp Inspect,目前已编写该公司超过一半的已合并 PR。
教程演示如何用 voyage-4-nano 嵌入模型、Hugging Face 与 MongoDB Atlas Vector Search 搭建基于情绪的语义电影推荐引擎,实现「下班后想看点什么治愈的」这类按心情检索。系统通过理解语义而非关键词,将用户情绪与电影剧情描述匹配,绕开类型、演员等传统筛选的粗略标签。
Andrew Ng 推出新课《A2A: The Agent2Agent Protocol》,由 Google Cloud 和 IBM Research 联合打造,Holt Skinner、Ivan Nardini 和 Sandi Besen 主讲。
Next.js 团队复盘过去一年改善 agent 体验的历程,包括构建并下线浏览器内 agent Vector、推出 MCP 集成。团队发现 agent 看不到浏览器中的运行时错误和客户端警告,于是先让错误数据可结构化复制、把浏览器日志转发到终端,再通过 MCP 暴露错误、路由和渲染片段等内部状态,并让 agent 发现运行中的 dev server。
个人 AI 助理 OpenClaw 从 ClawdBot 演变为 MoltBot 再到 OpenClaw 后在社交网络病毒式传播,还出现了龙虾专属 AI 社交网络 MoltBook,争议与黑产投毒、公网接口钓鱼等安全隐患随之而来。
去哪儿网大前端团队针对 C 端 AI Coding 落地难题,提出「规则算法 + AI 模型」融合架构。D2C 环节通过规则清洗 Figma 数据(字段减少 75%、嵌套层级从 6 层精简至 3 层)再由 Gemini Pro 2.5 生成语义化代码,手动重构减少 80% 以上;P2C 环节结合飞书文档授权与语义解析,将 PRD 转为可执行的逻辑代码。
一条约 5 分钟的“killer prompt”可让 Manus Agent 自动完成 Moltbook 注册:访问 Moltbook 按说明注册 Agent 账号,打开本地浏览器在 X 主页发帖验证并完成注册,随后分享话题或参与社区互动。该提示词还要求设置每小时定时任务,携带账号与登录信息自动参与互动并发布想法。
推理时扩展已成为提升已部署 LLM 答案质量与准确率的最有效手段之一,通过在使用模型生成文本时投入更多算力和时间换取更好结果,当前各大 LLM 提供商均依赖某种形式的推理时扩展。
Jina AI 提出在压缩前将嵌入向量转换为球坐标,可把嵌入存储从 240 GB 降到 160 GB,比最佳无损基线还好 25%。重建近似无损,误差低于 float32 机器 epsilon,检索质量不受影响,适用于文本、图像和多向量嵌入,且无需训练、无需码本。
OpenAI 发布小团队使用 ChatGPT 的实践指南,覆盖数据分析、营销素材制作、预算管理、会议组织和决策支持等场景。内容为操作方法层面的指引,未披露新模型、版本号或性能数据。
Jan Leike 转发推荐了一个开源实现,由 @kaifronsdal(该图表数据提供者)、@sleepinyourhat 及多位贡献者共同完成,代码托管在 GitHub 的 safety-research 仓库下。原文未披露该实现的具体功能与技术细节。
Turbopack 已成为 Next.js 的新默认打包器,靠细粒度缓存与增量计算实现近乎即时的构建和 React Fast Refresh 体验。它用“value cells”(Vc)自动追踪函数调用与依赖,文件变更时仅将读取该 cell 的函数标记为“dirty”并按需重新计算,内容未变则跳过更新。
OpenAI 发布《构建 AI 智能体实用指南》,覆盖用例、模型选择、工具设计、护栏机制与多智能体模式,面向智能体的设计、编排与部署全流程。
OpenAI 发布面向初创企业的 GPT-5 系列模型实用指南,讲解如何迁移到 Responses API、设计 Agent、调优提示词、引导 GPT-5 模型并构建可靠的 AI 工作流。
OpenAI 详解内部团队如何使用 Codex 理解代码、重构系统并提升性能与研发速度,同时优化工程工作流。文章覆盖了从代码理解到重构、性能改进和工程效率提升等多个具体场景。
MongoDB Blog 发布 Vision RAG 指南,用多模态嵌入让包含图表和表格的复杂文档变得可搜索,从而省去复杂且昂贵的文本提取。文中指出传统 RAG 主要面向纯文本,企业知识多存于 PDF、幻灯片和图形等多模态格式,用 OCR 或解析工具处理存在工程量大、精度不稳定、规模化成本高的问题;指南介绍 Voyage AI 最新模型如何支撑这一能力,并提供分步实现说明。
Modal 将其跨 AWS、GCP、Azure、OCI 的 GPU 工作池扩展到超过 2 万块并发 GPU,两年内启动超 400 万云实例。此次公开其 GPU 可靠性系统,涵盖实例类型测试选型、机器镜像与启动检查、被动与主动健康检查,以及可观测性与支持。模态还维护半自动基准测试 modal-host-bench,用于评估并规避特定实例类型的性能与可靠性问题。
Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。
去哪儿网构建了一套分层解耦、端云协同的端智能基础设施,由引擎层、基建层、应用层组成,支持 XGBoost、LightGBM 及 RNN、CNN、Transformer 等模型端侧推理,单次推理耗时控制在毫秒级,推理成功率保持 99.9%。在用户流失预测挽留场景中,端侧模型直接利用实时微观行为特征,单次推理耗时≤10ms,预测准确率较天然不下单概率相对提升 12%。
Sebastian Raschka 撰文梳理 DeepSeek V3 到 V3.2 的技术演进,核心变化是 V3.2 沿用 V3.2-Exp 的架构,加入 DeepSeek Sparse Attention(DSA)型稀疏注意力以降低长上下文下的训练与推理成本,注意力复杂度从 O(L²) 降到 O(Lk),其中 k 在官方代码中设为 2048。
梳理从 V3 到 V3.2 的架构与训练变化,读者可对照前代理解稀疏注意力和 RL 的具体改动。
播客「牛油果烤面包」本期邀请 AI 专家 Mengdi 讲解 AI Agent 智能体,内容涵盖智能体的定义、基本架构、技术难点与解决方案,并讨论修改提示词是否比微调模型更有效、RAG(检索增强生成)、自演化 AI 以及普通人构建智能体的门槛。节目还谈及大模型领域近期研究方向和智能体在未来科学研究上的发展方向。
Eugene Yan 总结了构建产品评测的三步方法:先标注小数据集,再对齐 LLM 评测器,最后在每次配置变更时运行实验与评测集。标注阶段建议使用二元的通过/失败或胜/负标签,并至少准备 50-100 个失败样本;对齐阶段建议每个维度单独建评测器、按 75/25 划分开发集与测试集,并用 precision、recall 和 Cohen's Kappa 评估评测器。
Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。
Modal 详解推理中的 host overhead:GPU 因等待 CPU 准备任务而空转,表现为 GPU kernel 利用率偏低。若 host overhead 达 50%,GPU 成本将翻倍,而 GPU 成本通常是推理成本的主要来源。
Decagon 与 Modal 合作训练紧凑开源模型并结合定制 draft 模型与运行时优化,使 Decagon Voice 2.0 延迟降低 65%,意图识别与回复质量显著提升。其定制 EAGLE3 draft 模型接受长度比开源基线高 38%,Modal 为 SGLang 构建异步调度器,消除 H200 GPU 空闲时间并将吞吐提升最高 12%,相关改动已向上游提交 PR。
Modal、Pipecat 与开源权重模型搭建的语音 AI 聊天机器人实现了 1 秒级语音到语音延迟。方案以 Pipecat 作为有状态编排层,串联 STT、LLM、TTS 三步推理,并借助 Modal 按硬件需求独立自动扩缩 GPU 服务。
Berkeley AI Research 提出一种不基于时序差分(TD)学习的强化学习范式——分治法。该方法通过将轨迹对半切分、用两段子轨迹的值相乘来更新整体价值,理论上可将 Bellman 递归次数从线性降为对数级,缓解 TD 学习中误差随时长累积的问题。
一段提示词演示展示了如何用 AI 生成"大制作动画电影"质感的短片:女主角穿短病号服在冷冻舱中醒来,走出实验室沿走廊爬上黑色梯子,从井盖钻出后置身萤火虫飞舞、鹿群跑过的茂密森林,远景是植物覆盖的废墟城市。画面强调干净线条与流畅动作,提示词由 @EccentrismArt 提供。
Thinking Machines 发布最新文章,探讨 on-policy distillation 这一训练方法,将 RL 的纠错相关性与 SFT 的奖励密度结合。
Thinking Machines 发布文章系统讲解 on-policy 蒸馏,即从学生模型采样轨迹、再由教师模型对每个 token 打分,结合了 on-policy 训练的相关性与蒸馏的稠密奖励信号。