Training Agents 3:如何用强化学习训练本地开源权重智能体
Hugging Face 发布 "Training Agents 3" 教程,讲解如何用强化学习训练一个本地运行的开源权重智能体(open weight agent),并以直播形式呈现。内容聚焦训练流程本身,具体模型、参数与效果原文未披露。
Hugging Face 发布 "Training Agents 3" 教程,讲解如何用强化学习训练一个本地运行的开源权重智能体(open weight agent),并以直播形式呈现。内容聚焦训练流程本身,具体模型、参数与效果原文未披露。
Weaviate 发布教程,演示跳过转录直接对音频做嵌入和检索。流程包括把原始音频切成重叠片段、用 Gemini Embedding 2 生成多模态嵌入向量、存入 Weaviate 并支持文本或音频查询检索相关片段,最后用 Gemini 3 Flash 基于检索到的音频生成回答。示例使用 Robert Frost 诗歌《Birches》的录音,同一方法可用于播客、访谈、课程和通话录音等音频集合。
Martin Fowler 发布新文章,指出 Subagents 常被"节省时间"和"并行执行"来论证价值,但 @techygarg 认为真正关键的是保护 orchestrator 的上下文。文章由 martinfowler.com/articles/orche 发布。
HelloGitHub 第 124 期收录 32 个开源项目,涵盖 C、C#、C++、Go、Java、JavaScript、Python、Rust、Swift 及 AI 等分类。
有意思小周刊 vol.170 提出面向 React Native 项目的 AI 需求开发闭环实践:把 PRD、接口文档、Figma 输入转化为可审阅的「需求规格」,并设人工门禁做需求审阅与架构确认,再依次执行代码生成、编译验证和视觉审计,形成从需求到可验证代码的人机协作流水线。
强少来了推荐开源书《深入理解 AI Agent》,该书围绕 Agent = LLM + 上下文 + 工具的核心公式,用 10 章把 AI Agent 从原理讲到工程实战,正文、配图与 92 个配套实验全部开源。
Qdrant 用 580 万条真实 Amazon 服饰商品搭建了 Qdrant Shopping 演示店铺,每次文本搜索都是对 Query API 的单次请求,约 40 毫秒返回排序货架,代码已开源于 GitHub。
Weaviate 指出,更大的上下文窗口无法修复有问题的智能体 RAG 流程,长上下文会引入矛盾信息、淹没相关工具并导致后续输入被忽略。其视频将智能体 RAG 流程拆解为查询增强、检索、记忆、工具、智能体五个系统,强调生产级智能体 RAG 本质是上下文工程问题。
播客「牛油果烤面包」第 153 期邀请 laike9m 和 Rice,聊 AI 编程的历史与技术核心,从「古法编程」、编译系统、测试与代码审核讲到 AI 编程工具的演进,重点剖析 Claude Code 与 Agentic Coding。
Tatsunori Hashimoto 称 Gigatoken 速度极快,让他(有望)不必再等待 tokenization,并认为训练前无需等待 tokenization 是一种范式转变。他指出,即便是 tokenizer 这类成熟组件,只要贴近硬件、用状态机实现,仍有数量级的提升空间。
Qdrant 发布增量嵌入更新教程,提供一套从第一天就能部署的流水线,检测文本数据变更并只重新嵌入改动的分块:未变的分块保持不动、文本移动时复用向量、新增与删除同步处理。
Andrej Karpathy 分享了一个与 LLM 协作的实用模式:信息不足又懒得打字时,切换到 /voice 语音输入漫谈约 10 分钟,任由思维发散,甚至可以说"切换到语音识别,抱歉有错别字"。他发现 LLM 很擅长重构冗长不连贯的漫谈,回显出的思路往往比原始输入更清晰,从而减少后续纠错。
Hugging Face 进行了一场名为 Local AI 201 的直播,标题与链接均指向 x.com 的广播页面。原文未披露直播涉及的具体模型、参数或技术细节。
React Server Components 传输的 Flight 流式协议本质是一套反序列化系统,其 $ 前缀解析机制(尤其是返回原始 Chunk 对象的 $@)构成攻击面。
Dify 团队总结了让 AI 支出花得更值的四种实践:按任务选择合适规模的模型、用 Annotation Reply 缓存重复答案、自托管以获得可预测的容量,以及按节点追踪成本、延迟与质量。文中提出"AI 成本不随用量增长,而随未优化的架构增长",并指出收益最大的团队并非花得最少,而是花得有章法。
一位用户分享用 Claude Cowork 管理日历的提示词:让 Claude 规划一周日程,把会议控制在 20 小时以内,合并冲突会议,并参考过往几周判断哪些会议会被拒绝,晚餐不计入 20 小时,更新邀请前先征求确认,同时构建一个可迭代打磨的技能。
Hugging Face 将于本周二举办本地 AI 主题活动,邀请 Ahmad Osman、Mike Bradley 讲解硬件配置与本地推理,并做现场演示。Alex Ocheema 与 0xSero 将分享如何按硬件选模型、模型压缩及 REAPs。
GPT-5.6 模型家族包含三种尺寸,每种尺寸提供大约五到六档推理努力设置。文章以 DeepSeek-R1 的 RLVR 训练方法为基础,讲解如何开发具备多种努力模式的推理模型,其中 OpenAI o1 让基于 LLM 的推理模型概念流行起来。
Andrew Ng 与 Cerebras 合作推出短课程,教开发者用为快速推理设计的 Cerebras Wafer-Scale Engine 构建 LLM 应用。
Nik Malykhin 需要让一套 Java 1.5 代码库跑在现代硬件上,最初直接使用 LLM 并未奏效,直到他用细致的步骤引导整个过程才取得进展。他把这段经历写成了文章发布在 martinfowler.com。
Qdrant 发布批量上传数据指南,针对大规模写入密集和稀疏向量时的内存、磁盘与搜索可用性问题给出配置策略。指南基于 Qdrant v1.19 引入的 memory 设置,提供三条路径:将密集向量设为 cold 存盘、上传前建好 payload 索引、以及用 TurboQuant 量化在 RAM 中保留压缩副本,其中 BITS4 为默认最接近全精度、BITS1 压缩最高。
TorchV 的 AIS 知识引擎把企业文档解析拆成解析引擎、解析实例、解析策略三层,策略按文件类型路由,PDF 可走 MinerU 并开启公式、表格、图片理解,Word 走 TorchV 默认解析,Excel 走 TextIn,音频走 Qwen ASR。
宝云区分 ChatGPT 三种模式的定位:Chat 回答问题,Work 跨应用完成知识工作交付成品,Codex 在代码仓库里完成开发任务。Work 与 Codex 共享同一“智能体用量”额度池,而 Chat 额度独立;二者底层是同一套 Agent 能力,分别面向办公与软件开发两类场景。
Birgitta Böckeler 在梳理本地 LLM 可行性因素后,报告了她用本地 LLM 编程的实测体验。她用两项标准任务对比了本地 LLM,并尝试将其中表现最好的模型用于日常工作。
微信读书推出 weread-skill,用户可以把读过的、感兴趣的书全加到书架,由 agent 调用该 skill 完成筛选、回顾和比较。作者认为这带来"主体"的转变:过去是"我"在阅读,现在"它"也要阅读。
Hugging Face 发布 Training Agents 2 直播教程,讲解如何用模型蒸馏训练自定义智能体。该教程以直播形式进行,附有 x.com 直播链接。
Birgitta Böckeler 近期实测用本地 LLM 完成部分编程任务,并梳理出影响其可行性的多项因素。相关备忘已发布在 martinfowler.com。
播客「AI 炼金术」中,徐文浩分享做大项目的 Harness 设计,认为纯 vibe coding 做大项目一定会塌掉,但不该得出 AI 没用的结论,而是要靠一整套基建管理复杂度并持续迭代。
Claude Code 团队把“循环”定义为 AI 智能体不断重复执行工作周期直到满足预设停止条件,并按触发方式、停止条件、所用基础指令和适配任务四个维度分类。
有用户分享用 Claude Code 搭配 workflows 和 artifacts 搜寻候选人的用法:向 Claude Code 描述职位与目标背景,让它启动动态工作流找出 100 名候选人,并为每人附上 LinkedIn、Twitter、博客、播客及一句话简介,再生成 artifact 邮件发送,随后可在离开电脑后随时查看结果。
有用户提示,可让 Claude Code 借助 computer use 功能自动完成 Claude Tag 的配置:只需把它指向 Claude Tag 文档,它就会为团队接入 GitHub 仓库、数据仓库、Google Drive 及其他数据源。
LLM 基于对话训练导致行业把所有 AI 能力塞进聊天框,但文本输入与输出各有代价:空白输入框让用户猜能力、须把模糊想法翻译成精确提示词,长文本回复则把解读负担转嫁给用户。文章提出用任务审计和输入/输出对齐矩阵两种工具,按用户当下意图匹配模态。
Qdrant 提出分支感知的语义代码搜索方法,用向量索引按语义检索代码,并让每次查询只作用于某一分支的实时视图:包含该分支自身的提交及其从祖先继承的内容,排除后续提交已替换的版本。
UX × AI 系列第二篇提出"提示词就是新的设计简报",认为写 prompt 并非新技能,而是设计师早已掌握的设计简报写作能力在新界面的应用。文章指出优秀简报与有效 prompt 共享四大要素:目标、受众、约束与上下文,提示词本质是沟通与设计能力,而非来自软件开发的"提示词工程"这类技术技能。
HelloGitHub 第 123 期推荐 31 个开源项目,包括一条命令检测本机硬件并推荐可本地运行模型的 Rust 工具 llmfit,以及基于 Git 的 Markdown 知识库工具 tolaria,内置 MCP 服务器可让 Claude Code、Codex 直接读写。
Sebastian Raschka 发布教程,讲解如何用 Ollama 服务本地 LLM 并接入 Qwen-Code、Codex、Claude Code 等编码智能体 harness。
Lilian Weng 发布了一篇拖延 3 年多的 Scaling Laws 长文,探讨如何在投入大规模训练前推理数据与模型规模之间的最优算力分配。文章涵盖 Scaling Laws 的预测内容、算力最优分配的工作机制、Kaplan et al. 与 Chinchilla 结论分歧的原因,以及数据上限与拟合细节如何让外推变得困难。
Qdrant 发布教程,介绍用查询分解(Query Decomposition)处理多跳问题:先检索原问题,由 LLM 读取结果并生成下一个子问题,循环检索直到补齐缺失事实,再融合各跳结果。该方案基于 Self-Ask 与 IRCoT,用 gpt-5-mini 生成子问题,并用 Reciprocal Rank Fusion(k=2)合并各跳结果。
Hugging Face 发布"Welcome to Open Source AI: Run Your Own Models Locally",主题是在本地运行开源 AI 模型,内容以 X 平台直播形式呈现。该帖获得 346 次点赞、55 次转发和约 5.1 万次浏览。
Modal 推出 Auto Endpoints,通过投机解码等优化实现低延迟推理。在 Decagon Voice 案例中,团队将某推理子系统从约 290ms(p50)降至约 190ms,比专有推理提供商同 workload 的最优延迟还快 60ms 以上。其低延迟方案组合了 Blackwell GPU、SGLang 引擎与 Modal Servers 区域部署。