HuggingFace 与 LiquidAI 发布多 Harness 强化学习训练指南
HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。
HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。
Jerry Liu(@jerryjliu0)在 World's Fair 2026 的演讲中探讨智能体如何解析、搜索企业业务所依赖的文档并给出来源引用。相关录播已发布,配套活动将于 10 月 12 日至 14 日在纽约举行。
微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。
4.6k Star 的 Paper-Writing-Tips 将论文写作经验整理成可供 Claude Code 调用的 paper-writing skill,可检查 LaTeX 排版、公式符号、图表、引用、英文表达和匿名信息。
一篇博客详解前沿文生图模型的后训练流程,涵盖 rubric 奖励的构建方式与完整离线评测方案。文章还给出可视化前后对比,展示作者发现并捕获的奖励攻击(reward hacking)失效模式。
Hugging Face 团队发布多 harness RL 实践指南,指出同一模型同一权重在一个 agent harness 中得分 62%,在另一个中仅 33%。
Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。
Datawhale 开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,覆盖 State 状态表示与 Choice、Score、Noul 三种核心问题原语。
一篇 LLM 面试题整理,从 Transformer 架构讲起,覆盖 Self-Attention 数学原理、Multi-Head Attention 代码实现。
Mole 开发者用 AI 写的本地脚本,按月份和国家语言给开售至9月底所有未激活用户重新发送 license key。下个版本付款后会自动跳转官网激活页面,用户点击激活即可一键唤起 Mole 客户端并自动填充 Key,邮件填错或被拦截也能第一时间看到。
这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。
LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。
元宝内置 AI 创作上线 Hy Image3.5 preview,网页和手机端均可免费使用,提供 25 种 AI 修图玩法,并内置大量可直接套用的提示词模版。玩法覆盖人像、风景、美食三类旅行照,包括黑白漫画拼贴封面、MBTI 登机牌、美式复古贴纸海报、JRPG 任务界面和 3D 城市地图定位等。模型在多文字信息图中可保持文字稳定,半身照也能补全全身。
Skip Labs 正在开发一门面向响应式编程的编程语言,以及专为 AI 智能体设计的约束式工具。Stack Overflow Blog 与 Julien Verlaguet 就此进行了交流;同期 Populist 徽章由 s0nix 获得,其回答针对「Git through Visual Studio Code is unusably slow」。
Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。
Claude Code 可在输入框上方显示上下文读数,危险命令执行前先查看影响,再按步骤复核一轮修改。另有三个官方例子讲清 Mods 的作用与写法。
Claude Code 的 Mods 升级允许通过 JavaScript 或 TypeScript 模块重写或替换部分行为,甚至绘制自定义 UI。
Rogo 正在 Vercel 上重构内部应用,智能体编写的代码可在 5 分钟内交付到生产环境。生产事故发生时,基于 AI SDK 的智能体集群会自动完成分诊与修复,无需人工介入。该团队目前每月部署超过 73,000 次,并有 6 个生产级 AI 智能体承担从流失分析到交易台的工作。
老照片修复可分三轮完成,每轮只处理一个目标:先清除划痕和污斑,再上色,最后调整为更清晰的现代摄影质感。上色不满意时容易定位到该轮重新调整,同时保留此前已完成的损伤修复成果。
阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。
Bolt.new 官方演示了如何构建一个根据 UTM 参数自动调整内容的自适应落地页站点,让不同来源和行为的访客看到匹配的页面,而非统一投放到同一落地页。该方案通过识别 URL 中的 UTM 参数来动态改变站点呈现。
LangChain Academy 更新了《Introduction to Deep Agents》课程,Deep Agents 让构建智能体更简单,Managed Deep Agents 则支持用单条 CLI 命令完成部署。课程还演示了如何把智能体部署到 Slack。
哈佛物理学家 Matthew Schwartz 在 Anthropic Science Blog 客座文章中提出,AI 与科学之间正出现类似物理学的「阻抗失配」:LLM 能力很强,但像对待人类合作者那样使用它,并非激发其科学优势的最佳方式。
Do Inference Now (DIN) Deploy 是一个开源 C++ 示例集合,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者把模型 checkpoint 推向原生本地应用。它面向需要可移植模型格式、可靠运行时和跨目标系统加速的本地 AI 应用场景。
Harrison Chase 与 Sydney Runkle 提出做好模型路由的四个步骤:理解任务、理解模型、在 harness 内构建路由器、追踪结果,目标是在不损失性能的前提下降低成本。原文对模型路由调侃称"没人知道它是什么意思,但它很有煽动性,能让人兴奋起来"。
LangChain 分享了在 harness 中构建模型路由器的四个步骤:理解任务、理解模型、在 harness 中实现路由器、追踪任务结果。据其披露,该方案将每线程中位成本降低了 64%,且质量没有变化。
Datalex 与 AWS 在 2025 年 12 月合作开展为期三天的 Experience-Based Acceleration(EBA)工作坊,16 名 Datalex 工程师与 6 名 AWS 专家将 EJB/Java 8 迁移到 Spring/Java 21。
AbridgeHQ 把临床医生反馈构建进评估系统,帮助团队衡量智能体质量、识别改进点并支持更快发布。这是医疗机构从主观评审转向可重复的生产级 AI 评估系统的一个案例。LangChain 免费指南中有更多相关内容。
国庆假期可做三个「自我觉察」小实验:记录让自己开心的细节,日积月累后发给 AI,让 AI 总结你的模式、偏好和习惯,为喜好「建模」;找出并解决生活中 1-3 个细枝末节的「将就」;识别自己在特定情境下下意识的默认脚本,再判断哪些需要调整。
Cursor 约一年间的 600 多个图标全部为手绘,涵盖两种尺寸、两种样式,作者在《The making of Cursor's icons》中详细记录了制作过程。文章后半部分重点讲光学补偿,另一半篇幅则介绍背后的基础设施实践。
NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。
Claude Code 团队在跑了几百个 skill 后总结,skill 不是一条提示词,而是一个文件夹,整个文件系统本身就是上下文工程。
用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统,将推荐任务重构为对用户行为的序列建模。用户的交互、上下文、候选物品与动作都被转化为高基数事件流中的 token,取代了原本割裂的召回、排序与预测多阶段流程,从而面向大规模个性化场景。
开发者 ericzakariasson 分享了自己用来配合新模型构建游戏的技能,可通过 `npx skills add ericzakariasson/skills --skill game-builder` 安装使用。该推文获得 530 次点赞、42 条回复,浏览量超过 4.5 万。
NVIDIA 发布教程,演示如何用 NVIDIA VSS Blueprint 3.3 新增的 Build Vision AI 技能,仅凭一条提示词就在 30 分钟内为制造产线构建并部署视觉 AI 智能体。该智能体具备告警、视频搜索和事件报告功能。
Fireworks AI 详解何时启用 GLOBAL 选项,并介绍其多区域路由架构如何把全球工作负载调度移出推理热路径,以优化低延迟、韧性与运维简便性。
NVIDIA NeMo Relay 用于追踪 Agent Harness 行为,解决智能体完成任务却走低效路径的问题:失败的搜索会触发重复搜索,被截断的文件读取会引发命令重复获取同一内容,最终答案正确却掩盖了这些增加延迟、消耗 tokens 的多余步骤。低效步骤会带来更多失败机会,该工具旨在帮助改进智能体的行为。
Viking(@vikingmute)把用 AI 写 SEO 文章的流程做成了名为 content-gate 的 skill,基于 Google Search Central 官方文档与内容质量合规指南。
WorkBuddy 5.6.1 及以上版本可一站式开发微信小程序,生成、预览、发布都在同一窗口完成,并以微信第三方服务商身份代传代码和提审,免去开发者工具、AppID 与手动传包。