用 C++ 和 NVIDIA TensorRT RTX 示例构建本地 AI 应用
Do Inference Now (DIN) Deploy 是一个开源 C++ 示例集合,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者把模型 checkpoint 推向原生本地应用。它面向需要可移植模型格式、可靠运行时和跨目标系统加速的本地 AI 应用场景。
Do Inference Now (DIN) Deploy 是一个开源 C++ 示例集合,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者把模型 checkpoint 推向原生本地应用。它面向需要可移植模型格式、可靠运行时和跨目标系统加速的本地 AI 应用场景。
Harrison Chase 与 Sydney Runkle 提出做好模型路由的四个步骤:理解任务、理解模型、在 harness 内构建路由器、追踪结果,目标是在不损失性能的前提下降低成本。原文对模型路由调侃称"没人知道它是什么意思,但它很有煽动性,能让人兴奋起来"。
LangChain 分享了在 harness 中构建模型路由器的四个步骤:理解任务、理解模型、在 harness 中实现路由器、追踪任务结果。据其披露,该方案将每线程中位成本降低了 64%,且质量没有变化。
Datalex 与 AWS 在 2025 年 12 月合作开展为期三天的 Experience-Based Acceleration(EBA)工作坊,16 名 Datalex 工程师与 6 名 AWS 专家将 EJB/Java 8 迁移到 Spring/Java 21。
国庆假期可做三个「自我觉察」小实验:记录让自己开心的细节,日积月累后发给 AI,让 AI 总结你的模式、偏好和习惯,为喜好「建模」;找出并解决生活中 1-3 个细枝末节的「将就」;识别自己在特定情境下下意识的默认脚本,再判断哪些需要调整。
Cursor 约一年间的 600 多个图标全部为手绘,涵盖两种尺寸、两种样式,作者在《The making of Cursor's icons》中详细记录了制作过程。文章后半部分重点讲光学补偿,另一半篇幅则介绍背后的基础设施实践。
NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。
Claude Code 团队在跑了几百个 skill 后总结,skill 不是一条提示词,而是一个文件夹,整个文件系统本身就是上下文工程。
用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。
NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统,将推荐任务重构为对用户行为的序列建模。用户的交互、上下文、候选物品与动作都被转化为高基数事件流中的 token,取代了原本割裂的召回、排序与预测多阶段流程,从而面向大规模个性化场景。
开发者 ericzakariasson 分享了自己用来配合新模型构建游戏的技能,可通过 `npx skills add ericzakariasson/skills --skill game-builder` 安装使用。该推文获得 530 次点赞、42 条回复,浏览量超过 4.5 万。
NVIDIA 发布教程,演示如何用 NVIDIA VSS Blueprint 3.3 新增的 Build Vision AI 技能,仅凭一条提示词就在 30 分钟内为制造产线构建并部署视觉 AI 智能体。该智能体具备告警、视频搜索和事件报告功能。
Fireworks AI 详解何时启用 GLOBAL 选项,并介绍其多区域路由架构如何把全球工作负载调度移出推理热路径,以优化低延迟、韧性与运维简便性。
NVIDIA NeMo Relay 用于追踪 Agent Harness 行为,解决智能体完成任务却走低效路径的问题:失败的搜索会触发重复搜索,被截断的文件读取会引发命令重复获取同一内容,最终答案正确却掩盖了这些增加延迟、消耗 tokens 的多余步骤。低效步骤会带来更多失败机会,该工具旨在帮助改进智能体的行为。
一篇登上 HN 的设计文章《How our vibe coded website looks like a designer made it》讲述毫无设计经验的程序员通过一步步优化,把网站做出设计师水准的像素风过山车大亨式游乐园动画效果。作者写得真诚、步骤详细、无 AI 生成痕迹,可总结成方法论,作品也因此走红。
Viking(@vikingmute)把用 AI 写 SEO 文章的流程做成了名为 content-gate 的 skill,基于 Google Search Central 官方文档与内容质量合规指南。
WorkBuddy 5.6.1 及以上版本可一站式开发微信小程序,生成、预览、发布都在同一窗口完成,并以微信第三方服务商身份代传代码和提审,免去开发者工具、AppID 与手动传包。
得物上线 3D 空间图片功能,用户发布图片时带上 #空间图片 话题,服务端即用单图前馈生成 3D Gaussian Splatting 三维场景模型,客户端按手机姿态实时渲染。该方案通过属性量化与紧凑编码把文件体积相比压缩前减少约 81.5%,并采用 GPU 稳定 Radix Sort 使排序耗时降低 60%–75%。经真机测试,iOS、Android 帧率稳定在 60FPS。
Tw93 给 Mole 做了一次图标精细化升级,主体采用 Phosphor Icon,约 30% 图标由 opus 5.5 自绘 SVG;「检查更新」「GPU」「压缩包」「内存」等按用户反馈重改,GPU 改为双风扇显卡、检查更新改为顺时针箭头。他认为图标应以表意优先,并建议替换图标后放到真实产品中与相邻图标一起看整体效果。
AI产品黄叔准备开新号做经典战役解说,用 Opus5.5 跑通几种内容类型后沉淀了几个 skill,把大部分流程自动化。成本约为 Claude Max 100 美元周额度的 2%-3%,一周 token 能出 30 条以上视频,另有 listenhub 配音消耗约单条 10 元。
小红书引擎架构团队与质效研发部公开推荐系统 Agentic 发布的 Harness 实践:一次发布横跨十几个部署组、数千个 Pod,平均持续 10 多个小时,并需等待次日真实流量验证。
独立开发者 Tw93 分享了给产品 Mole 做图标精细化升级的思路:App 场景下从 Remix Icon 换到 Phosphor Icon,约 70% 可直接使用,剩下 30% 用 opus 5.5 自绘 SVG 以保持整体一致。他强调图标必须放回真实产品、按整组搭配来看效果,并注重对齐与中英文垂直居中,用小细节(如咖啡杯、挥手、听诊器)给产品注入灵性。
有开发者反映,为简单简历开发 BOSS 直聘插件时,让 ChatGPT 通过 CDP 操作 Chrome、或用 grok bot 云端操作,都会被网站直接打到空白页面。现在不少网站会记录鼠标移动轨迹和按键等操作,用来分析是否为真人,国内很多平台可能也已采取类似反自动化手段。除非能做出完全拟人的操作,否则这类自动化封锁目前没有好的解决方案。
GitHub 分享了其最高星标仓库之一的诞生历程,并附上 YouTube 视频链接。原帖未透露该仓库具体名称,仅给出视频地址 youtube.com/watch?v=5VSwaU…。
架构师之路《AI时代的架构设计100讲》第8讲提出,进程内缓存应默认禁止、例外放行,并给出可直接复制的spec模板:模式声明、红线约束、异常与降级、验收标准四部分。原因是AI写代码时爱自作主张加本地Map“优化性能”,必须把默认禁止写进spec。仅三种场景放行:只读数据启动加载、极高峰挡流量、允许一定程度数据不一致。
Recraft 转发并公开了 @Abmankendrick 的一段写实人像提示词,描述一位二十多岁后期、深棕色长卷发的微笑女性,身穿中蓝色圆领卫衣、佩戴金色耳环。提示词指定了中性灰渐变影棚背景、左前方柔和漫射光、浅景深与 85mm 镜头,强调自然肤质与超高细节。
NVIDIA TensorRT Model Connect 是一个基于 TensorRT、用 C++ 编写的开源 AI 模型参考实现集合。项目以编码智能体为核心设计,采用并行开发、模型族隔离、可回滚改动和 GPU 验证等做法,目标是让 TensorRT 推理栈的性能更易被使用。
Julien Chaumond 推荐了 @0xSero 撰写的一份 DGX Spark 指南,该指南已在 Hugging Face 博客上线。原文未披露指南的具体内容、篇幅或技术细节。
Michele Catasta 分享了如何设计并构建 harness,以远低于常规的成本达到前沿性能。原文未披露具体模型、参数规模或 benchmark 数据。
NVIDIA 发布 Nemotron Labs 内容,介绍如何在 DGX Spark 与 DGX Station 上本地运行 Nemotron 模型。该内容面向本地部署场景,展示 Nemotron 在 NVIDIA 自有硬件上的运行方式。
作者冷逸演示了用 Coding 模型做视频的完整流程,底层逻辑是让 LLM 用 JavaScript 或 Three.js 写每一帧画面生成 HTML,经无头浏览器逐帧捕获后由 FFmpeg 编码成 MP4,全程在 Agent 内完成、不打开剪辑软件。
Claude Code 社区分享了一组实用技巧:从单机模式走向多人协作,多用 Artifacts 作为队友、其他线程和 subagent 的共享记忆上下文,只需让 Claude 把它做成 artifact 即可。用 `/eli5` 插件可让 Claude 用寥寥数语讲清全局,比读大段文字更有用。此外,真正的瓶颈是"未知的未知",解法是多尝试、多迭代以培养直觉与品味。
为给简单简历做 BOSS 直聘插件,用 ChatGPT 通过 CDP 操作 Chrome,或用 grok bot 云端操作,都会被网站直接打到空白页。作者称 GitHub 上的 loks666/get_jo 仓库及相关讨论让自己大开眼界,其中既有 AI 时代的各种巧思,也有针对自动化反制手段的干货讨论。
AWS 展示如何用 AG-UI 协议、Strands Agents SDK 的 Swarm 模式和 Amazon Nova Act 构建能随 AI 输出变化自动调整的界面。
阿里稳定性团队复盘 AI Native 研发转型:当后端、产品、设计师都能用 AI 写前端,代码能跑却难接手,于是把团队判断做成结构化规则包 Skill,并打包为 Claude Code Plugin「Anchor」。
美图设计室 PPT Skill 接入 WorkBuddy,用户把会议纪要 Word 草稿拖进对话框、附上参考图和提示词,即可直接生成完整的 8 页汇报 PPT,无需切换软件。生成结果按封面、目录、整体进度、模块进展组织,采用结论式标题与模块化内容并自动高亮重点数据,支持单页精准修改和一键跳转美图设计室画布做 3D 图标等微调。最终导出标准可编辑 PPTX 源文件,而非锁死的图片或 PDF。
在 Qdrant 中,文档经嵌入模型转为向量存储,用户查询也需转成同一向量空间的向量才能比对。问题在于更换嵌入模型通常意味着必须重新嵌入已有文档。
腾讯技术工程提出一套 Agent 自进化方法论,把评测、记忆、落地、控制四个环节作为同一闭环的四个齿轮,主张自进化的瓶颈不在单个技术点,而在环节之间的数据通路是否连通。
SemiAnalysis 分析 GLM-5.3 采用 DeepSeek Sparse Attention 后,稀疏注意力虽降低了 SDPA 阶段的 KV cache 读写需求,但 top-k 选择仍需完整上下文驻留 HBM,因此并未消除显存容量瓶颈。
生产级 AI 应用仅靠模型版本无法保证可复现,检索、提示词、工具契约与推理服务配置都会独立改变行为。文章建议用版本化发布清单(含模型、提示词、索引、嵌入、运行时修订号)统一界定发布边界,并以覆盖端到端路径的评估门禁和经过演练的回滚路径作为 MLOps 起点。