跳到正文

#教程/实践

今日 43 条
10月3日周六
  1. meng shao(@shao__meng)AI 评估 · 70/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    HuggingFace 与 LiquidAI 发布多 Harness 强化学习训练指南

    HuggingFace 和 LiquidAI 团队提出一种多 Harness 强化学习训练方案,不改框架代码,在框架与模型之间加一个记录代理,让同一模型同时在四个真实框架里做 RL。

  2. AI Engineer(@aiDotEngineer)AI 评估 · 13/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    你的智能体能读懂企业业务所依赖的文档吗?@jerryjliu0 谈解析、搜索与来源引用

    Jerry Liu(@jerryjliu0)在 World's Fair 2026 的演讲中探讨智能体如何解析、搜索企业业务所依赖的文档并给出来源引用。相关录播已发布,配套活动将于 10 月 12 日至 14 日在纽约举行。

  3. NVIDIA AI(@NVIDIAAI)AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    微调 NVIDIA Nemotron 3.5 ASR,沙特阿拉伯语词错误率从 55% 降至 30%

    微调 NVIDIA Nemotron 3.5 ASR 后,沙特 Najdi 和 Hijazi 方言的词错误率从 55% 降至 30%——支持阿拉伯语不等于能听懂当地方言。NVIDIA 发布新教程,讲解如何将该模型适配到其他方言和语言。

  4. 大模型智能AI 评估 · 60/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Paper-Writing-Tips 更新:新增 Claude Code 论文写作检查 Skill

    4.6k Star 的 Paper-Writing-Tips 将论文写作经验整理成可供 Claude Code 调用的 paper-writing skill,可检查 LaTeX 排版、公式符号、图表、引用、英文表达和匿名信息。

10月2日周五
  1. lmarena.ai(@lmarena_ai)AI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前沿文生图模型后训练指南:从 rubric 奖励到离线评测

    一篇博客详解前沿文生图模型的后训练流程,涵盖 rubric 奖励的构建方式与完整离线评测方案。文章还给出可视化前后对比,展示作者发现并捕获的奖励攻击(reward hacking)失效模式。

  2. Hugging Face(@huggingface)AI 评估 · 66/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Hugging Face 发布多 harness RL 指南:同一模型在不同 harness 得分 62% 与 33%

    Hugging Face 团队发布多 harness RL 实践指南,指出同一模型同一权重在一个 agent harness 中得分 62%,在另一个中仅 33%。

  3. Y Combinator(@ycombinator)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Y Combinator Paper Club 探讨替代计算:光计算、神经形态芯片与生物神经元

    Y Combinator 本期 Paper Club 聚焦替代计算,探讨超越传统数字硬件的 AI 算力路径:用光执行计算的光学系统、受大脑启发的神经形态架构,以及教活体脑细胞玩 Doom 的实验。议程涵盖零阶优化与 SOMA、用光构建扩散模型,以及用强化学习训练生物神经元。

  4. DatawhaleAI 评估 · 56/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datawhale 开源 Jev 中文教程项目 Jev Cookbook

    Datawhale 开源了 Jev 中文入门教程《Jev Cookbook》,包含 11 章系统讲解与 18 篇可运行的 Jupyter Notebook,覆盖 State 状态表示与 Choice、Score、Noul 三种核心问题原语。

  5. 掘金本周最热AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LLM 面试必问的 8 个问题,答不上来直接淘汰

    一篇 LLM 面试题整理,从 Transformer 架构讲起,覆盖 Self-Attention 数学原理、Multi-Head Attention 代码实现。

  6. Tw93(@HiTw93)AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Mole 向未激活用户补发 license key,并将在下个版本上线网页一键唤起激活

    Mole 开发者用 AI 写的本地脚本,按月份和国家语言给开售至9月底所有未激活用户重新发送 license key。下个版本付款后会自动跳转官网激活页面,用户点击激活即可一键唤起 Mole 客户端并自动填充 Key,邮件填错或被拦截也能第一时间看到。

  7. 掘金本周最热AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    前端转全栈笔记:讲 NestJS 框架前,先把 TypeScript 这一关过了

    这篇前端转全栈系列笔记主张,TypeScript 是 AI Coding 时代的一等公民,类型是人与 AI 之间最精确的契约,类型覆盖越完整,AI 生成代码的一次通过率越高。文章复习了 TS 基础语法,并重点讲解为 NestJS 打底的三块能力:class、依赖注入与装饰器,核心主线是 TS 类型在编译后被全部擦除、运行时不留痕迹。

  8. meng shao(@shao__meng)AI 评估 · 65/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 分享在 Agent Harness 内构建模型路由的四步方法

    LangChain 团队 Sydney Runkle 分享在开源 Coding Agent「Open SWE」的 Harness 内构建模型路由,根据任务难度把请求分发给不同价位模型。

  9. 卡尔的AI沃茨AI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    元宝内置 Hy Image3.5 preview 免费上线 25 种 AI 修图玩法

    元宝内置 AI 创作上线 Hy Image3.5 preview,网页和手机端均可免费使用,提供 25 种 AI 修图玩法,并内置大量可直接套用的提示词模版。玩法覆盖人像、风景、美食三类旅行照,包括黑白漫画拼贴封面、MBTI 登机牌、美式复古贴纸海报、JRPG 任务界面和 3D 城市地图定位等。模型在多文字信息图中可保持文字稳定,半身照也能补全全身。

  10. Stack Overflow BlogAI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Skip Labs 谈约束机制如何让开发者更快

    Skip Labs 正在开发一门面向响应式编程的编程语言,以及专为 AI 智能体设计的约束式工具。Stack Overflow Blog 与 Julien Verlaguet 就此进行了交流;同期 Populist 徽章由 s0nix 获得,其回答针对「Git through Visual Studio Code is unusably slow」。

  11. Guillermo Rauch(@rauchg)AI 评估 · 22/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Guillermo Rauch 用 quine 让模型"反向讲解"自己写的 Svelte 代码

    Guillermo Rauch 展示了一个应用,通过让模型以 quine(输出自身源码的程序)方式"反向讲解"自己做过的事,在演示中可逐步揭示驱动它的 Svelte 代码。该 demo 托管于 sveltekit3-models-test.labs.vercel.dev。

  12. 小互(@imxiaohu)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 实用技巧:输入框上方显示上下文读数、危险命令执行前预览影响、三步复核修改与 Mods 写法

    Claude Code 可在输入框上方显示上下文读数,危险命令执行前先查看影响,再按步骤复核一轮修改。另有三个官方例子讲清 Mods 的作用与写法。

  13. 小互(@imxiaohu)AI 评估 · 62/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code Mods 升级:用 JavaScript 或 TypeScript 定制界面与行为

    Claude Code 的 Mods 升级允许通过 JavaScript 或 TypeScript 模块重写或替换部分行为,甚至绘制自定义 UI。

  14. Vercel NewsAI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Rogo 如何在 Vercel 上把智能体编写的代码 5 分钟送上生产环境

    Rogo 正在 Vercel 上重构内部应用,智能体编写的代码可在 5 分钟内交付到生产环境。生产事故发生时,基于 AI SDK 的智能体集群会自动完成分诊与修复,无需人工介入。该团队目前每月部署超过 73,000 次,并有 6 个生产级 AI 智能体承担从流失分析到交易台的工作。

  15. 小互(@imxiaohu)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    老照片修复分三轮完成:先除划痕污斑,再上色,最后调出现代摄影质感

    老照片修复可分三轮完成,每轮只处理一个目标:先清除划痕和污斑,再上色,最后调整为更清晰的现代摄影质感。上色不满意时容易定位到该轮重新调整,同时保留此前已完成的损伤修复成果。

  16. meng shao(@shao__meng)AI 评估 · 36/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    阿里「AI Native 研发范式实践手册」:企业级 Agent Harness 如何集成企业软件与安全能力

    阿里发布的「AI Native 研发范式实践手册」在「企业级 AI 研发基础设施」一章中提出「企业级 Agent Harness」,在常规 Agent Harness 运行机制之上,解决企业软件集成与企业安全两大差异点。

  17. bolt.new(@boltdotnew)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Bolt.new 如何用 UTM 参数构建自适应落地页

    Bolt.new 官方演示了如何构建一个根据 UTM 参数自动调整内容的自适应落地页站点,让不同来源和行为的访客看到匹配的页面,而非统一投放到同一落地页。该方案通过识别 URL 中的 UTM 参数来动态改变站点呈现。

  18. LangChain(@LangChainAI)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain Academy 课程更新:Deep Agents 入门,Managed Deep Agents 可用单条 CLI 命令部署

    LangChain Academy 更新了《Introduction to Deep Agents》课程,Deep Agents 让构建智能体更简单,Managed Deep Agents 则支持用单条 CLI 命令完成部署。课程还演示了如何把智能体部署到 Slack。

  19. Anthropic(@AnthropicAI)AI 评估 · 41/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    哈佛物理学家 Matthew Schwartz:AI 与科学存在「阻抗失配」,用 Claude 搭建精确计算工具箱

    哈佛物理学家 Matthew Schwartz 在 Anthropic Science Blog 客座文章中提出,AI 与科学之间正出现类似物理学的「阻抗失配」:LLM 能力很强,但像对待人类合作者那样使用它,并非激发其科学优势的最佳方式。

  20. NVIDIA Technical BlogAI 评估 · 31/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 C++ 和 NVIDIA TensorRT RTX 示例构建本地 AI 应用

    Do Inference Now (DIN) Deploy 是一个开源 C++ 示例集合,将 ONNX Runtime 与 NVIDIA TensorRT RTX 执行提供程序结合,帮助开发者把模型 checkpoint 推向原生本地应用。它面向需要可移植模型格式、可靠运行时和跨目标系统加速的本地 AI 应用场景。

  21. Harrison Chase(@hwchase17)AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    模型路由怎么做才靠谱:Harrison Chase 谈理解任务、理解模型与在 harness 内构建路由器

    Harrison Chase 与 Sydney Runkle 提出做好模型路由的四个步骤:理解任务、理解模型、在 harness 内构建路由器、追踪结果,目标是在不损失性能的前提下降低成本。原文对模型路由调侃称"没人知道它是什么意思,但它很有煽动性,能让人兴奋起来"。

  22. LangChain(@LangChainAI)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    LangChain 如何为智能体加路由:中位成本降低 64% 的实践路径

    LangChain 分享了在 harness 中构建模型路由器的四个步骤:理解任务、理解模型、在 harness 中实现路由器、追踪任务结果。据其披露,该方案将每线程中位成本降低了 64%,且质量没有变化。

10月1日周四
  1. AWS Architecture BlogAI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Datalex 借助 AWS EBA 与智能体 AI 加速航空零售现代化

    Datalex 与 AWS 在 2025 年 12 月合作开展为期三天的 Experience-Based Acceleration(EBA)工作坊,16 名 Datalex 工程师与 6 名 AWS 专家将 EJB/Java 8 迁移到 Spring/Java 21。

  2. LangChain(@LangChainAI)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    AbridgeHQ 将临床医生反馈接入评估系统,衡量智能体质量并加速发布

    AbridgeHQ 把临床医生反馈构建进评估系统,帮助团队衡量智能体质量、识别改进点并支持更快发布。这是医疗机构从主观评审转向可重复的生产级 AI 评估系统的一个案例。LangChain 免费指南中有更多相关内容。

  3. L先生说AI 评估 · 10/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    国庆期间,可以做的3个「自我觉察」小实验

    国庆假期可做三个「自我觉察」小实验:记录让自己开心的细节,日积月累后发给 AI,让 AI 总结你的模式、偏好和习惯,为喜好「建模」;找出并解决生活中 1-3 个细枝末节的「将就」;识别自己在特定情境下下意识的默认脚本,再判断哪些需要调整。

  4. Viking(@vikingmute)AI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Cursor 的 600 多个图标是如何手绘完成的

    Cursor 约一年间的 600 多个图标全部为手绘,涵盖两种尺寸、两种样式,作者在《The making of Cursor's icons》中详细记录了制作过程。文章后半部分重点讲光学补偿,另一半篇幅则介绍背后的基础设施实践。

  5. NVIDIA Technical BlogAI 评估 · 20/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA Nemotron 微调适配沙特阿拉伯语方言,并可扩展至其他语言

    NVIDIA 对 Nemotron 进行微调,以提升其对沙特阿拉伯语方言的自动语音识别能力,并探索出一条可迁移至其他语言的路径。多语言模型即便在通用基准上表现良好,面对区域方言和本地录音条件时仍可能不达标,而沙特阿拉伯语正是这一问题的典型例子。

  6. 架构师之路AI 评估 · 25/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Claude Code 团队:skill 不是提示词,而是文件夹

    Claude Code 团队在跑了几百个 skill 后总结,skill 不是一条提示词,而是一个文件夹,整个文件系统本身就是上下文工程。

  7. 逛逛GitHubAI 评估 · 72/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 Claude Opus 5.5 写代码做视频的十支案例与开源项目

    用 Claude Opus 5.5 做视频的方式不是模型直接生成画面,而是让 Claude Code、Codex 等 Agent 工具编写 HTML、Canvas、WebGL 或 Remotion 动画,再逐帧导出 MP4,字幕、镜头路径和转场都能在代码里调整。

  8. NVIDIA Technical BlogAI 评估 · 24/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    用 NVIDIA Dynamo-Triton 部署 HSTU 生成式推荐系统

    NVIDIA 介绍如何用 Dynamo-Triton 部署 HSTU 生成式推荐系统,将推荐任务重构为对用户行为的序列建模。用户的交互、上下文、候选物品与动作都被转化为高基数事件流中的 token,取代了原本割裂的召回、排序与预测多阶段流程,从而面向大规模个性化场景。

  9. eric zakariasson(@ericzakariasson)AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    ericzakariasson 发布 game-builder 技能:用新模型构建游戏

    开发者 ericzakariasson 分享了自己用来配合新模型构建游戏的技能,可通过 `npx skills add ericzakariasson/skills --skill game-builder` 安装使用。该推文获得 530 次点赞、42 条回复,浏览量超过 4.5 万。

  10. NVIDIA AI(@NVIDIAAI)AI 评估 · 34/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA VSS Blueprint 3.3 新技能:一条提示词 30 分钟内构建产线视觉 AI 智能体

    NVIDIA 发布教程,演示如何用 NVIDIA VSS Blueprint 3.3 新增的 Build Vision AI 技能,仅凭一条提示词就在 30 分钟内为制造产线构建并部署视觉 AI 智能体。该智能体具备告警、视频搜索和事件报告功能。

  11. Fireworks AI(@FireworksAI_HQ)AI 评估 · 18/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Fireworks AI 解析 GLOBAL 选项与多区域路由架构

    Fireworks AI 详解何时启用 GLOBAL 选项,并介绍其多区域路由架构如何把全球工作负载调度移出推理热路径,以优化低延迟、韧性与运维简便性。

  12. NVIDIA Technical BlogAI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    NVIDIA NeMo Relay 如何追踪 Agent Harness 行为

    NVIDIA NeMo Relay 用于追踪 Agent Harness 行为,解决智能体完成任务却走低效路径的问题:失败的搜索会触发重复搜索,被截断的文件读取会引发命令重复获取同一内容,最终答案正确却掩盖了这些增加延迟、消耗 tokens 的多余步骤。低效步骤会带来更多失败机会,该工具旨在帮助改进智能体的行为。

9月30日周三
  1. Viking(@vikingmute)AI 评估 · 48/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    Viking 开源 content-gate:Codex + Gemini 的 AI 写 SEO 文章流程 skill

    Viking(@vikingmute)把用 AI 写 SEO 文章的流程做成了名为 content-gate 的 skill,基于 Google Search Central 官方文档与内容质量合规指南。

  2. 花叔AI 评估 · 40/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

    0基础速通!手把手教你用WorkBuddy开发出自己的第一个微信小程序

    WorkBuddy 5.6.1 及以上版本可一站式开发微信小程序,生成、预览、发布都在同一窗口完成,并以微信第三方服务商身份代传代码和提审,免去开发者工具、AppID 与手动传包。