NVIDIA 如何在联邦 Kubernetes 与 AI 平台间传递用户身份
NVIDIA 技术博客解析如何让用户身份跨越联邦 Kubernetes 集群与 AI 平台边界:用户从中央门户打开受治理数据集、启动 notebook 并调用另一集群中的助手服务,身份每步都要穿越控制面与数据面,传统单点登录在此失效。
NVIDIA 技术博客解析如何让用户身份跨越联邦 Kubernetes 集群与 AI 平台边界:用户从中央门户打开受治理数据集、启动 notebook 并调用另一集群中的助手服务,身份每步都要穿越控制面与数据面,传统单点登录在此失效。
YOLO Mode 指 AI 智能体自动批准所有操作、不再弹出确认提示,Claude Code 的对应开关是 --dangerously-skip-permissions,Codex CLI 为 --full-auto,Gemini CLI 用 --yolo,GitHub Copilot CLI 为 --allow-all,Cursor 则在设置中提供 auto-run。
一套 Wispr Flow + Claude 工作流把语音碎念转成结构化数据:先用 Wispr Flow 把会议或灵感口述进 Apple 备忘录,同步到 Mac 后由定时的 Claude 任务在夜间读取,次日早晨在 Notion 中整理出关键想法、行动项,并在 GCal 里自动排好深度工作时段。作者称其收益是承诺的跟进事项被标出、半成型的想法得到结构化,全年想法也变成可搜索的日志。
小红书与 vivo 联合打通从相册生成到社交发布的完整 3D 内容链路,双方共同设计移动社交场景 3D 内容格式,将原始产物压缩至约 4MB。
快手电商商家与运营赋能中心构建了覆盖需求、Spec、Dev、Test、Oncall 全生命周期的自动化交付流水线(Harness Engineering),目标需求吞吐率提升 30%、平均交付时长下降 40%。
Stanford 今年秋季首次开设 CS329Z「Engineering AI Agents」课程,由 Diyi Yang、Michael Ryan、Jyang Ballin 授课,内容为从零构建 AI 智能体。课程为首次在 Stanford 开课。
Dify 发布新手指南,教用户从一个目标出发,通过与 Dify 对话逐步搭建出可用的 Agent,并演示如何在过程中持续调整它。官方同时提供了指南全文和用于构建首个 Agent 的入口 cloud.dify.ai。
在电脑上运行 Grok Bot 后,该机器会变成一台主机,可以从手机访问。用户能在手机上让 Grok Bot 在自己的电脑上执行操作。
因重度使用 Grok Bot,即使额度刚被重置,一晚用量仍掉了 52%。作者此前已在某个 Bot 中接入 DeepSeek API 与智谱 Coding Plan,于是让分身把各 Bot 的大部分工作切换到智谱 Coding Plan 中的 GLM-5.3-Flash,切换成功。
Dify 发布指南,教你从一个目标出发,通过与 Dify 对话逐步构建出可用的 Agent,并在过程中持续调整优化。用户可按照该指南完成首个 Agent 的搭建,也可直接通过 cloud.dify.ai 开始构建。
AI产品黄叔指出,群聊若每2小时自动讨论一遍、且每次 bot 都读历史内容,会非常消耗用量,昨晚仅 grokbot 网站更新的抓取和上站就吃掉了 44% 的用量。其分享的玩法是训练一个黄叔分身,只给它安排活,它会自己去群里 @ 其他 bot、完成工作后直接汇报,类似董事长布置工作、总经理组织人员后回报。相关 GrokBot 玩法全景手册已开源,页面由图中的 Bot 协作自动更新。
NVIDIA 用一篇实战教程演示如何借助 Compute Sanitizer、CCCL API、NVTX、CUB、池化容器、pinned 内存和每线程独立 stream,分六步优化一条 RGB 转灰度并求 32×32 分块中值的 CUDA 图像处理流水线。每步只需少量代码改动,即可让示例更安全、易维护且更快,配套代码支持在 Google Colab 上运行。
NVIDIA 技术博客发布 AI 模型协同设计系列第三篇,介绍如何用投机解码在保持准确率的前提下加速 LLM 推理,并给出在帕累托前沿上选择草稿长度与草稿机制的 5 条准则。
Giles Edwards-Alexander 记录了一个团队意外触发一队 AI 智能体,让它们在 git 仓库内自发搭起一套黑板协调系统。该案例发布在 martinfowler.com。
Grok Bot 被训练成"黄叔分身"后,只需给它安排任务,它就会自己到群里 @ 其他 bot 组织协作,完成后直接向用户汇报,像董事长给总经理派活。配套的 GrokBot 玩法全景手册已开源,由图中 Bot 协作自动更新。
作者发布开源的 SBX AI Evaluation Kit,一个基于 Docker Sandboxes 的 Mixin Kit,用于让 AI 评测工作流更容易重跑、检查和对比。
得物小摊从 0 到 1 孵化中由一人同时负责 H5、运营后台、Node 网关和 Go 服务,AI 并行参与多模块后,作者把重点从写 Prompt 转向 Delivery Harness,用 Version Contract、Execution Boundary、Evidence Gate、Repair Loop 四个组件接管交付状态。
名为 grokbot.aihuangshu.com 的网站已实现用 Grok Bot 自动更新,每日新案例在顶部呈现,方便查看 Grok Bot 的最新变化。
Kling 发布教程,讲解如何在 Kling MCP 中使用 Elements 功能,在不同镜头之间保持角色身份一致,从而生成更具连贯性的 AI 故事。该教程以视频形式呈现,发布于 Kling AI 官方账号。
AI产品黄叔构建了一个 Grok BOT 分身并拉进其他群,可自动把任务转发到所在群、指挥其他 BOT 完成任务,最后在私聊窗口汇报结果。他还提到 Grok Bot 提供 8 核 / 16G 内存 / 126G 硬盘专享资源与 Grok 额度,并能自行调用 DeepSeek API。
Anthropic 的 Claude 博客发布电商 AI 智能体解剖指南,基于与零售商、电商平台及旅游、娱乐、电信团队的落地合作,主张在标准智能体循环中运行单一模型,用技能承载长尾需求而非拆分多个子智能体。
NVIDIA 发布基于 Nemotron 构建自适应智能体网络安全系统的方案,用于应对现有告警、预定义工作流和已知攻击行为难以覆盖的防御盲区。该系统让智能体跨安全运营环节协同工作、在长周期内追求复杂目标,重点识别防御遗漏并将缺口转化为改进方向。
Visual Studio 支持在 IDE 内直接查看和审查 GitHub PR:通过 Git → GitHub → View Pull Requests 打开列表,PR 按分配给我、仓库全部以及 Copilot 代为创建三类分组。
NVIDIA 技术博客解析如何为 AI 推理负载合理规划 GPU 资源并优化总拥有成本(TCO),避免超支。文章指出,延迟目标、模型选择、流量模式和预算约束的复杂组合让企业难以确定 GPU 规模,需在推理需求与成本之间找到平衡。
MCP 于 2026 年 7 月 28 日发布其发布以来最大的一次修订,协议核心改为无状态:initialize 握手和 Mcp-Session-Id 头被移除,每个请求自带协议版本与客户端上下文,首个消息即可直接发起工具调用,任一 server 实例都能响应。
Qdrant 公开了面向生产环境的向量搜索基准、数据集与 Supernova 代码,目标场景是数十亿向量、数千 RPS 且尾部延迟紧张,现有公开基准无法覆盖。数据集已托管在 HuggingFace,代码以 qdrant-labs/supernova 开源,配套说明见官方博客。
Agent“忘事”的根因在于记忆并非模型原生能力,而是应用层围绕上下文构建的工程系统,核心问题是每轮请求该把哪些历史信息带给模型。文章将记忆分为工作记忆、情节记忆、语义记忆和过程记忆四层,对应上下文、文档库与向量索引、KV/关系库、版本化配置等不同载体,并比较截断滑动窗口、滚动摘要、RAG 式记忆、事实抽取、知识图谱与主动调页等实现方式。
Bolt 官方给出了一段重构提示词,让 Bolt 及其他编码智能体在不改变 App 行为的前提下逐步清理代码,同样的按钮、同样的行为,底层更整洁。提示词按一次一步的方式执行,以降低重构风险。
吴恩达在来信中梳理 AI 工程技能图谱里的软件工程基础,涵盖构建全栈应用、管理数据、设计系统架构、构建安全可靠的系统、在生产环境中扩展并运维五类能力。他指出理解软件基础能帮助开发者引导编码智能体在延迟、可用性、可靠性、成本等方面做出正确权衡,而不懂基础的新手用 vibe coding 只会做出糟糕取舍。他强调深刻理解软件如何工作的开发者远优于仅凭感觉编程的人,后续两封信将继续讨论。
有用户发现 Grok Bot 的云端资源可用来批量提取视频截图和文案,处理完再把结果存到本地,全程只需三次交互。他此前用 Zcode 配合 GLM 5.3 Flash 蹭周末赠送的 3 亿 Token,但会占用 Mac 的内存和硬盘、速度慢,还一度导致电脑重启两三次。Grok Bot 提供 8 核、16G 内存、126G 硬盘的云端环境,并支持开启多线程处理。
得物技术两位司龄5年的校招生海狸(Hayley)和骅征(huazheng)分享了各自的成长经历。海狸在交易平台做后端开发,参与AI导购项目,经历了方案多次调整与反复试错;骅征在国际技术做后端开发,参与香港仓寄售、日本开仓、美国自建站等项目,并在国际火山云多云迁移中将RT涨幅控制在10-13毫秒,实现用户无感知的平稳迁移。
AI 博主宝玉在腾讯内部用自己做三年的字幕翻译 App 串起 AI 产品全流程:找需求看模型能力边界,同一提示词在模型具备检索能力后从无人问津到 Google CEO 致谢。他把成本优化做到调用从 33 次降至 12 次、单集处理从 31 分钟降至 18 分钟,并提出以终为始重设计、把 App 做成 Agent 插件的三条准则。
Mind Lab 研究员逯雨鑫以个人开发者身份,用 2 周和数百美元后训练出两个小模型,两次登顶 Hugging Face Model Trending 榜首。他没有 AI Lab 经历,也非 AI PhD,走的是蒸馏与 SFT 路线,认为最大卡点是数据和 Capacity Gap。他同时讨论了主权 AI、Personal Intelligence 与 Local AI 的普及门槛。
Qdrant 支持把 dense vectors、HNSW 图、量化向量和 payload 分别放到 Pinned、Cached、Cold 三种内存层级,Dense vectors 和 payload 无法 pinned。
黄叔计划把孙割昨晚的爆款小作文融入自己的 Agent 自动化内容工厂,用于在原有选题雷达、素材归类、初稿生成、直播精剪、中视频改写等环节上增加热点判断。他强调热点只是辅助、专业内容才是基础,Agent 是增强而非取代自己,并将在今晚直播分享该工作流,回放仅面向 Agent 社群付费会员。
HelloGitHub 第 125 期收录了 airllm,通过分层加载无需量化、蒸馏或剪枝,仅需 4GB 显存即可运行 70B 大模型,支持 Llama 3.x、Qwen3、DeepSeek 等模型。
Claude 博文《How Warp builds self-improving agents on Claude》介绍了终端工具 Warp 的内部实践:让 Agent 做代码审查时,问题不在于能力而在于缺少项目规范和历史经验的记忆,手动改系统提示词、完善 AGENTS.md 效果都不理想。
AI 能回答问题依靠三种机制:参数机制把人类知识拆成 token 并训练出权重(如 GLM 5.3 的 7440 亿个参数),推理机制补出参数里没记的知识,联网机制则通过 Agent 或应用框架搜索前两者都无法得到的知识。
Lovable 支持通过 MCP 把应用变成 AI 助手可直接调用的服务,适用场景包括:用户本身常驻 Claude、ChatGPT 等助手,应用需要以智能体方式执行重复任务,或用户需要从应用中获取答案与数据。Lovable 称这样能让用户获得更多而非更少的控制权。
Pramod Sadalage 与 Premanand Chandrasekaran 在 Martin Fowler 网站发文指出,AI 要产生效果,组织必须先把数据基础打好。文章从质量根基、语义上下文、清晰的访问控制和可观测性四个方面展开说明。