NVIDIA 全栈 NIM 优化如何让 Nemotron 3 Ultra 支撑 2.5 倍并发用户
NVIDIA 详解全栈 NIM 优化如何让 Nemotron 3 Ultra 在现有 GPU 上支撑 2.5 倍并发用户,同时保持交互响应速度。这一权衡对智能体 AI 负载尤为关键,因为其提示词更长、上下文会在多步之间复用。
NVIDIA 详解全栈 NIM 优化如何让 Nemotron 3 Ultra 在现有 GPU 上支撑 2.5 倍并发用户,同时保持交互响应速度。这一权衡对智能体 AI 负载尤为关键,因为其提示词更长、上下文会在多步之间复用。
AWS 介绍用 Amazon DynamoDB 条件写实现分布式租约,配合 Amazon ECS on AWS Fargate 管理实时转写服务的 WebSocket 连接归属与故障转移。该模式把连接恢复时间从数分钟缩短到数秒,减少故障和部署期间的人工干预,无需外部协调服务,同一套租约逻辑也可迁移到 Amazon EKS 或 Amazon EC2。
Milvus 官方给出常规 Collection 与 External Collection 的选用边界:应用需持续 insert/upsert、删除须经在线写入路径可搜。
Training Agents 4 将讨论重点从奖励函数转向环境。该系列内容由 Hugging Face 发布,附有 x.com 直播链接,具体细节未在正文中展开。
mem0 提出一条经验法则:只为需要过滤、校验或聚合的内容创建字段,其余内容保持为文本。这本质上是在写入时的灵活性与查询时的可靠性之间做权衡。
心理学作者李睿秋分享10个低成本小技巧:每天多做不同的事以"拉长"时间主观感受,做重要决策时先假设已经失败再复盘原因,把喜欢的事拆散到日常里延长多巴胺期待奖励。他还建议用关键词给工作和学习留"断点续传"接口,并让 AI 维护项目进度文档以便交接。
李忠泽自研的 Agentic Harness Workflow 把 AI 编码拆成需求澄清、方案设计、编码实现、审查验收、提交归档等固定阶段,每阶段由只干一件事的 Sub-Agent 执行,主会话 Manager 统一调度把关。
阿里云开发者梳理了 Agent 自进化(Self-Evolution)的技术全景:进化对象既包括 Skill、Harness、Memory 等非参数化组件,也包括通过微调、强化学习、自蒸馏将经验内化为模型权重。
腾讯开源跨端框架 Kuikly 基于 Kotlin Multiplatform 与共享 UI 体系,支持 Android、iOS、HarmonyOS、H5、微信小程序、Mac 六大平台,日活用户超 5 亿。
DeepLearning.AI 发布 AI 工程技能图谱第三支柱"使用编码智能体",聚焦开发者从手写代码转向定义规格、设计架构与评估智能体产出的能力转变。该支柱涵盖五大基础技能:工作流指挥、智能体自主性、成果审查(自动测试、智能体代码审查、llm-as-a-judge)、智能体与环境定制(技能、hooks、插件、MCP 服务器),以及编码智能体基础原理。
NVIDIA 发文说明 Encode-Prefill-Decode(EPD)解耦这一多模态模型推理优化技术:它将视觉编码阶段与 prefill、decode 阶段分离,在图像密集提示词、中短输出和量化 MoE 模型上最有效。配合 NVIDIA Dynamo 使用 EPD 解耦,最高可带来 5 倍加速。
Qdrant 上线面向零基础学习者的 Beginner Course,从传统搜索的局限、嵌入向量表意和相似度原理讲起,带学员搭建第一个 Qdrant collection,并理解向量、payload、HNSW 以及 dense、sparse、hybrid 搜索的差异。
Weaviate 介绍其磁盘向量索引 HFresh:用紧凑 HNSW 索引将查询路由到最相关的质心,再检索存于磁盘的压缩倒排数据。其中 RQ8 让质心向量缩小约 4 倍,RQ1 使存储的倒排向量数据较 32 位浮点最多减少 32 倍,后台拆分、合并与重分配操作让索引持续保持平衡。它面向更低堆内存占用、可控查询 I/O 和大型可变数据集,无需周期性全量重建;追求峰值查询性能仍应选 HNSW。
Browserbase 增长工程师 Kyle Jeong 分析了 Astra 的 Computer Use 能力实现方式:Codex 启动持续运行的 Node REPL 并接入浏览器与桌面工具,Astra 通过无障碍树读取界面语义信息,结合截图判断状态,并把操作写成代码交给 Codex 执行,再回看结果比对预期,Loop 直到任务完成。
开发者新清士以 GPT-6Astra 与 BlenderMCP 生成的蒸汽朋克风城市视频为素材,尝试用 MiniMax H3 转换为线画风格。流程为先用 GPT Image 2.5 将三段截图转成概念图,再以 ComfyUI 加 DepthAnything 将 15 秒视频转 Depth,最后投入 Hailuo 网站并让 Astra 拟定提示词生成视频。
得物技术披露基于 AgentScope Java 的企业级 MultiAgent 平台,将 Plan-and-Execute 从 Prompt 中拆出:计划由模型通过 create_plan、activate_subtask 等工具动态创建,独立持久化并支持断点恢复,状态经 SSE 以 PROCESSING 事件实时推送。
腾讯 WorkBuddy 团队整理 10 个使用技巧,核心是看住上下文用量、用对模式与会话、减少不必要的技能和废话占用窗口。对话框右下角的灰色小圈可查看上下文用量,显示如 4.9% · 49.4K/1000K;用量超过一半就建议压缩上下文或新开任务。
淘天集团直播技术团队分享了基于 Spring AI Alibaba 框架(版本 1.1.2.0)的 Agent 长程任务断点续传方案,采用框架层 Checkpoint 加上层任务调度的两层架构,且不修改框架源码。
阿里云开发者发布文章,探讨如何让 AI Agent 承担“架构师”职能,完成跨复杂存量分布式系统的技术方案设计。作者提出知识库建设应先“对齐领域”做结构化设计,而非首选 RAG,因为检索无法保证 AI 拿到完整工程判断所需的知识集合。文章还从技术方案设计 Agent 切入,逐步落地架构师 Agent。
LangChain 在 deepagents 最新版本中引入 context modes,支持 "isolated" 和 "fork" 两种子智能体上下文模式。
面对跨 Web 前端、后端服务、数据库与外部 API 的分布式 .NET 应用延迟,Visual Studio 性能分析器可用于定位真正负责慢操作的那个进程并采集其 CPU 活动。
用 GPT-6 Astra 通过 Hyper3D MCP 调用 Hyper3D Rodin 生成 3D 资产,再交回 GPT-6 接入 Blender 与 Three.js,可做出能拆件、换装、竞速的互动网页。
IntelliJ IDEA 新增安全提示嵌入(Security Inlays),可在调试 Spring MVC 接口遇到 403/401 时直接查看运行中应用对该端点要求的 hasRole/hasAuthority 角色,并在不修改 SecurityConfig、不重启应用的前提下解锁端点。
腾讯程序员用 Kuikly 框架开发了 DSH Mobile,一套 Kotlin 代码覆盖 Android、iOS 和鸿蒙,按 DSH 官方 Host 协议连接电脑上的 DeepSeek Harness。
Qdrant 在五个公开数据集上测试了向量检索的调参策略,发现该调哪个参数取决于问题出在哪里。将候选深度从 10 提升到 500,最佳可达分数最多提高 0.28,但最终分数提升至多只有 0.01,因为相关文档已被召回、只是排名不够高。Qdrant 因此建议先定位失败环节,再调整与之对应的 `hnsw_ef`、候选深度、RRF `k`、量化或重排序等参数,而非反复试参数。
结合 E-SAGE 电商 Agent 服务平台实践,给出三条判断标准——咨询频次高、判断路径固定、结论因人而异,符合任意两条就值得做成 Agent。门槛不在编程能力而在业务理解,已上线 Agent 的建设方以业务角色为主而非研发工程师。E-SAGE 通过自建的云原生架构 cns 将 Agent Loop、状态与执行环境三层解耦,实现多会话并行与故障自动恢复。
一位 MHXX 老玩家为已无人维护的开源存档编辑器 MHXXSaveEditor 补上缺失词条,把 AI 接入逆向研究流程。AI 通过 MCP 或 JSON Lines 接入,只能读取差分证据、提交候选判断并申请推进下一步;写入需人工在 Human Gate 逐次批准,且只改测试副本,原始存档不被覆盖。
双曲嵌入用负曲率几何匹配树状层级结构,空间随半径指数增长,因而能用更少维度表达分支关系。在 WordNet 名词层级重建任务中,5 维 Poincaré 嵌入取得 0.823 的平均精度,而 200 维欧氏嵌入仅为 0.168。
天猫新品 MDI 项目按四个阶段推进 AI 研发协同:单兵攻坚期用 AGENTS.md 入口地图加六个 collar Skill 构建结构化知识库,加人提速期以站点地图式 spec 目录物理隔离分工。
JDK 27 正式发布,包含九个 JEP,默认启用的紧凑对象头(JEP 534)将对象头从 96 位压缩到 64 位,堆占用降低 10%–20%、吞吐量提升 5%–10%,G1 也成为所有环境下的默认垃圾回收器(JEP 523)。
LovartAI 在 X 上发布了一段可直接复用的图像生成提示词,要求每张照片生成一张 3:4 竖版海报,上半为保留原构图与光色的原始照片,下半为手印风格抽象转译图像,并禁止加滤镜、调色或变形主体。
机器人触觉传感器目前主要有压阻式、压电式、电容式、光学式和磁感应五条路线,业内认为多传感器结合更适合全身不同部位的需求。其中光学式(视触觉)精度最高,一目科技称其传感器可达24万个感知点,超过人类指尖约12000个神经元,但单指单价仍在千元级。触觉可用训练数据基本为0,真机采集面临三大难题,成本并非现阶段首要障碍,验证路径可行性才是关键。
吴恩达在来信中详解使用编程智能体这项 AI 工程技能,提出规划、执行、部署与监控三阶段的高层工作流,并列出引导工作流、启用智能体自主性、审阅工作成果、定制智能体及其环境、编程智能体基础五项关键技能。
一份万字的 Grok Bot 蓝皮书已开源,内容涵盖官方定义、作者黄叔的个人理解以及 12 个实践 Case,通过知识点串联帮助读者快速掌握如何发挥 Grok Bot 能力、把它变成自己的 Agent 大管家。文档托管在飞书云,作者同时邀请感兴趣的人加入一起更新。
AI产品黄叔发布 Grok Bot 蓝皮书 v0.1,记录如何把 xAI 的 Grok Bot 当作调度器而非执行者使用。作者称同一账号下的 Bot 共用一台云电脑(8 核、16G 内存、126G 硬盘)并支持群聊协作,自己只与大管家 Bot 对话,由它派活给 X 热点抓取、网站开发等 Bot 完成网站自动更新。
Suhail 分享了一个名为 cleanbranch 的 Skill,用于创建只包含必要功能改动的分支,可通过 /cleanbranch、$cleanbranch 或相关请求触发。
开发者分享自己如今从 100K LOC 压缩到几千行的做法:把大量曲折的实验、验证测试和加载/对抗性破坏脚本留在一个混乱分支里,很少让这些冗余代码进入主分支。他只做帮助理解各部分的小实验,并公开征求更好的做法。
Mind Lab 研究员逯雨鑫以个人开发者身份,用约两周时间、一张 5090 显卡和数百美元成本(含 200 美元的 Claude Max Plan)后训练出两个登顶 Hugging Face Model Trending 榜的模型,把 agentic 场景的 benchmark 从底座模型的 15 分提升到 55-60 分。
实测豆包后,作者认为它能干活,但前提是需求要拆到足够细、记忆要跟得上;多轮任务总崩溃的命门在记忆,需求打分只有10分时会被AI直接回怼。他还提出办公场景本质仍是Office三件套,并用"水桶模型"强调办公别缺模态。
Greg Isenberg 列出 9 个值得尝试的 GPT 6 Astra 提示词,涵盖账单砍价、把代理服务逆向工程为 AI 产品、二手市场捡漏、一人公司仪表盘、企业智能体机会审计、浏览器操作员和自动化 QA 等场景。其中"代理变软件"提示词要求拆解某细分服务业务的工作流,并设计可收费 $500-$5,000/月的最简 AI 产品。