跳到正文
原文
NVIDIA Technical Blog· Tanya Lenz·· 19 天前AI 评估 · 27/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

NVIDIA TensorRT 多设备推理集成进 Dynamo-Triton,跨多 GPU 简化模型服务

Simplifying Model Serving Across Multiple GPUs with NVIDIA TensorRT Multi-Device Integration in NVIDIA Dynamo-Triton

AI 导读

NVIDIA TensorRT 推出多设备推理能力,让单个 TensorRT 网络借助 NCCL 分布式集合通信跨多 GPU 执行,同时保留 TensorRT 的推理优化。该能力自 TensorRT 11.0 起获得完整支持,并已集成进 NVIDIA Dynamo-Triton,用于简化多 GPU 模型服务。

来源:NVIDIA Technical Blog · developer.nvidia.com