Modal Blog·· 2026-05-04AI 评估 · 30/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。
Modal 用单个 Python 字典将 SGLang 多模态推理性能提升超 10%
Boosting multimodal inference performance by >10% with a single Python dictionary
AI 导读
Modal 工程师在 H100 上压测 Qwen2.5-VL-3B-Instruct 时,发现 SGLang 调度器的多模态请求处理存在重复调用 torch.UntypedStorage._new_shared_cuda 的开销。
来源:Modal Blog · modal.com