跳到正文
原文
MongoDB Blog·· 2025-12-18AI 评估 · 37/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

MongoDB 旗下 Voyage AI 用基于 token 计数的批处理让查询嵌入推理提速

Token-count-based Batching: Faster, Cheaper Embedding Inference for Queries

AI 导读

Voyage AI by MongoDB 通过基于 token 计数的批处理策略,让查询嵌入推理用少 3 倍的 GPU 仍将 GPU 推理延迟降低 50%。该方案依托 vLLM 和 SGLang 支持的 padding removal,将短查询序列拼接成变长批次处理,替代按 B×S 补 padding 的传统做法,避免 padding token 白白消耗算力与显存带宽。

来源:MongoDB Blog · mongodb.com