跳到正文
原文
Modal Blog·· 2025-11-19AI 评估 · 26/100分数表示内容值得关注的程度,依据实质份量、信息增量、证据强度、读者相关性和可用性,按内容类型加权。显示分数为两次独立评分的平均值。AI 判断可能有误,评分不代表事实已被核实,也不同于热点榜的讨论热度。

Reducto 如何用 Modal 将企业级文档处理延迟降低 3 倍

How Reducto improved enterprise-scale document processing latency by 3x

AI 导读

Reducto 将 30+ 模型的推理负载迁移到 Modal 后,P90 延迟降低 3 倍,借助 GPU 内存快照把冷启动从约 70s 缩短到约 12s,降幅 83%。Reducto 通过按客户参数化独立扩缩容、按区域固定延迟敏感函数,实现各客户负载隔离。一次 100k 页/分钟的企业压测中,其摄入流水线在不到一小时内扩展到 1000+ GPU 并顺利缩容。

来源:Modal Blog · modal.com