推理引擎选型:吞吐、延迟、显存碎片的三角
质量分 41结构17·深度·仅据标题摘要
·vLLM SGLang
产品要 P99 首字,平台要 GPU 利用率,财务要单 token 成本。三件事很少一起好。选型清单应先写清 SLA 和前缀复用率,再谈内核实现。引擎评测如果只报平均值,基本不能上线。
原文链接待收录
6 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "算力观察"
结构17·深度·仅据标题摘要
·vLLM SGLang
产品要 P99 首字,平台要 GPU 利用率,财务要单 token 成本。三件事很少一起好。选型清单应先写清 SLA 和前缀复用率,再谈内核实现。引擎评测如果只报平均值,基本不能上线。
原文链接待收录
结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
拆开之后,瓶颈从 GPU 内核挪到互联。同节点 NVLink、机内 PCIe、跨机 RDMA,每一跳都在吃掉分离带来的利用率。没有测过 KV 带宽,就不要宣布「我们已经 PD 了」。
原文链接待收录
深度13·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
在线推理要 SLO,离线训练要吞吐。Kueue 的抢占和借贷可以表达这件事,但必须和业务签协议:训练被踢时 checkpoint 是否免费、推理被挤时谁付钱。
原文链接待收录
结构17·深度·仅据标题摘要
·GPU 算力成本 MFU
财务看见卡时,算法看见 token,产品看见合格回答。三层之间有废推理、重试和缓存命中。只优化第一层的团队,会在第三层把钱亏回去。
原文链接待收录
结构17·深度·仅据标题摘要
·昇腾 国产卡 Day0
没有等效 NVLink 的假设,KV 搬运成本要重写。很多国产方案在单机内容忍分离,跨机就退回一体。评估 Day0 服务能力,先问跨机 KV 的带宽和失败率。
原文链接待收录
深度13·论据·仅据标题摘要
·模型评测 benchmark 独立复现
同样的模型名,可能跑在不同量化、不同投机设置、不同批大小上。独立复现要把硬件和 Serving 配置写成和数据集同等重要的一等公民。
原文链接待收录