推理引擎的假高峰:排队、抢占与 SLO
质量分 35结构17·深度·仅据标题摘要
·vLLM SGLang
监控上看 GPU 很忙,用户却在等。常见原因是队列里堆着 decode 长尾,新 prefill 进不去。给引擎加公平性和抢占,比再买一排卡更接近问题本身。
原文链接待收录
7 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "Infra 周报"
结构17·深度·仅据标题摘要
·vLLM SGLang
监控上看 GPU 很忙,用户却在等。常见原因是队列里堆着 decode 长尾,新 prefill 进不去。给引擎加公平性和抢占,比再买一排卡更接近问题本身。
原文链接待收录
深度13·结构·仅据标题摘要
·PD 分离 Prefill Decode
调度跨池、KV 排队、路由重试,都会把 TTFT 做坏。如果产品的卖点是「秒回」,分离必须配专属的短 prefill 通道,而不是复用批处理大池。
原文链接待收录
结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
多一个池就多一套 HPA、探针和发布窗口。很多中小团队拆完发现值班变复杂了,利用率却没上去。先分离流量最大的一条产品线,比全站改造更诚实。
原文链接待收录
深度13·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
团队看到的是本地队列,平台看到的是集群配额和借贷。讲清楚借款会不会被回收,比再写一份 YAML 更能减少「为什么我的 Job 不跑」。
原文链接待收录
深度13·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
Quota exceeded、gang waiting、topology mismatch、PVC、污点,全部表现为 Pending。把理由标准化成错误码,比让每个人 grep 控制器日志更接近平台。
原文链接待收录
深度13·结构·仅据标题摘要
·GPU 算力成本 MFU
内部结算如果只按调用次数,重模型会被当免费午餐。按输入输出 token、缓存命中和超时重试拆账,业务才会自己收敛 prompt。
原文链接待收录
结构17·深度·仅据标题摘要
·昇腾 国产卡 Day0
权重到仓、图编译缓存、算子缺口、回退 CUDA 集群、对外口径。清单比战报重要。Day0 成功的定义应提前写死:哪个模型、哪种精度、哪条业务链路。
原文链接待收录