结构17·深度·仅据标题摘要
·vLLM SGLang
对照实验固定模型、长度分布和并发水位,只换引擎。vLLM 在随机短请求上更稳,SGLang 在系统提示高度复用的会话里把前缀命中率拉到肉眼可见。结论不是谁赢,而是你的流量长什么样。
原文链接待收录
7 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "Serving 研究室"
结构17·深度·仅据标题摘要
·vLLM SGLang
对照实验固定模型、长度分布和并发水位,只换引擎。vLLM 在随机短请求上更稳,SGLang 在系统提示高度复用的会话里把前缀命中率拉到肉眼可见。结论不是谁赢,而是你的流量长什么样。
原文链接待收录
深度13·结构·仅据标题摘要
·vLLM SGLang
没有复用率,你无法解释为什么同样的 QPS 有时便宜有时贵。把它和缓存占用、驱逐次数放在同一块看板,讨论扩容才有共同语言。
原文链接待收录
深度19·结构·仅据标题摘要
·PD 分离 Prefill Decode
Prefill 吃算力,Decode 吃显存带宽,两者绑在同一组 SM 上会互相伤害。PD 分离把阶段拆到不同池,用中间 KV 传输换调度自由度。这是 2025–2026 云原生训推最常被问的架构题。
原文链接待收录
深度13·结构·仅据标题摘要
·GPU 算力成本 MFU
实时补全不可能为了 MFU 把 batch 加到论文数字。正确的做法是把实时池和离线池拆开考核,而不是逼一条 SLA 同时当英雄。
原文链接待收录
结构17·仅据标题摘要
·GPU 算力成本 MFU
前缀命中会让 GPU 显得更闲,但用户体验和成本同时变好。若考核仍惩罚低利用率,团队会关掉缓存。指标必须与目标同向。
原文链接待收录
结构14·深度·仅据标题摘要
·昇腾 国产卡 Day0
引擎接口在收敛,插件质量参差。分页 KV、前缀缓存、结构化输出并不是一起到达。选型时按特性矩阵打勾,不要按「已支持昇腾」五个字下单。
原文链接待收录
结构17·深度·仅据标题摘要
·模型评测 benchmark 独立复现
针能捞到,不代表能在噪声里保持推理。多跳、变更指令、中间插入冲突事实,比单针更接近产品。独立复现不要只复现最出名的那一张图。
原文链接待收录