微信公众号
关闭同一张 H100 上的 vLLM 与 SGLang:吞吐、尾延迟、前缀命中
互动数据需从 wechatDownload 导出导入
- 公众号
- Serving 研究室
- 发布时间
- 检索词
- vLLM SGLang
- 原文
- 原文链接待收录(不可用搜索页代替)
对照实验固定模型、长度分布和并发水位,只换引擎。vLLM 在随机短请求上更稳,SGLang 在系统提示高度复用的会话里把前缀命中率拉到肉眼可见。结论不是谁赢,而是你的流量长什么样。
原文链接待收录
本篇暂无已验证的微信公众号直链。请通过 wechatDownload 导出或扫描数据补全链接;勿使用搜狗搜索页作为「打开原文」。