微信公众号
关闭SGLang 和 vLLM:大模型背后的“推理引擎”
互动数据需从 wechatDownload 导出导入
- 公众号
- 水金聊投资
- 发布时间
- 检索词
- vLLM SGLang
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。
2026-09-12 · 90 篇 · 1 条可开原文
2026年9月12日
weread·90 篇·当前显示 90 篇
保留全部扫描条目;仅已验证 mp / 搜狗 link 跳转文章可「打开原文」,禁止搜索页兜底。
90 / 90
微信公众号
关闭互动数据需从 wechatDownload 导出导入
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。