深度18·结构·仅据标题摘要
·vLLM SGLang
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。
7 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "水金聊投资"
深度18·结构·仅据标题摘要
·vLLM SGLang
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。
深度16·结构·仅据标题摘要
·vLLM SGLang
叙事上它像新的中间件,账上它是把 GPU 小时换成 token。如果一家公司只报「接入了 vLLM」,却说不清批大小、缓存命中和 P99,那更像在卖关键词。
原文链接待收录
深度13·结构·仅据标题摘要
·PD 分离 Prefill Decode
有人说的是引擎内核拆阶段,有人说的是两个 Deployment,有人只是把长请求换了个队列。投资材料里出现 PD 分离,先问清 KV 在哪、谁持有会话。
原文链接待收录
结构17·深度·仅据标题摘要
·Kueue Volcano Gang Scheduling
不谈插件名,只谈:谁能抢谁、抢完怎么赔、队列是否可见。管理层听得懂的调度,才是能批预算的调度。Kueue 和 Volcano 只是实现细节。
原文链接待收录
结构14·仅据标题摘要
·GPU 算力成本 MFU
官价、承诺使用折扣、包年、抢占,四套数字能差出一个数量级。对外讲「算力成本下降」,要写清是哪一套。否则那只是汇率游戏。
原文链接待收录
结构13·深度·仅据标题摘要
·昇腾 国产卡 Day0
硬件折扣好看,适配工程师和机会成本写在另一本账上。没有 Day0 团队编制,买卡就是买一台昂贵的等待室。
原文链接待收录
结构20·深度·仅据标题摘要
·模型评测 benchmark 独立复现
先公开设置,再请求对齐,最后才下结论。市场喜欢冲突叙事,工程需要可核对的差异。独立复现的信誉,来自克制。
原文链接待收录