深度13·结构·仅据标题摘要
·vLLM SGLang
分页 KV 解决了显存洞,但调度器仍要在抢占、停等和气泡之间做选择。很多「引擎变慢」其实是批里混进了超长 decode,连续批处理被一条长尾巴拖成同步屏障。
原文链接待收录
8 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "训练推理手记"
深度13·结构·仅据标题摘要
·vLLM SGLang
分页 KV 解决了显存洞,但调度器仍要在抢占、停等和气泡之间做选择。很多「引擎变慢」其实是批里混进了超长 decode,连续批处理被一条长尾巴拖成同步屏障。
原文链接待收录
深度16·结构·仅据标题摘要
·vLLM SGLang
草稿模型够准时,投机解码能吃掉 decode 瓶颈;草稿经常打脸时,验证开销会把吞吐打穿。文中给了一个按接受率回算的简单盈亏式,避免把博客数字直接写进容量规划。
原文链接待收录
深度13·结构·仅据标题摘要
·PD 分离 Prefill Decode
Prefill 对中断更宽容,适合混部抢占式节点;Decode 要粘性和热缓存,适合稳定池。PD 分离让财务第一次能把两拨 GPU 买成不同规格。
原文链接待收录
结构17·深度·仅据标题摘要
·Kueue Volcano Gang Scheduling
99 张卡已占用,第 100 张在别的队列里碎着。没有 gang,作业会以半残方式启动然后死锁;有 gang,它会一直等,把碎片变成更长的等待。两种痛都要量化。
原文链接待收录
深度13·结构·仅据标题摘要
·GPU 算力成本 MFU
训练接近计算密集,推理常常带宽密集,还被 SLA 掐着不能把 batch 加满。用训练 MFU 去考核推理集群,会逼着Serving 牺牲延迟。
原文链接待收录
深度13·结构·仅据标题摘要
·GPU 算力成本 MFU
如果计算等待低、通信等待高,先减并行度或改拓扑;如果两者都低,多半是数据或启动开销。把诊断树画出来,避免每次低利用率都「再加卡」。
原文链接待收录
结构17·深度·仅据标题摘要
·昇腾 国产卡 Day0
模型并行把通信库推到前台。缺一个 allreduce 融合,MFU 能掉一个台阶。Day0 报告如果只贴 loss 曲线、不贴通信占比,等于没测。
原文链接待收录
深度16·结构·仅据标题摘要
·模型评测 benchmark 独立复现
贪婪解码看起来公平,却对部分模型不友好;采样又引入种子。复现协议必须冻结解码、种子和停止条件,否则你在比较两套采样运气。
原文链接待收录