赛道扫描

训练推理手记

8 篇扫描条目 · 追踪始于

下载正文(本地操作)

x-fetcher 仅支持单篇 mp URL。对已收录链接运行:

node scripts/download-account-bodies.mjs --account "训练推理手记"

文章列表

  • 深度13·结构·仅据标题摘要

    ·vLLM SGLang

    分页 KV 解决了显存洞,但调度器仍要在抢占、停等和气泡之间做选择。很多「引擎变慢」其实是批里混进了超长 decode,连续批处理被一条长尾巴拖成同步屏障。

    原文链接待收录

  • 深度16·结构·仅据标题摘要

    ·vLLM SGLang

    草稿模型够准时,投机解码能吃掉 decode 瓶颈;草稿经常打脸时,验证开销会把吞吐打穿。文中给了一个按接受率回算的简单盈亏式,避免把博客数字直接写进容量规划。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·PD 分离 Prefill Decode

    Prefill 对中断更宽容,适合混部抢占式节点;Decode 要粘性和热缓存,适合稳定池。PD 分离让财务第一次能把两拨 GPU 买成不同规格。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·Kueue Volcano Gang Scheduling

    99 张卡已占用,第 100 张在别的队列里碎着。没有 gang,作业会以半残方式启动然后死锁;有 gang,它会一直等,把碎片变成更长的等待。两种痛都要量化。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·GPU 算力成本 MFU

    训练接近计算密集,推理常常带宽密集,还被 SLA 掐着不能把 batch 加满。用训练 MFU 去考核推理集群,会逼着Serving 牺牲延迟。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·GPU 算力成本 MFU

    如果计算等待低、通信等待高,先减并行度或改拓扑;如果两者都低,多半是数据或启动开销。把诊断树画出来,避免每次低利用率都「再加卡」。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·昇腾 国产卡 Day0

    模型并行把通信库推到前台。缺一个 allreduce 融合,MFU 能掉一个台阶。Day0 报告如果只贴 loss 曲线、不贴通信占比,等于没测。

    原文链接待收录

  • 深度16·结构·仅据标题摘要

    ·模型评测 benchmark 独立复现

    贪婪解码看起来公平,却对部分模型不友好;采样又引入种子。复现协议必须冻结解码、种子和停止条件,否则你在比较两套采样运气。

    原文链接待收录