赛道扫描

Infra 周报

7 篇扫描条目 · 追踪始于

下载正文(本地操作)

x-fetcher 仅支持单篇 mp URL。对已收录链接运行:

node scripts/download-account-bodies.mjs --account "Infra 周报"

文章列表

  • 结构17·深度·仅据标题摘要

    ·vLLM SGLang

    监控上看 GPU 很忙,用户却在等。常见原因是队列里堆着 decode 长尾,新 prefill 进不去。给引擎加公平性和抢占,比再买一排卡更接近问题本身。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·PD 分离 Prefill Decode

    调度跨池、KV 排队、路由重试,都会把 TTFT 做坏。如果产品的卖点是「秒回」,分离必须配专属的短 prefill 通道,而不是复用批处理大池。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·PD 分离 Prefill Decode

    多一个池就多一套 HPA、探针和发布窗口。很多中小团队拆完发现值班变复杂了,利用率却没上去。先分离流量最大的一条产品线,比全站改造更诚实。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·Kueue Volcano Gang Scheduling

    团队看到的是本地队列,平台看到的是集群配额和借贷。讲清楚借款会不会被回收,比再写一份 YAML 更能减少「为什么我的 Job 不跑」。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·Kueue Volcano Gang Scheduling

    Quota exceeded、gang waiting、topology mismatch、PVC、污点,全部表现为 Pending。把理由标准化成错误码,比让每个人 grep 控制器日志更接近平台。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·GPU 算力成本 MFU

    内部结算如果只按调用次数,重模型会被当免费午餐。按输入输出 token、缓存命中和超时重试拆账,业务才会自己收敛 prompt。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·昇腾 国产卡 Day0

    权重到仓、图编译缓存、算子缺口、回退 CUDA 集群、对外口径。清单比战报重要。Day0 成功的定义应提前写死:哪个模型、哪种精度、哪条业务链路。

    原文链接待收录