赛道扫描

算力观察

6 篇扫描条目 · 追踪始于

下载正文(本地操作)

x-fetcher 仅支持单篇 mp URL。对已收录链接运行:

node scripts/download-account-bodies.mjs --account "算力观察"

文章列表

  • 结构17·深度·仅据标题摘要

    ·vLLM SGLang

    产品要 P99 首字,平台要 GPU 利用率,财务要单 token 成本。三件事很少一起好。选型清单应先写清 SLA 和前缀复用率,再谈内核实现。引擎评测如果只报平均值,基本不能上线。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·PD 分离 Prefill Decode

    拆开之后,瓶颈从 GPU 内核挪到互联。同节点 NVLink、机内 PCIe、跨机 RDMA,每一跳都在吃掉分离带来的利用率。没有测过 KV 带宽,就不要宣布「我们已经 PD 了」。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·Kueue Volcano Gang Scheduling

    在线推理要 SLO,离线训练要吞吐。Kueue 的抢占和借贷可以表达这件事,但必须和业务签协议:训练被踢时 checkpoint 是否免费、推理被挤时谁付钱。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·GPU 算力成本 MFU

    财务看见卡时,算法看见 token,产品看见合格回答。三层之间有废推理、重试和缓存命中。只优化第一层的团队,会在第三层把钱亏回去。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·昇腾 国产卡 Day0

    没有等效 NVLink 的假设,KV 搬运成本要重写。很多国产方案在单机内容忍分离,跨机就退回一体。评估 Day0 服务能力,先问跨机 KV 的带宽和失败率。

    原文链接待收录

  • 深度13·论据·仅据标题摘要

    ·模型评测 benchmark 独立复现

    同样的模型名,可能跑在不同量化、不同投机设置、不同批大小上。独立复现要把硬件和 Serving 配置写成和数据集同等重要的一等公民。

    原文链接待收录