赛道扫描

Serving 研究室

7 篇扫描条目 · 追踪始于

下载正文(本地操作)

x-fetcher 仅支持单篇 mp URL。对已收录链接运行:

node scripts/download-account-bodies.mjs --account "Serving 研究室"

文章列表

  • 结构17·深度·仅据标题摘要

    ·vLLM SGLang

    对照实验固定模型、长度分布和并发水位,只换引擎。vLLM 在随机短请求上更稳,SGLang 在系统提示高度复用的会话里把前缀命中率拉到肉眼可见。结论不是谁赢,而是你的流量长什么样。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·vLLM SGLang

    没有复用率,你无法解释为什么同样的 QPS 有时便宜有时贵。把它和缓存占用、驱逐次数放在同一块看板,讨论扩容才有共同语言。

    原文链接待收录

  • 深度19·结构·仅据标题摘要

    ·PD 分离 Prefill Decode

    Prefill 吃算力,Decode 吃显存带宽,两者绑在同一组 SM 上会互相伤害。PD 分离把阶段拆到不同池,用中间 KV 传输换调度自由度。这是 2025–2026 云原生训推最常被问的架构题。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·GPU 算力成本 MFU

    实时补全不可能为了 MFU 把 batch 加到论文数字。正确的做法是把实时池和离线池拆开考核,而不是逼一条 SLA 同时当英雄。

    原文链接待收录

  • 结构17·仅据标题摘要

    ·GPU 算力成本 MFU

    前缀命中会让 GPU 显得更闲,但用户体验和成本同时变好。若考核仍惩罚低利用率,团队会关掉缓存。指标必须与目标同向。

    原文链接待收录

  • 结构14·深度·仅据标题摘要

    ·昇腾 国产卡 Day0

    引擎接口在收敛,插件质量参差。分页 KV、前缀缓存、结构化输出并不是一起到达。选型时按特性矩阵打勾,不要按「已支持昇腾」五个字下单。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·模型评测 benchmark 独立复现

    针能捞到,不代表能在噪声里保持推理。多跳、变更指令、中间插入冲突事实,比单针更接近产品。独立复现不要只复现最出名的那一张图。

    原文链接待收录