深度13·结构·仅据标题摘要
·vLLM SGLang
一张卡挂几十个 LoRA 不再新鲜,真正难的是热切换时的权重驻留和批内混部。vLLM 把 adapter 当成可调度资源后,产品可以按租户拆模型,而不用按卡拆集群。
原文链接待收录
9 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "云原生指北"
深度13·结构·仅据标题摘要
·vLLM SGLang
一张卡挂几十个 LoRA 不再新鲜,真正难的是热切换时的权重驻留和批内混部。vLLM 把 adapter 当成可调度资源后,产品可以按租户拆模型,而不用按卡拆集群。
原文链接待收录
深度13·结构·仅据标题摘要
·vLLM SGLang
单卡脚本能跑,不代表路由器、健康检查和权重同步准备好了。SGLang 多机部署里最容易漏的是前缀缓存不跨节点、以及滚动更新时的冷启动风暴。
原文链接待收录
结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
引擎开始提供分离接口,并不等于开箱即用。还要自己解决服务发现、一致性哈希和缓存亲和。很多团队其实跑的是「半分离」:prefill 独立,decode 仍和旧网关缠在一起。
原文链接待收录
结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
迁移必须能在一小时内回到单池。条件包括路由开关、缓存清空和 inflight 请求排空。没有回滚开关的 PD 项目,本质上是一次赌博。
原文链接待收录
结构17·深度·仅据标题摘要
·Kueue Volcano Gang Scheduling
可以叠,但两套队列语义会打架。更常见的路径是:Kueue 管配额与公平,底层用 Coscheduling / Volcano 保证 gang。架构图上画两个方框很容易,值班手册要写清谁先拒谁。
原文链接待收录
深度13·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
只需要 gang,插件更轻;需要队列、抢占、异构资源,Volcano 或 Kueue 更完整。文章给了一个「功能/运维成本」对照表,避免一上来上最重的那套。
原文链接待收录
结构17·深度·仅据标题摘要
·GPU 算力成本 MFU
建议只保留:有效 FLOPs、峰值口径、数据等待、通信等待、队列等待。超过五条,周会就会变成指标展览。能解释成本的指标,才有资格上大屏。
原文链接待收录
深度19·结构·仅据标题摘要
·昇腾 国产卡 Day0
国产栈对版本组合更敏感。一次「小升」可能让图编译回退。把 CANN、驱动、引擎打成单一发行版,比让每个项目自己拼更接近 Day0 工程。
原文链接待收录
结构17·深度·仅据标题摘要
·模型评测 benchmark 独立复现
权重、tokenizer、聊天模板、引擎版本,全部写入清单。一次评测应能在另一台机器上重放。做不到重放的分数,只是一次表演。
原文链接待收录