结构17·深度·仅据标题摘要
·vLLM SGLang
引擎发版快,底层 ABI 更快。一次「小升级」就能让多 LoRA 或量化路径静默回退。生产环境应该锁镜像摘要,而不是锁「最新 vLLM」。
原文链接待收录
5 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "K8s 深夜食堂"
结构17·深度·仅据标题摘要
·vLLM SGLang
引擎发版快,底层 ABI 更快。一次「小升级」就能让多 LoRA 或量化路径静默回退。生产环境应该锁镜像摘要,而不是锁「最新 vLLM」。
原文链接待收录
深度16·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
Kueue 在队列和配额层工作,不替代 kube-scheduler 的绑核。对训推平台来说,这意味着「这个团队这周还能再拿 32 张 H100」第一次变成 API,而不是群里喊话。
原文链接待收录
深度13·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
weight、reclaimable 和 capability 写反,导致小团队永远借不到卡,大团队把碎片吃光。配置即政策,应该和财务预算一起 review,而不是只丢给平台值班。
原文链接待收录
深度16·结构·仅据标题摘要
·昇腾 国产卡 Day0
切虚卡、切 NPU 内存、切虚拟化实例,每一种都影响 gang 和配额。Kueue 的资源名要和 plugin 暴露的一致,否则队列是空转。
原文链接待收录
结构17·深度·仅据标题摘要
·模型评测 benchmark 独立复现
同样的错解,在不同沙箱限额下有的算过、有的算挂。复现必须公布 CPU、内存、时间。否则 LiveCodeBench 只是本地运气。
原文链接待收录