结构17·深度·仅据标题摘要
·vLLM SGLang
静态图、手工融合、分页 KV、前缀缓存,开源推理走过一条从「能跑」到「能值班」的路。每一次抽象变厚,都是在把运维经验写进内核。新引擎如果还只比 kernel 微基准,会漏掉半个生产故事。
原文链接待收录
7 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "开源前线"
结构17·深度·仅据标题摘要
·vLLM SGLang
静态图、手工融合、分页 KV、前缀缓存,开源推理走过一条从「能跑」到「能值班」的路。每一次抽象变厚,都是在把运维经验写进内核。新引擎如果还只比 kernel 微基准,会漏掉半个生产故事。
原文链接待收录
深度13·结构·仅据标题摘要
·PD 分离 Prefill Decode
从 DistServe、Splitwise 到各家内部实现,论文关心气泡,工单关心掉线重连。把学术图翻译成 Kubernetes 服务时,最难的是 KV 传输失败后的重算策略。
原文链接待收录
深度16·结构·仅据标题摘要
·Kueue Volcano Gang Scheduling
默认调度看见的是 CPU 内存,不是拓扑、NVLink 域和模型并行尺寸。Gang、拓扑感知和队列是三块补丁。指望一个默认 scheduler 吃下万卡训练,是 2023 年的幻想。
原文链接待收录
结构17·深度·仅据标题摘要
·昇腾 国产卡 Day0
适配层越厚,覆盖越快,性能越容易停在「能跑」。薄适配依赖算子库成熟。团队应公开:这次 Day0 是能训、能推,还是只能前向。
原文链接待收录
深度13·结构·仅据标题摘要
·昇腾 国产卡 Day0
有的是社区 issue,有的是官方镜像,有的只是某层 linear 能跑。把它当成采购依据前,先复现 README 里的那条命令,并记下缺了哪些 extra。
原文链接待收录
深度13·结构·仅据标题摘要
·模型评测 benchmark 独立复现
n-gram 重叠、搜索引擎快照、竞赛题原题,是复现组的日常。发现泄漏不是为了道德审判,而是给分数加注释:这题可能被看见过。
原文链接待收录
结构17·深度·仅据标题摘要
·模型评测 benchmark 独立复现
框架默认的 few-shot、模板和后处理,本身就是一种立场。换 harness 不换模型,分数也能跳。独立复现应锁定框架版本,或同时报告两套。
原文链接待收录