2026-09-12 · 90 篇 · 1 条可开原文
2026年9月12日
weread·90 篇·当前显示 90 篇
保留全部扫描条目;仅已验证 mp / 搜狗 link 跳转文章可「打开原文」,禁止搜索页兜底。
90 / 90
深度18·结构·仅据标题摘要
水金聊投资·27分钟前
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。
结构17·深度·仅据标题摘要
Serving 研究室·1小时前
对照实验固定模型、长度分布和并发水位,只换引擎。vLLM 在随机短请求上更稳,SGLang 在系统提示高度复用的会话里把前缀命中率拉到肉眼可见。结论不是谁赢,而是你的流量长什么样。
深度13·结构·仅据标题摘要
训练推理手记·2小时前
分页 KV 解决了显存洞,但调度器仍要在抢占、停等和气泡之间做选择。很多「引擎变慢」其实是批里混进了超长 decode,连续批处理被一条长尾巴拖成同步屏障。
结构14·深度·仅据标题摘要
机智流·3小时前
Agent、工具调用和多轮客服把同一段系统提示反复送进引擎。前缀树一旦命中,prefill 从算力问题变成查表问题。SGLang 把这件事做成默认路径,账本上最明显的是输入 token 单价下降。
算力观察·昨天
产品要 P99 首字,平台要 GPU 利用率,财务要单 token 成本。三件事很少一起好。选型清单应先写清 SLA 和前缀复用率,再谈内核实现。引擎评测如果只报平均值,基本不能上线。
开源前线·昨天
静态图、手工融合、分页 KV、前缀缓存,开源推理走过一条从「能跑」到「能值班」的路。每一次抽象变厚,都是在把运维经验写进内核。新引擎如果还只比 kernel 微基准,会漏掉半个生产故事。
模型前线·2天前
JSON 模式、正则约束和语法引导会改变采样轨迹,也会改变吞吐。约束越严,无效 token 越少,但状态机本身吃调度。用 SGLang 接内部 API 时,要把 schema 稳定性和引擎版本绑在一起发。
云原生指北·2天前
一张卡挂几十个 LoRA 不再新鲜,真正难的是热切换时的权重驻留和批内混部。vLLM 把 adapter 当成可调度资源后,产品可以按租户拆模型,而不用按卡拆集群。
Infra 周报·3天前
监控上看 GPU 很忙,用户却在等。常见原因是队列里堆着 decode 长尾,新 prefill 进不去。给引擎加公平性和抢占,比再买一排卡更接近问题本身。
硅星人Pro·3天前
消费卡上的数字不能直接外推数据中心,但能检验实现是否诚实。记录了 7B/14B 在 2k/8k 上下文下的首字与吞吐,并标出开启前缀缓存前后的差。适合当作个人基线,而不是对外 SLA。
K8s 深夜食堂·5天前
引擎发版快,底层 ABI 更快。一次「小升级」就能让多 LoRA 或量化路径静默回退。生产环境应该锁镜像摘要,而不是锁「最新 vLLM」。
Serving 研究室·5天前
没有复用率,你无法解释为什么同样的 QPS 有时便宜有时贵。把它和缓存占用、驱逐次数放在同一块看板,讨论扩容才有共同语言。
深度16·结构·仅据标题摘要
训练推理手记·一周前
草稿模型够准时,投机解码能吃掉 decode 瓶颈;草稿经常打脸时,验证开销会把吞吐打穿。文中给了一个按接受率回算的简单盈亏式,避免把博客数字直接写进容量规划。
云原生指北·一周前
单卡脚本能跑,不代表路由器、健康检查和权重同步准备好了。SGLang 多机部署里最容易漏的是前缀缓存不跨节点、以及滚动更新时的冷启动风暴。
水金聊投资·一周前
叙事上它像新的中间件,账上它是把 GPU 小时换成 token。如果一家公司只报「接入了 vLLM」,却说不清批大小、缓存命中和 P99,那更像在卖关键词。
深度19·结构·仅据标题摘要
Prefill 吃算力,Decode 吃显存带宽,两者绑在同一组 SM 上会互相伤害。PD 分离把阶段拆到不同池,用中间 KV 传输换调度自由度。这是 2025–2026 云原生训推最常被问的架构题。
算力观察·2小时前
拆开之后,瓶颈从 GPU 内核挪到互联。同节点 NVLink、机内 PCIe、跨机 RDMA,每一跳都在吃掉分离带来的利用率。没有测过 KV 带宽,就不要宣布「我们已经 PD 了」。
客服会话和代码补全对 decode 池的压力完全不同。前者要稳定的槽位,后者要突发吞吐。用一个 decode 池服务所有产品,是很多分离方案重新耦合的开始。
从 DistServe、Splitwise 到各家内部实现,论文关心气泡,工单关心掉线重连。把学术图翻译成 Kubernetes 服务时,最难的是 KV 传输失败后的重算策略。
训练推理手记·昨天
Prefill 对中断更宽容,适合混部抢占式节点;Decode 要粘性和热缓存,适合稳定池。PD 分离让财务第一次能把两拨 GPU 买成不同规格。
Infra 周报·2天前
调度跨池、KV 排队、路由重试,都会把 TTFT 做坏。如果产品的卖点是「秒回」,分离必须配专属的短 prefill 通道,而不是复用批处理大池。
引擎开始提供分离接口,并不等于开箱即用。还要自己解决服务发现、一致性哈希和缓存亲和。很多团队其实跑的是「半分离」:prefill 独立,decode 仍和旧网关缠在一起。
国产芯观察·3天前
一旦跨过单机,就要谈序列化、校验和失败重放。国产互联和 NVIDIA 域不能共用同一套假设。Day0 支持经常卡在「KV 过不了河」,而不是模型权重本身。
调度器札记·3天前
分离把一次请求拆成两个作业,连续批处理又想把它们重新粘住。控制面如果没有统一的 request id 和阶段状态,排障会变成两套日志对时间戳。
硅星人Pro·5天前
用火焰图说明:短 decode 占着 SM,长 prefill 进不来;或反过来。PD 分离是在空间上拆开这张图,而不是让内核「更聪明」。适合给非内核同学对齐语言。
卡间经济学·5天前
比例取决于输入输出比、缓存命中和 SLA。文中给了一个用 token 流量反推卡数的表,并提醒高峰时段输出突然变长时,decode 池会先崩。
评测复现组·一周前
演练比白皮书有用。切断 RDMA 后,有的实现重算 prefill,有的直接 500。对产品来说,静默重算可能比快速失败更贵,因为用户以为系统还在「思考」。
Infra 周报·一周前
多一个池就多一套 HPA、探针和发布窗口。很多中小团队拆完发现值班变复杂了,利用率却没上去。先分离流量最大的一条产品线,比全站改造更诚实。
有人说的是引擎内核拆阶段,有人说的是两个 Deployment,有人只是把长请求换了个队列。投资材料里出现 PD 分离,先问清 KV 在哪、谁持有会话。
迁移必须能在一小时内回到单池。条件包括路由开关、缓存清空和 inflight 请求排空。没有回滚开关的 PD 项目,本质上是一次赌博。
K8s 深夜食堂·1小时前
Kueue 在队列和配额层工作,不替代 kube-scheduler 的绑核。对训推平台来说,这意味着「这个团队这周还能再拿 32 张 H100」第一次变成 API,而不是群里喊话。
调度器札记·2小时前
Volcano 把 All-or-Nothing 带进 Kubernetes 已经很多年。今天它仍出现在不少训练集群里,尤其是和 Spark、MPI 混部的环境。新平台要换 Kueue,得先盘点这些 gang 假设。
训练推理手记·3小时前
99 张卡已占用,第 100 张在别的队列里碎着。没有 gang,作业会以半残方式启动然后死锁;有 gang,它会一直等,把碎片变成更长的等待。两种痛都要量化。
云原生指北·昨天
可以叠,但两套队列语义会打架。更常见的路径是:Kueue 管配额与公平,底层用 Coscheduling / Volcano 保证 gang。架构图上画两个方框很容易,值班手册要写清谁先拒谁。
Infra 周报·昨天
团队看到的是本地队列,平台看到的是集群配额和借贷。讲清楚借款会不会被回收,比再写一份 YAML 更能减少「为什么我的 Job 不跑」。
算力观察·2天前
在线推理要 SLO,离线训练要吞吐。Kueue 的抢占和借贷可以表达这件事,但必须和业务签协议:训练被踢时 checkpoint 是否免费、推理被挤时谁付钱。
开源前线·2天前
默认调度看见的是 CPU 内存,不是拓扑、NVLink 域和模型并行尺寸。Gang、拓扑感知和队列是三块补丁。指望一个默认 scheduler 吃下万卡训练,是 2023 年的幻想。
K8s 深夜食堂·3天前
weight、reclaimable 和 capability 写反,导致小团队永远借不到卡,大团队把碎片吃光。配置即政策,应该和财务预算一起 review,而不是只丢给平台值班。
模型前线·3天前
弹性训练希望晚到的 worker 能加入;严格 gang 希望一起出发。两者可以在不同作业类共存,但不能用同一套 Admission。混用时最常见的 bug 是规模缩小却仍按旧 world size 初始化。
调度器札记·5天前
配额层通过了,并不等于拓扑层能放下一个 8 卡一组的并行单元。把 Topology Aware Scheduling 和 Kueue 切开看,排障才不会在两个控制器之间踢皮球。
没有可见性,所有调度讨论都会变成阴谋论。哪怕只是把 Kueue 队列位置打到注释里,也能减少一半「平台是不是针对我」的工单。
产业观察·一周前
大数据时代的队列、公平和抢占,原样出现在 GPU 云上。换的是 API,不是人性。理解 Yarn 的人,往往比只写过 Deployment 的人更早看懂 Kueue。
只需要 gang,插件更轻;需要队列、抢占、异构资源,Volcano 或 Kueue 更完整。文章给了一个「功能/运维成本」对照表,避免一上来上最重的那套。
Quota exceeded、gang waiting、topology mismatch、PVC、污点,全部表现为 Pending。把理由标准化成错误码,比让每个人 grep 控制器日志更接近平台。
不谈插件名,只谈:谁能抢谁、抢完怎么赔、队列是否可见。管理层听得懂的调度,才是能批预算的调度。Kueue 和 Volcano 只是实现细节。
卡间经济学·1小时前
Model FLOPs Utilization 把实际算力除以峰值。低 MFU 可能是通信、数据加载、小 batch 或只是实现糟糕。先排除输入饥饿,再谈换卡、换并行。
财务看见卡时,算法看见 token,产品看见合格回答。三层之间有废推理、重试和缓存命中。只优化第一层的团队,会在第三层把钱亏回去。
训练接近计算密集,推理常常带宽密集,还被 SLA 掐着不能把 batch 加满。用训练 MFU 去考核推理集群,会逼着Serving 牺牲延迟。
产业观察·昨天
共用集群里,空闲、碎片、预留和故障都要有主人。没有摊销规则,每个团队都觉得自己在给别人买单。MFU 只是分子分母,分母怎么定义才是政治。
模型前线·昨天
张量并行和流水线并行让卡「很忙」,但忙在等。NCCL 日志和 MFU 对不上时,先画一张跨节点流量图。很多所谓的模型问题,其实是拓扑问题。
Serving 研究室·2天前
实时补全不可能为了 MFU 把 batch 加到论文数字。正确的做法是把实时池和离线池拆开考核,而不是逼一条 SLA 同时当英雄。
卡间经济学·2天前
抢占节省标价,但检查点、重排队和工程师时间是隐形账单。适合容错训练,不适合 decode 池。把 spot 比例写进成本模型,比写进宣传稿重要。
评测复现组·3天前
INT8/FP8 改变了峰值和实际 FLOPs 的定义。继续用 FP16 峰值当分子,利用率会看起来「爆表」。考核前先锁定精度和峰值口径。
内部结算如果只按调用次数,重模型会被当免费午餐。按输入输出 token、缓存命中和超时重试拆账,业务才会自己收敛 prompt。
一组卡 MFU 40% 但满载,往往好过一组卡 0% 在排队策略里睡大觉。容量规划要同时看利用率和等待时间,单看其中一个都会买错下一单。
云原生指北·5天前
建议只保留:有效 FLOPs、峰值口径、数据等待、通信等待、队列等待。超过五条,周会就会变成指标展览。能解释成本的指标,才有资格上大屏。
结构14·仅据标题摘要
官价、承诺使用折扣、包年、抢占,四套数字能差出一个数量级。对外讲「算力成本下降」,要写清是哪一套。否则那只是汇率游戏。
如果计算等待低、通信等待高,先减并行度或改拓扑;如果两者都低,多半是数据或启动开销。把诊断树画出来,避免每次低利用率都「再加卡」。
结构17·仅据标题摘要
Serving 研究室·一周前
前缀命中会让 GPU 显得更闲,但用户体验和成本同时变好。若考核仍惩罚低利用率,团队会关掉缓存。指标必须与目标同向。
卡间经济学·一周前
省的是卡时、token 还是合格回答?能不能牺牲延迟?废请求算谁的?三句问完,再决定是量化、分离、还是砍产品功能。
国产芯观察·1小时前
新模型发布当晚,CUDA 世界往往已有 nightly。昇腾要的是图编译、算子、集合通信和推理引擎同一天齐套。Day0 是一份清单,不是一句口号。
开源前线·2小时前
适配层越厚,覆盖越快,性能越容易停在「能跑」。薄适配依赖算子库成熟。团队应公开:这次 Day0 是能训、能推,还是只能前向。
Serving 研究室·3小时前
引擎接口在收敛,插件质量参差。分页 KV、前缀缓存、结构化输出并不是一起到达。选型时按特性矩阵打勾,不要按「已支持昇腾」五个字下单。
没有等效 NVLink 的假设,KV 搬运成本要重写。很多国产方案在单机内容忍分离,跨机就退回一体。评估 Day0 服务能力,先问跨机 KV 的带宽和失败率。
模型并行把通信库推到前台。缺一个 allreduce 融合,MFU 能掉一个台阶。Day0 报告如果只贴 loss 曲线、不贴通信占比,等于没测。
国产栈对版本组合更敏感。一次「小升」可能让图编译回退。把 CANN、驱动、引擎打成单一发行版,比让每个项目自己拼更接近 Day0 工程。
国产芯观察·2天前
在昇腾上手写 kernel 的回报曲线不同,图编译和融合才是主战场。把 CUDA 优化笔记原样搬过来,通常会失望。培训应从编译日志读起。
数值误差在 perplexity 上像毛刺,在分类边界上像事故。Day0 必须带业务集,而不是只带公开 benchmark。对齐失败时,要能指出是算子、还是随机性。
结构13·深度·仅据标题摘要
水金聊投资·3天前
硬件折扣好看,适配工程师和机会成本写在另一本账上。没有 Day0 团队编制,买卡就是买一台昂贵的等待室。
切虚卡、切 NPU 内存、切虚拟化实例,每一种都影响 gang 和配额。Kueue 的资源名要和 plugin 暴露的一致,否则队列是空转。
Infra 周报·5天前
权重到仓、图编译缓存、算子缺口、回退 CUDA 集群、对外口径。清单比战报重要。Day0 成功的定义应提前写死:哪个模型、哪种精度、哪条业务链路。
开源前线·一周前
有的是社区 issue,有的是官方镜像,有的只是某层 linear 能跑。把它当成采购依据前,先复现 README 里的那条命令,并记下缺了哪些 extra。
机智流·一周前
自研引擎能贴硬件,插件能吃生态。2026 年更常见的是双轨:对外 API 对齐 vLLM,对内 kernel 走自研。用户只应看见同一套 Serving 语义。
模型前线·一周前
特性矩阵里打钩很容易。交叉组合才是生产。文中记录了若干「单独能开、一起就回退」的路径,提醒评估不要只测单开关。
试点结束时只剩热情不够。要交出:覆盖的模型、未覆盖的算子、成本对照、人员编制。否则明年还是试点。
评测复现组·1小时前
同一套 benchmark,换提示词、换解码参数、换污染数据,名次就会搬家。独立复现的价值不是打脸,而是给出可审计的设置。没有设置,就没有分数。
论据16·结构·仅据标题摘要
模型前线·2小时前
子集、版本、中文翻译和泄漏检查,每一项都能让分数跳动。写复现报告的第一页应该是数据集指纹,而不是柱状图。
贪婪解码看起来公平,却对部分模型不友好;采样又引入种子。复现协议必须冻结解码、种子和停止条件,否则你在比较两套采样运气。
n-gram 重叠、搜索引擎快照、竞赛题原题,是复现组的日常。发现泄漏不是为了道德审判,而是给分数加注释:这题可能被看见过。
硅星人Pro·昨天
把英文基准翻成中文,难度和答案空间都变了。用翻译集给中文模型打「国际分」,既不公平,也不可比。独立复现应分开报告。
结构13·仅据标题摘要
评测复现组·2天前
开放生成、工具调用、安全拒答,自动指标经常对着干。小样本人工协议(盲评、双人、仲裁)比再加一个自动集更接近真实产品。
权重、tokenizer、聊天模板、引擎版本,全部写入清单。一次评测应能在另一台机器上重放。做不到重放的分数,只是一次表演。
深度13·论据·仅据标题摘要
算力观察·3天前
同样的模型名,可能跑在不同量化、不同投机设置、不同批大小上。独立复现要把硬件和 Serving 配置写成和数据集同等重要的一等公民。
结构17·论据·仅据标题摘要
产业观察·3天前
当融资材料只贴榜,训练就会对着榜拟合。独立复现组的存在,是把公共基准从广告位拉回仪器。仪器需要校准,广告不需要。
同样的错解,在不同沙箱限额下有的算过、有的算挂。复现必须公布 CPU、内存、时间。否则 LiveCodeBench 只是本地运气。
针能捞到,不代表能在噪声里保持推理。多跳、变更指令、中间插入冲突事实,比单针更接近产品。独立复现不要只复现最出名的那一张图。
深度14·结构·仅据标题摘要
差异表应逐项对应设置,而不是只写「我们低了 2 分」。读者要能判断:是实现差距、数据差距,还是官方用了未公开集。
模型周更,评测如果只做一次,档案会腐烂。把固定子集做成扫描任务,和赛道扫描同一节奏,比追每一个新榜更可持续。
框架默认的 few-shot、模板和后处理,本身就是一种立场。换 harness 不换模型,分数也能跳。独立复现应锁定框架版本,或同时报告两套。
结构20·深度·仅据标题摘要
先公开设置,再请求对齐,最后才下结论。市场喜欢冲突叙事,工程需要可核对的差异。独立复现的信誉,来自克制。