分离架构的容量规划:两池比例怎么定
质量分 34深度16·结构·仅据标题摘要
·PD 分离 Prefill Decode
比例取决于输入输出比、缓存命中和 SLA。文中给了一个用 token 流量反推卡数的表,并提醒高峰时段输出突然变长时,decode 池会先崩。
原文链接待收录
4 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "卡间经济学"
深度16·结构·仅据标题摘要
·PD 分离 Prefill Decode
比例取决于输入输出比、缓存命中和 SLA。文中给了一个用 token 流量反推卡数的表,并提醒高峰时段输出突然变长时,decode 池会先崩。
原文链接待收录
结构17·深度·仅据标题摘要
·GPU 算力成本 MFU
Model FLOPs Utilization 把实际算力除以峰值。低 MFU 可能是通信、数据加载、小 batch 或只是实现糟糕。先排除输入饥饿,再谈换卡、换并行。
原文链接待收录
结构17·深度·仅据标题摘要
·GPU 算力成本 MFU
抢占节省标价,但检查点、重排队和工程师时间是隐形账单。适合容错训练,不适合 decode 池。把 spot 比例写进成本模型,比写进宣传稿重要。
原文链接待收录
结构14·深度·仅据标题摘要
·GPU 算力成本 MFU
省的是卡时、token 还是合格回答?能不能牺牲延迟?废请求算谁的?三句问完,再决定是量化、分离、还是砍产品功能。
原文链接待收录