微信公众号
关闭训练 MFU 和推理利用率为什么不能互相换算
互动数据需从 wechatDownload 导出导入
- 公众号
- 训练推理手记
- 发布时间
- 检索词
- GPU 算力成本 MFU
- 原文
- 原文链接待收录(不可用搜索页代替)
训练接近计算密集,推理常常带宽密集,还被 SLA 掐着不能把 batch 加满。用训练 MFU 去考核推理集群,会逼着Serving 牺牲延迟。
原文链接待收录
本篇暂无已验证的微信公众号直链。请通过 wechatDownload 导出或扫描数据补全链接;勿使用搜狗搜索页作为「打开原文」。