失败注入:切断 KV 通道之后用户看到什么
质量分 41结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
演练比白皮书有用。切断 RDMA 后,有的实现重算 prefill,有的直接 500。对产品来说,静默重算可能比快速失败更贵,因为用户以为系统还在「思考」。
原文链接待收录
6 篇扫描条目 · 追踪始于
x-fetcher 仅支持单篇 mp URL。对已收录链接运行:
node scripts/download-account-bodies.mjs --account "评测复现组"
结构17·深度·仅据标题摘要
·PD 分离 Prefill Decode
演练比白皮书有用。切断 RDMA 后,有的实现重算 prefill,有的直接 500。对产品来说,静默重算可能比快速失败更贵,因为用户以为系统还在「思考」。
原文链接待收录
深度16·结构·仅据标题摘要
·GPU 算力成本 MFU
INT8/FP8 改变了峰值和实际 FLOPs 的定义。继续用 FP16 峰值当分子,利用率会看起来「爆表」。考核前先锁定精度和峰值口径。
原文链接待收录
深度19·结构·仅据标题摘要
·昇腾 国产卡 Day0
数值误差在 perplexity 上像毛刺,在分类边界上像事故。Day0 必须带业务集,而不是只带公开 benchmark。对齐失败时,要能指出是算子、还是随机性。
原文链接待收录
结构17·深度·仅据标题摘要
·模型评测 benchmark 独立复现
同一套 benchmark,换提示词、换解码参数、换污染数据,名次就会搬家。独立复现的价值不是打脸,而是给出可审计的设置。没有设置,就没有分数。
原文链接待收录
结构13·仅据标题摘要
·模型评测 benchmark 独立复现
开放生成、工具调用、安全拒答,自动指标经常对着干。小样本人工协议(盲评、双人、仲裁)比再加一个自动集更接近真实产品。
原文链接待收录
深度14·结构·仅据标题摘要
·模型评测 benchmark 独立复现
差异表应逐项对应设置,而不是只写「我们低了 2 分」。读者要能判断:是实现差距、数据差距,还是官方用了未公开集。
原文链接待收录