赛道扫描

水金聊投资

7 篇扫描条目 · 追踪始于

下载正文(本地操作)

x-fetcher 仅支持单篇 mp URL。对已收录链接运行:

node scripts/download-account-bodies.mjs --account "水金聊投资"

文章列表

  • 深度18·结构·仅据标题摘要

    ·vLLM SGLang

    大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。

    打开原文 →

  • 深度16·结构·仅据标题摘要

    ·vLLM SGLang

    叙事上它像新的中间件,账上它是把 GPU 小时换成 token。如果一家公司只报「接入了 vLLM」,却说不清批大小、缓存命中和 P99,那更像在卖关键词。

    原文链接待收录

  • 深度13·结构·仅据标题摘要

    ·PD 分离 Prefill Decode

    有人说的是引擎内核拆阶段,有人说的是两个 Deployment,有人只是把长请求换了个队列。投资材料里出现 PD 分离,先问清 KV 在哪、谁持有会话。

    原文链接待收录

  • 结构17·深度·仅据标题摘要

    ·Kueue Volcano Gang Scheduling

    不谈插件名,只谈:谁能抢谁、抢完怎么赔、队列是否可见。管理层听得懂的调度,才是能批预算的调度。Kueue 和 Volcano 只是实现细节。

    原文链接待收录

  • 结构14·仅据标题摘要

    ·GPU 算力成本 MFU

    官价、承诺使用折扣、包年、抢占,四套数字能差出一个数量级。对外讲「算力成本下降」,要写清是哪一套。否则那只是汇率游戏。

    原文链接待收录

  • 结构13·深度·仅据标题摘要

    ·昇腾 国产卡 Day0

    硬件折扣好看,适配工程师和机会成本写在另一本账上。没有 Day0 团队编制,买卡就是买一台昂贵的等待室。

    原文链接待收录

  • 结构20·深度·仅据标题摘要

    ·模型评测 benchmark 独立复现

    先公开设置,再请求对齐,最后才下结论。市场喜欢冲突叙事,工程需要可核对的差异。独立复现的信誉,来自克制。

    原文链接待收录