推荐阅读
质量分 40SGLang 和 vLLM:大模型背后的“推理引擎”
水金聊投资··vLLM SGLang
大模型能聊天,靠的往往不是训练框架,而是推理引擎。vLLM 用 PagedAttention 把显存碎片收成连续批处理;SGLang 用 RadixAttention 把共享前缀变成缓存资产。两者决定单卡能叠多少并发、首字延迟能不能进 SLO。这篇从产业和投资视角拆开「引擎」到底在卖什么。
全站检索
按标题、公众号、检索词或摘要搜索归档条目,进入扫描工作台深链阅读。
常见问题
赛道扫描是什么?
赛道扫描(Track Scan)把微信读书等来源的关键词扫描结果做成可浏览的静态归档,按日期与检索词组织文章。
如何打开微信公众号原文?
仅当条目含已验证 mp.weixin.qq.com 或搜狗 link 跳转时显示「打开原文」,不使用搜索页代替。
如何追踪公众号?
在 /accounts 在线增删追踪列表(Vercel KV + 管理口令)。