分清 4bit 权重、原生 FP4 计算和实际推理内核,判断量化模型在 3090 上能否运行、节省显存,以及是否值得部署。
高并发大模型服务真正容易爆掉的不是模型参数,而是随请求增长的 KV Cache。理解 PagedAttention 和 Continuous Batching,才能看懂 vLLM 为什么能把吞吐做上去。