VRAM 估算器
根据模型参数量、量化方式与上下文长度估算 LLM 推理所需的 GPU 显存
模型结构(影响 KV 缓存)
估算结果
| 模型权重 | 14.2 GB |
| KV 缓存 | 0.22 GB |
| 运行时开销 | 1.44 GB |
| 总计所需显存 | 15.9 GB |
常见显卡能否容纳
- RTX 3060 (12 GB)放不下
- RTX 4070 Ti (16 GB)勉强(<10% 余量)
- RTX 3090 / 4090 (24 GB)可以
- RTX A6000 (48 GB)可以
- A100 / H100 (80 GB)可以
- H200 / B200 (141 GB)可以
估算值仅供容量规划参考;实际占用随推理框架(vLLM、llama.cpp 等)、CUDA 上下文与激活值而变化。KV 缓存按所选量化精度的字节数计算。