量化策略对比
FP16 / INT8 / INT4 / GGUF / AWQ / GPTQ 效果、性能、兼容性对比
量化方法对比表
| 方法 | 质量损失(困惑度上升) | 推理速度 | 显存压缩率 | 硬件兼容性 | 最佳场景 |
|---|---|---|---|---|---|
| FP16 | 无损失(基线)(0%) | 1×(基线) | — | 所有 GPU / CPU / Apple Silicon | 质量优先、显存充足的训练与推理基线 |
| INT8 | 几乎无损(<1%) | 约 1.6× | ↓ 47% | NVIDIA / AMD GPU,部分 CPU 指令集 | 生产环境服务,要求质量接近 FP16 |
| INT4 | 可感知下降(3–8%) | 约 2.4× | ↓ 72% | 较新的 NVIDIA GPU(TensorRT-LLM 等) | 极限吞吐、可接受质量折损的场景 |
| GGUF Q8_0 | 几乎无损(<1%) | 约 1.3× | ↓ 47% | CPU、Apple Silicon、树莓派等边缘设备 | CPU / Mac 本地运行且不想损失质量 |
| GGUF Q4_K_M | 轻微下降(1–3%) | 约 1.8× | ↓ 70% | CPU、Apple Silicon、手机(llama.cpp / ollama) | 笔记本、家用机、移动端本地部署的首选 |
| AWQ (W4A16) | 轻微下降(1–3%) | 约 2.2× | ↓ 72% | NVIDIA GPU(vLLM / TensorRT-LLM 支持良好) | GPU 服务器上的高吞吐 API 服务 |
| GPTQ (4-bit) | 轻微下降(1–4%) | 约 2.0× | ↓ 72% | NVIDIA / AMD GPU,生态成熟(ExLlama、vLLM) | 已有 GPTQ 模型仓库可直接使用的场景 |
数值为经验估算:实际占用受框架、分组大小、上下文长度影响,请以实测为准。
决策指南:我该用哪种?
模型大小计算器
| 方法 | 权重占用 | 总占用 | 相比 FP16 节省 |
|---|---|---|---|
| FP16 | 14.0 GB | 14.0 GB | — |
| INT8 | 7.44 GB | 7.44 GB | 6.56 GB (↓ 47%) |
| INT4 | 3.94 GB | 3.94 GB | 10.1 GB (↓ 72%) |
| GGUF Q8_0 | 7.44 GB | 7.44 GB | 6.56 GB (↓ 47%) |
| GGUF Q4_K_M | 4.20 GB | 4.20 GB | 9.80 GB (↓ 70%) |
| AWQ (W4A16) | 3.94 GB | 3.94 GB | 10.1 GB (↓ 72%) |
| GPTQ (4-bit) | 3.94 GB | 3.94 GB | 10.1 GB (↓ 72%) |