← 返回工具列表English

量化策略对比

FP16 / INT8 / INT4 / GGUF / AWQ / GPTQ 效果、性能、兼容性对比

量化方法对比表

方法质量损失(困惑度上升)推理速度显存压缩率硬件兼容性最佳场景
FP16无损失(基线)(0%)1×(基线)—所有 GPU / CPU / Apple Silicon质量优先、显存充足的训练与推理基线
INT8几乎无损(<1%)约 1.6×↓ 47%NVIDIA / AMD GPU,部分 CPU 指令集生产环境服务,要求质量接近 FP16
INT4可感知下降(3–8%)约 2.4×↓ 72%较新的 NVIDIA GPU(TensorRT-LLM 等)极限吞吐、可接受质量折损的场景
GGUF Q8_0几乎无损(<1%)约 1.3×↓ 47%CPU、Apple Silicon、树莓派等边缘设备CPU / Mac 本地运行且不想损失质量
GGUF Q4_K_M轻微下降(1–3%)约 1.8×↓ 70%CPU、Apple Silicon、手机(llama.cpp / ollama)笔记本、家用机、移动端本地部署的首选
AWQ (W4A16)轻微下降(1–3%)约 2.2×↓ 72%NVIDIA GPU(vLLM / TensorRT-LLM 支持良好)GPU 服务器上的高吞吐 API 服务
GPTQ (4-bit)轻微下降(1–4%)约 2.0×↓ 72%NVIDIA / AMD GPU,生态成熟(ExLlama、vLLM)已有 GPTQ 模型仓库可直接使用的场景

数值为经验估算:实际占用受框架、分组大小、上下文长度影响,请以实测为准。

决策指南:我该用哪种?

模型大小计算器

方法权重占用总占用相比 FP16 节省
FP1614.0 GB14.0 GB—
INT87.44 GB7.44 GB6.56 GB (↓ 47%)
INT43.94 GB3.94 GB10.1 GB (↓ 72%)
GGUF Q8_07.44 GB7.44 GB6.56 GB (↓ 47%)
GGUF Q4_K_M4.20 GB4.20 GB9.80 GB (↓ 70%)
AWQ (W4A16)3.94 GB3.94 GB10.1 GB (↓ 72%)
GPTQ (4-bit)3.94 GB3.94 GB10.1 GB (↓ 72%)