← 返回工具列表English

LLM 部署检查清单

部署 LLM 前的交互式分阶段检查项(硬件/软件/模型/安全)

进度概览

总进度 0/30(0%) · 关键项 0/10

还有关键项未完成,不建议上线

硬件
0/6(0%)
软件
0/6(0%)
模型
0/6(0%)
安全
0/7(0%)
监控
0/5(0%)

勾选状态自动保存在浏览器本地

检查清单

1. 硬件0/6(0%)

  • GPU 显存容量核算关键显存需容纳模型权重(参数量 × 每参数字节数)+ KV 缓存(随并发与上下文长度增长)+ 框架开销,预留 10–20% 余量。
  • GPU 数量与互联拓扑确认单卡可放下模型,否则需要 tensor parallel 多卡方案;检查 NVLink / PCIe 带宽是否成为瓶颈。
  • 系统内存充足系统 RAM 至少能完整加载一份模型权重(加载/转换时需经 CPU 内存),使用 CPU offload 时需更多。
  • 存储容量与速度NVMe SSD 存放模型权重、日志与临时文件;加载速度直接影响冷启动时间,确认磁盘剩余空间 ≥ 2 倍模型大小。
  • 网络带宽评估估算峰值并发下的入口/出口带宽(流式输出 token 数 × 并发连接数),并确认与模型仓库/对象存储之间的拉取速度。
  • 供电与散热冗余自建机房需确认电源功率、UPS 与散热可支撑 GPU 满载长时间运行;云主机确认配额与可用区容量。

2. 软件0/6(0%)

  • 操作系统与内核参数使用受支持的 Linux 发行版;按需调优文件描述符上限、共享内存(/dev/shm)与网络内核参数。
  • GPU 驱动版本关键安装与 CUDA 工具链匹配的 NVIDIA 驱动,nvidia-smi 可正常识别全部 GPU;驱动版本写入部署文档。
  • CUDA / cuDNN 版本兼容关键确认 CUDA 运行时版本与推理引擎的官方支持矩阵一致(版本不符是部署失败最常见的原因之一)。
  • 推理引擎选型关键按场景选择 vLLM / SGLang / TensorRT-LLM / TGI / llama.cpp 等;确认支持目标模型架构、量化格式与所需功能(流式、工具调用)。
  • 运行环境固定用 Docker 镜像或锁定文件固定 Python、依赖库版本;镜像经过漏洞扫描并推送到私有镜像仓库。
  • 性能基准测试在真实硬件上压测:首 token 延迟(TTFT)、吞吐(tokens/s)、并发上限,达到业务 SLA 才进入下一阶段。

3. 模型0/6(0%)

  • 模型格式与引擎兼容关键确认权重格式(safetensors / GGUF / AWQ / GPTQ)被推理引擎原生支持;避免加载时静默回退到慢速路径。
  • 量化方案与质量回归选定量化精度(FP16 / BF16 / INT8 / INT4),在业务评测集上做质量回归测试,确认精度损失可接受。
  • 模型许可证审查关键确认许可证允许目标用途(商用、二次分发、微调后商用);注意 Llama、Qwen 等模型的附加条款与 MAU 限制。
  • 模型版本固定与回滚记录确切的模型版本/ commit hash,权重文件校验和入库;保留上一版本以便快速回滚。
  • Tokenizer 与聊天模板验证 tokenizer 配置与 chat template 和训练时一致,否则输出质量会明显下降;多语言场景测试特殊字符切分。
  • 上下文长度配置按业务需要设定 max context;超长上下文确认 RoPE scaling / YaRN 配置并实测长文质量与显存占用。

4. 安全0/7(0%)

  • API 鉴权关键对外接口必须启用鉴权(API key / OAuth / mTLS),禁止无鉴权暴露推理端口;按调用方发放独立凭证。
  • 速率限制与配额按用户/API key 配置 QPS、并发与每日 token 配额,防止单用户打满 GPU 影响其他租户。
  • 网络隔离关键推理服务置于内网/VPC,仅通过网关或反向代理暴露;安全组/防火墙只放行必要端口。
  • 输入防护限制输入长度,按需部署 prompt injection 检测与恶意内容过滤,防止滥用与越权指令。
  • 输出过滤与脱敏对输出做敏感信息(PII、密钥)检测与脱敏;面向终端用户的场景增加内容安全过滤。
  • 密钥管理API key、HF token 等密钥存入 KMS / Vault / 环境变量注入,不写入镜像、代码仓库或日志。
  • 审计日志记录调用方身份、时间、用量等审计信息(注意不记录敏感 prompt 原文,或做加密与访问控制)。

5. 监控0/5(0%)

  • 结构化请求日志关键每次请求记录 request id、延迟、输入/输出 token 数、模型版本与错误码,便于排障与计费。
  • 指标采集采集 GPU 利用率、显存占用、吞吐、队列深度、TTFT/TPOT 等指标(Prometheus + DCGM 或引擎自带 metrics)。
  • 告警规则关键配置错误率飙升、延迟超阈值、OOM、GPU 掉卡、磁盘将满等告警,并接通值班通知渠道。
  • 监控看板搭建 Grafana 看板,一屏展示 QPS、延迟分布、GPU 状态与配额使用,上线前演练一次故障定位流程。
  • 成本与用量统计按租户/项目统计 token 用量与 GPU 时长,定期核对单位成本是否符合预算。

操作