GPU 显存与模型大小的关系
深度学习训练的核心瓶颈是 GPU 显存(VRAM),而不是算力。显存决定了能训练多大的模型、用多大的 batch size。
| 模型类型 | 模型参数 | 训练显存(FP32) | 训练显存(混合精度) | 推荐 GPU |
|---|---|---|---|---|
| 小型 CNN (ResNet18) | 11M | 4 GB | 2 GB | T4 16GB |
| 中型 CNN (ResNet50) | 25M | 8 GB | 4 GB | T4 16GB |
| 大型 CNN (EfficientNet-B7) | 66M | 16 GB | 8 GB | A10 24GB |
| BERT-Base | 110M | 16 GB | 8 GB | A10 24GB |
| BERT-Large | 340M | 32 GB | 16 GB | A100 40GB |
| LLaMA-7B(LoRA) | 7B | — | 16-24 GB | A10 24GB |
| LLaMA-7B(全参) | 7B | 140 GB | 80 GB | A100 80GB |
GPU 型号对比
| GPU | 显存 | 适合场景 | 备注 |
|---|---|---|---|
| T4 | 16 GB | 推理 / 小模型训练 | 性价比高 |
| A10 | 24 GB | 中型模型 / BERT | 推荐起步 |
| A100 40GB | 40 GB | Transformer 预训练 | — |
| A100 80GB | 80 GB | LLM 全参微调 | 最佳选择 |