三种微调方式的显存对比
| 模型 | 全参微调 | LoRA | QLoRA (4bit) |
|---|---|---|---|
| 7B | 140 GB(2×A100 80G) | 16-24 GB(A10) | 8-10 GB(T4 勉强) |
| 13B | 260 GB(4×A100 80G) | 32 GB(A100 40G) | 12-16 GB(T4/A10) |
| 33B | 640 GB | 64 GB(A100 80G) | 24-32 GB(A100 40G) |
| 70B | 1400 GB | 128 GB(2×A100 80G) | 48-64 GB(A100 80G) |
LoRA 微调推荐配置
对于大多数科研场景,LoRA 微调 7B 模型是最实用的选择:
- 最低:T4 16GB + QLoRA(4bit 量化),可跑但速度慢、精度有损
- 推荐:A10 24GB + LoRA(16bit),速度和精度的平衡点
- 理想:A100 40GB + LoRA,可同时微调多个实验
工具推荐
- HuggingFace PEFT:官方 LoRA/QLoRA 实现
- DeepSpeed ZeRO:多卡显存优化,支持超大规模
- unsloth:7B LoRA 微调加速 2 倍,显存减半