day3-模型微调

此系列博客记录居丽叶的大模型自学计划表-算法岗速成版的学习过程,主要参考资料居里叶LLM知识体系搭建

背景

隔壁的程序员老王B站视频【什么是LoRA 大模型微调是怎么回事】

模型微调所需的显存并不比预训练的少

alt text
以约 1.5B 参数模型为例,FP16 权重本身约占 3GB;推理时主要还需要 KV Cache 和临时激活,因此显存需求通常为“模型权重 + KV Cache + 激活”,其中 KV Cache 会随 batch size 和上下文长度增长。训练时除了模型权重外,还需要保存梯度、前向激活以及优化器状态;对于 AdamW,为了保证训练精度,必须保证 FP32 的训练精度,主权重、一阶动量和二阶动量,每项约 6GB,因此仅参数、梯度和优化器状态就可能达到约 24GB,实际训练还要叠加 activation 和临时 buffer。

方法

LoRA

Low Rank Adaption

论文主图
LoRA 重参数化主图


day3-模型微调
https://liu-alessia.github.io/2026/07/13/2026-07-26-day3-模型微调/
作者
Alessia
发布于
2026年7月14日
许可协议