微调一个模型要多少显存和钱?7B/13B/70B 估算表
微调要多少显存,先把钱花在哪说清楚 「微调一个 7B 要几张卡」这个问题没法一句话回答,因为全参、LoRA、QLoRA 三条路的显存差着十倍以上。显存开销拆开就四块:模型权重、梯度、优化器状态、激活值。 按 bf16 训练加 AdamW 算笔账:权重 2 字节每参数,梯度 2 字节,AdamW 的一阶二阶动量是 fp32 的 8 字节,光这三项 12 字节,再叠上 fp32 master weight 和通信 buffer,经验倍数是 16~20 倍参数量。7B 落到 110~140GB,单张 80G 卡装不下,这就是全参的门槛。 LoRA 把梯度和优化器状态砍到只剩适配器那一小块,倍数量级掉到 2.5~3 倍参数量;QLoRA 再把冻结的基座压成 4bit,权重降到 0.5~0.7 字节每参数。但激活值这三条路都得付,序列长度一上去,激活能占到总占用的一半,这也是为什么…