Category AI算力

微调一个模型要多少显存和钱?7B/13B/70B 估算表

微调要多少显存,先把钱花在哪说清楚 「微调一个 7B 要几张卡」这个问题没法一句话回答,因为全参、LoRA、QLoRA 三条路的显存差着十倍以上。显存开销拆开就四块:模型权重、梯度、优化器状态、激活值。 按 bf16 训练加 AdamW 算笔账:权重 2 字节每参数,梯度 2 字节,AdamW 的一阶二阶动量是 fp32 的 8 字节,光这三项 12 字节,再叠上 fp32 master weight 和通信 buffer,经验倍数是 16~20 倍参数量。7B 落到 110~140GB,单张 80G 卡装不下,这就是全参的门槛。 LoRA 把梯度和优化器状态砍到只剩适配器那一小块,倍数量级掉到 2.5~3 倍参数量;QLoRA 再把冻结的基座压成 4bit,权重降到 0.5~0.7 字节每参数。但激活值这三条路都得付,序列长度一上去,激活能占到总占用的一半,这也是为什么…

跑图跑视频该配什么机器?文生图到批量出图配置清单

先记住一件事:显存是准入门槛,不是性能指标 很多人问「跑 Stable Diffusion 要什么显卡」,得到的回答往往是「8G 也能跑」。能跑是真的,但你让他跑一张 1024×1024 的 SDXL 再加两个 ControlNet,8G 卡会直接甩一个 CUDA out of memory 给你。显存决定的不是跑得快不快,而是这个任务能不能启动。所以选机器的顺序应该反过来:先按模型规模和目标分辨率算出显存下限,再看卡的算力,接着是内存和存储,出口带宽放最后——但批量任务里它又会变成主角。 下面按文生图、图生视频、批量出图三类任务拆开讲,每类给一份能直接拿去对照下单的清单。价格随行情浮动,文中区间仅供参考,以实际报价为准。 三类任务的配置对照表 任务类型 显存下限 推荐机型 内存 存储 网络 文生图 SD1.5 / LoRA 推理 6GB RTX 4060Ti 16G 32GB 500GB NVMe 100Mbps 文生图 SDXL…

AI 推理扛并发四步:量化、批处理、多实例、缓存降级

先分清两件事:首 token 延迟和吞吐 并发扛不住,多数时候不是卡不够,是参数没调对,或者指标看错了。上线前先把三个数约定好:TTFT(首 token 延迟,从请求发出到第一个 token 返回)、TPOT(后续每个 token 的间隔,决定“吐字”速度)、整体吞吐(tokens/s)。 不少团队只盯吞吐,把 batch 拉到 64、128,看板上 tokens/s 翻倍很开心,可 TTFT 从 200ms 涨到 3s。聊天类产品用户点完发送,两三秒没反应就以为卡死了;后面吐字再快,体验也是崩的。反过来,纯离线跑报表、批量翻译,你完全可以把 TTFT 放到几秒,去换更高的吞吐。两者策略相反,混在同一个实例上,总有一边难受。 指标 含义 什么场景该重点盯 TTFT 首 token 延迟,含排队 + prefill 对话、语音、Copilot 类交互 TPOT / ITL 相邻 token 输出间隔…