跑图跑视频该配什么机器?文生图到批量出图配置清单

先记住一件事:显存是准入门槛,不是性能指标

很多人问「跑 Stable Diffusion 要什么显卡」,得到的回答往往是「8G 也能跑」。能跑是真的,但你让他跑一张 1024×1024 的 SDXL 再加两个 ControlNet,8G 卡会直接甩一个 CUDA out of memory 给你。显存决定的不是跑得快不快,而是这个任务能不能启动。所以选机器的顺序应该反过来:先按模型规模和目标分辨率算出显存下限,再看卡的算力,接着是内存和存储,出口带宽放最后——但批量任务里它又会变成主角。

下面按文生图、图生视频、批量出图三类任务拆开讲,每类给一份能直接拿去对照下单的清单。价格随行情浮动,文中区间仅供参考,以实际报价为准。

三类任务的配置对照表

任务类型 显存下限 推荐机型 内存 存储 网络
文生图 SD1.5 / LoRA 推理 6GB RTX 4060Ti 16G 32GB 500GB NVMe 100Mbps
文生图 SDXL / Flux 原生精度 12GB(量化)~24GB RTX 4090 24G 64GB 1TB NVMe 100Mbps
训练 SDXL LoRA 24GB 起 RTX 4090 / A5000 64–128GB 1TB NVMe 100Mbps
图生视频(短片段) 16–24GB RTX 4090 24G 128GB 1–2TB NVMe 100–200Mbps
图生视频(13B/14B 大模型) 48–80GB A100 80G / H800 256GB 2TB NVMe 1Gbps
批量出图(高并发) 24GB × N 多卡 4090 / L40S 128GB 起 本地 NVMe + 对象存储 1Gbps + CDN

文生图:按模型档位倒推显存

SD1.5 系列的底模 fp16 权重 2GB 左右,512×512 出图峰值占用 4–6GB,8G 卡跑得很舒服,6G 卡得开 attention slicing 这类省显存开关,速度掉一截。SDXL 是另一回事,权重就有 7GB 上下,1024×1024 单张峰值 10–12GB,所以 12G 是能用的分界线,16G 更稳。

Flux.1 这类 12B 量级的模型又是另一个台阶。fp16 权重十几 GB,加上激活值,24G 卡才比较从容;16G 卡要靠 fp8/nf4 量化加 CPU offload,出图时间翻倍是常有的事。如果你打算把 Flux 放进生产流程,别在 16G 卡上省这笔钱。

ControlNet 和放大是显存杀手

每挂一个 ControlNet 模型,按模型大小多占 1.5–4GB。三个 ControlNet 叠在 1024 分辨率上,24G 卡也会紧张。LoRA 本身只有几十到几百 MB,影响不大,但多个 LoRA 叠加再加 hires fix 放大,峰值会明显往上顶。留 2GB 以上余量给 CUDA context 和框架开销,是比较稳的做法。

训练 LoRA 和推理不是一回事

SD1.5 LoRA 训练,12–16G 能跑;SDXL LoRA 训练,batch size 1 加梯度检查点,24G 是起步,想开大一点 batch 或者上 1024 分辨率,建议 40G 以上。容易被忽略的是内存:dataloader 解码图片、缓存 latent 都吃内存,64GB 是舒适线,128GB 更省心,否则训练中途开始 swap,一个 epoch 拖到天亮。

图生视频:显存翻倍,内存和存储跟着涨

视频比图片吃显存,原理不复杂:一次要同时处理 N 帧,注意力计算量随帧数增长,中间激活值也成倍堆在显存里。同一个底模,出图要 12G,出 16 帧视频可能要 24G。

给个量级参考:AnimateDiff 跑 SD1.5、512 分辨率 16 帧,16G 左右能压住;SVD 576×1024 出 25 帧,24G 比较稳;CogVideoX-5B 这个级别,24–40G;再往上 HunyuanVideo、Wan2.1 这些 13B/14B 的视频模型,单卡 48G 起步,80G 才谈得上顺畅,或者走多卡张量并行。预算有限又想试大模型的团队,用按需计费的 AI 算力服务 先做验证,比一次性买卡踏实。

内存不够会静默拖垮速度

不少视频推理框架支持把权重或激活 offload 到内存。这招能让你在显存不足时也跑起来,代价是每帧都往 PCIe 上来回搬数据。内存给够(视频任务 128GB 起,大模型 256GB),速度还能忍;内存不够触发 swap,本来两分钟一段的视频能拖到二十分钟。这个坑我们见过很多次,日志里看不出报错,就是慢,排查半天才发现是内存。

存储必须是本地 NVMe

视频任务的中间帧、latent、VAE 解码缓存动辄几十 GB,写盘频率很高。用 NFS 或普通云盘跑,IO 延迟会直接反映到生成速度上。选机器时确认是本地 NVMe SSD,优先直连而不是走 RAID 卡缓存。

批量出图:瓶颈会从显存转到存储 IO 和出口带宽

单张出图看显存,一万张出图看 IO 和带宽,这是两个完全不同的问题,不少团队第一次上批量任务就栽在这。

先算笔账。1024×1024 的 PNG,一张 1.5–2MB,一天出一万张就是 15–20GB 原始文件;如果开了 hires fix 出 2048 的图,体积翻四倍。这些文件要落盘、要打包、要回传。用机械盘或者低 IOPS 的云盘,写盘本身就成了瓶颈。

三个容易被忽略的点

  • 模型加载 IO:SDXL fp16 权重 7GB 左右,Flux 更大。每次任务都从对象存储重新拉一遍模型,光加载就几十秒到几分钟。做法是把常用底模和 LoRA 预热到本地 NVMe,常驻不卸载。
  • 小文件随机读写:批量任务会产出大量小文件——缩略图、latent 缓存、json 元数据。这时候看的是 IOPS 而不是顺序带宽,NVMe 和 SATA SSD 的差距在这个场景里体现得很直接。
  • 出口带宽:100Mbps 出口理论上一秒推 12MB 左右,按 2MB 一张算,一小时的上限是几万张,但这是裸算,实际受协议开销和并发连接数影响,打对折比较现实。网页端要给用户实时预览或下载,结果文件建议走 全球 CDN 加速,别让 GPU 机器自己扛下载流量,否则算力全耗在传文件上。

并发怎么切才不 OOM

显存切并发比较直接:24G 卡跑 SDXL 1024,单路峰值 10–12GB,并发 2 路比较稳;降到 768 分辨率、fp16、关掉 refiner,能上 3–4 路。并发不是越多越好,显存打满之后会 OOM,一波任务全挂。稳妥算法是按单路峰值 ×1.3 估,再留 2GB 余量。

几个实际判断,帮你少花冤枉钱

  • 只做文生图、量不大:一张 4090 24G 足够,配 64GB 内存、1TB NVMe。任务不连续的团队租比买划算。
  • 要跑视频、要试大模型:优先看 48G/80G 的卡。别用两张 24G 硬凑,多卡切分对视频模型的支持不如张量并行成熟,调试成本比省下的钱高。
  • 批量生产:先压测存储 IOPS 和写盘延迟,再谈加卡。IO 拖后腿的时候加卡只是让更多任务排队。
  • 对外提供 API 或页面的,GPU 机器前面最好有独立接入层,需要抵御刷量的可以放在高防机房里做前置。

下一步怎么做

如果现在只是要试一个模型,省事的路子是用一张 24G 卡把流程跑通,跑通之后再按任务类型扩容。我们接过的项目里,有团队一开始就上 8 卡,结果大半时间在调环境和排队,不如先小规模验证,把显存水位和单路耗时摸清楚。

把你要跑的模型、目标分辨率、每天出图或出片量整理成三行,就能反推出显存下限和卡数,避免买多了闲置、买少了反复扩容。机型说明可以看 GPU 服务器租用,需求直接发 bd@319keji.com,或者走 联系合作 说下你的场景,我们帮你把配置单核一遍。

Leave a Reply

Your email address will not be published. Required fields are marked *