先把这张表填一遍,再谈价格
跟供应商聊之前,把下面这张表自己先填一遍。左边是指标,中间是销售常挂在嘴边的话,右边是你真正该追问的问题。填不满的那几行,基本就是后面扯皮的来源。
| 指标 | 常见话术 | 你该追问的 | 为什么重要 |
|---|---|---|---|
| 显卡型号 | 「A100 级别的算力」 | 具体型号、显存容量、是否整卡 | 型号差一代,价格和性能差一档 |
| 显存 | 「大显存随便跑」 | 24G 还是 48G/80G,是否全部可见 | 决定模型规模、上下文长度和 batch |
| 独享 / 共享 | 「资源充足」 | 是否 vGPU 切分、有没有超卖 | 直接决定跑分稳不稳,价差能到几倍 |
| 算力形态 | 「弹性算力」 | 按小时还是包月,关机计不计费 | 直接影响预算能不能控住 |
| 存储 | 「送 500G」 | SSD 还是 NVMe、IOPS 多少、数据盘是否持久 | 模型加载和数据集读取的主要瓶颈 |
| 公网带宽 | 「百兆带宽」 | 独享还是共享、超量单价、口子多大 | 对外服务时最容易超支的一项 |
| 内网带宽 | 通常不提 | 多卡是否同一台物理机、怎么互联 | 多卡扩展效率全看这个 |
| 线路与防护 | 「BGP 多线」 | 是否含高防、跨境走哪条线 | 延迟和被打时能不能扛住 |
| SLA 与赔付 | 「可用性很高」 | 故障响应时间、赔付怎么算 | 出事时你实际能拿到什么 |
表填完你会发现,真正决定报价的是三件事:卡型、独享还是共享、带宽和存储怎么计费。剩下的看着都是细节,但细节会在你凌晨收到告警的时候变成大问题。
显存:先算账,再挑卡
显存不是越大越好,是先算清楚你需要多少。行业里比较通用的估算方式是:FP16 权重约占参数量 2 倍(7B 约 14GB),INT8 约 1 倍,INT4 约 0.5 倍。再往上加 KV cache、激活值和框架自身的开销,长上下文场景下 KV cache 吃掉十几 GB 很常见。
- 7B 模型做在线推理:FP16 建议 24GB 显存起步,留出并发余量;量化到 INT8 可以往 16GB 压。
- 7B 做 LoRA 微调:24GB 能跑但比较紧,序列长度一长就容易 OOM,32G 到 48G 舒服得多。
- 7B 做全参微调:优化器状态加梯度,量级远高于权重本身,单卡基本没戏,得靠多卡加 ZeRO 之类的并行策略。
这些数字是估算,实际和框架版本、序列长度、batch size 都有关系。拿着模型和数据集去问供应商「能不能给半小时试用跑一轮」,比听十页 PPT 有用。
卡型与代际:别被「同级算力」绕进去
训练卡和推理卡是两条路线。A100、H100 这类带 NVLink 的卡,多卡通信走高速互联,适合训练和需要张量并行的场景;L40S、4090 这类消费或推理向的卡性价比高,但多卡只能走 PCIe,卡一多通信就成了瓶颈。
同一个型号还有形态差异:SXM 版和 PCIe 版、80G 和 40G、是否被降频。采购时值得问一句「能不能给一下 nvidia-smi 的截图」,功耗墙、显存容量、驱动版本一眼就清楚。如果对方含糊其辞,通常不是好信号。
存储和带宽:两张容易超支的账单
模型权重动辄几十 GB,每次重启实例都从远端拉一遍,用机械盘和用 NVMe 的体感差距是分钟级的。数据盘是否持久、快照怎么收费、实例释放后数据保留多久,这几条要写进合同。
公网带宽更要注意计费口径。按流量计费看着单价低,一个热点接口被刷起来,账单会很难看;独享带宽单价高但可预测。做对外服务的话,静态资源和可缓存内容尽量往前推到 全球 CDN 加速 上,源站只承担动态请求,带宽和防护压力都会小很多。跨境业务还要额外确认线路走向,这部分在 美国西海岸 CDN 节点 的选择上也有讲究。
共享卡和独享卡:报价差几倍就出在这
这是坑比较多的地方。所谓共享卡,可能是 vGPU 切分、MIG 切片,也可能是时间片轮转调度。你拿到的是「一张 24G 卡」,实际上显存和算力都被人分走一块。表现是:白天跑得好好的,晚上 step time 突然翻倍,或者显存明明够却 OOM。排查半天代码,问题在别人那边。
几个能当场验证的动作:
- 登录后看
nvidia-smi,显存总量是不是完整型号的容量,驱动里有没有 vGPU 字样。 - 跑一段十分钟以上的稳定负载,记录每步耗时,看波动幅度。共享卡的抖动通常很明显。
- 问清楚 CPU 和内存有没有超卖。GPU 没超卖但 CPU 抢不到,数据加载照样拖死。
- 确认能不能独占 PCIe 通道,多卡场景下这个比单卡跑分更关键。
价格上,同型号独享通常比共享贵两到四倍,具体以实际报价为准。这个价差不是供应商乱开,是资源占用模型本身不同。判断标准很简单:如果这个任务中断一次会耽误交付,就老实买独享;如果只是跑个 demo 或者做批量离线任务,共享卡能省钱。做 GPU 服务器租用 之前先把这个问清楚,比后面迁移环境省事。
场景一:三四个人做微调,钱花在哪
典型情况是团队三五个人,拿开源 7B 到 14B 模型在垂直数据上做 LoRA,一周跑几轮,产出是给业务用的专用模型。
这种场景的取舍是:宁可要一张 48G 的独享卡,也不要四张 24G 的共享卡。原因是 LoRA 微调本身很难把多卡并行效率吃满,四张共享卡的算力波动叠加起来,训练时间反而不可预测;而单卡显存大一点,序列长度和 batch 能开得更大,一轮跑完的时间更短。
存储上给数据集留一块持久盘,checkpoint 按小时存一次。包月比按小时便宜,但如果每周只跑两天,按小时加持久存储的组合通常更划算。更细的并行策略和卡型搭配,可以参考 大模型训练 GPU 方案 里的分档思路,别一上来就冲旗舰卡。
场景二:做在线推理,吞吐比单卡峰值重要
推理服务和训练是完全不同的账。训练看单卡算力,推理看的是稳定并发下的吞吐和首 token 延迟。一张跑分很高的卡,如果显存被权重占满、留给 KV cache 的空间不够,并发一上来就开始排队,用户体验反而差。
几个实操点:显存规划时先把 KV cache 的空间留够,再决定 batch;把日志、监控、健康检查这些辅助进程的资源开销算进去;对外接口做限流,防止单个客户端把整个实例拖垮。做推理部署时如果前面挂了 CDN,动态请求回源的压力会明显下降,具体链路设计可以看 AI 推理部署方案。
另外,推理实例对线路的敏感度高于训练。训练跑在内网,晚几十毫秒没人在意;推理接口多 30 毫秒,用户能感觉出来。做跨境业务的话,机房位置和线路质量要单独评估,别只看显卡型号下单。
合同和计费:几行字能省不少事
- 计费粒度:按秒、按小时还是按天;关机状态是否计费;释放实例后退款怎么算。
- 带宽口径:独享还是峰值共享,超量部分单价多少,能不能设封顶。
- 数据归属:实例释放后数据保留多久,快照是否额外收费,迁出要不要费用。
- 扩容窗口:临时加卡要提前多久申请,节假日能不能加。业务高峰期加不到卡是常态。
- SLA 与赔付:写清故障响应时间和赔付方式,口头承诺不算数。
还有一种便宜的形态叫抢占式实例,价格低但随时可能被回收,适合跑可中断的离线任务,不适合训练到一半的微调或者在线推理。
下一步:先跑压测,再签长约
采购走到这里,动作其实很清楚:先把自己的需求写成一张表(模型规模、并发量、每天跑多久、能不能中断),拿这张表去要一轮试用,用你自己真实的模型和数据集跑一遍,记录显存占用曲线、每步耗时波动、加载时间。数据出来之后,再决定是共享还是独享、按小时还是包月。
如果表格里还有几项拿不准,或者不确定自己的模型在哪种卡上跑得更合适,可以直接把场景发给我们,319科技做企业级 GPU 算力和 IDC 这块,可以按你的实际负载给一个配置建议和报价区间,邮箱 bd@319keji.com,也可以走 联系合作 页面。先聊清楚需求,比先谈价格有用。