租GPU服务器看哪些指标?企业采购对照清单与避坑

租GPU服务器该看哪些指标?本文从企业采购视角给出一张对照表,逐项拆解显存、卡型、带宽、存储与计费方式,点明共享卡和独享卡这个容易被话术盖过去的坑,并用微调、推理两个场景说明取舍,附签约前确认清单。训练还是推理、独享还是共享,先搞清楚再谈价格。

先把这张表填一遍,再谈价格

跟供应商聊之前,把下面这张表自己先填一遍。左边是指标,中间是销售常挂在嘴边的话,右边是你真正该追问的问题。填不满的那几行,基本就是后面扯皮的来源。

指标 常见话术 你该追问的 为什么重要
显卡型号 「A100 级别的算力」 具体型号、显存容量、是否整卡 型号差一代,价格和性能差一档
显存 「大显存随便跑」 24G 还是 48G/80G,是否全部可见 决定模型规模、上下文长度和 batch
独享 / 共享 「资源充足」 是否 vGPU 切分、有没有超卖 直接决定跑分稳不稳,价差能到几倍
算力形态 「弹性算力」 按小时还是包月,关机计不计费 直接影响预算能不能控住
存储 「送 500G」 SSD 还是 NVMe、IOPS 多少、数据盘是否持久 模型加载和数据集读取的主要瓶颈
公网带宽 「百兆带宽」 独享还是共享、超量单价、口子多大 对外服务时最容易超支的一项
内网带宽 通常不提 多卡是否同一台物理机、怎么互联 多卡扩展效率全看这个
线路与防护 「BGP 多线」 是否含高防、跨境走哪条线 延迟和被打时能不能扛住
SLA 与赔付 「可用性很高」 故障响应时间、赔付怎么算 出事时你实际能拿到什么

表填完你会发现,真正决定报价的是三件事:卡型、独享还是共享、带宽和存储怎么计费。剩下的看着都是细节,但细节会在你凌晨收到告警的时候变成大问题。

显存:先算账,再挑卡

显存不是越大越好,是先算清楚你需要多少。行业里比较通用的估算方式是:FP16 权重约占参数量 2 倍(7B 约 14GB),INT8 约 1 倍,INT4 约 0.5 倍。再往上加 KV cache、激活值和框架自身的开销,长上下文场景下 KV cache 吃掉十几 GB 很常见。

  • 7B 模型做在线推理:FP16 建议 24GB 显存起步,留出并发余量;量化到 INT8 可以往 16GB 压。
  • 7B 做 LoRA 微调:24GB 能跑但比较紧,序列长度一长就容易 OOM,32G 到 48G 舒服得多。
  • 7B 做全参微调:优化器状态加梯度,量级远高于权重本身,单卡基本没戏,得靠多卡加 ZeRO 之类的并行策略。

这些数字是估算,实际和框架版本、序列长度、batch size 都有关系。拿着模型和数据集去问供应商「能不能给半小时试用跑一轮」,比听十页 PPT 有用。

卡型与代际:别被「同级算力」绕进去

训练卡和推理卡是两条路线。A100、H100 这类带 NVLink 的卡,多卡通信走高速互联,适合训练和需要张量并行的场景;L40S、4090 这类消费或推理向的卡性价比高,但多卡只能走 PCIe,卡一多通信就成了瓶颈。

同一个型号还有形态差异:SXM 版和 PCIe 版、80G 和 40G、是否被降频。采购时值得问一句「能不能给一下 nvidia-smi 的截图」,功耗墙、显存容量、驱动版本一眼就清楚。如果对方含糊其辞,通常不是好信号。

存储和带宽:两张容易超支的账单

模型权重动辄几十 GB,每次重启实例都从远端拉一遍,用机械盘和用 NVMe 的体感差距是分钟级的。数据盘是否持久、快照怎么收费、实例释放后数据保留多久,这几条要写进合同。

公网带宽更要注意计费口径。按流量计费看着单价低,一个热点接口被刷起来,账单会很难看;独享带宽单价高但可预测。做对外服务的话,静态资源和可缓存内容尽量往前推到 全球 CDN 加速 上,源站只承担动态请求,带宽和防护压力都会小很多。跨境业务还要额外确认线路走向,这部分在 美国西海岸 CDN 节点 的选择上也有讲究。

共享卡和独享卡:报价差几倍就出在这

这是坑比较多的地方。所谓共享卡,可能是 vGPU 切分、MIG 切片,也可能是时间片轮转调度。你拿到的是「一张 24G 卡」,实际上显存和算力都被人分走一块。表现是:白天跑得好好的,晚上 step time 突然翻倍,或者显存明明够却 OOM。排查半天代码,问题在别人那边。

几个能当场验证的动作:

  1. 登录后看 nvidia-smi,显存总量是不是完整型号的容量,驱动里有没有 vGPU 字样。
  2. 跑一段十分钟以上的稳定负载,记录每步耗时,看波动幅度。共享卡的抖动通常很明显。
  3. 问清楚 CPU 和内存有没有超卖。GPU 没超卖但 CPU 抢不到,数据加载照样拖死。
  4. 确认能不能独占 PCIe 通道,多卡场景下这个比单卡跑分更关键。

价格上,同型号独享通常比共享贵两到四倍,具体以实际报价为准。这个价差不是供应商乱开,是资源占用模型本身不同。判断标准很简单:如果这个任务中断一次会耽误交付,就老实买独享;如果只是跑个 demo 或者做批量离线任务,共享卡能省钱。做 GPU 服务器租用 之前先把这个问清楚,比后面迁移环境省事。

场景一:三四个人做微调,钱花在哪

典型情况是团队三五个人,拿开源 7B 到 14B 模型在垂直数据上做 LoRA,一周跑几轮,产出是给业务用的专用模型。

这种场景的取舍是:宁可要一张 48G 的独享卡,也不要四张 24G 的共享卡。原因是 LoRA 微调本身很难把多卡并行效率吃满,四张共享卡的算力波动叠加起来,训练时间反而不可预测;而单卡显存大一点,序列长度和 batch 能开得更大,一轮跑完的时间更短。

存储上给数据集留一块持久盘,checkpoint 按小时存一次。包月比按小时便宜,但如果每周只跑两天,按小时加持久存储的组合通常更划算。更细的并行策略和卡型搭配,可以参考 大模型训练 GPU 方案 里的分档思路,别一上来就冲旗舰卡。

场景二:做在线推理,吞吐比单卡峰值重要

推理服务和训练是完全不同的账。训练看单卡算力,推理看的是稳定并发下的吞吐和首 token 延迟。一张跑分很高的卡,如果显存被权重占满、留给 KV cache 的空间不够,并发一上来就开始排队,用户体验反而差。

几个实操点:显存规划时先把 KV cache 的空间留够,再决定 batch;把日志、监控、健康检查这些辅助进程的资源开销算进去;对外接口做限流,防止单个客户端把整个实例拖垮。做推理部署时如果前面挂了 CDN,动态请求回源的压力会明显下降,具体链路设计可以看 AI 推理部署方案。

另外,推理实例对线路的敏感度高于训练。训练跑在内网,晚几十毫秒没人在意;推理接口多 30 毫秒,用户能感觉出来。做跨境业务的话,机房位置和线路质量要单独评估,别只看显卡型号下单。

合同和计费:几行字能省不少事

  • 计费粒度:按秒、按小时还是按天;关机状态是否计费;释放实例后退款怎么算。
  • 带宽口径:独享还是峰值共享,超量部分单价多少,能不能设封顶。
  • 数据归属:实例释放后数据保留多久,快照是否额外收费,迁出要不要费用。
  • 扩容窗口:临时加卡要提前多久申请,节假日能不能加。业务高峰期加不到卡是常态。
  • SLA 与赔付:写清故障响应时间和赔付方式,口头承诺不算数。

还有一种便宜的形态叫抢占式实例,价格低但随时可能被回收,适合跑可中断的离线任务,不适合训练到一半的微调或者在线推理。

下一步:先跑压测,再签长约

采购走到这里,动作其实很清楚:先把自己的需求写成一张表(模型规模、并发量、每天跑多久、能不能中断),拿这张表去要一轮试用,用你自己真实的模型和数据集跑一遍,记录显存占用曲线、每步耗时波动、加载时间。数据出来之后,再决定是共享还是独享、按小时还是包月。

如果表格里还有几项拿不准,或者不确定自己的模型在哪种卡上跑得更合适,可以直接把场景发给我们,319科技做企业级 GPU 算力和 IDC 这块,可以按你的实际负载给一个配置建议和报价区间,邮箱 bd@319keji.com,也可以走 联系合作 页面。先聊清楚需求,比先谈价格有用。

Leave a Reply

Your email address will not be published. Required fields are marked *