GPU租赁按时、包月、包年怎么算才不亏?含闲置成本公式

先把成本公式摆出来,别只盯单卡小时价

挑 GPU 租用的时候,多数人扫一眼单卡小时价就下单了。这个数字没错,但它只是账单的一部分。真正决定月底花多少钱的是一条完整的式子:

月总成本 ≈ 单卡小时价 × 卡数 × 计费时长 + 存储费 + 带宽与流量费 + 环境重建与数据搬迁成本

前四项是供应商出账的,第五项是你自己掏的。前四项里,存储和流量经常被忽略;第五项要等到你想换一家供应商的时候才疼。

还有一个概念要先掰开:「计费时长」不等于「你用了多久」。按小时计费时两者相等;包月时计费时长固定按 720 小时(30 天)算,你跑不跑都收钱。

计费项 常见口径 容易漏掉的地方
GPU 卡时 按秒 / 按小时 / 包月 / 包年 关机后是否继续计费,各家规则不一样,签约前要逐条问清
系统盘与数据盘 按 GB / 月 机器释放了、盘还挂着,照样出账;快照单独计价
公网带宽 按 Mbps 包月,或按流量 GB 计费 训练阶段从公网拉数据集,几百 GB 很快就没了
内网 / 对象存储 同机房内网通常不计流量 跨区域读取会变成公网流量,账单直接跳一档
镜像与快照 按 GB / 月 留着一堆历史镜像,一年下来也是一笔实打实的钱

闲置成本:账本里真正的大头

我们见过太多团队的典型场景:包了一台 8 卡整机,白天跑训练,晚上和周末空着。按每天有效 10 小时算,一个月 300 卡时,可你付的是 720 小时的钱。钱花了,卡的利用率只有四成出头。

用等效单价一算就清楚

判断包月亏不亏,不看标价,看这一条:

等效单卡小时成本 = 当期总费用 ÷ (卡数 × 实际卡时)

再算临界点:临界卡时 = 包月价 ÷ (单卡按量小时价 × 卡数)。举个例子,假设某 8 卡整机包月 45000 元,同卡型按量计费单卡小时价 10 元(都只是示例数字,实际以报价为准),临界卡时就是 45000 ÷ 80 = 562.5 卡时/月,折算下来约等于每天 18.7 小时。跑不满这条线,按量更合适。

反过来看,如果这台机器一个月只跑了 300 卡时,等效单价是 45000 ÷ 2400 = 18.75 元/卡时,比按量的 10 元贵出近一倍。这就是闲置成本的真面目——它不出现在任何一张明细单上,但一直在扣钱。

卡时之外,还有三笔隐性支出

  • 数据搬迁:换供应商要把几百 GB 到几 TB 的数据重传一遍,走公网就是几十小时起步,这段时间算力和人力都是空转的。
  • 环境重建:驱动版本、CUDA、Python 依赖、自编译算子,一套环境重新对齐少则半天多则一周。这也是为什么很多人宁愿贵一点也不换池子。
  • 排队与抢占:共享资源池里任务被中断、需要重跑,等于同一段算力付了两次钱。做长任务时这个损耗比单价差异更致命。

三种使用节奏,对应三种计费

节奏一:断续实验、调参、小规模微调 → 按量(按小时或按秒)

这类负载的特点是总量小、时间散,一个月有效卡时通常几十到两百出头,单次任务几十分钟到几小时。选支持随时释放、按秒或按小时结算的池子,配合两件事:数据集放对象存储而不是系统盘;任务脚本末尾挂自动关机。别为了「单价看着便宜」去签包月,你锁不住自己的使用节奏。

节奏二:长期训练(多卡、多周)→ 包月或包季,但要先跑通再锁

多卡训练最怕中途掉链子,签之前确认四件事:是不是独占整机、卡间互联走 NVLink 还是 IB、存储是打包价还是单独计费、断点续训要不要额外收费。包年相对包月的折扣,市场上常见区间在 15%–30%,但前提是项目周期能覆盖 8 个月以上。没把握就先包一个月,把吞吐和稳定性摸清再谈长约,同时留意提前退租条款和故障是否折算退费。具体卡型和互联配置可以对照 大模型训练 GPU 方案 里的说明挑。

节奏三:常驻推理 → 包年、整机托管,或把自有卡放进机房

推理是 7×24 在线,用按量计费反而危险:高峰期可能被其他租户挤占资源,而单价乘上 720 小时之后通常高于包月。推理真正该看的是并发能力和显存配比,不是峰值算力。另一块容易失控的是出网流量,接口返回图片、音频、大 JSON 的时候,流量账单涨得比 GPU 还快,建议在算力前面加一层 全球 CDN 加速 扛住静态资源和回源。部署侧的取舍可以参考 AI 推理部署方案。

使用节奏 月有效卡时参考 建议计费 主要风险
断续实验、调参 50–200 按小时 / 按秒 忘记关机,盘和数据没清理
长期训练 400–700 包月 / 包季 锁长约后项目变更,停机维护算谁的
常驻推理 650 以上 包年 / 整机托管 出网流量失控,单点故障

一套能直接套用的判断流程

  1. 拉出过去 30 天的实际使用卡时,不是账单上的计费卡时,两个数字往往差一倍。
  2. 算等效单价:当期总费用 ÷ 实际卡时,先知道你现在每卡时掏了多少钱。
  3. 算临界卡时:包月价 ÷(按量单卡小时价 × 卡数)。
  4. 实际卡时超过临界卡时的 1.2 倍以上,再考虑包月,多出来的两成留给维护、重跑和临时空闲。
  5. 每个季度复查一次,负载结构变了,计费方式也该跟着变。

不同卡型、不同区域的报价差异不小,多对比几家再定,可以先看一轮 GPU 租赁价格对比 建立价格感,再拿上面的式子往自家数据上套。

下一步怎么做

想立刻把闲置成本压下来,两件事投入产出比高:把「用完即停」写进脚本而不是靠人记;把存储和算力拆开看,机器释放了盘也一并清掉。如果负载曲线本身就不规律,与其自己纠结,不如把过去一个月的监控数据整理成一页,发到 bd@319keji.com 或者走 联系合作,我们按上面的式子帮你算一遍该走按量还是包月,顺便看看有没有更合适的卡型和机房位置。

Leave a Reply

Your email address will not be published. Required fields are marked *