竞价实例和预留 GPU 实例哪个更省钱?先看任务能不能中断,再算利用率

2026-09-29 53 0

只看标价,竞价实例(Spot)通常最便宜,预留实例最稳。算综合成本时,结论取决于两件事:任务被打断后能不能接着跑,以及这张卡未来一年实际运行的时间占比有多高。

  • 能断点续跑、量大、不赶时间的离线任务,适合竞价实例。
  • 全天候满载、规格短期不会变的线上推理,适合预留实例。
  • 周期在几小时到几周之间的微调、原型验证和间歇性测试,用这两种都容易多花钱。选择无合约、按小时计费的算力,资金风险通常最低。

下面分别说明怎么判断,以及钱会花在哪里。

两种实例各自便宜在哪,代价是什么

竞价实例卖的是云厂商的闲置算力,价格常比按需低 60%~90%。代价是实例随时可能被回收。以 AWS 为例,回收前大约提前 2 分钟通知,有的平台只提前 30 秒。实例停止或销毁后,内存里的状态和还没保存的中间权重都会丢失。

预留实例或承诺用量折扣(如 Savings Plans)一般能便宜约 30%~72%,而且保证有卡可用。前提是签 1 年或 3 年的消费承诺。签约后不管有没有跑任务,都按承诺额度计费。

不同平台的通知时长、回收规则和合约条款不一样,下单前请以所用平台的文档为准。

用两道题给任务归类

第一题:被打断后能不能接着跑? 满足以下任一条,就算“能断”:训练代码会定期保存检查点并支持断点续训;推理是异步批处理,失败后可以自动重试;任务结果可以重复计算且不影响最终输出,比如数据清洗和离线打标。

第二题:未来一年卡的实际利用率是多少? 这里要按真实跑任务的小时数估算,不要按峰值估算。

两题的答案组合起来:

  • 能断,量大,不急:优先考虑竞价实例。
  • 不能断,全天候满载,规格一年内不会变:可以考虑预留实例。
  • 不能断,但只是间歇性使用:用按需或按小时计费的实例。
  • 周期短,还在试方案:用按小时计费,不要签合约。

竞价实例:标价之外还有三笔账

1. 重做的进度。 被回收时,从上一个检查点到回收那一刻的计算全部作废,重新调度和启动也要花时间。检查点间隔越长,每次中断丢的进度越多。间隔越短,写检查点占用的训练时间越多。这个间隔需要根据实测的中断频率来调整。

2. 检查点的存储费。 为了防中断,检查点要高频写到实例以外的存储或对象存储。另一个常被忽略的点是,实例被中断或停止后,挂载的云盘往往还在计费,AWS 的 EBS 就是这样。不主动删除,这些空置的磁盘会一直产生账单。

3. 换节点重跑的下载费。 在新节点上重新拉起任务,要再下载几十 GB 的模型权重和数据集。这既花时间,也可能产生流量费。

估算竞价实例的真实成本,可以用这个口径:

有效单价 ≈ 竞价单价 × 实际消耗的卡时 ÷ 真正产出结果的卡时,再加上检查点存储费和重复下载的流量费

如果任务一被中断就要从头开始,这个比值会迅速变大,折扣基本就抵消了。还有一点要注意:各可用区旗舰卡的实际中断率,云厂商一般不公开。事前很难算准,比较稳妥的做法是先小规模跑一段时间,记下真实的中断次数,再决定要不要把整批任务放上去。

预留实例:利用率决定是否划算

预留实例是否划算,可以用一个简单的盈亏线判断:

盈亏平衡利用率 ≈ 1 − 折扣率

举例来说,折扣 40% 时,实际利用率要高于 60% 才比按需便宜。折扣 60% 时,利用率要高于 40%。一般来说,实际使用率低于 50%~60% 的任务,长期预留的均摊成本很容易反超按小时计费。

预留实例均摊成本随利用率下降,与按小时计费成本相交处即盈亏平衡利用率

这条线只算了钱,还没算两类风险:

  • 规格被锁定:1~3 年的合约锁定了显卡架构、显存大小和算力规格。如果新的开源模型把显存门槛抬高,旧卡可能直接跑不动。
  • 硬件贬值:新一代 GPU 性价比大幅提升后,旧卡合约不能退,剩余的承诺额度就成了沉没成本。

所以在 AI 业务里,决定预留之前,除了算利用率,还要问一句:这张卡的规格一年后还够用吗?怎么按业务阶段估算利用率,可以参考专有云与公有云 GPU 成本怎么比。

微调、原型和间歇推理:两头都不合适

很多个人开发者和小团队的任务属于这一类,比如微调一个开源模型、验证一个推理方案、每周跑几次批量生成。这类任务利用率低,签预留合约不划算。它们也不一定受得了中断:调参调到一半被回收,排查和重跑花的精力可能比省下的卡费还多。

这类任务更适合无合约、按小时计费的算力。以 NexGPU 为例,它按小时计费、按秒计量,没有最低消费,也不需要签合约。下单时单价就锁定,一直到实例销毁都不变。账单只有算力、存储、流量三项,每笔钱花在哪里都能对上。

有一条边界需要记住:停机后仍然收存储费,销毁后才全部停止计费。这和竞价实例被停后云盘继续计费是同一类问题。任务做完后,先把结果和检查点移出实例,再销毁实例,费用才会全部停止。具体做法可以看租的 GPU 实例数据怎么保存和GPU 实例关机还收不收费。

下单前的避坑清单

  • 用竞价实例之前,先演练一次中断:手动终止任务,确认能从最近的检查点恢复,而不是从头开始。
  • 检查点写到实例之外,并定期清理:只保留最近几个,避免存储费越积越多。
  • 任务结束后确认磁盘已删除:只停机不删盘,账单不会停止。
  • 减少重复下载:尽量使用预置环境的镜像。常用的权重放在离计算节点近的存储里,换节点时不必每次从头下载。
  • 签预留之前,用历史数据算利用率:拿过去几个月的实际运行时长来算,不要用峰值估算。拿不准的时候,先用按小时计费跑一个季度,看清使用曲线再决定。
  • 线上业务可以组合使用:稳定的基线负载用长期资源,突发峰值用按小时计费,离线批处理放到竞价实例上。

下一步

如果你的任务属于微调、原型验证或间歇推理,可以直接在 NexGPU 价格页查看可租节点和当前单价,按任务需要的显存挑卡。

如果你评估的是多卡长期稳定运行,比如线上推理集群或长期训练,需要确定容量和规格,建议先按企业 GPU 集群和预留实例怎么咨询准备好需求清单,再联系销售沟通方案。

相关文章

AI服务器自购托管还是租GPU?先测利用率,再算隐性成本
专有云与公有云 GPU 成本怎么比:先算利用率,再按业务阶段选
企业GPU集群和预留实例怎么咨询:先备好这份需求清单再联系
2026 AI算力租赁:云端灵活应对需求波动

评论(0)

暂无评论

发布评论