L40S 与 A100 跑大模型推理,哪张卡的 Token 成本更低?按并发、上下文和精度来选

2026-09-26 57 0

先说结论:请求并发高、模型能放进单卡(7B/13B,或 FP8 量化后的 30B 级),并且推理框架能开启 FP8 时,L40S 的每百万 Token 成本通常更低。并发低、要求逐字输出快、上下文很长,或者要把 70B 以上未量化模型切到多张卡上跑,A100 80GB 更合适,多卡时最好选 SXM 版本。

两张卡的优势对应的是推理过程中的不同阶段。弄清楚你的负载主要卡在哪个阶段,选卡就容易判断了。

推理分两个阶段,两张卡各有强项

大模型推理可以拆成两个阶段:

  • Prefill:一次性处理整段输入,主要消耗算力。
  • Decode:逐个生成 token。每生成一个 token,都要把模型权重从显存读一遍,速度主要受显存带宽限制。

两张卡的关键参数如下:

  • A100:Ampere 架构,HBM2e 显存。40GB 版带宽约 1,555 GB/s,80GB 版约 2,039 GB/s,是 L40S 的两倍以上。不支持原生 FP8,BF16 算力峰值 312 TFLOPS。
  • L40S:Ada Lovelace 架构,48GB GDDR6 显存,带宽 864 GB/s。第 4 代 Tensor Core 原生支持 FP8,FP8 Tensor 算力约 733 TFLOPS。

所以在单用户对话、Batch Size 接近 1 的场景里,Decode 阶段受带宽限制,A100 每个 token 的生成延迟明显更低。并发上来之后,同一次权重读取可以服务更多请求,瓶颈逐渐转到算力上,这时 L40S 的 FP8 算力就能发挥出来。

随 Batch Size 增大,推理瓶颈从显存带宽转向算力,L40S 单位 Token 成本逐渐低于 A100 的示意图

按三个变量判断

1. 并发量

一般来说,Batch 达到 8 以上,或者用 vLLM 这类框架开启连续批处理(Continuous Batching)后,L40S 的吞吐优势会更明显。再加上 L40S 的小时租价通常低于 A100,平摊到每个 token 上会更便宜。如果服务大部分时间只有一两个用户,L40S 的算力用不满,带宽短板就会暴露,按 token 算未必划算。

2. 上下文长度

上下文越长,KV Cache 占用的显存越多,Decode 阶段也越依赖带宽。32K、64K 甚至更长的上下文窗口,建议优先考虑 A100 80GB,它在显存容量和带宽上都更充裕。L40S 的 48GB 需要在权重和 KV Cache 之间分配,长上下文加高并发时,容易先碰到显存上限。

3. 精度与模型大小

  • FP16 下的 7B/13B 模型:L40S 单卡就能放下,还有不少空间留给 KV Cache。
  • 30B 级模型:L40S 需要 FP8 或 INT4 量化才能单卡运行。FP8 权重和 FP8 KV Cache 能让显存占用大约减半、有效吞吐大约翻倍,能抵消一部分带宽劣势。
  • A100 没有原生 FP8 硬件支持,上面这部分 FP8 收益在 A100 上拿不到。要跑未量化的中大模型,主要靠 80GB 的显存容量。

注意,L40S 的 FP8 优势需要推理框架开启对应选项才会生效,比如 vLLM、TensorRT-LLM 的 FP8 权重和 KV Cache。如果只用默认的 FP16 运行,两张卡之间的差距会和预期不一样。

需要多卡时,互联方式很关键

70B 以上模型不量化的话,单卡放不下,需要张量并行(TP)切到 2、4 或 8 张卡上。张量并行在每一层都要进行跨卡通信:

  • A100 SXM 配有 600 GB/s 的 NVLink 3.0,跨卡通信开销很小,适合做低延迟的张量并行。
  • L40S 只有 PCIe 4.0(双向 64 GB/s),不支持 NVLink。多卡张量并行时容易被通信拖慢。

L40S 更适合单卡独立跑中小模型,或者部署多个独立实例共同分担流量,也可以采用通信频率较低的流水线并行。如果准备用多张 A100 做张量并行,租之前先确认节点是 SXM 还是 PCIe、是否带 NVLink,不能只看型号。多卡切分的具体做法可以参考 Llama 模型部署实操。

快速对照

你的场景更可能省钱的卡主要原因
高并发 API 服务,7B–13B 模型L40S批处理后以算力为瓶颈,租价低
30B 级模型,可接受 FP8 量化L40SFP8 节省显存、提高吞吐
低并发交互,要求逐字输出快A100 80GBDecode 阶段依赖带宽
32K/64K 以上长上下文A100 80GBKV Cache 占用大,带宽和容量都需要
70B 以上未量化,多卡张量并行A100 SXMNVLink 跨卡通信开销小
多个中小模型各自独立部署L40S 多实例不依赖跨卡互联

最可靠的办法:用自己的负载各测一次

表里的判断只能帮你缩小范围。实际成本和模型、提示长度、输出长度、并发曲线都有关系,最准确的做法是用同一套负载在两张卡上分别测一次,再按下面的公式计算:

每百万输出 Token 成本 = 小时单价 ÷(每秒输出 Token 数 × 3600)× 1,000,000

操作步骤:

  1. 统一测试条件:模型、精度、最大上下文长度、测试提示集都保持一致。L40S 另外跑一组 FP8,A100 用 BF16,对比才公平。
  2. 选推理镜像:在 NexGPU 镜像模板 里选 vLLM 或 TGI,一键部署,省去自己配环境的时间。
  3. 按真实并发压测:分别在你预期的低峰和高峰并发下运行,记录每秒输出 token 数和每个 token 的延迟。只看单并发数据会误判 L40S,只看高并发数据又会忽略交互体验。
  4. 代入公式对比:先确认延迟满足业务要求,再在满足要求的配置里选单位成本最低的。

在 价格页 查看可租节点时,除了单价,还要核对显存规格(A100 有 40GB 和 80GB 两种)以及接口形式(SXM 还是 PCIe)。这两项会直接影响上面的判断。

测试期间的费用说明

NexGPU 按小时计价、按秒计量,没有最低消费,所以短时间对比测试花费不多。需要注意几点:

  • 下单时单价就锁定,一直到实例销毁都按这个价格计算,测试期间价格不会变。
  • 关机只停止算力计费,存储仍在计费。测完如果想保留环境改天继续,可以关机,但磁盘费用会一直累积。
  • 销毁后才会停止全部计费。销毁前先把压测结果和配置导出保存。

费用细节可以参考 GPU 实例关机还收不收费。如果测完决定长期部署多卡,或者需要评估集群规模,可以先按 企业 GPU 集群咨询清单 整理好需求,再联系销售。

相关文章

两张L40S能替代一张A100吗?按任务瓶颈分四类判断
L40S 跑 Stable Diffusion 够用吗?按 SD 1.5、SDXL、Flux 和 LoRA 训练分开看
L40S 租一小时多少钱?先看实时单价,再按算力、存储、流量算整次任务

评论(0)

暂无评论

发布评论