先说结论:请求并发高、模型能放进单卡(7B/13B,或 FP8 量化后的 30B 级),并且推理框架能开启 FP8 时,L40S 的每百万 Token 成本通常更低。并发低、要求逐字输出快、上下文很长,或者要把 70B 以上未量化模型切到多张卡上跑,A100 80GB 更合适,多卡时最好选 SXM 版本。
两张卡的优势对应的是推理过程中的不同阶段。弄清楚你的负载主要卡在哪个阶段,选卡就容易判断了。
推理分两个阶段,两张卡各有强项
大模型推理可以拆成两个阶段:
- Prefill:一次性处理整段输入,主要消耗算力。
- Decode:逐个生成 token。每生成一个 token,都要把模型权重从显存读一遍,速度主要受显存带宽限制。
两张卡的关键参数如下:
- A100:Ampere 架构,HBM2e 显存。40GB 版带宽约 1,555 GB/s,80GB 版约 2,039 GB/s,是 L40S 的两倍以上。不支持原生 FP8,BF16 算力峰值 312 TFLOPS。
- L40S:Ada Lovelace 架构,48GB GDDR6 显存,带宽 864 GB/s。第 4 代 Tensor Core 原生支持 FP8,FP8 Tensor 算力约 733 TFLOPS。
所以在单用户对话、Batch Size 接近 1 的场景里,Decode 阶段受带宽限制,A100 每个 token 的生成延迟明显更低。并发上来之后,同一次权重读取可以服务更多请求,瓶颈逐渐转到算力上,这时 L40S 的 FP8 算力就能发挥出来。

按三个变量判断
1. 并发量
一般来说,Batch 达到 8 以上,或者用 vLLM 这类框架开启连续批处理(Continuous Batching)后,L40S 的吞吐优势会更明显。再加上 L40S 的小时租价通常低于 A100,平摊到每个 token 上会更便宜。如果服务大部分时间只有一两个用户,L40S 的算力用不满,带宽短板就会暴露,按 token 算未必划算。
2. 上下文长度
上下文越长,KV Cache 占用的显存越多,Decode 阶段也越依赖带宽。32K、64K 甚至更长的上下文窗口,建议优先考虑 A100 80GB,它在显存容量和带宽上都更充裕。L40S 的 48GB 需要在权重和 KV Cache 之间分配,长上下文加高并发时,容易先碰到显存上限。
3. 精度与模型大小
- FP16 下的 7B/13B 模型:L40S 单卡就能放下,还有不少空间留给 KV Cache。
- 30B 级模型:L40S 需要 FP8 或 INT4 量化才能单卡运行。FP8 权重和 FP8 KV Cache 能让显存占用大约减半、有效吞吐大约翻倍,能抵消一部分带宽劣势。
- A100 没有原生 FP8 硬件支持,上面这部分 FP8 收益在 A100 上拿不到。要跑未量化的中大模型,主要靠 80GB 的显存容量。
注意,L40S 的 FP8 优势需要推理框架开启对应选项才会生效,比如 vLLM、TensorRT-LLM 的 FP8 权重和 KV Cache。如果只用默认的 FP16 运行,两张卡之间的差距会和预期不一样。
需要多卡时,互联方式很关键
70B 以上模型不量化的话,单卡放不下,需要张量并行(TP)切到 2、4 或 8 张卡上。张量并行在每一层都要进行跨卡通信:
- A100 SXM 配有 600 GB/s 的 NVLink 3.0,跨卡通信开销很小,适合做低延迟的张量并行。
- L40S 只有 PCIe 4.0(双向 64 GB/s),不支持 NVLink。多卡张量并行时容易被通信拖慢。
L40S 更适合单卡独立跑中小模型,或者部署多个独立实例共同分担流量,也可以采用通信频率较低的流水线并行。如果准备用多张 A100 做张量并行,租之前先确认节点是 SXM 还是 PCIe、是否带 NVLink,不能只看型号。多卡切分的具体做法可以参考 Llama 模型部署实操。
快速对照
| 你的场景 | 更可能省钱的卡 | 主要原因 |
|---|---|---|
| 高并发 API 服务,7B–13B 模型 | L40S | 批处理后以算力为瓶颈,租价低 |
| 30B 级模型,可接受 FP8 量化 | L40S | FP8 节省显存、提高吞吐 |
| 低并发交互,要求逐字输出快 | A100 80GB | Decode 阶段依赖带宽 |
| 32K/64K 以上长上下文 | A100 80GB | KV Cache 占用大,带宽和容量都需要 |
| 70B 以上未量化,多卡张量并行 | A100 SXM | NVLink 跨卡通信开销小 |
| 多个中小模型各自独立部署 | L40S 多实例 | 不依赖跨卡互联 |
最可靠的办法:用自己的负载各测一次
表里的判断只能帮你缩小范围。实际成本和模型、提示长度、输出长度、并发曲线都有关系,最准确的做法是用同一套负载在两张卡上分别测一次,再按下面的公式计算:
每百万输出 Token 成本 = 小时单价 ÷(每秒输出 Token 数 × 3600)× 1,000,000
操作步骤:
- 统一测试条件:模型、精度、最大上下文长度、测试提示集都保持一致。L40S 另外跑一组 FP8,A100 用 BF16,对比才公平。
- 选推理镜像:在 NexGPU 镜像模板 里选 vLLM 或 TGI,一键部署,省去自己配环境的时间。
- 按真实并发压测:分别在你预期的低峰和高峰并发下运行,记录每秒输出 token 数和每个 token 的延迟。只看单并发数据会误判 L40S,只看高并发数据又会忽略交互体验。
- 代入公式对比:先确认延迟满足业务要求,再在满足要求的配置里选单位成本最低的。
在 价格页 查看可租节点时,除了单价,还要核对显存规格(A100 有 40GB 和 80GB 两种)以及接口形式(SXM 还是 PCIe)。这两项会直接影响上面的判断。
测试期间的费用说明
NexGPU 按小时计价、按秒计量,没有最低消费,所以短时间对比测试花费不多。需要注意几点:
- 下单时单价就锁定,一直到实例销毁都按这个价格计算,测试期间价格不会变。
- 关机只停止算力计费,存储仍在计费。测完如果想保留环境改天继续,可以关机,但磁盘费用会一直累积。
- 销毁后才会停止全部计费。销毁前先把压测结果和配置导出保存。
费用细节可以参考 GPU 实例关机还收不收费。如果测完决定长期部署多卡,或者需要评估集群规模,可以先按 企业 GPU 集群咨询清单 整理好需求,再联系销售。
NexGPU-算力租赁,GPU服务器,GPU云算力,AI服务器租用-新闻博客
评论(0)