L40S 推理吞吐比 A100 低多少?按 Decode、Prefill 和并发度分开看

差距不是固定数字,要看工作负载处在哪个瓶颈L40S 与 A100 的推理吞吐差距没有统一答案,因为大模型推理分两个阶段:Prompt 编码(Prefill) 吃算力,Token 生成(Decode) 吃带宽。L40S 带宽远低于 A100,但算力更高且原生支持 FP8;在低并发生成任务中会落后 50%~60%,在高并发或长 Prompt 任务里则能追平...