先给结论:vLLM多卡张量并行配置指南的参数决定顺序很多人以为把 --tensor-parallel-size 调得越大,多卡推理就一定越快,但实际上 TP 设多少要由显存分账和模型注意力头数共同决定,不是越大越好。正确的思路是:先按四笔显存账算出 TP 下限,再按注意力头数整除约束和卡间互联确定上限,然后依次调整 --gpu-memory-utili...
多卡推理优化的正确做法,是先按 Prefill 与 Decode 两段负载分别算账,再决定切分方式与加卡时机。很多团队直接翻倍卡数,结果 8 卡反而比单卡慢,归根结底是加的卡越多,通信税越重。这句话不是空谈。2026 年 8 月,vLLM 发布 v0.27.0,深入集成 FlashAttention 4,为 Blackwell SM100 提供 FP8...
0 条留言