跑推理时你有没有碰到过这种事:模型权重明明塞得下,一开长上下文或多并发就OOM,或者token生成速度死活上不去?别急着加卡。现在越来越多一线反馈指向同一个点——推理尤其是decode阶段,真正卡脖子的不是FLOPS,而是显存容量和带宽。训练时GPU几乎满负荷算梯度,算力是主角。推理反过来。生成一个token,整模型权重得从HBM搬进计算单元,GPU核...
很多人盯着GPU买不到、交付周期拉长这事儿,却忽略了另一头更扎心的现实:已经到手的卡,大量时间在空转。行业数据显示,典型ML工作负载里GPU空闲时间常达60-80%,部分Kubernetes集群平均利用率甚至只有5%左右,相当于企业实际用着的算力只是采购量的零头。训练集群可能跑到95%饱和,推理侧却一天闲置30-60%。短缺和浪费同时存在,钱就这么悄悄...
最近两周,算力圈动静不小。一边是Meta计划搭建云业务,把多余的AI计算能力和模型访问卖给外部客户;另一边是NVIDIA推动多租户AI工厂模式,和云伙伴一起用收入分成、信用支持的方式快速扩容。市场第一反应有点慌——有人担心供应突然变多、租金要崩。可再看实际租赁曲线和硬件落地情况,故事没那么简单。H100这类主流卡的按需容量在不少地方依然紧张,甚至出现售...
以前训练跑完就完事,账单也清零。现在模型一上线,推理就成了无底洞——用户每点一次、agent每跑一步,token就在持续燃烧。行业估算,企业AI的GPU支出里,推理已经占到55%到80%。训练是一次性项目,推理是永续运营。一个70B模型,假设服务1000日活用户、每人每天1000次请求、每次500 token,日均就能到5亿token量级。按常见H10...
Nvidia B200 等高端卡租赁价从近期高点回落超过三成,这让不少中小团队和个人开发者看到了部署 AI 推理服务的机会。过去半年里,训练需求拉高了整体算力成本,现在价格松动,正好适合把更多精力放在推理优化上。实际操作中,先评估自己的模型规模和并发量。轻量级文本生成或简单分类任务,单卡 4090 或 A100 就能扛住;视频理解或多模态推理则需要多卡...
0 条留言