最近算力圈动静不小。很多中小团队还在为最新GPU发愁:要么排队等几个月,要么价格高到试都不敢试。NVIDIA刚推的收入分成与信用支持模式,直接把这道坎降了一截。AI云提供商不用一次性掏满硬件成本,就能拿到大规模Grace Blackwell等集群,部署多租户AI工厂。云方卖服务,NVIDIA既拿标准产品收入,又分云端使用产生的收入。这结构让工厂能更快上...
跑推理时你有没有碰到过这种事:模型权重明明塞得下,一开长上下文或多并发就OOM,或者token生成速度死活上不去?别急着加卡。现在越来越多一线反馈指向同一个点——推理尤其是decode阶段,真正卡脖子的不是FLOPS,而是显存容量和带宽。训练时GPU几乎满负荷算梯度,算力是主角。推理反过来。生成一个token,整模型权重得从HBM搬进计算单元,GPU核...
很多人盯着GPU买不到、交付周期拉长这事儿,却忽略了另一头更扎心的现实:已经到手的卡,大量时间在空转。行业数据显示,典型ML工作负载里GPU空闲时间常达60-80%,部分Kubernetes集群平均利用率甚至只有5%左右,相当于企业实际用着的算力只是采购量的零头。训练集群可能跑到95%饱和,推理侧却一天闲置30-60%。短缺和浪费同时存在,钱就这么悄悄...
最近两周,算力圈动静不小。一边是Meta计划搭建云业务,把多余的AI计算能力和模型访问卖给外部客户;另一边是NVIDIA推动多租户AI工厂模式,和云伙伴一起用收入分成、信用支持的方式快速扩容。市场第一反应有点慌——有人担心供应突然变多、租金要崩。可再看实际租赁曲线和硬件落地情况,故事没那么简单。H100这类主流卡的按需容量在不少地方依然紧张,甚至出现售...
0 条留言