只是一个默认分类

B300 288GB上线后,B200与H100算力性价比分析是否被改写?单位Token成本重算指南

2026年年中,NVIDIA Blackwell Ultra(B300)上线,面对B200的时租,多付约1.75倍时租能否被拓扑简化赚回?本文用单位Token成本框架给出答案。一、B300上线后,高端卡的价格梯队被拉成了什么样B300(Blackwell Ultra)的公开规格是288GB HBM3e显存(2026年公开规格)和15 PFLOPS密集F...

vLLM v0.26.0 发布后,SGLang部署还值不值得做?共享前缀吞吐领先 29% 的选型与落地指南

一、vLLM v0.26.0 上线后,SGLang部署的价值坐标变了吗2026 年 7 月 28 日,vLLM 发布 v0.26.0,带来三项重磅更新:NVFP4 模型量化支持、DeepSeek-V4 专用路由算子(官方称 E2E TPOT 降低 2.94%)以及基于对象存储的 KV Cache 分级卸载(fact_1)。一周后的 8 月 5 日,De...

Ollama v0.32.6 支持 MTP 自动投机解码后,Ollama GPU服务器怎么选:从单卡显存到按量部署

据 Ollama 官方 GitHub Release Notes(v0.32.6,2026-08-05),Ollama 在 2026 年 8 月 5 日发布了 v0.32.6,带来了基于 MTP Head 的自动投机解码,并改进 /v1/chat/completions 的 OpenAI 协议兼容性。对于想在云 GPU 服务器上快速搭建内部大模型 AP...

RTX 5090 时租稳在 $0.49–$0.99 后,RTX 4090云服务器还值得租吗:24GB 到 32GB 的显存台阶怎么算

2026 年 8 月的云算力市场,RTX 5090 的按量租用价格已经稳定在 $0.49–$0.99/小时,而 RTX 4090云服务器的中位时租在 $0.34–$0.48(Spot 甚至低至 $0.13–$0.22)。价差不到一倍,问题就来了:继续租 24GB 的 RTX 4090云服务器还划算吗?还是该为 32GB 的 RTX 5090 多付一点?...

H200租用价格下探到 $3.82/小时后,8×H200 单节点与 16 卡 H100 跨节点哪种更划算?

2026 年 8 月的按量 GPU 市场出现了一个值得注意的变化:搭载 141GB HBM3e 的 H200 租用价格下探到 $3.82 - $4.50/GPU-小时(例如 Jarvislabs 报 $3.99/hr、RunPod 报 $4.39/hr)[fact_1]。这一价格水平让「H200租用」从单纯的高端算力选项,变成了与 H100 正面竞争的...