SGLang 新版本 DCP 与前缀缓存落地后,GPU集群怎么规划:节点数、拓扑与显存账

SGLang 在 2026 年 7 月底的官方 Release 中,提供了对 Kimi K3 2.8T LatentMoE 模型与 MiniMax-H3 音视频模型的 Day-0 原生推理支持,并引入了 DCP(Decode Context Parallelism)、DSpark 投机解码、KDA-aware 前缀缓存与 FlashInfer 优化,且...

B300 288GB上线后,B200与H100算力性价比分析是否被改写?单位Token成本重算指南

2026年年中,NVIDIA Blackwell Ultra(B300)上线,面对B200的时租,多付约1.75倍时租能否被拓扑简化赚回?本文用单位Token成本框架给出答案。一、B300上线后,高端卡的价格梯队被拉成了什么样B300(Blackwell Ultra)的公开规格是288GB HBM3e显存(2026年公开规格)和15 PFLOPS密集F...

vLLM v0.26.0 发布后,SGLang部署还值不值得做?共享前缀吞吐领先 29% 的选型与落地指南

一、vLLM v0.26.0 上线后,SGLang部署的价值坐标变了吗2026 年 7 月 28 日,vLLM 发布 v0.26.0,带来三项重磅更新:NVFP4 模型量化支持、DeepSeek-V4 专用路由算子(官方称 E2E TPOT 降低 2.94%)以及基于对象存储的 KV Cache 分级卸载(fact_1)。一周后的 8 月 5 日,De...

Ollama v0.32.6 支持 MTP 自动投机解码后,Ollama GPU服务器怎么选:从单卡显存到按量部署

据 Ollama 官方 GitHub Release Notes(v0.32.6,2026-08-05),Ollama 在 2026 年 8 月 5 日发布了 v0.32.6,带来了基于 MTP Head 的自动投机解码,并改进 /v1/chat/completions 的 OpenAI 协议兼容性。对于想在云 GPU 服务器上快速搭建内部大模型 AP...

RTX 5090 时租稳在 $0.49–$0.99 后,RTX 4090云服务器还值得租吗:24GB 到 32GB 的显存台阶怎么算

2026 年 8 月的云算力市场,RTX 5090 的按量租用价格已经稳定在 $0.49–$0.99/小时,而 RTX 4090云服务器的中位时租在 $0.34–$0.48(Spot 甚至低至 $0.13–$0.22)。价差不到一倍,问题就来了:继续租 24GB 的 RTX 4090云服务器还划算吗?还是该为 32GB 的 RTX 5090 多付一点?...