01 — 模板分类
按你要做的事挑
同一套算力,换个镜像就是另一条产线。下面是使用最多的六类环境。
大模型推理服务
vLLM、TGI、Ollama、SGLang 预置完成,拉起后即是一个 OpenAI 兼容的 HTTP 接口。适合把开源模型变成自己的私有 API。
vLLM · TGI · Ollama · SGLang
训练与微调
PyTorch、TensorFlow、JAX 配齐 CUDA 与 cuDNN,另附 LLaMA Factory、Axolotl、Unsloth 等微调框架,LoRA / QLoRA / 全参数训练开箱即跑。
PyTorch · TensorFlow · JAX · Axolotl
图像与视频生成
ComfyUI 与 AUTOMATIC1111 预装常用节点与采样器,支持 SDXL、FLUX、视频扩散模型。启动后浏览器直接进 Web UI。
ComfyUI · A1111 · FLUX · SDXL
语音与音频
Whisper 全系列模型加速转录,含 faster-whisper 与 WhisperX 对齐,批量音频处理与字幕生成直接可用。
Whisper · faster-whisper · WhisperX
数据处理与科学计算
NVIDIA RAPIDS 全家桶(cuDF / cuML / cuGraph),把 pandas 量级的数据管线搬到 GPU 上跑,另含 Jupyter 与常用科学栈。
RAPIDS · cuDF · cuML · Jupyter
纯净系统与自定义
Ubuntu 22.04 / 24.04 纯 CLI 镜像,只装驱动与 CUDA 工具链,剩下的全归你。也支持填入自己的 Docker 镜像地址。
Ubuntu · CUDA Toolkit · 自定义镜像
02 — 部署流程
从下单到能用,三步
没有工单、没有配额审批、没有等待队列。
01
挑一台机器
按显存、价格、地区、带宽和可靠性筛,实时看到全网可租节点。价格所见即所付,下单即锁定。
02
选镜像与磁盘
选一个预置模板,或填自己的镜像。磁盘容量按需给 —— 大模型权重记得留够,磁盘按 GB/月 单独计价。
03
连上去
实例就绪后给出直连 SSH 命令、Jupyter 地址与端口映射表。也可以在浏览器里直接开终端,或一键装上可视化面板。
03 — 选卡参考
哪张卡跑得动你的模型
显存是硬门槛。下表列出常见开源模型在半精度下的最低显存需求,以及能跑它的最便宜的卡。
| 模型规模 | 权重大小 | 最低显存 | 推荐显卡 |
|---|---|---|---|
| DeepSeek V4Flash · 3-bit | 103GB | 110GB | H200140GB$6.660/hr |
| DeepSeek V4Flash · 4-bit | 155GB | 162GB | B200179GB$10.797/hr |
| DeepSeek V4Flash · 8-bit | 162GB | 169GB | B200179GB$10.797/hr |
| DeepSeek V4Pro · Q2_K | 400GB | 420GB | 需多卡节点 |
| Qwen3.827B · INT4 | 14GB | 20GB | Tesla V10032GB$0.188/hr |
| Qwen3.827B · INT8 | 28GB | 36GB | Q RTX 800048GB$0.508/hr |
| Qwen3.827B · FP16 | 56GB | 64GB | A100 SXM480GB$1.088/hr |
| Qwen3.8Max · 量化 | 400GB | 420GB | 需多卡节点 |
以上为 FP16/BF16 权重加载的下限估算,实际还需为 KV cache 与批处理留出余量。使用 INT8 或 INT4 量化可显著降低门槛,一张 24GB 的 RTX 4090 量化后足以跑 32B 级模型。
04 — 生态兼容
你现在用的工具,这里都能跑
标准 NVIDIA 驱动与 CUDA 环境,没有魔改运行时,没有专有 SDK 绑定。你的代码怎么在本地跑,在这里就怎么跑。
- PyTorch
- TensorFlow
- JAX
- ComfyUI
- Stable Diffusion
- FLUX
- vLLM
- Ollama
- Whisper
- RAPIDS
- Blender
- Axolotl
- Unsloth
- LLaMA Factory
05 — FAQ
