01 — 适用情况
谁需要一台临时的 CUDA 机器
第一类是学习者。CUDA、Triton、OpenAI kernel 编程这些技能的入门门槛不在概念上,而在硬件上 —— 没有 NVIDIA 卡就无从开始。按小时租一台,跑通第一个 kernel 的成本是几毛钱,这比为了学习去买一张卡合理得多。
第二类是需要跨架构验证的开发者。你的算子在 Ampere 上跑得好,在 Ada 上呢?在老一点的 Turing 上还能编译吗?自己攒机不可能覆盖这么多代,而在市场里换一台不同架构的机器只是重新下一次单。
第三类是做性能优化的人。Nsight Compute 与 Nsight Systems 需要在真实硬件上采样,而且你常常需要在几种不同显存带宽、不同 SM 数量的卡上对比同一个 kernel 的表现 —— 这正是租用的形态。
02 — 典型负载
在这里做的事
共同点是需要真实硬件,但不需要长期拥有它。
CUDA 入门与课程实践
跟着教程写第一个 kernel、理解 warp 与内存层级、做矩阵乘法优化练习。租一台跑完一章的成本可以忽略不计。
自定义算子开发
为 PyTorch 写自定义 CUDA 扩展,或用 Triton 写更高层的 kernel。开发调试都需要真实 GPU,且经常要在多种卡上验证。
性能剖析与优化
用 Nsight Compute 看 kernel 的占用率、内存吞吐与指令瓶颈,用 Nsight Systems 看整体时间线。这些工具必须在目标硬件上运行。
跨架构兼容性验证
同一份代码在 Turing、Ampere、Ada、Hopper 上分别编译运行,验证兼容性与性能差异。每换一代只是重新下一次单。
03 — 环境
开发环境与工具
root 权限、完整工具链、你想装什么装什么。
CUDA Toolkit 完整安装
nvcc 编译器、cuBLAS/cuFFT/cuSPARSE 等数学库、CUDA 示例代码。纯净 Ubuntu 镜像只带驱动与工具链,其余环境完全由你决定。
nvcc · cuBLAS · cuFFT · Ubuntu
Nsight 调试与剖析
Nsight Compute 做 kernel 级剖析,Nsight Systems 做系统级时间线分析,cuda-gdb 做调试。都可以在实例内直接运行。
Nsight Compute · Nsight Systems · cuda-gdb
高层 kernel 语言
Triton 让你用 Python 语法写高性能 kernel,配合 PyTorch 环境可以直接对比自定义算子与原生实现的性能。
Triton · PyTorch 扩展 · CUTLASS
04 — 选卡
学习和开发该租什么卡
GPU 编程学习不需要贵卡 —— 概念、语法和优化思路在便宜卡上完全一样。只有做架构特性开发时才需要对应的代次。
| 使用目的 | 建议显存 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| CUDA 入门学习 | 6GB | GTX 1660 S$0.083/小时 | 最便宜的卡就够。语法、内存模型、并行思路的练习不需要大显存。 |
| 算子开发与调试 | 12GB | RTX 3060$0.100/小时 | 有一定数据规模才能观察到真实的性能特征,这一档比较合适。 |
| 性能剖析与优化 | 24GB | Tesla V100$0.188/小时 | 需要在接近生产的数据规模上剖析,24GB 档的 SM 数量与带宽比较有代表性。 |
| 数据中心特性开发 | 80GB | A100 SXM4$1.088/小时 | 需要 Tensor Core 新特性、NVLink 或大显存特性时,在 80GB 数据中心档上验证。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
开一台开发机
01
选纯净系统镜像
Ubuntu CLI 镜像只带驱动与 CUDA 工具链,剩下的环境完全由你控制。想要预置框架的话选 PyTorch 镜像也可以。
02
用网页终端直接进 root
浏览器里就能开终端,默认 root 权限,装什么都不用加 sudo。也可以下载密钥用本地 SSH 客户端连。
03
跑完销毁,下次再开
开发机不需要常驻。学一章、调一次性能就销毁,下次从同一个镜像重开,环境一模一样。
06 — FAQ
