Kandinsky 5.0 出自 Kandinsky Lab(Sber AI 与 AIRI 的生成模型团队),是目前这个系列还在维护的主线,2025 年 11 月发布,代码在 github.com/kandinskylab/kandinsky-5,权重在 Hugging Face 的 kandinskylab 组织下,模型卡标注 MIT。它一共三条产品线:Image Lite 6B 负责文生图和图像编辑,Video Lite 2B 负责 5 秒 / 10 秒 24fps 视频,Video Pro 19B 负责 1280×720 的高质量文生视频与图生视频。架构上是 Flow Matching + CrossDiT,Image Lite 50 个 block、Video Lite 32 个、Video Pro 60 个;图像分支用 FLUX.1-dev 的 VAE,视频分支用 HunyuanVideo 的 3D VAE。技术报告里的训练规模是 5 亿以上图像、2.5 亿以上视频片段、约 1.5 亿组图像编辑配对。
真正决定你要租多大卡的,不是那个 6B 的 DiT,而是挂在它前面的文本编码器。Kandinsky 5.0 用 Qwen2.5-VL 7B 做主编码器(嵌入维度 3584),再叠一个 CLIP ViT-L/14。按 bf16 每参数 2 字节算:6B DiT 权重约 12GB,Qwen2.5-VL 7B 约 15GB,CLIP 与 VAE 加起来约 1GB——全部常驻就是 28GB 起,24GB 卡直接装不下。官方给的解法是三个开关:`--offload` 把不在计算的组件换出到主机内存,`--qwen_quantization` 把文本编码器压到 NF4,`--attention_engine` 在 Flash Attention 3 / 2 / SageAttention / SDPA 之间切。仓库明确写了:开启 offload 后,12GB 显存的卡也能出图。视频侧还有一个 NABLA 稀疏注意力,在 90% 稀疏率下把训练和推理时间压到约 1/2.7。
所以租卡逻辑很直接:只是想看看效果、批量出 1024×1024 的图,RTX 3090 24GB($0.193/卡·时)或 RTX 4090 24GB($0.540/卡·时)配 offload + NF4 就够;要把全套权重常驻不换出、或者练 LoRA,上 RTX A6000 48GB($0.817/卡·时);要跑 19B 的 Video Pro 出 HD 片子,只有 80GB 级别才谈得上舒服,A100 SXM4 80GB $1.088/卡·时,赶交付就上 H100 SXM 80GB $3.582/卡·时——Flash Attention 3 本来也只在 Hopper 上跑得起来。顺带说清一件事:如果你搜到的是 Kandinsky 2.1 / 2.2 那套 prior + decoder 双阶段管线,或者 Kandinsky 3.0 那个挂 FLAN-UL2 编码器、用 Sber-MoVQGAN 解码的版本,diffusers 里确实还留着 KandinskyV22Pipeline 和 Kandinsky3Pipeline,但都已被 5.0 取代,新项目别从那里起手。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU,按秒计量、按小时计价,没有起租量、没有开通费、不用提配额工单。
01 —
Kandinsky 5.0 各变体与显存账
权重显存按 bf16 每参数 2 字节直接算;延迟为官方在 H100 80GB(CUDA 12.8.1 / PyTorch 2.8)上的实测值
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Kandinsky-5.0-T2I-Lite | 6B(CrossDiT 50 blocks) | DiT bf16 ≈ 12GB;加 Qwen2.5-VL 7B ≈ 15GB 后全常驻 ≈ 28GB;开 --offload 官方称 12GB 卡可跑 | 1024×1024 / 1280×768,100 NFE | 主力文生图。官方标注的差异化能力是画面里的文字渲染以及俄语概念理解,H100 上单图 13 秒。 |
| Kandinsky-5.0-I2I-Lite | 6B | 与 T2I Lite 同量级:DiT bf16 ≈ 12GB + 编码器 ≈ 16GB | 1K 分辨率,输入图 + 文本指令 | 文本指令图像编辑与局部重绘,训练用了约 1.5 亿组编辑配对。有 sft 与 pretrain 两个 checkpoint。 |
| Kandinsky-5.0-T2V-Lite-sft-5s / -10s | 2B(CrossDiT 32 blocks) | DiT bf16 ≈ 4GB,但管线显存仍由 Qwen2.5-VL 7B 主导;开 offload 后 12GB 级别可跑 | 768×512,5 秒 / 10 秒 @ 24fps | 轻量文生视频主力。H100 上 5 秒片 139 秒。10 秒版是 SD 分辨率,别指望 HD。 |
| Kandinsky-5.0-T2V-Lite-distilled16steps-5s | 2B | 同 Lite,步数从 100 NFE 降到 16 | 768×512,5 秒 @ 24fps | CFG 蒸馏 + TSCD + 对抗后训练的产物,H100 上 35 秒出一条。做交互式预览、批量筛稿就用它。 |
| Kandinsky-5.0-T2V-Pro-sft-5s / I2V-Pro-sft-5s | 19B(CrossDiT 60 blocks) | DiT bf16 ≈ 38GB,加编码器后 80GB 卡也偏紧;仓库提供多卡分布式推理 | 1280×720 HD 5 秒;10s 版为 SD | 质量线。README 记录 2025 年 12 月在 LMArena 拿到开源文生视频第一。H100 上 5 秒 HD 需 1241 秒。 |
| Kandinsky 2.1 / 2.2 / 3.0(已被取代) | 2.2 为 prior + decoder 双阶段;3.0 为 3B UNet + FLAN-UL2 | 3.0 因 FLAN-UL2 编码器体量大,实践中远超 24GB,需切分加载 | 512 / 768 级别 | diffusers 里 KandinskyV22Pipeline、Kandinsky3Pipeline 仍在,但新项目请直接用 5.0。 |
02 —
按场景选卡:NexGPU 实际可租型号与费率
显存按上面的账匹配,不做超卖式推荐
跑 T2I Lite 出图 / 评估,接受 offload + NF4 文本编码器
RTX 4090 24GB$0.540/卡·时
24GB 装得下 12GB 的 DiT 并留足激活空间,编码器压 NF4 后换进换出,是单卡出图性价比最稳的一档。
长时间批量出图、成本优先,能忍受更慢的单张耗时
RTX 3090 24GB$0.193/卡·时
同为 24GB 但每小时不到两毛,批处理场景下每张图的实际成本往往比 H100 还低。
全套权重常驻不 offload,或练 rank-16 LoRA
RTX A6000 48GB$0.817/卡·时
48GB 能同时放下 6B DiT 与 bf16 的 Qwen2.5-VL,省掉换出开销;LoRA 训练也不必上激进的 int8 量化。
Video Pro 19B 出 1280×720 HD 片子
H100 SXM 80GB$3.582/卡·时
38GB 权重加视频激活只有 80GB 级别扛得住,而 Flash Attention 3 本身就要 Hopper;预算敏感可换 A100 SXM4 80GB $1.088/卡·时走 FA2。
03 —
在 NexGPU 上把 Kandinsky 5.0 跑起来
从开机到第一张图,四步;2,000+ 预置镜像里选 PyTorch 或 ComfyUI 就能跳过环境配置
- 01
开实例、拉官方仓库
在控制台选一张 24GB 或以上的卡,挑 PyTorch 预置镜像开机,SSH 或 Jupyter 进去。仓库依赖里 Flash Attention 3 只对 Hopper 有意义,Ada / Ampere 卡装 FA2 或直接用 SDPA 即可。
git clone https://github.com/kandinskylab/kandinsky-5.git && cd kandinsky-5 && pip install -r requirements.txt - 02
用 diffusers 走最短路径出第一张图
Kandinsky 5.0 已经进了 diffusers,T2I Lite 一行 from_pretrained 就能加载。第一次运行会拉 6B DiT 加 Qwen2.5-VL 7B,权重下载体量接近 28GB,先确认磁盘和网络。
python -c "import torch;from diffusers import DiffusionPipeline;p=DiffusionPipeline.from_pretrained('kandinskylab/Kandinsky-5.0-T2I-Lite',dtype=torch.bfloat16,device_map='cuda');p('a cat in a red hat, neon sign reads HELLO').images[0].save('out.png')" - 03
上官方 CLI,把显存开关全部打开
要跑视频、或者卡只有 12~16GB,就换官方 test.py。`--offload` 换出闲置组件,`--qwen_quantization` 把文本编码器降到 NF4,`--magcache` 加速采样,`--attention_engine` 按卡选后端。注意 Qwen2.5-VL 的文本上下文只有 256 token,超长 prompt 会被截断——把关键描述写在前面。
python test.py --config ./configs/k5_lite_t2v_5s_sft_sd.yaml --prompt "A dog in a red hat" --offload --qwen_quantization --attention_engine=flash_attention_2 - 04
接 ComfyUI 工作流或转向微调
仓库自带 ComfyUI 自定义节点和四套工作流(T2V / I2V / T2I / I2I)。注意它要两套 VAE:图像分支的 flux_vae 和视频分支的 hunyuan_vae,分别放进 ComfyUI/models/vae/ 下对应目录,放错就是加载失败。要做风格 LoRA 可以走 SimpleTuner,rank-16 加全量梯度检查点时 24GB 是舒适下限,16GB 需要 int8 量化底模加逐块 offload——但文本编码器请保持不量化,Qwen2.5-VL 对量化很敏感。
python test.py --config ./configs/k5_lite_t2i_sft_hd.yaml --prompt "A cat in a red hat with a label 'HELLO'" --offload
一条片子、一张图,到底多少钱
官方在 H100 80GB 上的实测:T2I Lite 出一张 1024×1024 图 13 秒,Video Lite 蒸馏版 5 秒片 35 秒,Video Pro 5 秒 HD 1241 秒。直接乘 NexGPU 的 H100 SXM 80GB 费率 $3.582/卡·时——单图 = 13 ÷ 3600 × 3.582 ≈ $0.0129,出 100 张约 $1.29;蒸馏视频 = 35 ÷ 3600 × 3.582 ≈ $0.035 一条;Video Pro HD = 1241 ÷ 3600 × 3.582 ≈ $1.24 一条 5 秒。消费级卡官方没给延迟数字,但账你自己就能算:RTX 3090 24GB 是 $0.193/卡·时,哪怕它比 H100 慢 10 倍、一张图跑 130 秒,也只有 130 ÷ 3600 × 0.193 ≈ $0.0070,反而比 H100 便宜近一半——批量出图选便宜卡、赶交付选 H100,是两笔完全不同的账。存储另算:T2I Lite 的一整套权重(6B DiT bf16 约 12GB + Qwen2.5-VL 7B 约 15GB + CLIP/VAE 约 1GB ≈ 28GB)常驻,按 $0.414/GB·月 的中位价约 28 × 0.414 ≈ $11.6 一个月。算力按秒计量、停机即停止计费,存储则一直计到你销毁为止。
04 —
