跳到主要内容

图像与视频生成模型

Kandinsky 5.0 本地部署:12GB 显存起步,19B 视频模型直接上 H100

Kandinsky Lab 在 2025 年 11 月一次开源了文生图、图像编辑、文生视频、图生视频四条线,权重按 MIT 放出。这一页把每个变体的真实显存账、该租哪张卡、跑一条片子花多少钱,全部算清楚。

Kandinsky 5.0 出自 Kandinsky Lab(Sber AI 与 AIRI 的生成模型团队),是目前这个系列还在维护的主线,2025 年 11 月发布,代码在 github.com/kandinskylab/kandinsky-5,权重在 Hugging Face 的 kandinskylab 组织下,模型卡标注 MIT。它一共三条产品线:Image Lite 6B 负责文生图和图像编辑,Video Lite 2B 负责 5 秒 / 10 秒 24fps 视频,Video Pro 19B 负责 1280×720 的高质量文生视频与图生视频。架构上是 Flow Matching + CrossDiT,Image Lite 50 个 block、Video Lite 32 个、Video Pro 60 个;图像分支用 FLUX.1-dev 的 VAE,视频分支用 HunyuanVideo 的 3D VAE。技术报告里的训练规模是 5 亿以上图像、2.5 亿以上视频片段、约 1.5 亿组图像编辑配对。

真正决定你要租多大卡的,不是那个 6B 的 DiT,而是挂在它前面的文本编码器。Kandinsky 5.0 用 Qwen2.5-VL 7B 做主编码器(嵌入维度 3584),再叠一个 CLIP ViT-L/14。按 bf16 每参数 2 字节算:6B DiT 权重约 12GB,Qwen2.5-VL 7B 约 15GB,CLIP 与 VAE 加起来约 1GB——全部常驻就是 28GB 起,24GB 卡直接装不下。官方给的解法是三个开关:`--offload` 把不在计算的组件换出到主机内存,`--qwen_quantization` 把文本编码器压到 NF4,`--attention_engine` 在 Flash Attention 3 / 2 / SageAttention / SDPA 之间切。仓库明确写了:开启 offload 后,12GB 显存的卡也能出图。视频侧还有一个 NABLA 稀疏注意力,在 90% 稀疏率下把训练和推理时间压到约 1/2.7。

所以租卡逻辑很直接:只是想看看效果、批量出 1024×1024 的图,RTX 3090 24GB($0.193/卡·时)或 RTX 4090 24GB($0.540/卡·时)配 offload + NF4 就够;要把全套权重常驻不换出、或者练 LoRA,上 RTX A6000 48GB($0.817/卡·时);要跑 19B 的 Video Pro 出 HD 片子,只有 80GB 级别才谈得上舒服,A100 SXM4 80GB $1.088/卡·时,赶交付就上 H100 SXM 80GB $3.582/卡·时——Flash Attention 3 本来也只在 Hopper 上跑得起来。顺带说清一件事:如果你搜到的是 Kandinsky 2.1 / 2.2 那套 prior + decoder 双阶段管线,或者 Kandinsky 3.0 那个挂 FLAN-UL2 编码器、用 Sber-MoVQGAN 解码的版本,diffusers 里确实还留着 KandinskyV22Pipeline 和 Kandinsky3Pipeline,但都已被 5.0 取代,新项目别从那里起手。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU,按秒计量、按小时计价,没有起租量、没有开通费、不用提配额工单。

01 —

Kandinsky 5.0 各变体与显存账

权重显存按 bf16 每参数 2 字节直接算;延迟为官方在 H100 80GB(CUDA 12.8.1 / PyTorch 2.8)上的实测值

版本参数量显存上下文说明
Kandinsky-5.0-T2I-Lite6B(CrossDiT 50 blocks)DiT bf16 ≈ 12GB;加 Qwen2.5-VL 7B ≈ 15GB 后全常驻 ≈ 28GB;开 --offload 官方称 12GB 卡可跑1024×1024 / 1280×768,100 NFE主力文生图。官方标注的差异化能力是画面里的文字渲染以及俄语概念理解,H100 上单图 13 秒。
Kandinsky-5.0-I2I-Lite6B与 T2I Lite 同量级:DiT bf16 ≈ 12GB + 编码器 ≈ 16GB1K 分辨率,输入图 + 文本指令文本指令图像编辑与局部重绘,训练用了约 1.5 亿组编辑配对。有 sft 与 pretrain 两个 checkpoint。
Kandinsky-5.0-T2V-Lite-sft-5s / -10s2B(CrossDiT 32 blocks)DiT bf16 ≈ 4GB,但管线显存仍由 Qwen2.5-VL 7B 主导;开 offload 后 12GB 级别可跑768×512,5 秒 / 10 秒 @ 24fps轻量文生视频主力。H100 上 5 秒片 139 秒。10 秒版是 SD 分辨率,别指望 HD。
Kandinsky-5.0-T2V-Lite-distilled16steps-5s2B同 Lite,步数从 100 NFE 降到 16768×512,5 秒 @ 24fpsCFG 蒸馏 + TSCD + 对抗后训练的产物,H100 上 35 秒出一条。做交互式预览、批量筛稿就用它。
Kandinsky-5.0-T2V-Pro-sft-5s / I2V-Pro-sft-5s19B(CrossDiT 60 blocks)DiT bf16 ≈ 38GB,加编码器后 80GB 卡也偏紧;仓库提供多卡分布式推理1280×720 HD 5 秒;10s 版为 SD质量线。README 记录 2025 年 12 月在 LMArena 拿到开源文生视频第一。H100 上 5 秒 HD 需 1241 秒。
Kandinsky 2.1 / 2.2 / 3.0(已被取代)2.2 为 prior + decoder 双阶段;3.0 为 3B UNet + FLAN-UL23.0 因 FLAN-UL2 编码器体量大,实践中远超 24GB,需切分加载512 / 768 级别diffusers 里 KandinskyV22Pipeline、Kandinsky3Pipeline 仍在,但新项目请直接用 5.0。

02 —

按场景选卡:NexGPU 实际可租型号与费率

显存按上面的账匹配,不做超卖式推荐

  • 跑 T2I Lite 出图 / 评估,接受 offload + NF4 文本编码器

    RTX 4090 24GB$0.540/卡·时

    24GB 装得下 12GB 的 DiT 并留足激活空间,编码器压 NF4 后换进换出,是单卡出图性价比最稳的一档。

  • 长时间批量出图、成本优先,能忍受更慢的单张耗时

    RTX 3090 24GB$0.193/卡·时

    同为 24GB 但每小时不到两毛,批处理场景下每张图的实际成本往往比 H100 还低。

  • 全套权重常驻不 offload,或练 rank-16 LoRA

    RTX A6000 48GB$0.817/卡·时

    48GB 能同时放下 6B DiT 与 bf16 的 Qwen2.5-VL,省掉换出开销;LoRA 训练也不必上激进的 int8 量化。

  • Video Pro 19B 出 1280×720 HD 片子

    H100 SXM 80GB$3.582/卡·时

    38GB 权重加视频激活只有 80GB 级别扛得住,而 Flash Attention 3 本身就要 Hopper;预算敏感可换 A100 SXM4 80GB $1.088/卡·时走 FA2。

03 —

在 NexGPU 上把 Kandinsky 5.0 跑起来

从开机到第一张图,四步;2,000+ 预置镜像里选 PyTorch 或 ComfyUI 就能跳过环境配置

  1. 01

    开实例、拉官方仓库

    在控制台选一张 24GB 或以上的卡,挑 PyTorch 预置镜像开机,SSH 或 Jupyter 进去。仓库依赖里 Flash Attention 3 只对 Hopper 有意义,Ada / Ampere 卡装 FA2 或直接用 SDPA 即可。

    git clone https://github.com/kandinskylab/kandinsky-5.git && cd kandinsky-5 && pip install -r requirements.txt
  2. 02

    用 diffusers 走最短路径出第一张图

    Kandinsky 5.0 已经进了 diffusers,T2I Lite 一行 from_pretrained 就能加载。第一次运行会拉 6B DiT 加 Qwen2.5-VL 7B,权重下载体量接近 28GB,先确认磁盘和网络。

    python -c "import torch;from diffusers import DiffusionPipeline;p=DiffusionPipeline.from_pretrained('kandinskylab/Kandinsky-5.0-T2I-Lite',dtype=torch.bfloat16,device_map='cuda');p('a cat in a red hat, neon sign reads HELLO').images[0].save('out.png')"
  3. 03

    上官方 CLI,把显存开关全部打开

    要跑视频、或者卡只有 12~16GB,就换官方 test.py。`--offload` 换出闲置组件,`--qwen_quantization` 把文本编码器降到 NF4,`--magcache` 加速采样,`--attention_engine` 按卡选后端。注意 Qwen2.5-VL 的文本上下文只有 256 token,超长 prompt 会被截断——把关键描述写在前面。

    python test.py --config ./configs/k5_lite_t2v_5s_sft_sd.yaml --prompt "A dog in a red hat" --offload --qwen_quantization --attention_engine=flash_attention_2
  4. 04

    接 ComfyUI 工作流或转向微调

    仓库自带 ComfyUI 自定义节点和四套工作流(T2V / I2V / T2I / I2I)。注意它要两套 VAE:图像分支的 flux_vae 和视频分支的 hunyuan_vae,分别放进 ComfyUI/models/vae/ 下对应目录,放错就是加载失败。要做风格 LoRA 可以走 SimpleTuner,rank-16 加全量梯度检查点时 24GB 是舒适下限,16GB 需要 int8 量化底模加逐块 offload——但文本编码器请保持不量化,Qwen2.5-VL 对量化很敏感。

    python test.py --config ./configs/k5_lite_t2i_sft_hd.yaml --prompt "A cat in a red hat with a label 'HELLO'" --offload

一条片子、一张图,到底多少钱

官方在 H100 80GB 上的实测:T2I Lite 出一张 1024×1024 图 13 秒,Video Lite 蒸馏版 5 秒片 35 秒,Video Pro 5 秒 HD 1241 秒。直接乘 NexGPU 的 H100 SXM 80GB 费率 $3.582/卡·时——单图 = 13 ÷ 3600 × 3.582 ≈ $0.0129,出 100 张约 $1.29;蒸馏视频 = 35 ÷ 3600 × 3.582 ≈ $0.035 一条;Video Pro HD = 1241 ÷ 3600 × 3.582 ≈ $1.24 一条 5 秒。消费级卡官方没给延迟数字,但账你自己就能算:RTX 3090 24GB 是 $0.193/卡·时,哪怕它比 H100 慢 10 倍、一张图跑 130 秒,也只有 130 ÷ 3600 × 0.193 ≈ $0.0070,反而比 H100 便宜近一半——批量出图选便宜卡、赶交付选 H100,是两笔完全不同的账。存储另算:T2I Lite 的一整套权重(6B DiT bf16 约 12GB + Qwen2.5-VL 7B 约 15GB + CLIP/VAE 约 1GB ≈ 28GB)常驻,按 $0.414/GB·月 的中位价约 28 × 0.414 ≈ $11.6 一个月。算力按秒计量、停机即停止计费,存储则一直计到你销毁为止。

04 —

常见问题

Kandinsky 5.0 本地部署最低要多大显存?

官方 README 写明:开启 offload 后 12GB 显存的卡就能生成。但那是把组件轮换进显存换来的,速度会掉。想让 6B DiT(bf16 约 12GB)安稳常驻并留出激活空间,24GB 是实际下限;要把 bf16 的 Qwen2.5-VL 7B 也一起常驻不换出,就得 48GB。NexGPU 这三档都能按秒租:RTX 3090 24GB $0.193、RTX 4090 24GB $0.540、RTX A6000 48GB $0.817,先用便宜卡验通,再决定要不要升配。

Kandinsky 5.0 是什么许可证,能不能商用?

Hugging Face 上 kandinskylab 组织的模型卡与 GitHub 仓库标注的是 MIT,属于最宽松的一档,商用没有额外的开源许可障碍。要注意的是它并非单一模型而是一整条管线,文本编码器 Qwen2.5-VL、图像 VAE 来自 FLUX.1-dev、视频 VAE 来自 HunyuanVideo,各自有自己的条款,商用前把这三份也过一遍。合规确认完,在 NexGPU 上开一台自己的实例跑私有化推理,数据不出你的机器。

我搜到的 Kandinsky 2.2 教程还能用吗?

能跑,但别用来起新项目。2.1 / 2.2 是 prior + decoder 的双阶段结构,3.0 换成了 FLAN-UL2 文本编码器加 Sber-MoVQGAN 解码器,两者都已经被 5.0 的 Flow Matching + CrossDiT 架构取代,diffusers 里保留 KandinskyV22Pipeline 和 Kandinsky3Pipeline 更多是兼容历史代码。如果你只是想横向比一比新旧两代的产出,NexGPU 上开两台按秒计费的实例并行跑一小时,成本不到一杯咖啡。

为什么我的长 prompt 好像没生效?

Kandinsky 5.0 的主文本编码器 Qwen2.5-VL 的最大文本上下文只有 256 token,超出部分会被截断,写在段末的关键描述等于白写。把主体、构图、风格这些决定性信息放在最前面,细节修饰放后面。另一个常见坑是 guidance 拉太高:超过 7.0 容易过曝、画面「烧焦」,官方验证默认值是 5.0。这类参数需要成批试错,用 NexGPU 的按秒计费扫一遍参数网格,比在本地一张卡上熬夜划算得多。

19B 的 Video Pro 一张 80GB 卡够吗?

单条 5 秒 HD 是能跑的——权重 bf16 约 38GB,剩下的空间留给视频潜变量和注意力激活,但确实偏紧,官方仓库因此提供了多卡分布式推理。参考数据是 H100 80GB 上一条 5 秒 HD 需要 1241 秒。NexGPU 的 H100 SXM 80GB 是 $3.582/卡·时、A100 SXM4 80GB $1.088/卡·时,单节点最多挂 14 张卡、节点最大显存 2,152GB,要做多卡并行不用换平台。

想给 Kandinsky 5.0 练一个风格 LoRA,要什么配置?

以 SimpleTuner 的 Kandinsky 5 图像流程为参照:rank-16 加全量梯度检查点时,24GB(3090 / 4090)是舒适下限,16GB 得靠底模 int8 量化加逐块 offload 硬顶,主机内存最好 64GB。有个必须记住的细节——文本编码器不要量化,Qwen2.5-VL 对量化非常敏感;另外逐块 group offload 不能和 enable_model_cpu_offload 同时开。在 NexGPU 上租 RTX A6000 48GB 是 $0.817/卡·时,跑满 4 小时也就 4 × 0.817 ≈ $3.27,训完停机即停止计费。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。