跳到主要内容

三维生成模型

TripoSR 本地部署:一张图,半秒一个三维网格

Tripo AI 与 Stability AI 联合出品的单图三维重建模型,6GB 显存起步,整套 MIT 许可证。在 NexGPU 上从开机到第一个 .obj,一张 RTX 3090 就够。

TripoSR 走的是 LRM(Large Reconstruction Model)前馈路线——没有扩散采样、没有 SDS 优化、没有多视图一致性迭代,一次前向就吐出三平面(triplane)特征,再由 NeRF 解码器配 marching cubes 直接提出网格。官方给出的数字是 A100 上不到 0.5 秒生成一个完整纹理网格,默认参数下单图推理约 6GB 显存,权重文件 model.ckpt 只有 1.68GB。在一堆动辄几十 GB 的三维生成模型里,它小得不像话。

拆开看结构就明白显存为什么这么低。图像端是 facebook/dino-vitb16,512×512 输入按 16×16 切 patch;主干是 16 层、16 个注意力头、每头 64 维(合计 1024 通道)的 Transformer,用 768 维交叉注意力吃 DINO 特征;三平面 tokenizer 起手 32×32、1024 通道,后处理上采样成 64×64×40;解码器是 9 层隐藏层、64 神经元、SiLU 激活的小 MLP,渲染半径 0.87、每条光线 128 个采样点。技术报告里明确写了,40 这个三平面通道数是为了压低推理时的内存占用专门选的——这就是它能挤进 6GB 卡的直接原因。

两年过去,单图转 3D 这条赛道已经挤满了 TripoSG 1.5B、TRELLIS 1.2B、Hunyuan3D 2.1 这些更大、更慢也更精细的模型,论几何细节 TripoSR 确实不占优。但它守住了两件别人拿不走的东西:一是延迟,半秒级前馈用来做实时预览、批量粗模、给精修模型喂初始网格,至今没有等价替代;二是许可证,源码、预训练权重、交互演示整套 MIT,而 Stability 自家的后继 Stable Fast 3D 已经换成了 Stability Community License,年收入超过 100 万美元的组织必须另谈企业授权。想找一个能商用、能改、能塞进产品里的三维重建模型,TripoSR 仍然是清单上的第一行。

01 —

TripoSR 有哪些版本,2026 年该怎么和同类模型搭配

官方权重只有一份,但周边选项和替代模型的显存门槛要分清楚。

版本参数量显存上下文说明
stabilityai/TripoSR(官方权重)model.ckpt 1.68GB fp32(约 4.2 亿参数)fp32 约 6GB(run.py 默认参数)512×512 单图输入,mc-resolution 256唯一官方发布的权重,源码与权重整套 MIT。默认输出 .obj,只带顶点色不带 UV 贴图。
TripoSR + --bake-texture同一份权重,只是换输出路径显存与默认档持平,xatlas UV 展开和 2048² 烘焙主要吃 CPU 与内存--texture-resolution 默认 2048,可直接导 .glb要拿进 Blender、Unity 或三维打印切片就必须走这条;顶点色模型在多数 DCC 里显示成灰模。
Stable Fast 3D(SF3D)Stability AI 的独立后继,2024 年 8 月技术报告官方未公布具体数字,实践上 24GB 卡宽裕单图 → UV 展开网格 + PBR 材质,一秒以内多了 delighting、粗糙度/金属度参数和低面数输出,但许可证换成 Stability Community License,年收入超 100 万美元需另购企业授权。
TripoSG 1.5B1.5B 整流流(rectified flow)+ SDF VAE,2048 个隐 token官方要求至少 8GB2025 年 3 月发布,4 月补 scribble 512-token 蒸馏版VAST 自家的质量路线,同样 MIT。几何细节明显强于 TripoSR,代价是不再是半秒量级。
TRELLIS-image-large1.2B(文本线还有 342M / 1.1B / 2.0B 三档)官方要求至少 16GB,测试基于 A100 与 A60002024 年 12 月发布,SLAT 结构化隐变量表示同一份隐变量可分别导出 3D Gaussians、辐射场或网格,MIT(个别子模块另有许可)。
Hunyuan3D 2.1形状模型 3.3B + 纹理模型 2B只跑形状 10GB;只跑纹理 21GB;全流程 29GB2025 年 6 月 13 日发布,需 Python 3.10 + PyTorch 2.5.1+开源里 PBR 纹理质量最高的一档,显存门槛也最高——29GB 直接把 24GB 消费卡排除在外。

02 —

TripoSR 用什么显卡跑最划算

6GB 的显存需求意味着你不必为它买贵卡,钱应该花在吞吐和后续精修上。

  • 单图试跑、Gradio 常驻、默认参数批量出粗模

    RTX 3090 24GB$0.193/卡·时

    6GB 的需求下,这是列表里每小时最便宜的 24GB 卡——比只有 16GB 的 Tesla T4($0.298/卡·时)还便宜三成,显存却多出 8GB。

  • 生产批处理:mc-resolution 512 叠加 --bake-texture 2048²

    RTX 4090 24GB$0.540/卡·时

    marching cubes 与 xatlas 展开吃的是单卡吞吐,4090 把每张图的端到端时间压到最短,按秒计费下总账反而更省。

  • 复现技术报告里「A100 上不到 0.5 秒」,或做横向基准

    A100 PCIE 80GB$0.824/卡·时

    论文原始基准就是 A100,同卡对比才有说服力;80GB 还能同时挂着 TripoSG 或 TRELLIS 做同机 A/B。

  • TripoSR 出粗模,Hunyuan3D 2.1 全流程精修,一张卡串起来

    RTX A6000 48GB$0.817/卡·时

    Hunyuan3D 2.1 形状加纹理全流程要 29GB,48GB 单卡装得下整条流水线,省掉模型反复换进换出的 I/O。

03 —

从开机到第一个 .obj,四步

所有坑集中在第二步的 torchmcubes 上,先把 CUDA 版本对齐,后面一路顺。

  1. 01

    开一台带 CUDA 的实例

    在 NexGPU 控制台选 RTX 3090 24GB,镜像用预置的 PyTorch。开机后第一件事是确认 nvcc 和 PyTorch 编译时用的 CUDA 是同一个大版本——第二步编译 torchmcubes 时对不上就一定失败。

    nvidia-smi && nvcc --version && python -c "import torch; print(torch.__version__, torch.version.cuda)"
  2. 02

    拉代码,装依赖

    requirements.txt 把 transformers 钉在 4.35.0、trimesh 4.0.5、xatlas 0.0.9、moderngl 5.10.0、omegaconf 2.3.0,而 torchmcubes 是直接从 tatsy 的仓库源码编译的 CUDA 扩展。「Failed building wheel for torchmcubes」是这个仓库至今最高频的 issue,根因几乎都是 nvcc 与 torch 的 CUDA 版本错开,对齐后重装即可。setuptools 需要 49.6.0 以上。

    git clone https://github.com/VAST-AI-Research/TripoSR && cd TripoSR && pip install -U "setuptools>=49.6.0" && pip install -r requirements.txt
  3. 03

    跑第一张图

    run.py 先用 rembg 抠背景(--foreground-ratio 默认 0.85,加 --no-remove-bg 可跳过),再前向一次拿到三平面,最后 marching cubes 提面。首次运行会自动从 stabilityai/TripoSR 拉 1.68GB 的 model.ckpt,以及 rembg 的 u2net 权重。显存吃紧就把 --chunk-size 从 8192 往下调,它控制表面提取与渲染的分块大小,设成 0 表示完全不分块。

    python run.py examples/chair.png --output-dir output/ --mc-resolution 256 --chunk-size 8192
  4. 04

    要能直接进 DCC 的资产就烘贴图

    默认 .obj 只带顶点色,导进 Blender、Unity 多半是一坨灰模。加 --bake-texture 会用 xatlas 做 UV 展开并烘出贴图,再配 --model-save-format glb 就是一个可直接分发的单文件。注意 mc-resolution 从 256 提到 512 时,密度场采样点从 256³(约 1677 万)涨到 512³(约 1.34 亿),正好 8 倍,时间和内存都要留余量。

    python run.py input.png --bake-texture --texture-resolution 2048 --mc-resolution 512 --model-save-format glb --output-dir output/

一份真实的账

TripoSR 的成本结构和大语言模型完全不同:它没有需要常驻显存的服务进程,权重才 1.68GB,你租的其实是「把这一批图跑完」的那段时间。按 RTX 3090 24GB 的 $0.193/卡·时 算,装环境(含 torchmcubes 编译)按 20 分钟计是 0.193 × 0.33 ≈ $0.064;跑批量任务整卡占用 1 小时就是 $0.193;一整个 8 小时工作日不停机也只有 0.193 × 8 = $1.54。想压到极限可以换 Tesla V100 32GB 的 $0.188/卡·时,显存还多 8GB,代价是 Volta 架构没有 bf16——TripoSR 本来就跑 fp32,影响有限。要对齐论文基准就上 A100 PCIE 80GB,$0.824/卡·时,跑半小时基准测试是 0.824 × 0.5 = $0.41。产出侧同样便宜:一轮跑出 1000 个 .glb,每个约 3MB 共 3GB,按 $0.0081/GB 的中位出网价下载走是 3 × 0.0081 ≈ $0.024,不到三分钱;权重加输出留 10GB 在盘上,按 $0.414/GB·月 的中位存储价是 $4.14/月。记住算力停机即停止计费,存储要到你销毁卷才停。全程按秒计量、按小时计价,没有最低消费、没有开通费、不用提配额工单。

04 —

常见问题

TripoSR 需要多大显存?8GB 显卡能跑吗?

官方数字是默认参数下单图推理约 6GB,8GB 卡完全够用。真正会把显存推高的是 --mc-resolution:默认 256 很稳,提到 512 时密度场采样点直接变成 8 倍。显存吃紧就把 --chunk-size 从 8192 往下调,它控制表面提取和渲染的分块大小,越小越省显存也越慢,设成 0 表示不分块。在 NexGPU 上开一张 RTX 3090 24GB,$0.193/卡·时,这些参数你可以随便试而不用担心 OOM。

2026 年 TripoSR 还值得用吗?是不是已经被 TripoSG、Hunyuan3D 取代了?

论几何细节,TripoSG 1.5B、TRELLIS 1.2B、Hunyuan3D 2.1(形状 3.3B + 纹理 2B)都比它强,这点没什么好争的。但这三者的显存门槛分别是 8GB、16GB、29GB,速度也早已不在半秒量级。TripoSR 的位置很清楚:实时预览、海量粗模、给精修模型当初始网格,以及唯一一整套 MIT 的商用授权。工程上常见做法是两条流水线并排跑——NexGPU 上一张 RTX A6000 48GB($0.817/卡·时)就能同时装下 TripoSR 和 Hunyuan3D 2.1 的完整流程。

torchmcubes 编译失败、Failed building wheel for torchmcubes 怎么解决?

这是 TripoSR 仓库里最高频的 issue。requirements.txt 里它是从 tatsy/torchmcubes 源码装的 CUDA 扩展,所以 nvcc 的 CUDA 版本必须和你装的 PyTorch 编译时用的 CUDA 对得上。先用 nvcc --version 和 torch.version.cuda 对比,不一致就换 PyTorch 轮子或换 CUDA toolkit,再卸载重装 torchmcubes。版本一旦错开,它会静默退回 CPU 路径,慢到你以为是模型的问题。NexGPU 的 2000+ 预置镜像里,PyTorch 镜像已经把 nvcc 和 torch 对齐好了,这一整段可以省掉。

TripoSR 生成的模型带贴图吗?能直接导入 Blender 或 Unity 吗?

默认导出的 .obj 只带顶点色、不带 UV,拖进 Blender 或 Unity 多半显示成灰模。加上 --bake-texture 会调 xatlas 做 UV 展开并烘出贴图,--texture-resolution 默认 2048;再配 --model-save-format glb 就是一个能直接分发的单文件。这一步吃 CPU 和内存多过吃显存,所以选卡策略不用变,但墙钟时间会明显拉长。在 NexGPU 上用 RTX 4090 24GB($0.540/卡·时)跑批量烘焙,整体时间最短。

TripoSR 可以商用吗?许可证到底是什么?

MIT,而且同时覆盖源码、预训练权重和交互演示三部分,是这条赛道上限制最少的一个。对照着看,Stability 自家的后继 Stable Fast 3D 已经换成 Stability Community License,年收入超过 100 万美元的组织必须另买企业授权;TripoSR 的训练数据用的是 Objaverse 里 CC-BY 的子集。要拿它做产品,就在 NexGPU 上按秒租卡先把效果验证完,跑完停机即停止计费,不用先谈年框合同。

TripoSR 能不能用 CPU 跑?没有显卡怎么办?

run.py 有 --device 参数,默认 cuda:0,改成 cpu 确实能跑通,但那半秒的前馈会拉长到分钟级,marching cubes 也同样慢——验证代码路径可以,做任何有量的事都不现实。另外要提醒:torchmcubes 装错版本时它也会静默走 CPU,社区里很多「TripoSR 好慢」其实是这个原因。与其为它买一张卡,不如在 NexGPU 上开一张 Tesla V100 32GB,$0.188/卡·时,按秒计费,跑完就停。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。