TripoSR 走的是 LRM(Large Reconstruction Model)前馈路线——没有扩散采样、没有 SDS 优化、没有多视图一致性迭代,一次前向就吐出三平面(triplane)特征,再由 NeRF 解码器配 marching cubes 直接提出网格。官方给出的数字是 A100 上不到 0.5 秒生成一个完整纹理网格,默认参数下单图推理约 6GB 显存,权重文件 model.ckpt 只有 1.68GB。在一堆动辄几十 GB 的三维生成模型里,它小得不像话。
拆开看结构就明白显存为什么这么低。图像端是 facebook/dino-vitb16,512×512 输入按 16×16 切 patch;主干是 16 层、16 个注意力头、每头 64 维(合计 1024 通道)的 Transformer,用 768 维交叉注意力吃 DINO 特征;三平面 tokenizer 起手 32×32、1024 通道,后处理上采样成 64×64×40;解码器是 9 层隐藏层、64 神经元、SiLU 激活的小 MLP,渲染半径 0.87、每条光线 128 个采样点。技术报告里明确写了,40 这个三平面通道数是为了压低推理时的内存占用专门选的——这就是它能挤进 6GB 卡的直接原因。
两年过去,单图转 3D 这条赛道已经挤满了 TripoSG 1.5B、TRELLIS 1.2B、Hunyuan3D 2.1 这些更大、更慢也更精细的模型,论几何细节 TripoSR 确实不占优。但它守住了两件别人拿不走的东西:一是延迟,半秒级前馈用来做实时预览、批量粗模、给精修模型喂初始网格,至今没有等价替代;二是许可证,源码、预训练权重、交互演示整套 MIT,而 Stability 自家的后继 Stable Fast 3D 已经换成了 Stability Community License,年收入超过 100 万美元的组织必须另谈企业授权。想找一个能商用、能改、能塞进产品里的三维重建模型,TripoSR 仍然是清单上的第一行。
01 —
TripoSR 有哪些版本,2026 年该怎么和同类模型搭配
官方权重只有一份,但周边选项和替代模型的显存门槛要分清楚。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| stabilityai/TripoSR(官方权重) | model.ckpt 1.68GB fp32(约 4.2 亿参数) | fp32 约 6GB(run.py 默认参数) | 512×512 单图输入,mc-resolution 256 | 唯一官方发布的权重,源码与权重整套 MIT。默认输出 .obj,只带顶点色不带 UV 贴图。 |
| TripoSR + --bake-texture | 同一份权重,只是换输出路径 | 显存与默认档持平,xatlas UV 展开和 2048² 烘焙主要吃 CPU 与内存 | --texture-resolution 默认 2048,可直接导 .glb | 要拿进 Blender、Unity 或三维打印切片就必须走这条;顶点色模型在多数 DCC 里显示成灰模。 |
| Stable Fast 3D(SF3D) | Stability AI 的独立后继,2024 年 8 月技术报告 | 官方未公布具体数字,实践上 24GB 卡宽裕 | 单图 → UV 展开网格 + PBR 材质,一秒以内 | 多了 delighting、粗糙度/金属度参数和低面数输出,但许可证换成 Stability Community License,年收入超 100 万美元需另购企业授权。 |
| TripoSG 1.5B | 1.5B 整流流(rectified flow)+ SDF VAE,2048 个隐 token | 官方要求至少 8GB | 2025 年 3 月发布,4 月补 scribble 512-token 蒸馏版 | VAST 自家的质量路线,同样 MIT。几何细节明显强于 TripoSR,代价是不再是半秒量级。 |
| TRELLIS-image-large | 1.2B(文本线还有 342M / 1.1B / 2.0B 三档) | 官方要求至少 16GB,测试基于 A100 与 A6000 | 2024 年 12 月发布,SLAT 结构化隐变量表示 | 同一份隐变量可分别导出 3D Gaussians、辐射场或网格,MIT(个别子模块另有许可)。 |
| Hunyuan3D 2.1 | 形状模型 3.3B + 纹理模型 2B | 只跑形状 10GB;只跑纹理 21GB;全流程 29GB | 2025 年 6 月 13 日发布,需 Python 3.10 + PyTorch 2.5.1+ | 开源里 PBR 纹理质量最高的一档,显存门槛也最高——29GB 直接把 24GB 消费卡排除在外。 |
02 —
TripoSR 用什么显卡跑最划算
6GB 的显存需求意味着你不必为它买贵卡,钱应该花在吞吐和后续精修上。
单图试跑、Gradio 常驻、默认参数批量出粗模
RTX 3090 24GB$0.193/卡·时
6GB 的需求下,这是列表里每小时最便宜的 24GB 卡——比只有 16GB 的 Tesla T4($0.298/卡·时)还便宜三成,显存却多出 8GB。
生产批处理:mc-resolution 512 叠加 --bake-texture 2048²
RTX 4090 24GB$0.540/卡·时
marching cubes 与 xatlas 展开吃的是单卡吞吐,4090 把每张图的端到端时间压到最短,按秒计费下总账反而更省。
复现技术报告里「A100 上不到 0.5 秒」,或做横向基准
A100 PCIE 80GB$0.824/卡·时
论文原始基准就是 A100,同卡对比才有说服力;80GB 还能同时挂着 TripoSG 或 TRELLIS 做同机 A/B。
TripoSR 出粗模,Hunyuan3D 2.1 全流程精修,一张卡串起来
RTX A6000 48GB$0.817/卡·时
Hunyuan3D 2.1 形状加纹理全流程要 29GB,48GB 单卡装得下整条流水线,省掉模型反复换进换出的 I/O。
03 —
从开机到第一个 .obj,四步
所有坑集中在第二步的 torchmcubes 上,先把 CUDA 版本对齐,后面一路顺。
- 01
开一台带 CUDA 的实例
在 NexGPU 控制台选 RTX 3090 24GB,镜像用预置的 PyTorch。开机后第一件事是确认 nvcc 和 PyTorch 编译时用的 CUDA 是同一个大版本——第二步编译 torchmcubes 时对不上就一定失败。
nvidia-smi && nvcc --version && python -c "import torch; print(torch.__version__, torch.version.cuda)" - 02
拉代码,装依赖
requirements.txt 把 transformers 钉在 4.35.0、trimesh 4.0.5、xatlas 0.0.9、moderngl 5.10.0、omegaconf 2.3.0,而 torchmcubes 是直接从 tatsy 的仓库源码编译的 CUDA 扩展。「Failed building wheel for torchmcubes」是这个仓库至今最高频的 issue,根因几乎都是 nvcc 与 torch 的 CUDA 版本错开,对齐后重装即可。setuptools 需要 49.6.0 以上。
git clone https://github.com/VAST-AI-Research/TripoSR && cd TripoSR && pip install -U "setuptools>=49.6.0" && pip install -r requirements.txt - 03
跑第一张图
run.py 先用 rembg 抠背景(--foreground-ratio 默认 0.85,加 --no-remove-bg 可跳过),再前向一次拿到三平面,最后 marching cubes 提面。首次运行会自动从 stabilityai/TripoSR 拉 1.68GB 的 model.ckpt,以及 rembg 的 u2net 权重。显存吃紧就把 --chunk-size 从 8192 往下调,它控制表面提取与渲染的分块大小,设成 0 表示完全不分块。
python run.py examples/chair.png --output-dir output/ --mc-resolution 256 --chunk-size 8192 - 04
要能直接进 DCC 的资产就烘贴图
默认 .obj 只带顶点色,导进 Blender、Unity 多半是一坨灰模。加 --bake-texture 会用 xatlas 做 UV 展开并烘出贴图,再配 --model-save-format glb 就是一个可直接分发的单文件。注意 mc-resolution 从 256 提到 512 时,密度场采样点从 256³(约 1677 万)涨到 512³(约 1.34 亿),正好 8 倍,时间和内存都要留余量。
python run.py input.png --bake-texture --texture-resolution 2048 --mc-resolution 512 --model-save-format glb --output-dir output/
一份真实的账
TripoSR 的成本结构和大语言模型完全不同:它没有需要常驻显存的服务进程,权重才 1.68GB,你租的其实是「把这一批图跑完」的那段时间。按 RTX 3090 24GB 的 $0.193/卡·时 算,装环境(含 torchmcubes 编译)按 20 分钟计是 0.193 × 0.33 ≈ $0.064;跑批量任务整卡占用 1 小时就是 $0.193;一整个 8 小时工作日不停机也只有 0.193 × 8 = $1.54。想压到极限可以换 Tesla V100 32GB 的 $0.188/卡·时,显存还多 8GB,代价是 Volta 架构没有 bf16——TripoSR 本来就跑 fp32,影响有限。要对齐论文基准就上 A100 PCIE 80GB,$0.824/卡·时,跑半小时基准测试是 0.824 × 0.5 = $0.41。产出侧同样便宜:一轮跑出 1000 个 .glb,每个约 3MB 共 3GB,按 $0.0081/GB 的中位出网价下载走是 3 × 0.0081 ≈ $0.024,不到三分钱;权重加输出留 10GB 在盘上,按 $0.414/GB·月 的中位存储价是 $4.14/月。记住算力停机即停止计费,存储要到你销毁卷才停。全程按秒计量、按小时计价,没有最低消费、没有开通费、不用提配额工单。
04 —
