跳到主要内容

AI 文本生成

把开源模型变成你自己的 API

不用把数据交给第三方,也不用按 token 付费。租一张卡,拉起 vLLM,你就有了一个跑在自己控制的机器上的 OpenAI 兼容接口 —— 并发、上下文长度、量化方式全部由你决定。

7B 级模型每小时起
$0.540
70B 级模型每小时起
$1.088
单节点最大显存
2152GB

01 — 适用情况

什么时候该自己部署推理

商业 API 按 token 计费,在低频调用时很划算,但一旦进入批量生成、长上下文处理或高并发线上服务,成本会以超出预期的速度上升 —— 而且这条曲线不受你控制,服务商随时可以调价、限速或下线某个模型版本。

自建推理的成本结构完全不同:你付的是 GPU 的时间,不是 token 的数量。一张 RTX 4090 每小时 $0.540,跑一个 7B 量化模型可以支撑相当可观的并发。当吞吐量足够大时,单位 token 成本能压到商业 API 的零头。

更关键的是数据边界。医疗记录、法律文书、企业内部知识库、用户对话日志 —— 这些内容一旦发往外部接口就脱离了你的控制。自建推理让数据始终留在你租用的这台机器里,销毁实例即彻底清除。

02 — 典型负载

这些活它都能干

同一个推理服务,接上不同的前端就是不同的产品。

  • 私有知识库问答(RAG)

    把企业文档、产品手册、历史工单向量化后接入推理服务,做一个只回答自己业务问题的助手。全流程不出网,检索与生成都在同一台机器上完成。

  • 批量内容生成

    商品描述、摘要、翻译、数据标注 —— 需要跑几十万条的任务,按 token 付费会很贵,按 GPU 小时付费则是固定成本。跑完销毁,不留尾巴。

  • 线上对话服务

    vLLM 的连续批处理与 PagedAttention 让单卡也能扛住相当的并发。搭配前端直接对外提供服务,延迟与吞吐都可控。

  • 模型评测与选型

    在同一台机器上依次拉起几个候选模型,用自己的测试集横向对比。几小时的租金,换一个有依据的选型决定。

03 — 软件栈

预置好的推理引擎

三种引擎覆盖从追求极限吞吐到只想快点跑起来的不同需求。

  • vLLM — 吞吐优先

    PagedAttention 与连续批处理是目前开源推理吞吐的标杆。适合有并发压力的线上服务和大批量离线生成。启动后直接提供 OpenAI 兼容的 /v1/chat/completions。

    vLLM · OpenAI 兼容 · 张量并行

  • Ollama — 上手最快

    一条命令拉起一个模型,自动处理量化与显存分配。适合快速验证想法、本地开发联调,或者你只想要一个能用的接口而不想调参。

    Ollama · GGUF · 自动量化

  • TGI 与 SGLang — 特定优化

    TGI 在流式输出与生产可观测性上更成熟;SGLang 的 RadixAttention 在多轮对话与复杂 prompt 结构下有明显优势。按你的负载形态选。

    TGI · SGLang · RadixAttention

04 — 选卡

跑多大的模型,租哪张卡

推理的硬门槛是显存装得下权重加 KV cache。下表按常见部署规模给出最低配置与当前最便宜的可租卡。

部署规模建议显存当前最便宜可选说明
7B 模型 · INT4 量化10GBRTX 3060$0.100/小时个人助手、小规模内测。量化后质量损失有限,性价比最高的入门档。
14B 模型 · FP1632GBTesla V100$0.188/小时中文任务的常见甜点区间,质量与成本平衡得最好。
32B 模型 · INT4 量化24GBTesla V100$0.188/小时量化后 32B 可以塞进 24GB 单卡,是单卡能达到的最强质量档位。
70B 模型 · FP16141GBB200$10.797/小时光是权重就要 140GB,实际部署还要给 KV cache 留量,多数情况下需要多卡节点。张量并行由 vLLM 自动处理,无需改代码。

「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。

05 — 上手

三步跑起一个推理服务

  • 01

    选卡并留够端口

    按上表选定显存档位下单。注意端口映射在容器创建时固定,记得留出推理服务要对外暴露的端口。

  • 02

    拉起 vLLM 镜像

    选 vLLM 模板,填入模型名称即可自动下载权重并启动。首次拉取大模型权重需要一些时间,这段时间只产生存储费。

  • 03

    接上你的应用

    实例详情页给出映射后的公网地址,把它当作 OpenAI 的 base_url 填进你现有的代码,改一个 URL 就完成迁移。

06 — FAQ

关于大模型推理部署

部署一个 7B 模型每小时大概多少钱?

INT4 量化的 7B 模型 10GB 显存就够,当前最便宜的合规卡每小时不到 $0.15。即使用 FP16 跑在 RTX 4090 上也只要 $0.540/小时。以每天跑 8 小时算,一个月的推理服务成本在几十美元量级。

vLLM 和 Ollama 该选哪个?

如果你要对外提供服务、在意吞吐和并发,选 vLLM;如果你只是想快速把某个模型跑起来看看效果,选 Ollama —— 它一条命令就能起,代价是极限吞吐不如 vLLM。两个模板都预置好了,切换只需要重开一台实例。

模型权重要自己传上去吗?

不用。绝大多数开源模型可以在实例内直接从 Hugging Face 拉取,带宽走的是宿主机的公网。如果是你自己微调过的私有权重,可以用 scp、rsync 或对象存储同步进去。

能做张量并行、跑多卡推理吗?

可以。市场里筛选多卡节点,vLLM 用 --tensor-parallel-size 指定卡数即可,不需要改模型代码。单节点最高 14 卡、合计 2152GB 显存。

实例销毁后模型权重会保留吗?

不会,销毁即释放磁盘。如果你会反复用同一套权重,建议把它同步到对象存储,下次开机再拉回来 —— 或者干脆保持实例停机状态,但请注意停机期间存储费仍在产生。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。