01 — 适用情况
什么时候该自己部署推理
商业 API 按 token 计费,在低频调用时很划算,但一旦进入批量生成、长上下文处理或高并发线上服务,成本会以超出预期的速度上升 —— 而且这条曲线不受你控制,服务商随时可以调价、限速或下线某个模型版本。
自建推理的成本结构完全不同:你付的是 GPU 的时间,不是 token 的数量。一张 RTX 4090 每小时 $0.540,跑一个 7B 量化模型可以支撑相当可观的并发。当吞吐量足够大时,单位 token 成本能压到商业 API 的零头。
更关键的是数据边界。医疗记录、法律文书、企业内部知识库、用户对话日志 —— 这些内容一旦发往外部接口就脱离了你的控制。自建推理让数据始终留在你租用的这台机器里,销毁实例即彻底清除。
02 — 典型负载
这些活它都能干
同一个推理服务,接上不同的前端就是不同的产品。
私有知识库问答(RAG)
把企业文档、产品手册、历史工单向量化后接入推理服务,做一个只回答自己业务问题的助手。全流程不出网,检索与生成都在同一台机器上完成。
批量内容生成
商品描述、摘要、翻译、数据标注 —— 需要跑几十万条的任务,按 token 付费会很贵,按 GPU 小时付费则是固定成本。跑完销毁,不留尾巴。
线上对话服务
vLLM 的连续批处理与 PagedAttention 让单卡也能扛住相当的并发。搭配前端直接对外提供服务,延迟与吞吐都可控。
模型评测与选型
在同一台机器上依次拉起几个候选模型,用自己的测试集横向对比。几小时的租金,换一个有依据的选型决定。
03 — 软件栈
预置好的推理引擎
三种引擎覆盖从追求极限吞吐到只想快点跑起来的不同需求。
vLLM — 吞吐优先
PagedAttention 与连续批处理是目前开源推理吞吐的标杆。适合有并发压力的线上服务和大批量离线生成。启动后直接提供 OpenAI 兼容的 /v1/chat/completions。
vLLM · OpenAI 兼容 · 张量并行
Ollama — 上手最快
一条命令拉起一个模型,自动处理量化与显存分配。适合快速验证想法、本地开发联调,或者你只想要一个能用的接口而不想调参。
Ollama · GGUF · 自动量化
TGI 与 SGLang — 特定优化
TGI 在流式输出与生产可观测性上更成熟;SGLang 的 RadixAttention 在多轮对话与复杂 prompt 结构下有明显优势。按你的负载形态选。
TGI · SGLang · RadixAttention
04 — 选卡
跑多大的模型,租哪张卡
推理的硬门槛是显存装得下权重加 KV cache。下表按常见部署规模给出最低配置与当前最便宜的可租卡。
| 部署规模 | 建议显存 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| 7B 模型 · INT4 量化 | 10GB | RTX 3060$0.100/小时 | 个人助手、小规模内测。量化后质量损失有限,性价比最高的入门档。 |
| 14B 模型 · FP16 | 32GB | Tesla V100$0.188/小时 | 中文任务的常见甜点区间,质量与成本平衡得最好。 |
| 32B 模型 · INT4 量化 | 24GB | Tesla V100$0.188/小时 | 量化后 32B 可以塞进 24GB 单卡,是单卡能达到的最强质量档位。 |
| 70B 模型 · FP16 | 141GB | B200$10.797/小时 | 光是权重就要 140GB,实际部署还要给 KV cache 留量,多数情况下需要多卡节点。张量并行由 vLLM 自动处理,无需改代码。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
三步跑起一个推理服务
01
选卡并留够端口
按上表选定显存档位下单。注意端口映射在容器创建时固定,记得留出推理服务要对外暴露的端口。
02
拉起 vLLM 镜像
选 vLLM 模板,填入模型名称即可自动下载权重并启动。首次拉取大模型权重需要一些时间,这段时间只产生存储费。
03
接上你的应用
实例详情页给出映射后的公网地址,把它当作 OpenAI 的 base_url 填进你现有的代码,改一个 URL 就完成迁移。
06 — FAQ
