01 — 适用情况
Agent 为什么特别适合自建推理
Agent 与普通对话应用的成本结构完全不同。一次对话是一问一答,而一个 Agent 完成一个任务,可能要经历规划、调用工具、观察结果、重新规划这样十几轮循环,每一轮都是一次完整的模型调用,很多轮还带着很长的上下文。
这意味着按 token 计费时,Agent 的账单不是线性增长而是会突然跳变 —— 一个陷入循环的 Agent 可以在你没注意的时候烧掉一整天的预算。而按 GPU 小时计费,无论它想多少次,成本上限是确定的。
还有一层是延迟与稳定性。Agent 的每一轮都依赖上一轮,外部 API 的限流、抖动或偶发超时会被整条链路放大。跑在自己租的机器上,这些不确定性就消失了 —— 唯一的瓶颈是显卡本身。
02 — 典型负载
常见的 Agent 形态
共同点是:调用次数多、上下文长、需要长时间运行。
研究与信息汇总
给一个题目,让 Agent 自己检索、阅读、交叉验证、写成报告。这类任务的模型调用次数最多,也是自建推理省钱最明显的场景。
代码助手与自动化
读代码库、定位问题、改代码、跑测试、看结果再改 —— 循环次数不可预测。跑在本地推理上,改到满意为止不心疼。
多智能体协作
CrewAI、AutoGen 这类框架让多个角色互相对话推进任务。角色越多、轮次越多,token 账单越吓人,而 GPU 小时费不变。
长期驻留的自动化流程
监控、定时分析、事件触发处理 —— 需要 7×24 在线的 Agent。一台常驻实例的月成本是可预测的固定值。
03 — 软件栈
Agent 框架与推理底座
推理服务在本机,框架随你挑 —— 它们大多只需要一个 OpenAI 兼容的地址。
推理底座:vLLM
Agent 的高频调用最看重吞吐。vLLM 的连续批处理让并行的多个 Agent 共享一张卡而不互相拖慢,启动即提供 OpenAI 兼容接口。
vLLM · OpenAI 兼容 · 高吞吐
编排:LangChain / LlamaIndex
工具调用、记忆、检索增强的事实标准。把 base_url 指向本机的 vLLM,其余代码一行不用改。
LangChain · LlamaIndex · RAG
多角色:CrewAI / AutoGen
适合需要多个 Agent 分工协作的复杂任务。轮次多意味着调用多,也意味着本地推理的成本优势被放大。
CrewAI · AutoGen · 多智能体
04 — 选卡
Agent 该配多大的卡
Agent 对推理质量敏感(判断错一步整条链就跑偏),也对吞吐敏感(调用次数多)。别在这里省过头。
| 使用规模 | 建议显存 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| 单 Agent · 7B 量化模型 | 12GB | RTX 3060$0.100/小时 | 验证想法、跑简单流程够用。复杂推理任务上小模型容易在中途判断失误。 |
| 单 Agent · 14B 级模型 | 32GB | Tesla V100$0.188/小时 | 工具调用与多步推理的可靠性明显提升,是自建 Agent 的实用起点。 |
| 多 Agent 并行 · 32B 量化 | 48GB | Q RTX 8000$0.508/小时 | 多个角色共享一张卡,需要更大显存放 KV cache。质量与并发的平衡点。 |
| 生产环境 · 70B 级模型 | 80GB | A100 SXM4$1.088/小时 | 复杂决策链路需要更强的推理能力,80GB 档单卡或多卡节点。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
把 Agent 迁到自建推理
01
起一个 vLLM 实例
选显存达标的卡,用 vLLM 模板拉起模型。记得在下单时留出推理服务要暴露的端口 —— 端口映射创建后无法追加。
02
改一行 base_url
LangChain、CrewAI、AutoGen 等主流框架都支持自定义 OpenAI 兼容端点。把地址换成实例给出的公网地址,迁移就完成了。
03
跑起来再调模型
先用中等规模模型跑通流程,再根据实际表现决定要不要换更大的模型。换模型只需要重开一台实例,不用改任何代码。
06 — FAQ
