跳到主要内容

AI Agents

让 Agent 跑在你自己的机器上

Agent 最费钱的地方在于它会反复思考 —— 一个任务几十次模型调用是常态。按 token 计费时这笔账会失控,按 GPU 小时计费时它是固定的。

本地推理每小时起
$0.540
按 token 计的费用
0
可持续运行
24/7

01 — 适用情况

Agent 为什么特别适合自建推理

Agent 与普通对话应用的成本结构完全不同。一次对话是一问一答,而一个 Agent 完成一个任务,可能要经历规划、调用工具、观察结果、重新规划这样十几轮循环,每一轮都是一次完整的模型调用,很多轮还带着很长的上下文。

这意味着按 token 计费时,Agent 的账单不是线性增长而是会突然跳变 —— 一个陷入循环的 Agent 可以在你没注意的时候烧掉一整天的预算。而按 GPU 小时计费,无论它想多少次,成本上限是确定的。

还有一层是延迟与稳定性。Agent 的每一轮都依赖上一轮,外部 API 的限流、抖动或偶发超时会被整条链路放大。跑在自己租的机器上,这些不确定性就消失了 —— 唯一的瓶颈是显卡本身。

02 — 典型负载

常见的 Agent 形态

共同点是:调用次数多、上下文长、需要长时间运行。

  • 研究与信息汇总

    给一个题目,让 Agent 自己检索、阅读、交叉验证、写成报告。这类任务的模型调用次数最多,也是自建推理省钱最明显的场景。

  • 代码助手与自动化

    读代码库、定位问题、改代码、跑测试、看结果再改 —— 循环次数不可预测。跑在本地推理上,改到满意为止不心疼。

  • 多智能体协作

    CrewAI、AutoGen 这类框架让多个角色互相对话推进任务。角色越多、轮次越多,token 账单越吓人,而 GPU 小时费不变。

  • 长期驻留的自动化流程

    监控、定时分析、事件触发处理 —— 需要 7×24 在线的 Agent。一台常驻实例的月成本是可预测的固定值。

03 — 软件栈

Agent 框架与推理底座

推理服务在本机,框架随你挑 —— 它们大多只需要一个 OpenAI 兼容的地址。

  • 推理底座:vLLM

    Agent 的高频调用最看重吞吐。vLLM 的连续批处理让并行的多个 Agent 共享一张卡而不互相拖慢,启动即提供 OpenAI 兼容接口。

    vLLM · OpenAI 兼容 · 高吞吐

  • 编排:LangChain / LlamaIndex

    工具调用、记忆、检索增强的事实标准。把 base_url 指向本机的 vLLM,其余代码一行不用改。

    LangChain · LlamaIndex · RAG

  • 多角色:CrewAI / AutoGen

    适合需要多个 Agent 分工协作的复杂任务。轮次多意味着调用多,也意味着本地推理的成本优势被放大。

    CrewAI · AutoGen · 多智能体

04 — 选卡

Agent 该配多大的卡

Agent 对推理质量敏感(判断错一步整条链就跑偏),也对吞吐敏感(调用次数多)。别在这里省过头。

使用规模建议显存当前最便宜可选说明
单 Agent · 7B 量化模型12GBRTX 3060$0.100/小时验证想法、跑简单流程够用。复杂推理任务上小模型容易在中途判断失误。
单 Agent · 14B 级模型32GBTesla V100$0.188/小时工具调用与多步推理的可靠性明显提升,是自建 Agent 的实用起点。
多 Agent 并行 · 32B 量化48GBQ RTX 8000$0.508/小时多个角色共享一张卡,需要更大显存放 KV cache。质量与并发的平衡点。
生产环境 · 70B 级模型80GBA100 SXM4$1.088/小时复杂决策链路需要更强的推理能力,80GB 档单卡或多卡节点。

「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。

05 — 上手

把 Agent 迁到自建推理

  • 01

    起一个 vLLM 实例

    选显存达标的卡,用 vLLM 模板拉起模型。记得在下单时留出推理服务要暴露的端口 —— 端口映射创建后无法追加。

  • 02

    改一行 base_url

    LangChain、CrewAI、AutoGen 等主流框架都支持自定义 OpenAI 兼容端点。把地址换成实例给出的公网地址,迁移就完成了。

  • 03

    跑起来再调模型

    先用中等规模模型跑通流程,再根据实际表现决定要不要换更大的模型。换模型只需要重开一台实例,不用改任何代码。

06 — FAQ

关于 AI Agent 部署

自建推理跑 Agent 真的比调 API 便宜吗?

看调用量。低频使用时商业 API 更划算,因为你不用为空闲时间付钱。但 Agent 的特征恰好是高频 —— 一个任务几十次调用,一天跑上百个任务。到这个量级,一张 $0.540/小时的卡的成本会明显低于同等 token 量的 API 账单,而且上限是确定的。

小模型能撑得起 Agent 的推理链吗?

简单流程可以,复杂决策会吃力。Agent 的问题在于误差会累积 —— 第三步判断错了,后面全跑偏。建议至少从 14B 级模型起步,验证通过后再考虑能不能降到更小的模型。

Agent 需要联网调用外部工具,实例能出网吗?

可以,实例有完整的公网访问能力,调用外部 API、抓网页、连你自己的数据库都正常。需要注意出网流量按 GB 计费,中位价约 $0.0081/GB —— 常规 Agent 的流量量级下这笔钱基本可以忽略。

怎么让 Agent 7×24 一直跑?

保持实例运行、账户余额充足即可。系统会在余额偏低时提前发预警邮件。建议把 Agent 用 systemd 或 supervisor 托管,这样进程崩溃能自动拉起。

多个 Agent 可以共用一个推理服务吗?

可以,而且推荐这么做。vLLM 的连续批处理正是为这种场景设计的 —— 多个并发请求共享一张卡的算力,总吞吐远高于每个 Agent 独占一张卡。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。