SuperAGI 由 TransformerOptimus 团队在 2023 年放出,GitHub 上攒到 17.7k star,MIT 协议。它给智能体这件事做了一套完整的产品化外壳:FastAPI 后端 + Celery 任务队列 + PostgreSQL 15 + Redis Stack 长期记忆 + Next.js 图形界面,前面挂一层 Nginx 反代到 3000 端口,全部由 docker compose 一次拉起。工具箱(Toolkit)、智能体模板市场、APM 性能面板、Webhook 事件触发、定时运行、Python 与 Node 客户端 SDK,这些当年别的框架还在 notebook 里手搓的东西,SuperAGI 早早做成了可点的界面。
所以「SuperAGI 需要多大显存」这个问题本身是问偏了。默认路径下它只是拿 openai==0.27.7 去调远端 API,整套栈跑在 CPU 上,一台普通机器就够。真正吃显存的是本地化那条路,而 SuperAGI 给了两个入口:一是内置的 llama-cpp 路径,Dockerfile-gpu 基于 nvidia/cuda:12.1.1-devel-ubuntu22.04,用 CMAKE_ARGS="-DLLAMA_CUBLAS=on" 编译 llama_cpp_python==0.2.7,模型文件直接放在容器里的 /app/local_model_path,GPU_LAYERS 默认 -1(整模卸载到显卡),LocalLLM 类默认 context_length 是 4096,配置模板里的 MAX_MODEL_TOKEN_LIMIT 写死 4032;二是旁挂一个 OpenAI 兼容端点,把 OPENAI_API_BASE 指过去。后者是 2026 年真正跑得通的那条路,原因下面会讲。
还有一件必须说清楚的事:SuperAGI 主仓库的最后一个正式 release 是 2024-01-16 的 v0.0.14(带来 Local LLM 与多 GPU 支持),main 分支最后一次提交停在 2025-01-22。原班人马没有消失,只是把火力挪到了新项目上——Ishaan Bhola、Adithyan Krishnan、Mukunda NS 在 2026 年 8 月放出了 SuperScout(arXiv:2608.04804),核心权重 SuperScout-7B 是 Qwen2.5-Coder-7B-Instruct 的 LoRA 微调,在 SWE-bench Pro 完整 Python 切片(266 题)上解出 159 题,追平最强单模型的 158 题,而每解决一题的总成本只有大约五分之一。想在自己卡上跑 SuperAGI 一脉的东西,今天最值得占一张 GPU 的,是这个 7.6B。
01 —
SuperAGI 一脉的版本与权重
框架、模型、后继项目分开看,显存需求完全不是一回事
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| SuperAGI v0.0.14 | 框架本体,不含模型权重 | 不占显存;Docker 全栈建议 8GB 以上内存 | MAX_MODEL_TOKEN_LIMIT 4032 | 2024-01-16 发布的最后一个正式 release,主要内容就是 Local LLM 集成与多 GPU 支持。MIT 协议,main 分支最后一次提交在 2025-01-22。要复刻当年那套智能体工作流,装这个版本没错。 |
| SuperAGI/SuperScout-7B | 7.6B(Qwen2.5-Coder-7B-Instruct 的 LoRA 微调,r=64、alpha=128) | bf16 约 15.2GB/FP8 约 7.6GB/AWQ INT4 约 5.6GB;32K 满上下文 KV 再加约 1.9GB | 32,768 | 2026 年放出的仓库勘探模型:它负责翻代码库、定位涉事文件、尝试写一个失败的复现、产出结构化 handoff,然后交棒给前沿模型去打补丁——它自己不写补丁。Apache-2.0,bf16 分四个 safetensors 分片。 |
| SuperAGI/SAM(SAM-7B) | 7B(Mistral-7B 微调) | F16 约 14.5GB/社区 GGUF Q4_K_M 约 4.4GB | 8K 有效(Mistral-7B 滑窗架构) | 2023-12 的推理特化模型,训练数据全部由开源模型生成。模型卡自己写得很直白:不适合对话和简单问答,只在任务拆解与推理上表现更好。RichardErkhov 与 featherless-ai 都出过 GGUF 量化。 |
| SuperAGI/mistral-7B-PoSE-32k | 7B | fp16 约 14.5GB | 32K(PoSE 位置外推) | 用 PoSE 把 Mistral-7B 的上下文窗口撑到 32K 的实验权重。智能体的长期记忆很容易把上下文顶爆,这个权重是当年拿来做长上下文对照的,今天更多是研究价值。 |
| SuperCoder(同团队后继项目) | 无自带权重,自带 LLM Key | 本体不占显存;可选的 Context Engine 走 docker compose | 取决于你接的模型 | 已经重写成 Tauri 2 桌面端的本地优先编码智能体,原生对接 OpenAI Chat Completions 与 Anthropic Messages 两套 API,代码不出本机。MIT 协议。想要「今天还在动」的 SuperAGI 系产品,看它。 |
02 —
该租哪张卡
按你到底要跑什么来选,别为框架本身买显存
只跑 SuperAGI 框架,配一个 7B GGUF 做本地 LLM(Q4_K_M 约 4.7GB、4096 上下文)
Tesla V100 32GB$0.188/卡·时
llama-cpp 的 cuBLAS 后端在 Volta 上跑得好好的,32GB 显存装下 4-bit 权重后还剩一大截余量给 KV 和别的进程,这是整份价目表里最便宜的一档。
SuperScout-7B 单卡评估,用 AWQ INT4 或自量化的 Q4_K_M 先摸清楚它的行为
RTX 3090 24GB$0.193/卡·时
INT4 权重约 5.6GB,24GB 卡连满 32K 上下文都绰绰有余,$0.193 一小时基本等于白嫖一次完整评估。
SuperScout-7B bf16 全精度上线,配满 32,768 上下文
RTX 4090 24GB$0.540/卡·时
15.2GB 权重加上 32K 单序列约 1.9GB 的 KV,合计约 17.1GB,24GB 卡刚好装得下还能留出并发余量;Ada 架构也是这一代 vLLM 优化最成熟的目标。
多路 scout 并发跑批,需要更大的 KV 池和更长的排队深度
RTX A6000 48GB$0.817/卡·时
SuperScout 的 KV 是每 token 约 56KiB,48GB 减掉 15.2GB 权重后能撑十几路 32K 的并发序列,批量刷 SWE-bench Pro 这种场景直接省一半墙上时间。
03 —
从零到跑通
先把框架拉起来,再把模型接进去,最后处理那两个必踩的坑
- 01
拉起 SuperAGI 全栈
克隆仓库,把 config_template.yaml 复制成 config.yaml,然后用 GPU 版的 compose 文件构建。这份 compose 会起 backend、celery、gui、super__redis、super__postgres、proxy 六个服务,backend 和 celery 都带 nvidia 驱动的 GPU 预留(count: all)。构建完浏览器开 http://localhost:3000,GitHub OAuth 或者本地账号进去就能建智能体。首次 build 要编译带 cuBLAS 的 llama-cpp-python,耐心等十几分钟。
git clone https://github.com/TransformerOptimus/SuperAGI.git && cd SuperAGI && cp config_template.yaml config.yaml && docker compose -f docker-compose-gpu.yml up --build - 02
用 vLLM 把 SuperScout-7B 起成 OpenAI 兼容端点
这是把本地模型接进 SuperAGI 最省心的方式。注意 SuperScout-7B 有一条硬性要求:不要用 greedy 解码。模型卡实测 greedy 的文件定位准确率只有 0.1104,而 temperature 0.9 单次采样是 0.3058,相差 2.65 倍;采样参数要钉死 top_p=1.0、top_k=-1,只取一次 draw。max-model-len 顶到 32768 就是它 config 里的 max_position_embeddings 上限。
vllm serve SuperAGI/SuperScout-7B --served-model-name superscout-7b --dtype bfloat16 --max-model-len 32768 --gpu-memory-utilization 0.90 --port 8000 - 03
把 SuperAGI 指向本地端点
SuperAGI 用的是 openai 0.27.7 这一代 SDK,它认 api_base 覆盖,所以只要把 config.yaml 里的 OPENAI_API_BASE 改成本地 vLLM 的 /v1,OPENAI_API_KEY 随便填一个非空值,重启 backend 和 celery 就生效。模型名要和 --served-model-name 对齐,再到界面的 Models 控制台里把它登记进去,建智能体时才选得到。
sed -i 's|^OPENAI_API_BASE:.*|OPENAI_API_BASE: http://host.docker.internal:8000/v1|' config.yaml && docker compose -f docker-compose-gpu.yml restart backend celery - 04
可选:走内置的 GGUF 路径,并绕开版本坑
SuperAGI 内置的本地推理是 llama_cpp.Llama 直接加载容器里 /app/local_model_path 这个文件,GPU_LAYERS 默认 -1 表示整模卸载到显卡,还会用 superagi/llms/grammar/json.gbnf 这个 GBNF 语法强制模型吐合法 JSON——这一手很聪明,小模型的工具调用格式因此稳得多。坑在于 requirements 里钉的是 llama_cpp_python==0.2.7(2023 年 9 月的版本),只吃那个年代的 GGUF;拿新版 llama.cpp 量化出来的文件大概率报 unknown model architecture 或 unsupported GGUF version。要么挑同期的量化文件,要么进容器把 llama-cpp-python 按 cuBLAS 重编到新版本。
docker compose -f docker-compose-gpu.yml cp ./model-q4_k_m.gguf backend:/app/local_model_path
这一趟到底要花多少钱
拿 RTX 4090 24GB($0.540/卡·时)把 SuperScout-7B 完整跑一遍 SWE-bench Pro 的 Python 266 题:15.2GB 权重下载约 10 分钟,vLLM 冷启动加载约 3 分钟,266 个任务按每题平均占用 4 分钟单卡时间估算是 1064 分钟,合计 (10 + 3 + 1064) ÷ 60 ≈ 17.95 小时,17.95 × $0.540 = $9.69,摊到每题约 $0.036。每题 4 分钟是估算值,你自己的仓库规模会把它拉长或缩短,但量级不会变。如果只是想把 SuperAGI 界面点开、建两个智能体看看工作流长什么样,换 RTX 3090 24GB($0.193/卡·时),一小时 $0.193,按秒计费、没有起租时长、不用申请配额,关机就停算力计费。权重加镜像大约 40GB,按 $0.414/GB·月 的存储中位价算是 $16.56/月,注意实例停止后算力停计费、存储会一直算到你把它销毁为止;把 handoff 的 JSON 结果拉回本地按 $0.0081/GB 出网,几百 MB 的量基本可以忽略不计。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU,单节点最多 14 卡、最大节点显存 2,152GB,跑批的时候不用排队等卡。
04 —
