Ollama 是一套 MIT 许可的本地大模型运行时,仓库在 github.com/ollama/ollama,模型库在 ollama.com/library。它把 llama.cpp 那一整套量化推理封装成三样东西:一条安装脚本、一个 ollama run 命令、一个常驻在 11434 端口的 HTTP 服务。当前稳定线是 0.32.x,0.33 在预览通道。除了原生的 /api/chat、/api/generate、/api/embed,它同时兼容 OpenAI SDK 的调用方式,还能用 ollama launch 直接把本地模型接进 Claude Code、VS Code、JetBrains、Zed 和 n8n。
但 Ollama 本身不是模型,它只是壳。真正决定你能跑什么的是显存,而且有两层:第一层是装得下装不下——ollama.com/library 上标的 GB 是权重文件体积,不是峰值显存,实际还要给 KV cache 留出 20%–50% 的余量,上下文越长这个系数越大。第二层更隐蔽:Ollama 会根据可用显存自动决定默认上下文窗口,低于 24GB 只给 4K,24–48GB 给 32K,48GB 以上才开到 256K 档。也就是说显存不只决定能不能跑,还直接决定了你拿到多长的窗口——而官方对 Agent、编码助手、Web 搜索这类场景的建议下限就是 64K。
装不下的后果不是报错,是悄悄降速。Ollama 会把放不下的层甩给 CPU,ollama ps 的 Processor 一列从 100% GPU 变成混合,吞吐直接掉一个数量级,而你可能要跑完一整轮评估才发现。与其在 16GB 的笔记本上和量化等级死磕,不如按秒租一张真正装得下的卡。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,单节点最多 14 卡、最高 2,152GB 显存;2,000+ 预置镜像里 PyTorch、vLLM、Ubuntu CLI 都是现成的,SSH 进去一条 curl 就装好 Ollama,计算费用在实例停止的那一秒就停,没有最低消费、没有开通费、不用申请配额。
01 —
在 Ollama 上真正值得跑的模型档位
体积取自 ollama.com/library 的权重文件大小,实际显存占用要在此之上再留 KV cache 与上下文的余量。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| gpt-oss:20b | 20B(MXFP4,4.25 bit/参数) | 权重 14GB,官方称 16GB 内存/显存即可运行 | 128K | 单卡起步的最优解。MXFP4 已经把 90% 以上的 MoE 权重压到 4.25 bit,开箱就带工具调用和思维链,是评估选型阶段最省事的一档。 |
| gpt-oss:120b | 120B MoE(MXFP4) | 权重 65GB,官方明确可装进单张 80GB 卡 | 128K | 目前单卡能完整放下的最大一档开源前沿模型,不需要张量并行、不需要多卡切分,是自建私有推理的性价比拐点。 |
| qwen3.5:9b / :27b / :35b | 9B / 27B / 35B | 6.6GB / 17GB / 24GB | 256K | Gated Delta Networks 配稀疏 MoE 的多模态系列,文本加图像输入,中文场景的默认选择。9b 是 latest 标签指向的默认版本。 |
| gemma4:12b / :26b / :31b | 12B / 25.2B(3.8B 激活)/ 30.7B | 7.6GB / 18GB / 20GB | 256K | Google DeepMind 出品,图文输入。26b 是 MoE 结构,25.2B 参数只激活 3.8B,显存吃 18GB 但推理速度接近小模型。 |
| deepseek-r1:14b / :32b / :70b | 14B / 32B / 70B 蒸馏版 | 9.0GB / 20GB / 43GB | 128K | 思维链推理蒸馏系列,数学和代码推理明显强于同体积通用模型。完整的 671B 原版是 404GB,只有多卡节点才谈得上。 |
| qwen3.5:122b | 122B MoE | 权重 81GB——刚好越过 80GB 单卡的上限 | 256K | 81GB 这个数字很折磨人:80GB 的 A100/H100 差一口气装不下。要么上 141GB 单卡,要么接受多卡拆分带来的额外开销。 |
02 —
按你要跑的档位选卡
按秒计费、按小时定价,无最低消费、无开通费、不用申请配额。以下为每卡时列表价。
跑 7B–14B 量化模型做原型和批量评估(qwen3.5:9b 6.6GB、deepseek-r1:14b 9.0GB)
RTX 3090 24GB$0.193/卡·时
24GB 足够把 14GB 以内的权重整卡放下,再留出 4K–32K 上下文的 KV cache,是目前每美元 token 产出最划算的一档。
跑 gpt-oss:20b(14GB)、gemma4:31b(20GB)、deepseek-r1:32b(20GB),并且要 32K 上下文
RTX 5090 32GB$0.723/卡·时
32GB 越过了 Ollama 自动上下文的 24GB 门槛拿到 32K 窗口,20GB 权重之外还剩十几 GB 给 KV cache;Blackwell 计算能力 12.0 在官方支持列表内。
单卡跑 gpt-oss:120b(65GB),或者任何需要 256K 长上下文的 Agent 场景
A100 PCIE 80GB$0.824/卡·时
官方说明 gpt-oss:120b 可装进单张 80GB 卡;而且 48GB 以上才触发 256K 上下文档位——A100 PCIE 80GB 只比 RTX A6000 48GB 的 $0.817 贵 7 美分,长上下文场景直接选 80GB 那张。
qwen3.5:122b(81GB 权重),或把 OLLAMA_NUM_PARALLEL 拉到 8 以上做多人并发
H200 141GB$6.660/卡·时
81GB 权重已经超出 80GB 单卡的上限,141GB 装下之后还剩约 60GB 给并发 KV cache,省掉多卡拆分的通信开销和调试时间。
03 —
四步把 Ollama 跑在租来的卡上
从空实例到能被外部应用调用的 OpenAI 兼容端点,全程不到十分钟。
- 01
开实例,装 Ollama
在控制台按显存挑卡:7B–14B 选 RTX 3090 24GB,20B–32B 选 RTX 5090 32GB,120B 选 A100 PCIE 80GB。镜像选 Ubuntu CLI 或 PyTorch 都行,SSH 进去跑官方安装脚本,它会自动注册 systemd 服务并检测驱动。硬性门槛:NVIDIA 计算能力 5.0 以上、驱动 550 以上(计算能力 5.0–6.2 的老卡需要 570 以上)。
curl -fsSL https://ollama.com/install.sh | sh - 02
改掉三个一定会踩坑的默认值
Ollama 默认只监听 127.0.0.1:11434,远端应用根本连不上;上下文按显存自动决定,24GB 以下只有 4K;KV cache 默认 f16。用 systemd override 一次改完:监听改 0.0.0.0、上下文顶到 64K、KV cache 降到 q8_0(显存占用约为 f16 的一半,q4_0 是四分之一)、强制打开 Flash Attention。注意 0.0.0.0 意味着接口裸奔无鉴权,务必配合安全组或 SSH 隧道。
sudo mkdir -p /etc/systemd/system/ollama.service.d && printf '[Service]\nEnvironment="OLLAMA_HOST=0.0.0.0:11434"\nEnvironment="OLLAMA_CONTEXT_LENGTH=65536"\nEnvironment="OLLAMA_KV_CACHE_TYPE=q8_0"\nEnvironment="OLLAMA_FLASH_ATTENTION=1"\n' | sudo tee /etc/systemd/system/ollama.service.d/override.conf && sudo systemctl daemon-reload && sudo systemctl restart ollama - 03
拉模型,然后确认它真的 100% 在 GPU 上
这是自建 Ollama 最容易被跳过、也最贵的一步。ollama ps 的 Processor 一列会告诉你模型是 100% GPU 还是被拆成了 GPU/CPU 混合。一旦看到 CPU 占比,说明有层落进了系统内存,token/s 会掉一个数量级——要么调小 OLLAMA_CONTEXT_LENGTH,要么换一张显存更大的卡。日志在 journalctl -u ollama 里。
ollama pull gpt-oss:20b && ollama run gpt-oss:20b "用一句话解释 MoE" && ollama ps - 04
把 11434 接进你自己的应用
原生接口是 /api/chat、/api/generate、/api/embed,同时兼容 OpenAI SDK——把 base_url 指向实例地址即可,代码一行都不用改。需要多人同时用的话,把 OLLAMA_NUM_PARALLEL(默认 1)和 OLLAMA_MAX_LOADED_MODELS(默认为 GPU 数的 3 倍)一起调;模型默认闲置 5 分钟卸载,长期服务把 OLLAMA_KEEP_ALIVE 设成 -1 常驻显存。
curl http://<你的节点IP>:11434/api/chat -d '{"model":"gpt-oss:20b","messages":[{"role":"user","content":"你好"}],"stream":false}'
一周选型评估要花多少钱
假设你要在一周内把三个候选模型跑一遍再定生产用哪个:gpt-oss:20b(14GB)、qwen3.5:27b(17GB)、deepseek-r1:32b(20GB),合计 51GB 权重。选 A100 PCIE 80GB($0.824/卡·时),三个模型可以同时驻留,80GB 也把 Ollama 的自动上下文顶到 256K 档。每天实际跑 4 小时、连续 5 天:计算 = 20 小时 × $0.824 = $16.48。模型文件占盘 51GB,按 $0.414/GB·月的中位价只保留 7 天 = 51 × 0.414 × 7 ÷ 30 ≈ $4.93。评估日志导出 2GB,出网 = 2 × $0.0081 ≈ $0.02。一周合计约 $21.43。两点要记住:计算费用在实例停止那一秒就停了,但存储要等你销毁实例才停止计费;如果只想快速验证 7B–14B 量化模型,把卡换成 RTX 3090 24GB($0.193/卡·时),同样 20 小时只要 $3.86——比你为这件事重装一次本地驱动的时间还便宜。
04 —
