跳到主要内容

推理运行时

Ollama 本地部署:显存怎么算,模型怎么选,卡怎么租

Ollama 把开源大模型压缩成一条 curl 和一个 11434 端口。真正卡住你的从来不是这条命令,是显存。

Ollama 是一套 MIT 许可的本地大模型运行时,仓库在 github.com/ollama/ollama,模型库在 ollama.com/library。它把 llama.cpp 那一整套量化推理封装成三样东西:一条安装脚本、一个 ollama run 命令、一个常驻在 11434 端口的 HTTP 服务。当前稳定线是 0.32.x,0.33 在预览通道。除了原生的 /api/chat、/api/generate、/api/embed,它同时兼容 OpenAI SDK 的调用方式,还能用 ollama launch 直接把本地模型接进 Claude Code、VS Code、JetBrains、Zed 和 n8n。

但 Ollama 本身不是模型,它只是壳。真正决定你能跑什么的是显存,而且有两层:第一层是装得下装不下——ollama.com/library 上标的 GB 是权重文件体积,不是峰值显存,实际还要给 KV cache 留出 20%–50% 的余量,上下文越长这个系数越大。第二层更隐蔽:Ollama 会根据可用显存自动决定默认上下文窗口,低于 24GB 只给 4K,24–48GB 给 32K,48GB 以上才开到 256K 档。也就是说显存不只决定能不能跑,还直接决定了你拿到多长的窗口——而官方对 Agent、编码助手、Web 搜索这类场景的建议下限就是 64K。

装不下的后果不是报错,是悄悄降速。Ollama 会把放不下的层甩给 CPU,ollama ps 的 Processor 一列从 100% GPU 变成混合,吞吐直接掉一个数量级,而你可能要跑完一整轮评估才发现。与其在 16GB 的笔记本上和量化等级死磕,不如按秒租一张真正装得下的卡。NexGPU 在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU、75 种卡型,单节点最多 14 卡、最高 2,152GB 显存;2,000+ 预置镜像里 PyTorch、vLLM、Ubuntu CLI 都是现成的,SSH 进去一条 curl 就装好 Ollama,计算费用在实例停止的那一秒就停,没有最低消费、没有开通费、不用申请配额。

01 —

在 Ollama 上真正值得跑的模型档位

体积取自 ollama.com/library 的权重文件大小,实际显存占用要在此之上再留 KV cache 与上下文的余量。

版本参数量显存上下文说明
gpt-oss:20b20B(MXFP4,4.25 bit/参数)权重 14GB,官方称 16GB 内存/显存即可运行128K单卡起步的最优解。MXFP4 已经把 90% 以上的 MoE 权重压到 4.25 bit,开箱就带工具调用和思维链,是评估选型阶段最省事的一档。
gpt-oss:120b120B MoE(MXFP4)权重 65GB,官方明确可装进单张 80GB 卡128K目前单卡能完整放下的最大一档开源前沿模型,不需要张量并行、不需要多卡切分,是自建私有推理的性价比拐点。
qwen3.5:9b / :27b / :35b9B / 27B / 35B6.6GB / 17GB / 24GB256KGated Delta Networks 配稀疏 MoE 的多模态系列,文本加图像输入,中文场景的默认选择。9b 是 latest 标签指向的默认版本。
gemma4:12b / :26b / :31b12B / 25.2B(3.8B 激活)/ 30.7B7.6GB / 18GB / 20GB256KGoogle DeepMind 出品,图文输入。26b 是 MoE 结构,25.2B 参数只激活 3.8B,显存吃 18GB 但推理速度接近小模型。
deepseek-r1:14b / :32b / :70b14B / 32B / 70B 蒸馏版9.0GB / 20GB / 43GB128K思维链推理蒸馏系列,数学和代码推理明显强于同体积通用模型。完整的 671B 原版是 404GB,只有多卡节点才谈得上。
qwen3.5:122b122B MoE权重 81GB——刚好越过 80GB 单卡的上限256K81GB 这个数字很折磨人:80GB 的 A100/H100 差一口气装不下。要么上 141GB 单卡,要么接受多卡拆分带来的额外开销。

02 —

按你要跑的档位选卡

按秒计费、按小时定价,无最低消费、无开通费、不用申请配额。以下为每卡时列表价。

  • 跑 7B–14B 量化模型做原型和批量评估(qwen3.5:9b 6.6GB、deepseek-r1:14b 9.0GB)

    RTX 3090 24GB$0.193/卡·时

    24GB 足够把 14GB 以内的权重整卡放下,再留出 4K–32K 上下文的 KV cache,是目前每美元 token 产出最划算的一档。

  • 跑 gpt-oss:20b(14GB)、gemma4:31b(20GB)、deepseek-r1:32b(20GB),并且要 32K 上下文

    RTX 5090 32GB$0.723/卡·时

    32GB 越过了 Ollama 自动上下文的 24GB 门槛拿到 32K 窗口,20GB 权重之外还剩十几 GB 给 KV cache;Blackwell 计算能力 12.0 在官方支持列表内。

  • 单卡跑 gpt-oss:120b(65GB),或者任何需要 256K 长上下文的 Agent 场景

    A100 PCIE 80GB$0.824/卡·时

    官方说明 gpt-oss:120b 可装进单张 80GB 卡;而且 48GB 以上才触发 256K 上下文档位——A100 PCIE 80GB 只比 RTX A6000 48GB 的 $0.817 贵 7 美分,长上下文场景直接选 80GB 那张。

  • qwen3.5:122b(81GB 权重),或把 OLLAMA_NUM_PARALLEL 拉到 8 以上做多人并发

    H200 141GB$6.660/卡·时

    81GB 权重已经超出 80GB 单卡的上限,141GB 装下之后还剩约 60GB 给并发 KV cache,省掉多卡拆分的通信开销和调试时间。

03 —

四步把 Ollama 跑在租来的卡上

从空实例到能被外部应用调用的 OpenAI 兼容端点,全程不到十分钟。

  1. 01

    开实例,装 Ollama

    在控制台按显存挑卡:7B–14B 选 RTX 3090 24GB,20B–32B 选 RTX 5090 32GB,120B 选 A100 PCIE 80GB。镜像选 Ubuntu CLI 或 PyTorch 都行,SSH 进去跑官方安装脚本,它会自动注册 systemd 服务并检测驱动。硬性门槛:NVIDIA 计算能力 5.0 以上、驱动 550 以上(计算能力 5.0–6.2 的老卡需要 570 以上)。

    curl -fsSL https://ollama.com/install.sh | sh
  2. 02

    改掉三个一定会踩坑的默认值

    Ollama 默认只监听 127.0.0.1:11434,远端应用根本连不上;上下文按显存自动决定,24GB 以下只有 4K;KV cache 默认 f16。用 systemd override 一次改完:监听改 0.0.0.0、上下文顶到 64K、KV cache 降到 q8_0(显存占用约为 f16 的一半,q4_0 是四分之一)、强制打开 Flash Attention。注意 0.0.0.0 意味着接口裸奔无鉴权,务必配合安全组或 SSH 隧道。

    sudo mkdir -p /etc/systemd/system/ollama.service.d && printf '[Service]\nEnvironment="OLLAMA_HOST=0.0.0.0:11434"\nEnvironment="OLLAMA_CONTEXT_LENGTH=65536"\nEnvironment="OLLAMA_KV_CACHE_TYPE=q8_0"\nEnvironment="OLLAMA_FLASH_ATTENTION=1"\n' | sudo tee /etc/systemd/system/ollama.service.d/override.conf && sudo systemctl daemon-reload && sudo systemctl restart ollama
  3. 03

    拉模型,然后确认它真的 100% 在 GPU 上

    这是自建 Ollama 最容易被跳过、也最贵的一步。ollama ps 的 Processor 一列会告诉你模型是 100% GPU 还是被拆成了 GPU/CPU 混合。一旦看到 CPU 占比,说明有层落进了系统内存,token/s 会掉一个数量级——要么调小 OLLAMA_CONTEXT_LENGTH,要么换一张显存更大的卡。日志在 journalctl -u ollama 里。

    ollama pull gpt-oss:20b && ollama run gpt-oss:20b "用一句话解释 MoE" && ollama ps
  4. 04

    把 11434 接进你自己的应用

    原生接口是 /api/chat、/api/generate、/api/embed,同时兼容 OpenAI SDK——把 base_url 指向实例地址即可,代码一行都不用改。需要多人同时用的话,把 OLLAMA_NUM_PARALLEL(默认 1)和 OLLAMA_MAX_LOADED_MODELS(默认为 GPU 数的 3 倍)一起调;模型默认闲置 5 分钟卸载,长期服务把 OLLAMA_KEEP_ALIVE 设成 -1 常驻显存。

    curl http://<你的节点IP>:11434/api/chat -d '{"model":"gpt-oss:20b","messages":[{"role":"user","content":"你好"}],"stream":false}'

一周选型评估要花多少钱

假设你要在一周内把三个候选模型跑一遍再定生产用哪个:gpt-oss:20b(14GB)、qwen3.5:27b(17GB)、deepseek-r1:32b(20GB),合计 51GB 权重。选 A100 PCIE 80GB($0.824/卡·时),三个模型可以同时驻留,80GB 也把 Ollama 的自动上下文顶到 256K 档。每天实际跑 4 小时、连续 5 天:计算 = 20 小时 × $0.824 = $16.48。模型文件占盘 51GB,按 $0.414/GB·月的中位价只保留 7 天 = 51 × 0.414 × 7 ÷ 30 ≈ $4.93。评估日志导出 2GB,出网 = 2 × $0.0081 ≈ $0.02。一周合计约 $21.43。两点要记住:计算费用在实例停止那一秒就停了,但存储要等你销毁实例才停止计费;如果只想快速验证 7B–14B 量化模型,把卡换成 RTX 3090 24GB($0.193/卡·时),同样 20 小时只要 $3.86——比你为这件事重装一次本地驱动的时间还便宜。

04 —

常见问题

Ollama 本地部署到底需要多大显存?

先看 ollama.com/library 上标的体积——那是权重文件大小,不是峰值显存。gpt-oss:20b 是 14GB,qwen3.5:27b 是 17GB,deepseek-r1:32b 是 20GB,gpt-oss:120b 是 65GB。在此之上要给 KV cache 留余量,经验值是权重体积再乘 1.2–1.5,上下文开得越长系数越大。所以 14GB 的模型别指望在 16GB 卡上开 128K 上下文。与其估算,不如按秒租一小时 RTX 5090 32GB($0.723/卡·时)实测一次 ollama ps,NexGPU 上这一小时的成本不到一杯咖啡。

ollama ps 显示 Processor 是 GPU/CPU 混合,怎么让它 100% 跑在 GPU 上?

混合意味着模型没完整装进显存,放不下的层落到了系统内存,吞吐会掉一个数量级。三条路:调小 OLLAMA_CONTEXT_LENGTH、把 OLLAMA_KV_CACHE_TYPE 设成 q8_0 或 q4_0(分别约为 f16 的 1/2 和 1/4)、或者换一张显存更大的卡。前两条是拿窗口和精度换显存,第三条才是真解。NexGPU 从 RTX 3090 24GB($0.193/卡·时)到 H200 141GB($6.660/卡·时)共 75 种卡型都能按秒起停,换卡重跑一次的代价小到可以忽略。

Ollama 和 vLLM 该选哪个?

Ollama 赢在开箱即用:一条 curl 装好、一条 ollama run 拉起、11434 端口直接给 OpenAI 兼容接口,库里的 GGUF/MXFP4 权重已经量化好,适合单人开发、评估选型和内部小流量服务。vLLM 赢在吞吐:连续批处理和 PagedAttention 在高并发下更能压榨显存和算力,适合正式对外的推理服务。常见做法是先用 Ollama 选型、再用 vLLM 上生产。NexGPU 的 2,000+ 预置镜像里 PyTorch、vLLM、Ubuntu CLI 都有,同一台机器上两套都能装,不用为换框架重开环境。

把 OLLAMA_HOST 设成 0.0.0.0 安全吗?

不安全。Ollama 的 HTTP 接口默认没有任何鉴权,11434 一旦暴露在公网,任何人都能拉模型、跑推理、烧你的显卡。稳妥做法是保持默认的 127.0.0.1 绑定、用 SSH 端口转发把 11434 映射到本地;或者绑 0.0.0.0 但在防火墙只放行你自己的 IP,再套一层 Nginx 做鉴权。NexGPU 每个实例都同时提供 SSH、Jupyter、Web 终端、REST API 和 CLI 五种接入方式,跑 Ollama 走 SSH 隧道是最省事的一种。

Ollama 支持哪些显卡?Tesla P40、V100 这种老卡还能用吗?

能。Ollama 要求 NVIDIA 计算能力 5.0 及以上、驱动 550 及以上,计算能力 5.0–6.2 的老卡需要 570 及以上驱动。Tesla P40 是 Pascal 6.1、V100 是 Volta 7.0,都在支持列表里;AMD 需要 ROCm v7,Intel 和其他厂商走 Vulkan 后端。老卡的短板不是跑不动,是没有 FP8/MXFP4 这类新格式的原生加速,但跑 GGUF Q4 量化依然非常划算。NexGPU 的 Tesla V100 32GB 只要 $0.188/卡·时、Tesla P40 24GB $0.214/卡·时,是跑 7B–14B 量化模型最便宜的两档。

上下文拉到 128K,显存会不会直接爆?

会,而且比多数人预期得快。Ollama 按可用显存自动选默认窗口:低于 24GB 给 4K,24–48GB 给 32K,48GB 以上才到 256K 档;官方对 Agent、编码助手、Web 搜索这类场景的建议下限是 64K。不换卡的前提下可以开 OLLAMA_FLASH_ATTENTION=1 并把 OLLAMA_KV_CACHE_TYPE 设成 q8_0,但最直接的办法还是上 48GB 以上的卡。NexGPU 的 RTX A6000 48GB 是 $0.817/卡·时、A100 PCIE 80GB 是 $0.824/卡·时——差 7 美分,长上下文场景直接选后者。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。