跳到主要内容

本地推理运行时

LM Studio 本地部署:显存要多大,服务端怎么常驻

它已经不只是一个桌面聊天窗口了。0.4 这一代把内核拆成了 llmster 守护进程,无头机器上照样跑得起来——问题只剩下你手里那张卡够不够大。

很多人对 LM Studio 的印象还停留在「装在笔记本上点两下就能聊天的 GUI」。0.4 这一代改了这件事:内核被拆成一个叫 llmster 的无界面守护进程,可以直接装在 Linux 服务器、云上的 GPU 机器甚至 Colab 里;底层的 llama.cpp 升到 2.0.0,带来了连续批处理,加载时多出 Max Concurrent Predictions 和 Unified KV Cache 两个选项,并发请求不再是一个一个排队。同时新增了原生的 /api/v1/chat 有状态接口,返回 response_id,下一轮用 previous_response_id 续接,不用每次重发整段历史。

但真正卡住人的从来不是软件,是显存。官方系统要求写得很克制:Windows 端建议至少 4GB 独立显存加 16GB 内存,CPU 需要支持 AVX2;macOS 要 14.0 以上而且只认 Apple 芯片;Linux 要 Ubuntu 20.04 以上。这条线只保证程序能启动。能不能跑得动,看的是 GGUF 权重的实际体积——gpt-oss-20b 的 MXFP4 权重是 12.1GB,Qwen3-32B 的 Q4_K_M 是 19.76GB,Llama-3.3-70B 的 Q4_K_M 是 42.52GB,gpt-oss-120b 的 MXFP4 分两片合计 63.4GB。权重之外还要给 KV 缓存留位置。一旦装不下,llama.cpp 就把溢出的层留在内存里跑,吞吐直接掉一个数量级,界面上看不出报错,只觉得「怎么这么慢」。

所以问题就变成了:为了跑通一次评估,值不值得给主机换一张 48GB 或者 80GB 的卡。NexGPU 上按秒租一张就行——3090 24GB $0.193/卡·时,A6000 48GB $0.817/卡·时,A100 PCIE 80GB $0.824/卡·时,无最低消费、无开通费、无配额申请。装好 llmster,SSH 隧道把 1234 端口拉回本地,你原来那套指向 localhost 的 OpenAI 客户端一行都不用改。

01 —

LM Studio 0.4 的四个组成部分

桌面应用只是其中一块,真正跑在服务器上的是另外几块

版本参数量显存上下文说明
LM Studio 0.4.21(桌面版)Electron GUI,macOS / Windows / Linux官方建议至少 4GB 独立显存起步加载时可调,上限随模型带 Split View 分屏、开发者模式、聊天导出 PDF 与 Markdown。Linux 版是 AppImage,需要图形环境——所以它不是你在云 GPU 上该装的东西。
llmster(无界面守护进程)服务端常驻,完全无 GUI没有界面开销,显存全部留给模型支持 Unified KV Cache 统一分配0.4 这一代拆出来的核心,一行 install.sh 装好,lms daemon up 起来,配 systemd 就能开机常驻。租来的 GPU 机器要的正是这个。
lms CLI(MIT 开源)源码在 lmstudio-ai/lms,基于 lmstudio.js自身不占显存--context-length 直接指定lms get / load / unload / ps / server / log stream / runtime / daemon / link 一整套,全部可脚本化,CI 里也能跑。
llama.cpp 2.0.0 运行时(GGUF)CUDA / Vulkan / ROCm / CPU 多后端GGUF 文件体积约等于显存下限,KV 缓存另算连续批处理,Max Concurrent Predictions 可调租 NVIDIA 卡走的就是这条路。多卡的 Priority Order 优先级分配和「只用独立显存」两个开关目前是 CUDA 独有,AMD 侧还在补。
MLX 运行时仅 Apple Silicon走统一内存,不适用独立显卡随模型M 系列 Mac 专用。在 N 卡上完全用不到——下模型时记得挑 GGUF 版本而不是 MLX 版本,这是新手最常踩的坑。

02 —

按权重体积选卡:四个真实档位

显存要同时装得下权重和 KV 缓存,才叫跑得动

  • 单卡跑 gpt-oss-20b(MXFP4 权重 12.1GB)做本地评估

    RTX 3090 24GB$0.193/卡·时

    12.1GB 权重全量卸载之后还剩十来 GB 留给 KV 缓存,32K 上下文压得很稳,而且这是整张价目表里每 GB 显存最便宜的一张卡。

  • Qwen3-32B Q4_K_M(19.76GB)开长上下文并发服务

    RTX 5090 32GB$0.723/卡·时

    19.76GB 塞进 24GB 卡会把 KV 缓存挤没,32GB 才能一边开大上下文一边把 Max Concurrent Predictions 拉起来。

  • Llama-3.3-70B Q4_K_M(42.52GB)单卡全量卸载

    RTX A6000 48GB$0.817/卡·时

    48GB 刚好接得住 42.52GB 权重,不用拆多卡分层,也不用担心溢出到内存把速度拖垮。

  • gpt-oss-120b(MXFP4 两片合计 63.4GB)一张卡吃下

    A100 PCIE 80GB$0.824/卡·时

    比 48GB 的 A6000 每小时只贵 $0.007,却是这个价位上唯一能单卡装下 63.4GB 权重、还留得出 KV 缓存空间的选择。

03 —

在租来的 GPU 上把 LM Studio 跑成服务

四步,全程命令行,不需要图形界面

  1. 01

    开实例,顺手把 1234 端口隧道回本地

    在 NexGPU 控制台开一台带 NVIDIA 卡的 Ubuntu CLI 实例,SSH 连上去的时候直接带 -L 做端口转发。LM Studio 的服务端默认只听 localhost:1234,用隧道拉回本地比把端口开到公网安全得多,而且本地代码里的 base_url 照样写 localhost,一个字都不用改。

    ssh -L 1234:localhost:1234 root@<your-node>.nexgpu.net
  2. 02

    装 llmster,把守护进程拉起来

    别装桌面版——那是个需要图形环境的 Electron 应用,无头机器上根本起不来。llmster 是 0.4 拆出来的无界面内核,一行脚本装完,二进制落在 ~/.lmstudio/bin/lms,装完先 lms --help 验一下。

    curl -fsSL https://lmstudio.ai/install.sh | bash && ~/.lmstudio/bin/lms daemon up
  3. 03

    拉模型,全量卸载进显存

    --gpu=max 让 llama.cpp 把所有层都推到显卡上。这一步是性能分水岭:只要有一层落回 CPU,吞吐就掉一个数量级,而且不会报错。加载完务必用 lms ps 确认卸载比例,别凭感觉。

    lms get openai/gpt-oss-20b && lms load openai/gpt-oss-20b --gpu=max --context-length=32768
  4. 04

    起服务,接上你原有的客户端

    1234 端口上同时提供三套接口:OpenAI 兼容的 /v1/chat/completions、/v1/completions、/v1/embeddings、/v1/responses 和 /v1/models;Anthropic 风格的 Messages 接口;以及原生的 /api/v1/chat 有状态会话(带 Authorization: Bearer 令牌,用 previous_response_id 续接,不必每轮重发历史)。要开机自启就写 systemd unit:Type=oneshot 配 RemainAfterExit=yes,ExecStartPre 里依次跑 lms daemon up 和 lms load --yes,ExecStop 用 lms daemon down。

    lms server start && curl http://localhost:1234/v1/models

两个真实账单

场景一,用 RTX 3090 24GB 评估 gpt-oss-20b。权重 12.1GB 全量卸载进 24GB 显存,算力按 $0.193/卡·时:一周每天 6 小时、共 30 小时,30 × $0.193 = $5.79。模型留在盘上一个月,12.1 × $0.414 = $5.01。导出 2GB 评估日志,2 × $0.0081 = $0.02。合计约 $10.82,比给主机加一张 24GB 显卡便宜两个数量级。场景二,用 A100 PCIE 80GB 跑 gpt-oss-120b。这里有个容易被价目表骗过去的地方:RTX A6000 48GB 是 $0.817/卡·时,A100 PCIE 80GB 是 $0.824/卡·时,每小时只差 $0.007,但 48GB 装不下 63.4GB 的权重,多花的那七毫钱买的是「能不能跑」而不是「快多少」。跑 10 小时是 10 × $0.824 = $8.24。真正要留神的是存储:63.4GB 的权重存一个月是 63.4 × $0.414 = $26.25,比这 10 小时算力还贵三倍多——用完销毁卷、下次重新 lms get 反而更省。算力停机即停止计费,存储则一直算到卷被销毁为止,这两条要分开记。

04 —

常见问题

LM Studio 本地部署到底需要多大显存?

官方门槛是 Windows 端至少 4GB 独立显存加 16GB 内存,但那只保证程序能开起来。真正决定成败的是 GGUF 权重体积加 KV 缓存:gpt-oss-20b 的 MXFP4 是 12.1GB,Qwen3-32B Q4_K_M 是 19.76GB,Llama-3.3-70B Q4_K_M 是 42.52GB,gpt-oss-120b 是 63.4GB。照这条线往上找卡,在 NexGPU 上分别对应 RTX 3090 24GB($0.193/卡·时)、RTX 5090 32GB、RTX A6000 48GB 和 A100 PCIE 80GB($0.824/卡·时)。按秒计费,选错了换一张就是重开一台的事,不用先把硬件买回家。

LM Studio 可以不装图形界面,直接部署在服务器上吗?

可以,0.4 这一代就是为这件事拆的。llmster 是不带 GUI 的守护进程,curl -fsSL https://lmstudio.ai/install.sh | bash 装好之后,lms daemon up 起守护进程、lms server start 开服务,再写个 systemd unit 就能常驻——官方模板用 Type=oneshot 加 RemainAfterExit=yes,ExecStartPre 里先 lms daemon up 再 lms load --yes。NexGPU 的 Ubuntu CLI 镜像开机即用,SSH 进去照抄这套配置就行,不需要装 X server,也不需要折腾 AppImage。

LM Studio 商用要授权费吗?源码开放吗?

个人和工作场景都免费,团队在公司内部使用不需要单独申请许可,也不用走采购流程;面向组织另有 Teams 和 Enterprise 方案,提供 SSO、模型准入和访问控制。桌面应用本身不开源,但 lms CLI 以 MIT 许可开源在 lmstudio-ai/lms,TypeScript 的 lmstudio-js 和 Python 的 lmstudio-python 两个 SDK 也都在 GitHub 上。所以把它塞进内网服务或者 CI 流水线是没有法律负担的——在 NexGPU 上,一张 3090 $0.193/卡·时 就足够撑起一个团队自用的推理端点。

LM Studio 和 Ollama、vLLM 该怎么选?

定位不一样。Ollama 和 LM Studio 都走 llama.cpp 加 GGUF 这条线,LM Studio 多了图形界面、MCP 主机能力、内置的 Bionic 智能体以及 Agent Skills(SKILL.md)支持;0.4 升到 llama.cpp 2.0.0 之后也拿到了连续批处理,并发不再是纯排队。但要扛真正的生产级高并发,vLLM 的 PagedAttention 依然更合适。最省事的判断办法是在同一张卡上都跑一遍——NexGPU 的 2000 多个预置镜像里 vLLM、PyTorch 都是现成的,换镜像重开一台,代价不过是几小时卡时。

远程 GPU 上的 LM Studio 怎么安全地访问?

原生 REST 接口 /api/v1/chat 支持 Authorization: Bearer 令牌鉴权,但服务端默认监听的是 localhost:1234,最稳妥的做法仍然是 SSH 隧道(ssh -L 1234:localhost:1234),别图省事把 1234 直接开到公网。另一条路是 LM Link:lms link enable 之后,远端机器上加载的模型可以当本地模型直接调用,你的代码里还是打 localhost,配合 lms link set-preferred-device 指定用哪台。NexGPU 每台实例都给独立 SSH 凭证,隧道打完就当本地端点使。

模型明明加载成功了,为什么生成还是很慢?

十有八九是没有全量卸载。llama.cpp 发现显存不够时会把溢出的层留在内存里跑,吞吐掉一个数量级却不会报错——用 lms ps 看一眼卸载比例,加载时补上 --gpu=max。其次是上下文长度乘并发数决定 KV 缓存占用,开 Unified KV Cache 之后预分配不再按请求硬切;CUDA 上 Flash Attention 已经是默认开启,不用手动打开。还想再快就上投机解码,配一个同族、同词表的小模型当草稿模型,官方给的加速区间是 1.5 到 3 倍。要是这些都调完还是紧,那就是卡不够大——在 NexGPU 上从 24GB 换到 48GB 或 80GB 只是重开一台实例的事,按秒结算,停机即停止计费。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。