很多人对 LM Studio 的印象还停留在「装在笔记本上点两下就能聊天的 GUI」。0.4 这一代改了这件事:内核被拆成一个叫 llmster 的无界面守护进程,可以直接装在 Linux 服务器、云上的 GPU 机器甚至 Colab 里;底层的 llama.cpp 升到 2.0.0,带来了连续批处理,加载时多出 Max Concurrent Predictions 和 Unified KV Cache 两个选项,并发请求不再是一个一个排队。同时新增了原生的 /api/v1/chat 有状态接口,返回 response_id,下一轮用 previous_response_id 续接,不用每次重发整段历史。
但真正卡住人的从来不是软件,是显存。官方系统要求写得很克制:Windows 端建议至少 4GB 独立显存加 16GB 内存,CPU 需要支持 AVX2;macOS 要 14.0 以上而且只认 Apple 芯片;Linux 要 Ubuntu 20.04 以上。这条线只保证程序能启动。能不能跑得动,看的是 GGUF 权重的实际体积——gpt-oss-20b 的 MXFP4 权重是 12.1GB,Qwen3-32B 的 Q4_K_M 是 19.76GB,Llama-3.3-70B 的 Q4_K_M 是 42.52GB,gpt-oss-120b 的 MXFP4 分两片合计 63.4GB。权重之外还要给 KV 缓存留位置。一旦装不下,llama.cpp 就把溢出的层留在内存里跑,吞吐直接掉一个数量级,界面上看不出报错,只觉得「怎么这么慢」。
所以问题就变成了:为了跑通一次评估,值不值得给主机换一张 48GB 或者 80GB 的卡。NexGPU 上按秒租一张就行——3090 24GB $0.193/卡·时,A6000 48GB $0.817/卡·时,A100 PCIE 80GB $0.824/卡·时,无最低消费、无开通费、无配额申请。装好 llmster,SSH 隧道把 1234 端口拉回本地,你原来那套指向 localhost 的 OpenAI 客户端一行都不用改。
01 —
LM Studio 0.4 的四个组成部分
桌面应用只是其中一块,真正跑在服务器上的是另外几块
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| LM Studio 0.4.21(桌面版) | Electron GUI,macOS / Windows / Linux | 官方建议至少 4GB 独立显存起步 | 加载时可调,上限随模型 | 带 Split View 分屏、开发者模式、聊天导出 PDF 与 Markdown。Linux 版是 AppImage,需要图形环境——所以它不是你在云 GPU 上该装的东西。 |
| llmster(无界面守护进程) | 服务端常驻,完全无 GUI | 没有界面开销,显存全部留给模型 | 支持 Unified KV Cache 统一分配 | 0.4 这一代拆出来的核心,一行 install.sh 装好,lms daemon up 起来,配 systemd 就能开机常驻。租来的 GPU 机器要的正是这个。 |
| lms CLI(MIT 开源) | 源码在 lmstudio-ai/lms,基于 lmstudio.js | 自身不占显存 | --context-length 直接指定 | lms get / load / unload / ps / server / log stream / runtime / daemon / link 一整套,全部可脚本化,CI 里也能跑。 |
| llama.cpp 2.0.0 运行时(GGUF) | CUDA / Vulkan / ROCm / CPU 多后端 | GGUF 文件体积约等于显存下限,KV 缓存另算 | 连续批处理,Max Concurrent Predictions 可调 | 租 NVIDIA 卡走的就是这条路。多卡的 Priority Order 优先级分配和「只用独立显存」两个开关目前是 CUDA 独有,AMD 侧还在补。 |
| MLX 运行时 | 仅 Apple Silicon | 走统一内存,不适用独立显卡 | 随模型 | M 系列 Mac 专用。在 N 卡上完全用不到——下模型时记得挑 GGUF 版本而不是 MLX 版本,这是新手最常踩的坑。 |
02 —
按权重体积选卡:四个真实档位
显存要同时装得下权重和 KV 缓存,才叫跑得动
单卡跑 gpt-oss-20b(MXFP4 权重 12.1GB)做本地评估
RTX 3090 24GB$0.193/卡·时
12.1GB 权重全量卸载之后还剩十来 GB 留给 KV 缓存,32K 上下文压得很稳,而且这是整张价目表里每 GB 显存最便宜的一张卡。
Qwen3-32B Q4_K_M(19.76GB)开长上下文并发服务
RTX 5090 32GB$0.723/卡·时
19.76GB 塞进 24GB 卡会把 KV 缓存挤没,32GB 才能一边开大上下文一边把 Max Concurrent Predictions 拉起来。
Llama-3.3-70B Q4_K_M(42.52GB)单卡全量卸载
RTX A6000 48GB$0.817/卡·时
48GB 刚好接得住 42.52GB 权重,不用拆多卡分层,也不用担心溢出到内存把速度拖垮。
gpt-oss-120b(MXFP4 两片合计 63.4GB)一张卡吃下
A100 PCIE 80GB$0.824/卡·时
比 48GB 的 A6000 每小时只贵 $0.007,却是这个价位上唯一能单卡装下 63.4GB 权重、还留得出 KV 缓存空间的选择。
03 —
在租来的 GPU 上把 LM Studio 跑成服务
四步,全程命令行,不需要图形界面
- 01
开实例,顺手把 1234 端口隧道回本地
在 NexGPU 控制台开一台带 NVIDIA 卡的 Ubuntu CLI 实例,SSH 连上去的时候直接带 -L 做端口转发。LM Studio 的服务端默认只听 localhost:1234,用隧道拉回本地比把端口开到公网安全得多,而且本地代码里的 base_url 照样写 localhost,一个字都不用改。
ssh -L 1234:localhost:1234 root@<your-node>.nexgpu.net - 02
装 llmster,把守护进程拉起来
别装桌面版——那是个需要图形环境的 Electron 应用,无头机器上根本起不来。llmster 是 0.4 拆出来的无界面内核,一行脚本装完,二进制落在 ~/.lmstudio/bin/lms,装完先 lms --help 验一下。
curl -fsSL https://lmstudio.ai/install.sh | bash && ~/.lmstudio/bin/lms daemon up - 03
拉模型,全量卸载进显存
--gpu=max 让 llama.cpp 把所有层都推到显卡上。这一步是性能分水岭:只要有一层落回 CPU,吞吐就掉一个数量级,而且不会报错。加载完务必用 lms ps 确认卸载比例,别凭感觉。
lms get openai/gpt-oss-20b && lms load openai/gpt-oss-20b --gpu=max --context-length=32768 - 04
起服务,接上你原有的客户端
1234 端口上同时提供三套接口:OpenAI 兼容的 /v1/chat/completions、/v1/completions、/v1/embeddings、/v1/responses 和 /v1/models;Anthropic 风格的 Messages 接口;以及原生的 /api/v1/chat 有状态会话(带 Authorization: Bearer 令牌,用 previous_response_id 续接,不必每轮重发历史)。要开机自启就写 systemd unit:Type=oneshot 配 RemainAfterExit=yes,ExecStartPre 里依次跑 lms daemon up 和 lms load --yes,ExecStop 用 lms daemon down。
lms server start && curl http://localhost:1234/v1/models
两个真实账单
场景一,用 RTX 3090 24GB 评估 gpt-oss-20b。权重 12.1GB 全量卸载进 24GB 显存,算力按 $0.193/卡·时:一周每天 6 小时、共 30 小时,30 × $0.193 = $5.79。模型留在盘上一个月,12.1 × $0.414 = $5.01。导出 2GB 评估日志,2 × $0.0081 = $0.02。合计约 $10.82,比给主机加一张 24GB 显卡便宜两个数量级。场景二,用 A100 PCIE 80GB 跑 gpt-oss-120b。这里有个容易被价目表骗过去的地方:RTX A6000 48GB 是 $0.817/卡·时,A100 PCIE 80GB 是 $0.824/卡·时,每小时只差 $0.007,但 48GB 装不下 63.4GB 的权重,多花的那七毫钱买的是「能不能跑」而不是「快多少」。跑 10 小时是 10 × $0.824 = $8.24。真正要留神的是存储:63.4GB 的权重存一个月是 63.4 × $0.414 = $26.25,比这 10 小时算力还贵三倍多——用完销毁卷、下次重新 lms get 反而更省。算力停机即停止计费,存储则一直算到卷被销毁为止,这两条要分开记。
04 —
