跳到主要内容

文本大模型 · 小参数推理模型

把 Phi-4 跑在自己的卡上,14B 的体量、9GB 的显存门槛

微软 Phi 系列一直在赌同一件事:高质量合成数据能让小模型打赢大模型。到 Phi-4-reasoning-vision-15B 这一代,这个赌注已经很难反驳了。全系 MIT 许可,权重随便下,随便商用。

Phi 之所以值得单独开一页讲本地部署,是因为它是极少数「参数量小到能塞进消费级卡,但推理能力对得起生产环境」的开源模型。Phi-4 是 14B 的稠密解码器模型,2024 年 12 月 12 日放出权重,用 9.8T token 训练,其中大量是筛选和合成出来的教科书级数据 —— 这条路线让它在数学和代码推理上长期越级打同期的 70B 模型。

现在这条产品线的头部是 Phi-4-reasoning-vision-15B,2026 年 3 月 4 日发布,15B 参数,以 Phi-4-reasoning 为语言骨干、SigLIP-2 做视觉编码器的中融合架构,16K 上下文,最多 3600 个视觉 token。它最有意思的设计是会自己决定要不要思考:约 80% 的训练数据走直接回答(看图说话、OCR、目标定位),约 20% 走 `<think>` 链式推理(数理科学)。微软自己也承认这个边界并不精确,你可以用显式 token 强制切换。顺带说清楚一件事:截至目前微软没有发布过 Phi-5,网上那些「Phi-5 部署教程」是照着路线图脑补的。

对自建的人来说,Phi 的真正吸引力在成本结构。同样一段私有语料要做批量抽取、分类、结构化改写,Phi-4-mini 用 3.8B 参数、128K 上下文就能扛,bf16 权重只有 7.6GB;Phi-4 量化到 Q4_K_M 是 9.05GB,一张 RTX 3090 绰绰有余。全系 MIT 许可这一点也很关键 —— 权重、微调代码、评测日志都能拿,不存在调用量到了要谈商务的问题。

01 —

Phi 全系版本与显存对照

以下参数量、上下文、许可与发布时间均来自各模型的官方 Hugging Face 卡片。

版本参数量显存上下文说明
Phi-4-reasoning-vision-15B15Bbf16 权重约 30GB/实跑建议 40GB 以上16K当前旗舰。多模态推理,SigLIP-2 视觉编码器支持动态分辨率、最多 3600 视觉 token。擅长数理推理和界面理解(GUI Agent、屏幕元素定位)。官方在 A6000/A100/H100/B200 上验证过,推荐 vLLM ≥ 0.15.2、bf16 直接跑。
Phi-4-reasoning-plus14Bbf16 权重约 28GB/32K 推理链建议 48GB 以上32K在 Phi-4-reasoning 的监督微调之上再加一轮强化学习,准确率更高,代价是输出长度约增加 50%、延迟同步上升。跑复杂题要把 max_new_tokens 开到 32768。纯文本推理场景的首选。
phi-414Bbf16 约 28GB/Q4_K_M 9.05GB/Q5_K_M 10.60GB/Q8_0 15.58GB16K系列基石,9.8T token 训练,MIT 许可。GGUF 生态最成熟的一个:Q4_K_M 是社区默认档,IQ4_XS 压到 7.94GB 质量损失也可接受。不需要长链推理、只要通用能力的话选它最省。
Phi-4-mini-instruct3.8Bbf16 约 7.6GB/Q4 量化约 2.5GB128K20 万词表、GQA、原生 function calling,覆盖含中文在内的 22 种语言 —— 全系里对中文最友好的一个。128K 上下文让它很适合长文档抽取和批处理流水线。老卡(V100 及以上)用 eager attention 也能跑。
Phi-4-mini-flash-reasoning3.8Bbf16 约 7.6GB64K微软与斯坦福合作的 SambaY 解码器混合架构:Mamba 状态空间模型 + 滑动窗口注意力 + 门控记忆单元(GMU)。在 2K 提示、32K 生成的场景下,vLLM 解码吞吐比 Phi-4-mini-reasoning 高约 10 倍,延迟随生成长度近似线性增长。需要 flash attention 支持。
Phi-4-multimodal-instruct5.6Bbf16 约 11.2GB128K文本 + 视觉 + 语音三模态,用 speech-lora 和 vision-lora 两组适配器实现,vLLM 推理支持最大 LoRA rank 320。语音侧覆盖中英德法意日西葡 8 种语言。要做语音转写加理解的一体化管线就用它。

02 —

按场景选卡:NexGPU 实际报价

显存按「权重 + KV cache + 激活」估算,不做乐观假设。

  • Phi-4 Q4_K_M 量化单卡跑评估、做原型验证

    RTX 3090 24GB$0.193/卡·时

    Q4_K_M 只占 9.05GB,24GB 显存剩下的空间足够开满 16K 上下文还能跑并发,而这是全平台最便宜的 24GB 卡。

  • Phi-4-mini / mini-flash-reasoning 常驻服务,吃满 128K 长上下文

    A10 24GB$0.414/卡·时

    3.8B bf16 权重才 7.6GB,剩余 16GB 全部留给 128K 的 KV cache;A10 是数据中心卡,长时间常驻比消费级卡稳。

  • Phi-4-reasoning-plus bf16 全精度,跑 32K 长推理链

    A100 PCIE 80GB$0.824/卡·时

    28GB 权重加上 32K 推理链的 KV cache,48GB 会很紧张;A100 80GB 只比 A6000 48GB 贵 $0.007,多出 32GB 显存,没有理由不选。

  • Phi-4-reasoning-vision-15B 多模态推理服务,带并发

    RTX A6000 48GB$0.817/卡·时

    官方明确在 A6000 上验证过;30GB 权重加 3600 视觉 token 的开销,48GB 单卡够用,要更高并发再换 A100 SXM4 80GB($1.088/卡·时)。

03 —

四步把 Phi-4 部署起来

从开机到拿到 OpenAI 兼容接口,正常情况十几分钟。

  1. 01

    开一台带 vLLM 的实例

    在 NexGPU 控制台按上面的表选卡,直接挑预置的 vLLM 或 PyTorch 镜像,2000 多个镜像里已经装好 CUDA 和驱动,不用自己配环境。开机后 SSH 或 Web 终端进去。注意版本门槛:Phi-4-reasoning-vision-15B 要求 transformers ≥ 4.57.1、vLLM ≥ 0.15.2,老镜像先升级。

    pip install -U "vllm>=0.15.2" "transformers>=4.57.1"
  2. 02

    拉权重并起 OpenAI 兼容服务

    MIT 许可,不需要申请授权、不需要填表。vLLM 会自动从 Hugging Face 下载。纯文本推理跑 Phi-4-reasoning-plus,多模态跑 reasoning-vision-15B。显存利用率给到 0.90,剩下的留给 CUDA context。

    vllm serve microsoft/Phi-4-reasoning-plus --max-model-len 32768 --gpu-memory-utilization 0.90 --dtype bfloat16
  3. 03

    按官方推荐的采样参数调用

    Phi-4-reasoning 系列对采样参数和系统提示很敏感,别用默认值。官方推荐 temperature=0.8、top_k=50、top_p=0.95,系统提示要以「You are Phi, a language model trained by Microsoft」开头并要求模型用 `<think> {reasoning} </think> {solution}` 结构作答,否则思考块可能不出现。复杂题把 max_tokens 放到 32768。

    curl http://localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"microsoft/Phi-4-reasoning-plus","messages":[{"role":"system","content":"You are Phi, a language model trained by Microsoft to help users. Format your response as <think> {reasoning} </think> {solution}."},{"role":"user","content":"证明根号 2 是无理数"}],"temperature":0.8,"top_p":0.95,"max_tokens":32768}'
  4. 04

    想省钱就换量化路线

    只做评估或者对精度要求没那么极端,直接上 GGUF:Q4_K_M 9.05GB 是社区公认的默认档,能在 RTX 3090 上留出大量余量。注意一个坑 —— vLLM 对 Phi-4 的 GGUF 支持长期有问题(社区在 v0.7.3 到 v0.8.3 都复现过加载失败),走 GGUF 请用 llama.cpp 或 Ollama,别硬套 vLLM。

    ollama run phi4

算一笔真实的账

假设你要把 Phi-4-reasoning-plus 接进内部知识库做推理问答,先评估再上线。第一阶段:Q4_K_M 量化在 RTX 3090 24GB 上跑通流程、调提示词,$0.193/卡·时 × 8 小时 = $1.544,一个完整工作日不到两美元。第二阶段:换 A100 PCIE 80GB 跑 bf16 全精度做正式评测,$0.824/卡·时 × 6 小时 = $4.944。两个阶段合计 $6.488,比多数人一顿午饭贵不了多少。上线后按 A100 PCIE 80GB 常驻计算,一个月 720 小时 = $593.28;如果业务只在工作时间有量,按秒计费停机即停算,每天开 10 小时的话 22 个工作日 × 10 小时 × $0.824 = $181.28。没有起租门槛,没有开通费,不用提配额申请。存储另计,中位价 $0.414/GB·月 —— Phi-4 的 bf16 权重 28GB 存着一个月约 $11.6,注意实例停了存储还在计费,不用了记得销毁。

04 —

常见问题

Phi-4 本地部署到底需要多大显存?24GB 的卡够不够?

看精度。Q4_K_M 量化 9.05GB,Q5_K_M 10.60GB,Q8_0 15.58GB —— 这三档 24GB 卡都轻松;但 bf16 全精度权重就是 28GB,24GB 单卡装不下,别信「优化一下就能塞进去」的说法。量化路线在 NexGPU 上开 RTX 3090 24GB,$0.193/卡·时;全精度直接上 A100 PCIE 80GB,$0.824/卡·时,一小时就能验证清楚哪条路适合你。

Phi-5 出了吗?现在该用哪个版本?

没有。微软至今没有发布 Phi-5,搜到的那些「Phi-5 部署指南」是按路线图推测写的,参数和显存数字都不可信。当前这条线的最新款是 2026 年 3 月 4 日发布的 Phi-4-reasoning-vision-15B;纯文本推理用 Phi-4-reasoning-plus,通用任务用 phi-4,轻量场景用 Phi-4-mini。想横向比一遍,NexGPU 按秒计费,开几台不同规格的卡并行测,成本是可以接受的。

启动时报 rope_scaling 的 short_factor 长度错误,怎么解决?

这是 Phi-4 系列最经典的坑。校验逻辑要求 rope_scaling 里 short_factor 的长度正好等于 rotary_ndims // 2,而 rotary_ndims 依赖 partial_rotary_factor(Phi-4 是 0.75),老版本框架算错就会抛 ValueError。升级到 transformers ≥ 4.49.0、vLLM ≥ 0.7.3 即可。另有一个独立的坑:vLLM 0.11.1 的命令行解析器不认 --rope-scaling 参数,目前只能退回 0.11.0。NexGPU 的预置镜像可以直接指定版本重开一台,不用在坏环境里反复折腾。

Phi-4 对中文支持怎么样?做中文业务能用吗?

要分开看。Phi-4-mini-instruct 用 20 万词表覆盖包括中文在内的 22 种语言,中文任务可用;Phi-4-multimodal-instruct 的语音侧也支持中文。但 Phi-4-reasoning 和 reasoning-vision 系列微软明确说明主要用英文训练,非英文性能会明显下降 —— 中文推理任务建议先小规模实测再决定。在 NexGPU 上开一张 RTX 3090 跑半小时量化版做中文评测,$0.1 出头就能得到结论。

Phi-4-reasoning-plus 为什么比 Phi-4-reasoning 慢这么多?

因为 plus 版在监督微调之上多做了一轮强化学习,准确率提升的代价是输出长度约增加 50%,延迟自然同步上涨。这不是部署配置问题,是模型行为本身。如果你的场景对延迟敏感、对最后几个百分点的准确率不敏感,用不带 plus 的 Phi-4-reasoning 更划算;要极致吞吐就看 Phi-4-mini-flash-reasoning,它的 SambaY 架构在 32K 生成场景下解码吞吐约为 Phi-4-mini-reasoning 的 10 倍。这几个都能在 NexGPU 的 A10 24GB($0.414/卡·时)上并排跑一遍再定。

Phi-4-reasoning-vision-15B 该配什么卡?在哪租得到?

微软官方在 A6000、A100、H100、B200 上做过验证,推荐 vLLM 上用 bf16 部署。15B 权重约 30GB,加上最多 3600 个视觉 token 的开销,RTX A6000 48GB 单卡够用,NexGPU 上是 $0.817/卡·时;要跑高并发服务换 A100 SXM4 80GB,$1.088/卡·时。我们在 51 个国家和地区有 1,175 个已验证可租节点、2,498 张 GPU,单节点最多 14 张卡、最大节点显存 2,152GB,SSH、Jupyter、Web 终端、REST API、CLI 都开放,Telegram 上有中英双语支持、不用排工单。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。