Phi 之所以值得单独开一页讲本地部署,是因为它是极少数「参数量小到能塞进消费级卡,但推理能力对得起生产环境」的开源模型。Phi-4 是 14B 的稠密解码器模型,2024 年 12 月 12 日放出权重,用 9.8T token 训练,其中大量是筛选和合成出来的教科书级数据 —— 这条路线让它在数学和代码推理上长期越级打同期的 70B 模型。
现在这条产品线的头部是 Phi-4-reasoning-vision-15B,2026 年 3 月 4 日发布,15B 参数,以 Phi-4-reasoning 为语言骨干、SigLIP-2 做视觉编码器的中融合架构,16K 上下文,最多 3600 个视觉 token。它最有意思的设计是会自己决定要不要思考:约 80% 的训练数据走直接回答(看图说话、OCR、目标定位),约 20% 走 `<think>` 链式推理(数理科学)。微软自己也承认这个边界并不精确,你可以用显式 token 强制切换。顺带说清楚一件事:截至目前微软没有发布过 Phi-5,网上那些「Phi-5 部署教程」是照着路线图脑补的。
对自建的人来说,Phi 的真正吸引力在成本结构。同样一段私有语料要做批量抽取、分类、结构化改写,Phi-4-mini 用 3.8B 参数、128K 上下文就能扛,bf16 权重只有 7.6GB;Phi-4 量化到 Q4_K_M 是 9.05GB,一张 RTX 3090 绰绰有余。全系 MIT 许可这一点也很关键 —— 权重、微调代码、评测日志都能拿,不存在调用量到了要谈商务的问题。
01 —
Phi 全系版本与显存对照
以下参数量、上下文、许可与发布时间均来自各模型的官方 Hugging Face 卡片。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Phi-4-reasoning-vision-15B | 15B | bf16 权重约 30GB/实跑建议 40GB 以上 | 16K | 当前旗舰。多模态推理,SigLIP-2 视觉编码器支持动态分辨率、最多 3600 视觉 token。擅长数理推理和界面理解(GUI Agent、屏幕元素定位)。官方在 A6000/A100/H100/B200 上验证过,推荐 vLLM ≥ 0.15.2、bf16 直接跑。 |
| Phi-4-reasoning-plus | 14B | bf16 权重约 28GB/32K 推理链建议 48GB 以上 | 32K | 在 Phi-4-reasoning 的监督微调之上再加一轮强化学习,准确率更高,代价是输出长度约增加 50%、延迟同步上升。跑复杂题要把 max_new_tokens 开到 32768。纯文本推理场景的首选。 |
| phi-4 | 14B | bf16 约 28GB/Q4_K_M 9.05GB/Q5_K_M 10.60GB/Q8_0 15.58GB | 16K | 系列基石,9.8T token 训练,MIT 许可。GGUF 生态最成熟的一个:Q4_K_M 是社区默认档,IQ4_XS 压到 7.94GB 质量损失也可接受。不需要长链推理、只要通用能力的话选它最省。 |
| Phi-4-mini-instruct | 3.8B | bf16 约 7.6GB/Q4 量化约 2.5GB | 128K | 20 万词表、GQA、原生 function calling,覆盖含中文在内的 22 种语言 —— 全系里对中文最友好的一个。128K 上下文让它很适合长文档抽取和批处理流水线。老卡(V100 及以上)用 eager attention 也能跑。 |
| Phi-4-mini-flash-reasoning | 3.8B | bf16 约 7.6GB | 64K | 微软与斯坦福合作的 SambaY 解码器混合架构:Mamba 状态空间模型 + 滑动窗口注意力 + 门控记忆单元(GMU)。在 2K 提示、32K 生成的场景下,vLLM 解码吞吐比 Phi-4-mini-reasoning 高约 10 倍,延迟随生成长度近似线性增长。需要 flash attention 支持。 |
| Phi-4-multimodal-instruct | 5.6B | bf16 约 11.2GB | 128K | 文本 + 视觉 + 语音三模态,用 speech-lora 和 vision-lora 两组适配器实现,vLLM 推理支持最大 LoRA rank 320。语音侧覆盖中英德法意日西葡 8 种语言。要做语音转写加理解的一体化管线就用它。 |
02 —
按场景选卡:NexGPU 实际报价
显存按「权重 + KV cache + 激活」估算,不做乐观假设。
Phi-4 Q4_K_M 量化单卡跑评估、做原型验证
RTX 3090 24GB$0.193/卡·时
Q4_K_M 只占 9.05GB,24GB 显存剩下的空间足够开满 16K 上下文还能跑并发,而这是全平台最便宜的 24GB 卡。
Phi-4-mini / mini-flash-reasoning 常驻服务,吃满 128K 长上下文
A10 24GB$0.414/卡·时
3.8B bf16 权重才 7.6GB,剩余 16GB 全部留给 128K 的 KV cache;A10 是数据中心卡,长时间常驻比消费级卡稳。
Phi-4-reasoning-plus bf16 全精度,跑 32K 长推理链
A100 PCIE 80GB$0.824/卡·时
28GB 权重加上 32K 推理链的 KV cache,48GB 会很紧张;A100 80GB 只比 A6000 48GB 贵 $0.007,多出 32GB 显存,没有理由不选。
Phi-4-reasoning-vision-15B 多模态推理服务,带并发
RTX A6000 48GB$0.817/卡·时
官方明确在 A6000 上验证过;30GB 权重加 3600 视觉 token 的开销,48GB 单卡够用,要更高并发再换 A100 SXM4 80GB($1.088/卡·时)。
03 —
四步把 Phi-4 部署起来
从开机到拿到 OpenAI 兼容接口,正常情况十几分钟。
- 01
开一台带 vLLM 的实例
在 NexGPU 控制台按上面的表选卡,直接挑预置的 vLLM 或 PyTorch 镜像,2000 多个镜像里已经装好 CUDA 和驱动,不用自己配环境。开机后 SSH 或 Web 终端进去。注意版本门槛:Phi-4-reasoning-vision-15B 要求 transformers ≥ 4.57.1、vLLM ≥ 0.15.2,老镜像先升级。
pip install -U "vllm>=0.15.2" "transformers>=4.57.1" - 02
拉权重并起 OpenAI 兼容服务
MIT 许可,不需要申请授权、不需要填表。vLLM 会自动从 Hugging Face 下载。纯文本推理跑 Phi-4-reasoning-plus,多模态跑 reasoning-vision-15B。显存利用率给到 0.90,剩下的留给 CUDA context。
vllm serve microsoft/Phi-4-reasoning-plus --max-model-len 32768 --gpu-memory-utilization 0.90 --dtype bfloat16 - 03
按官方推荐的采样参数调用
Phi-4-reasoning 系列对采样参数和系统提示很敏感,别用默认值。官方推荐 temperature=0.8、top_k=50、top_p=0.95,系统提示要以「You are Phi, a language model trained by Microsoft」开头并要求模型用 `<think> {reasoning} </think> {solution}` 结构作答,否则思考块可能不出现。复杂题把 max_tokens 放到 32768。
curl http://localhost:8000/v1/chat/completions -H 'Content-Type: application/json' -d '{"model":"microsoft/Phi-4-reasoning-plus","messages":[{"role":"system","content":"You are Phi, a language model trained by Microsoft to help users. Format your response as <think> {reasoning} </think> {solution}."},{"role":"user","content":"证明根号 2 是无理数"}],"temperature":0.8,"top_p":0.95,"max_tokens":32768}' - 04
想省钱就换量化路线
只做评估或者对精度要求没那么极端,直接上 GGUF:Q4_K_M 9.05GB 是社区公认的默认档,能在 RTX 3090 上留出大量余量。注意一个坑 —— vLLM 对 Phi-4 的 GGUF 支持长期有问题(社区在 v0.7.3 到 v0.8.3 都复现过加载失败),走 GGUF 请用 llama.cpp 或 Ollama,别硬套 vLLM。
ollama run phi4
算一笔真实的账
假设你要把 Phi-4-reasoning-plus 接进内部知识库做推理问答,先评估再上线。第一阶段:Q4_K_M 量化在 RTX 3090 24GB 上跑通流程、调提示词,$0.193/卡·时 × 8 小时 = $1.544,一个完整工作日不到两美元。第二阶段:换 A100 PCIE 80GB 跑 bf16 全精度做正式评测,$0.824/卡·时 × 6 小时 = $4.944。两个阶段合计 $6.488,比多数人一顿午饭贵不了多少。上线后按 A100 PCIE 80GB 常驻计算,一个月 720 小时 = $593.28;如果业务只在工作时间有量,按秒计费停机即停算,每天开 10 小时的话 22 个工作日 × 10 小时 × $0.824 = $181.28。没有起租门槛,没有开通费,不用提配额申请。存储另计,中位价 $0.414/GB·月 —— Phi-4 的 bf16 权重 28GB 存着一个月约 $11.6,注意实例停了存储还在计费,不用了记得销毁。
04 —
