跳到主要内容

文本大模型

Yi 本地部署:6B 到 34B 的显存账,一次算清

零一万物的开放平台在 2026 年 9 月 3 日停止 API 调用,Apache 2.0 的 Yi 开源权重成了继续用下去的唯一途径。这页把 Yi-1.5、Yi-Coder 每个变体的真实显存占用列全,并告诉你该开哪张卡。

Yi 是零一万物(01.AI)从零训练的大模型系列。初代 Yi 在 2023 年 11 月发布,用 3.1T 多语言语料训练,一口气给了 6B / 9B / 34B 三档,还额外放出 200K 上下文的变体;2024 年 5 月的 Yi-1.5 在初代基础上又追加了 500B token 的继续预训练(累计 3.6T),配合 300 万条微调样本,把代码、数学和指令遵循拉了一个台阶;2024 年 9 月的 Yi-Coder 则在 Yi-9B 上再喂了 2.4T 代码 token,覆盖 52 种编程语言,把窗口开到 128K。这就是 Yi 开源线的全貌——01-ai 在 Hugging Face 上的仓库最后一次更新停在 2024 年 11 月,之后公司把重心挪到了万智企业平台。

所以现在搜「Yi 本地部署」的人,多半不是在挑最新最强,而是有一件更急的事:2026 年 8 月 10 日零一万物公告,大模型开放平台将逐步停止面向用户的在线体验、API 调用与充值服务,2026 年 9 月 3 日 24:00 起 API 正式停用,退款窗口开到 12 月 3 日。闭源的 Yi-Lightning 会跟着一起下线,而 Yi-1.5 与 Yi-Coder 的权重是 Apache 2.0 的,谁都下得到、谁都删不掉。把线上调用换成自己的一台机器,是这批模型唯一的续命路径,也恰好是最省心的那条。

好消息是 Yi 部署起来几乎没有适配成本:config.json 里的 architectures 字段就是 LlamaForCausalLM,vLLM、SGLang、TGI、llama.cpp 全部原生支持,不需要 trust_remote_code。但有三个坑必须提前知道——词表是 64000 而不是 Llama 的 32000,对话模板是 ChatML 的 <|im_start|> / <|im_end|> 而不是 [INST],套错模板直接输出乱码;rope_theta 是 5,000,000(Yi-Coder 是 10,000,000),不是常见的 10000;最要命的是 Yi-1.5-34B-Chat、9B-Chat、6B-Chat 的 max_position_embeddings 全都写死在 4096,vLLM 会照着封顶,想要长上下文必须换仓库而不是改参数。下面每一条都按这些真实约束来算。

01 —

Yi 各版本显存占用对照

参数量、量化后体积、真实可用窗口,全部来自官方 config 与社区实测量化文件

版本参数量显存上下文说明
Yi-1.5-34B-Chat-16K34.4B(60 层 / 56 头 / 8 KV 头,GQA)bf16 ~69GB;Q8_0 36.54GB;Q6_K 28.21GB;Q5_K_M 24.32GB;Q4_K_M 20.65GB;IQ4_XS 18.47GB16K(config 里 max_position_embeddings=16384)开源 Yi 线最强的一档,也是唯一一个 config 真写了长上下文的 34B 对话权重。要做 RAG、长文档摘要、多轮客服就用这个仓库,别拿 Yi-1.5-34B-Chat 硬撑。8 个 KV 头把 KV 缓存压到每 token 240KiB,16K 满窗一条序列约 3.75GB。
Yi-1.5-34B-Chat34.4Bbf16 ~69GB;Q5_K_M 24.32GB;Q4_K_M 20.65GB;Q3_K_M 16.65GB4K(max_position_embeddings=4096)对话能力与 16K 版同源,MMLU-Pro 52.29,官方评价是「在多数榜单上追平甚至超过更大的模型」。但窗口被写死在 4096,vLLM 起服务时直接按 4K 封顶。只做短问答、分类、字段抽取时选它,KV 开销最小、并发最高。
Yi-1.5-9B-Chat-16K8.83B(48 层 / 32 头 / 4 KV 头)bf16 ~17.7GB;Q8_0 9.38GB;Q6_K 7.24GB;Q5_K_M 6.25GB;Q4_K_M 5.32GB16K单卡甜点,官方称它是同尺寸开源模型里的头名。只有 4 个 KV 头,KV 缓存每 token 才 96KiB,16K 满窗一条序列约 1.5GB——一张 24GB 卡装完 bf16 权重还能同时挂十几路并发,这是 9B 档很少见的余量。
Yi-1.5-6B-Chat6.06Bbf16 ~12.1GB(官方标最小 15GB);Q8_0 6.44GB;Q5_K_M 4.30GB;Q4_K_M 3.67GB4K门槛最低的一档。Q4_K_M 只有 3.67GB,塞进 16GB 的 Tesla T4 都绰绰有余。适合放在流水线里做意图识别、文本改写、数据清洗这类高频小活,一台机器可以并排跑好几个副本。
Yi-Coder-9B-Chat8.83B(在 Yi-9B 上追加 2.4T 代码 token,覆盖 52 种编程语言)bf16 ~17.7GB;Q8_0 9.38GB;Q6_K 7.25GB;Q4_K_M 5.33GB;128K 满窗单序列 KV 另需约 12GB128K(max_position_embeddings=131072,rope_theta=1e7)HumanEval 85.4%、MBPP 73.8%、LiveCodeBench 23.4%,程序辅助数学七项平均 70.3%,超过了体量大三倍的 DeepSeek-Coder-33B。10B 以内真正能吃下仓库级上下文的代码模型,另有 1.5B 版本专供补全场景。
Yi-34B-200K(初代 Yi)34.4B官方标最小 200GB;拆开看是 bf16 权重 69GB + 200K 满窗 KV 约 48GB/条序列200KYi-1.5 全系没有 200K 变体,最长只到 32K(Yi-1.5-34B-32K / Yi-1.5-9B-32K 两个基座)。要真正的二十万 token 窗口就得回头用初代 Yi 的 200K 仓库,同系列还有 Yi-6B-200K 与 Yi-9B-200K,后两者的显存需求分别是 50GB 和相近量级。

02 —

该开哪张卡

按显存诚实匹配:权重放得下只是及格线,KV 缓存的余量才决定你能开多长的上下文

  • 单卡跑 Yi-1.5-9B-Chat-16K 或 Yi-1.5-6B-Chat 的 bf16 原始权重

    RTX 3090 24GB$0.193/卡·时

    9B 的 bf16 权重 17.7GB、6B 只有 12.1GB,24GB 装完还留得出 KV 空间;而 3090 比 16GB 的 Tesla T4($0.298/卡·时)还便宜,是这一档没有理由不选的卡。

  • 单卡跑 Yi-1.5-34B-Chat 的 Q4_K_M GGUF 或官方 AWQ 4bit 权重

    RTX 5090 32GB$0.723/卡·时

    Q4_K_M 权重 20.65GB,放进 24GB 卡刨掉碎片只剩两三 GB 装 KV,而 16K 满窗就要 3.75GB,稍长一点必 OOM;32GB 能留出约 10GB,够 16K 上下文再加几路并发。

  • bf16 精度跑 Yi-1.5-34B-Chat-16K,做正式评测或对外服务

    A100 PCIE 80GB$0.824/卡·时

    69GB 权重落在单卡上才躲得开张量并行的通信开销,剩下的约 10GB 正好覆盖 16K 上下文的 KV。要更高吞吐再往上换 A100 SXM4 80GB($1.088/卡·时)或 H100 SXM 80GB($3.582/卡·时)。

  • Yi-Coder-9B-Chat 开满 128K 窗口读整个代码仓库

    RTX A6000 48GB$0.817/卡·时

    权重 17.7GB 加上 128K 满窗单序列约 12GB 的 KV,48GB 能同时挂两三路长上下文请求;换 24GB 卡实际只开得到 32K 左右,读不完一个中型仓库。

03 —

四步把 Yi 跑起来

从开机到 OpenAI 兼容接口,二十分钟以内,命令可以直接抄

  1. 01

    开一台带 vLLM 的实例

    在 NexGPU 控制台按上表选卡,镜像直接挑预置的 vLLM 或 PyTorch 镜像——2,000 多个镜像里 CUDA、PyTorch、vLLM 都装好了,不用自己配环境,也不用提配额申请。开机后 SSH、Jupyter、网页终端随便用哪个进去都行,计费从实例真正跑起来那一秒开始按秒算。

  2. 02

    把权重拉到实例上

    Yi 全系在 Hugging Face 的 01-ai 组织下,Apache 2.0,不需要申请授权、不用签同意书、下载不分地区。国内节点从 ModelScope 的 01ai 同名仓库拉通常更快。34B 的 69GB bf16 权重在千兆带宽下大约十分钟;只想先试水就先拉 9B,17.7GB 两三分钟就好。

    pip install -U huggingface_hub && hf download 01-ai/Yi-1.5-34B-Chat-16K --local-dir /workspace/Yi-1.5-34B-Chat-16K
  3. 03

    用 vLLM 起一个 OpenAI 兼容接口

    Yi 的 architectures 就是 LlamaForCausalLM,vLLM 原生认,不需要 trust_remote_code。关键是 --max-model-len 不能瞎填:Yi-1.5-34B-Chat 的 config 写死 4096,只有 -Chat-16K 仓库才是 16384,vLLM 会照 config 封顶;硬把参数调到训练长度之外,模型只会输出噪声。服务起来后把接口地址换进原来调零一万物 API 的代码里,base_url 一改就通。

    vllm serve /workspace/Yi-1.5-34B-Chat-16K --served-model-name yi-34b --dtype bfloat16 --max-model-len 16384 --gpu-memory-utilization 0.92 --port 8000
  4. 04

    显存不够就换 GGUF 单卡路线

    24GB 到 32GB 的卡上直接用 llama.cpp 跑 Q4_K_M:34B 权重压到 20.65GB,-ngl 99 把全部 60 层丢进显存,中文对话里的质量损失基本感知不到。别忘了 Yi 用的是 ChatML 模板——<|im_start|>system / <|im_start|>user / <|im_start|>assistant,以 <|im_end|> 收尾,词表 64000 而非 Llama 的 32000,套 Llama 的 [INST] 模板会直接输出乱码。

    llama-server -m /workspace/Yi-1.5-34B-Chat-Q4_K_M.gguf -ngl 99 -c 16384 --host 0.0.0.0 --port 8000

跑一轮评测到底花多少钱

拿一件真事算笔账。在 A100 PCIE 80GB($0.824/卡·时)上用 bf16 起 Yi-1.5-34B-Chat-16K,跑 5,000 条内部评测:开机拉 vLLM 预置镜像约 3 分钟,下 69GB 权重按千兆带宽约 10 分钟,加载预热约 4 分钟,评测本身约 2.5 小时,合计约 2.8 小时。计算费 2.8 × $0.824 = $2.31。权重留在盘上七天等下一轮迭代:69GB × $0.414 ÷ 30 天 × 7 天 = $6.67。导出 1.2GB 结果文件:1.2 × $0.0081 = $0.01。总计 $8.99,其中真正烧 GPU 的只有 $2.31。 同一轮评测换成 Q4_K_M(20.65GB)跑在 RTX 5090 32GB($0.723/卡·时)上:吞吐略低,约 3.4 小时 × $0.723 = $2.46;权重只占 20.65GB,七天存储 20.65 × $0.414 ÷ 30 × 7 = $2.00;合计约 $4.46,不到 bf16 方案的一半。想先摸底 9B,RTX 3090 24GB 一小时只要 $0.193——一杯咖啡的钱够你跑五十多个小时。 两笔账里最容易被忽略的是存储:实例一停,计算费当秒停止,但盘上的权重会一直计费到你把它销毁。评测跑完顺手停实例,权重留着下次开机秒用;确定不再迭代就把卷删掉。没有最低消费、没有开通费、没有配额审批,这三笔常规云厂商的隐形成本在这里都是零。

04 —

常见问题

零一万物的 API 要停了,Yi 还能继续用吗?

开放平台的在线体验与 API 调用在 2026 年 9 月 3 日 24:00 停止,新用户注册与充值已经关闭,退款窗口开到 12 月 3 日 24:00,闭源的 Yi-Lightning 会跟着一起下线。但 Yi-1.5 与 Yi-Coder 的权重是 Apache 2.0 开源的,谁都下得到、谁都删不掉,自己起一份服务是唯一也是最稳的续命方式。把 base_url 指向自己的 vLLM 实例,业务代码几乎不用改。NexGPU 按秒计费、无最低消费,把 API 账单换成 GPU 时长,多数团队算下来反而更便宜。

Yi-1.5-34B 本地部署需要多大显存?

bf16 原始权重是 34.4B × 2 字节 ≈ 69GB,官方给的最小值 72GB,要单卡就得上 80GB 级别;Q4_K_M 量化后 20.65GB,官方 AWQ 4bit 版标 20GB,GPTQ 8bit 版标 38GB。对应到 NexGPU:bf16 走 A100 PCIE 80GB $0.824/卡·时,4bit 走 RTX 5090 32GB $0.723/卡·时,8bit 走 RTX A6000 48GB $0.817/卡·时。别忘了在权重之外给 KV 缓存留量,Yi-1.5-34B 每 token 要 240KiB。

一张 RTX 4090 24GB 能跑 Yi-34B 吗?

能跑起来,但很紧。Q4_K_M 是 20.65GB,24GB 卡刨掉显存碎片只剩两三 GB 给 KV 缓存,而 16K 满窗一条序列就要 3.75GB,上下文稍长就 OOM。省钱可以退到 IQ4_XS(18.47GB)或 Q3_K_M(16.65GB),但更实在的做法是花 $0.723/卡·时 开 RTX 5090 32GB,多出来的 8GB 正好是上下文的活动空间。真要用 4090($0.540/卡·时),建议只跑短对话,或者干脆把它留给 Yi-1.5-9B 的 bf16。

为什么 vLLM 起 Yi 只给我 4096 的上下文?

因为 Yi-1.5-34B-Chat、Yi-1.5-9B-Chat、Yi-1.5-6B-Chat 这几个仓库的 config.json 里 max_position_embeddings 就是 4096,vLLM 照这个值封顶。这是 Yi 的老资格坑,vLLM 仓库早年就有 issue 记录它把 Yi 的 200K 模型算成 4K。解法不是硬调参数,而是换仓库:对话要长上下文用 Yi-1.5-34B-Chat-16K 或 Yi-1.5-9B-Chat-16K(16384),基座要 32K 用 Yi-1.5-34B-32K / Yi-1.5-9B-32K,要 200K 只能回初代 Yi-34B-200K。在 NexGPU 上换仓库重开一台只是几分钟的事,试错成本按秒结算。

Yi 是 Apache 2.0,商用真的不用额外授权吗?

是。Yi 早期用的是 Yi Series Models Community License,2024 年整体换成了 Apache 2.0,代码和权重都在这个许可下,个人、学术、商用全部放行,不用发邮件申请、不用按用户数分成、不用报备部署规模。这也是很多团队至今仍愿意在私有化项目里押 Yi 的原因——权重在自己盘上,许可写死在文件里,供应商的平台停不停服都影响不到你。在 NexGPU 上跑,实例里的数据同样归你,实例一停计算费就停。

Yi 的开源线已经停更了,现在还值得部署吗?

要挑最前沿的能力,Yi 确实已经不是第一选择——开源权重停在 Yi-1.5(2024 年 5 月)和 Yi-Coder(2024 年 9 月),01-ai 在 Hugging Face 的仓库最后一次更新是 2024 年 11 月。但 Yi-1.5-9B 到今天仍是 10B 档中文表现扎实的一档,Yi-Coder-9B 的 128K 仓库级理解在 10B 以内几乎没有对手,加上许可干净、架构就是 Llama、生态零适配成本,这类「装上就不用再管」的场景 Yi 依然很好用。在 NexGPU 上 RTX 3090 24GB 只要 $0.193/卡·时 就能把 9B 跑满,试错成本低到可以直接拿真实业务数据比一轮再决定。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。