Yi 是零一万物(01.AI)从零训练的大模型系列。初代 Yi 在 2023 年 11 月发布,用 3.1T 多语言语料训练,一口气给了 6B / 9B / 34B 三档,还额外放出 200K 上下文的变体;2024 年 5 月的 Yi-1.5 在初代基础上又追加了 500B token 的继续预训练(累计 3.6T),配合 300 万条微调样本,把代码、数学和指令遵循拉了一个台阶;2024 年 9 月的 Yi-Coder 则在 Yi-9B 上再喂了 2.4T 代码 token,覆盖 52 种编程语言,把窗口开到 128K。这就是 Yi 开源线的全貌——01-ai 在 Hugging Face 上的仓库最后一次更新停在 2024 年 11 月,之后公司把重心挪到了万智企业平台。
所以现在搜「Yi 本地部署」的人,多半不是在挑最新最强,而是有一件更急的事:2026 年 8 月 10 日零一万物公告,大模型开放平台将逐步停止面向用户的在线体验、API 调用与充值服务,2026 年 9 月 3 日 24:00 起 API 正式停用,退款窗口开到 12 月 3 日。闭源的 Yi-Lightning 会跟着一起下线,而 Yi-1.5 与 Yi-Coder 的权重是 Apache 2.0 的,谁都下得到、谁都删不掉。把线上调用换成自己的一台机器,是这批模型唯一的续命路径,也恰好是最省心的那条。
好消息是 Yi 部署起来几乎没有适配成本:config.json 里的 architectures 字段就是 LlamaForCausalLM,vLLM、SGLang、TGI、llama.cpp 全部原生支持,不需要 trust_remote_code。但有三个坑必须提前知道——词表是 64000 而不是 Llama 的 32000,对话模板是 ChatML 的 <|im_start|> / <|im_end|> 而不是 [INST],套错模板直接输出乱码;rope_theta 是 5,000,000(Yi-Coder 是 10,000,000),不是常见的 10000;最要命的是 Yi-1.5-34B-Chat、9B-Chat、6B-Chat 的 max_position_embeddings 全都写死在 4096,vLLM 会照着封顶,想要长上下文必须换仓库而不是改参数。下面每一条都按这些真实约束来算。
01 —
Yi 各版本显存占用对照
参数量、量化后体积、真实可用窗口,全部来自官方 config 与社区实测量化文件
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Yi-1.5-34B-Chat-16K | 34.4B(60 层 / 56 头 / 8 KV 头,GQA) | bf16 ~69GB;Q8_0 36.54GB;Q6_K 28.21GB;Q5_K_M 24.32GB;Q4_K_M 20.65GB;IQ4_XS 18.47GB | 16K(config 里 max_position_embeddings=16384) | 开源 Yi 线最强的一档,也是唯一一个 config 真写了长上下文的 34B 对话权重。要做 RAG、长文档摘要、多轮客服就用这个仓库,别拿 Yi-1.5-34B-Chat 硬撑。8 个 KV 头把 KV 缓存压到每 token 240KiB,16K 满窗一条序列约 3.75GB。 |
| Yi-1.5-34B-Chat | 34.4B | bf16 ~69GB;Q5_K_M 24.32GB;Q4_K_M 20.65GB;Q3_K_M 16.65GB | 4K(max_position_embeddings=4096) | 对话能力与 16K 版同源,MMLU-Pro 52.29,官方评价是「在多数榜单上追平甚至超过更大的模型」。但窗口被写死在 4096,vLLM 起服务时直接按 4K 封顶。只做短问答、分类、字段抽取时选它,KV 开销最小、并发最高。 |
| Yi-1.5-9B-Chat-16K | 8.83B(48 层 / 32 头 / 4 KV 头) | bf16 ~17.7GB;Q8_0 9.38GB;Q6_K 7.24GB;Q5_K_M 6.25GB;Q4_K_M 5.32GB | 16K | 单卡甜点,官方称它是同尺寸开源模型里的头名。只有 4 个 KV 头,KV 缓存每 token 才 96KiB,16K 满窗一条序列约 1.5GB——一张 24GB 卡装完 bf16 权重还能同时挂十几路并发,这是 9B 档很少见的余量。 |
| Yi-1.5-6B-Chat | 6.06B | bf16 ~12.1GB(官方标最小 15GB);Q8_0 6.44GB;Q5_K_M 4.30GB;Q4_K_M 3.67GB | 4K | 门槛最低的一档。Q4_K_M 只有 3.67GB,塞进 16GB 的 Tesla T4 都绰绰有余。适合放在流水线里做意图识别、文本改写、数据清洗这类高频小活,一台机器可以并排跑好几个副本。 |
| Yi-Coder-9B-Chat | 8.83B(在 Yi-9B 上追加 2.4T 代码 token,覆盖 52 种编程语言) | bf16 ~17.7GB;Q8_0 9.38GB;Q6_K 7.25GB;Q4_K_M 5.33GB;128K 满窗单序列 KV 另需约 12GB | 128K(max_position_embeddings=131072,rope_theta=1e7) | HumanEval 85.4%、MBPP 73.8%、LiveCodeBench 23.4%,程序辅助数学七项平均 70.3%,超过了体量大三倍的 DeepSeek-Coder-33B。10B 以内真正能吃下仓库级上下文的代码模型,另有 1.5B 版本专供补全场景。 |
| Yi-34B-200K(初代 Yi) | 34.4B | 官方标最小 200GB;拆开看是 bf16 权重 69GB + 200K 满窗 KV 约 48GB/条序列 | 200K | Yi-1.5 全系没有 200K 变体,最长只到 32K(Yi-1.5-34B-32K / Yi-1.5-9B-32K 两个基座)。要真正的二十万 token 窗口就得回头用初代 Yi 的 200K 仓库,同系列还有 Yi-6B-200K 与 Yi-9B-200K,后两者的显存需求分别是 50GB 和相近量级。 |
02 —
该开哪张卡
按显存诚实匹配:权重放得下只是及格线,KV 缓存的余量才决定你能开多长的上下文
单卡跑 Yi-1.5-9B-Chat-16K 或 Yi-1.5-6B-Chat 的 bf16 原始权重
RTX 3090 24GB$0.193/卡·时
9B 的 bf16 权重 17.7GB、6B 只有 12.1GB,24GB 装完还留得出 KV 空间;而 3090 比 16GB 的 Tesla T4($0.298/卡·时)还便宜,是这一档没有理由不选的卡。
单卡跑 Yi-1.5-34B-Chat 的 Q4_K_M GGUF 或官方 AWQ 4bit 权重
RTX 5090 32GB$0.723/卡·时
Q4_K_M 权重 20.65GB,放进 24GB 卡刨掉碎片只剩两三 GB 装 KV,而 16K 满窗就要 3.75GB,稍长一点必 OOM;32GB 能留出约 10GB,够 16K 上下文再加几路并发。
bf16 精度跑 Yi-1.5-34B-Chat-16K,做正式评测或对外服务
A100 PCIE 80GB$0.824/卡·时
69GB 权重落在单卡上才躲得开张量并行的通信开销,剩下的约 10GB 正好覆盖 16K 上下文的 KV。要更高吞吐再往上换 A100 SXM4 80GB($1.088/卡·时)或 H100 SXM 80GB($3.582/卡·时)。
Yi-Coder-9B-Chat 开满 128K 窗口读整个代码仓库
RTX A6000 48GB$0.817/卡·时
权重 17.7GB 加上 128K 满窗单序列约 12GB 的 KV,48GB 能同时挂两三路长上下文请求;换 24GB 卡实际只开得到 32K 左右,读不完一个中型仓库。
03 —
四步把 Yi 跑起来
从开机到 OpenAI 兼容接口,二十分钟以内,命令可以直接抄
- 01
开一台带 vLLM 的实例
在 NexGPU 控制台按上表选卡,镜像直接挑预置的 vLLM 或 PyTorch 镜像——2,000 多个镜像里 CUDA、PyTorch、vLLM 都装好了,不用自己配环境,也不用提配额申请。开机后 SSH、Jupyter、网页终端随便用哪个进去都行,计费从实例真正跑起来那一秒开始按秒算。
- 02
把权重拉到实例上
Yi 全系在 Hugging Face 的 01-ai 组织下,Apache 2.0,不需要申请授权、不用签同意书、下载不分地区。国内节点从 ModelScope 的 01ai 同名仓库拉通常更快。34B 的 69GB bf16 权重在千兆带宽下大约十分钟;只想先试水就先拉 9B,17.7GB 两三分钟就好。
pip install -U huggingface_hub && hf download 01-ai/Yi-1.5-34B-Chat-16K --local-dir /workspace/Yi-1.5-34B-Chat-16K - 03
用 vLLM 起一个 OpenAI 兼容接口
Yi 的 architectures 就是 LlamaForCausalLM,vLLM 原生认,不需要 trust_remote_code。关键是 --max-model-len 不能瞎填:Yi-1.5-34B-Chat 的 config 写死 4096,只有 -Chat-16K 仓库才是 16384,vLLM 会照 config 封顶;硬把参数调到训练长度之外,模型只会输出噪声。服务起来后把接口地址换进原来调零一万物 API 的代码里,base_url 一改就通。
vllm serve /workspace/Yi-1.5-34B-Chat-16K --served-model-name yi-34b --dtype bfloat16 --max-model-len 16384 --gpu-memory-utilization 0.92 --port 8000 - 04
显存不够就换 GGUF 单卡路线
24GB 到 32GB 的卡上直接用 llama.cpp 跑 Q4_K_M:34B 权重压到 20.65GB,-ngl 99 把全部 60 层丢进显存,中文对话里的质量损失基本感知不到。别忘了 Yi 用的是 ChatML 模板——<|im_start|>system / <|im_start|>user / <|im_start|>assistant,以 <|im_end|> 收尾,词表 64000 而非 Llama 的 32000,套 Llama 的 [INST] 模板会直接输出乱码。
llama-server -m /workspace/Yi-1.5-34B-Chat-Q4_K_M.gguf -ngl 99 -c 16384 --host 0.0.0.0 --port 8000
跑一轮评测到底花多少钱
拿一件真事算笔账。在 A100 PCIE 80GB($0.824/卡·时)上用 bf16 起 Yi-1.5-34B-Chat-16K,跑 5,000 条内部评测:开机拉 vLLM 预置镜像约 3 分钟,下 69GB 权重按千兆带宽约 10 分钟,加载预热约 4 分钟,评测本身约 2.5 小时,合计约 2.8 小时。计算费 2.8 × $0.824 = $2.31。权重留在盘上七天等下一轮迭代:69GB × $0.414 ÷ 30 天 × 7 天 = $6.67。导出 1.2GB 结果文件:1.2 × $0.0081 = $0.01。总计 $8.99,其中真正烧 GPU 的只有 $2.31。 同一轮评测换成 Q4_K_M(20.65GB)跑在 RTX 5090 32GB($0.723/卡·时)上:吞吐略低,约 3.4 小时 × $0.723 = $2.46;权重只占 20.65GB,七天存储 20.65 × $0.414 ÷ 30 × 7 = $2.00;合计约 $4.46,不到 bf16 方案的一半。想先摸底 9B,RTX 3090 24GB 一小时只要 $0.193——一杯咖啡的钱够你跑五十多个小时。 两笔账里最容易被忽略的是存储:实例一停,计算费当秒停止,但盘上的权重会一直计费到你把它销毁。评测跑完顺手停实例,权重留着下次开机秒用;确定不再迭代就把卷删掉。没有最低消费、没有开通费、没有配额审批,这三笔常规云厂商的隐形成本在这里都是零。
04 —
