跳到主要内容

文本大模型

Falcon 之前,先把显存算明白

从 Falcon-H1-Tiny 的 90M 到 Falcon-H1-34B 的 68GB bf16 权重,从 665MB 的 BitNet 到 256K 上下文的混合架构——这一页只讲你真正需要多少显存,以及配哪张卡。

Falcon 是阿布扎比 TII(Technology Innovation Institute)的开源模型线,但别再用 2023 年 Falcon-180B 的印象去判断今天的 Falcon。180B 那一代的序列长度只有 2048,而当前主线 Falcon-H1 是把 Transformer 注意力头和 Mamba-2 状态空间头**并行**放进同一个 mixer block 的混合架构,两种头的比例可以独立调节。家族覆盖 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六个尺寸,base 与 instruct 双版本,原生支持 256K 上下文,18 种语言里明确包含中文。

混合架构对自部署最直接的收益就在显存曲线上。纯 Transformer 的 KV cache 随上下文长度线性膨胀,而 Falcon-H1 只有一部分层是注意力层,其余 Mamba-2 层携带的是固定大小的循环状态,不随 token 数增长。这就是一个 7B 模型敢开 256K 窗口的原因,也是 TII 宣称 Falcon-H1-34B 相比同级 Transformer 能拿到最高 4 倍输入吞吐、8 倍生成加速的来源。代价是你必须把 mamba-ssm 和 causal-conv1d 这两个 CUDA 内核包装好,否则会掉进慢速回退路径。

这条线上还长出了几个值得单独点名的分支:Falcon-H1R-7B 是基于 Falcon-H1-7B-Base 做 SFT(推理轨迹长达 48K token)加 GRPO 强化学习的推理版,AIME-24 拿到 88.1%、AIME-25 83.1%、LiveCodeBench v6 68.6%、GPQA-D 61.3%;Falcon-H1 Arabic 的 3B/7B/34B 在 Open Arabic LLM Leaderboard 上分别是 61.87/71.47/75.36;Falcon-H1-Tiny 一口气放了 15 个 90M 到 600M 的极小模型,含 Coder 与 Tool-Calling 专版;Falcon-E 用 BitNet 1.58bit 三值权重把 3B 压到 999MB;Falcon Perception 则是约 600M 的多模态视觉模型。许可证是 Falcon LLM License,不是 Apache 2.0——只有老的 Falcon-7B / Falcon-40B 才是 Apache 2.0,商用前务必自己读一遍随附的 Acceptable Use Policy。

01 —

Falcon 各版本显存对照

量化档位取自 tiiuae 官方 GGUF 仓库的实际文件大小,不是估算

版本参数量显存上下文说明
Falcon-H1-7B-Instruct7B(权重实测约 7.6B)bf16 15.2GB / Q8_0 8.07GB / Q5_K_M 5.39GB / Q4_K_M 4.6GB / Q2_K 2.89GB256K通用主力档。Q4_K_M 4.6GB 意味着一张 24GB 卡还能留出十几 GB 给长上下文,是最适合先跑通再决策的尺寸。
Falcon-H1R-7B7Bbf16 权重约 14–15GB,FP8 约 7.9GB;32K 上下文的 KV 再吃约 6GB256K(vLLM 默认 max-model-len 262144)推理特化版,输出长思维链。vLLM 必须加 --reasoning-parser deepseek_r1 才能把 thinking 段和最终答案分开。
Falcon-H1-34B-Instruct34Bbf16 ≈68GB / Q8_0 35.8GB / Q6_K 27.6GB / Q5_K_M 23.9GB / Q4_K_M 20.3GB / Q3_K_M 16.3GB256K开源权重里最强的一档。Q4_K_M 20.3GB 能塞进 24GB 卡但上下文窗口会很紧,32GB 起才算舒服。
Falcon-H1-1.5B-Deep-Instruct1.5B(深而窄)bf16 ≈3GB / Q8_0 ≈1.6GB256KTII 称其对标当前主流 7B–10B 模型。适合做批量离线标注、路由分类这类不值得占大卡的活。
Falcon-H1 Arabic 3B / 7B / 34B3B / 7B / 34B与同尺寸 Falcon-H1 一致(7B bf16 约 15GB、34B Q4_K_M 20.3GB)256K阿拉伯语方言与文化基准上的当前最强,OALL 平均分 61.87 / 71.47 / 75.36,34B 档超过 70B 级别的 Qwen2.5-72B。
Falcon-E-1B / Falcon-E-3B(BitNet 1.58bit)1.8B / 3B665MB / 999MB(三值权重)短上下文边缘场景CPU 也能跑的档位。TII 同时放出 bf16 版和预量化 BitNet 版,后者是专门为低成本微调准备的。

02 —

配哪张 NexGPU 的卡

按显存诚实匹配,不把 34B 的全精度往 24GB 卡上塞

  • Falcon-H1-7B Q4_K_M / Q5_K_M 单卡跑通与效果评估

    RTX 3090 24GB$0.193/卡·时

    4.6GB 的权重加上 llama.cpp 的 32K 上下文,24GB 绰绰有余,而这是整个列表里每小时最便宜的现代 CUDA 卡之一。

  • Falcon-H1R-7B bf16 起 vLLM 服务,64K 上下文跑长思维链

    RTX 5090 32GB$0.723/卡·时

    15GB 权重加上 64K 的 KV 与 Mamba 状态缓存会顶到 24GB 卡的天花板,32GB 让你还能把 --max-num-seqs 开到有意义的并发。

  • Falcon-H1-34B Q4_K_M / Q5_K_M 单卡上线,长文档场景

    RTX A6000 48GB$0.817/卡·时

    Q5_K_M 就是 23.9GB,再要 128K 级别的上下文余量,48GB 是唯一不用做张量并行的单卡选择。

  • Falcon-H1-34B bf16 全精度推理或做 LoRA 微调

    A100 SXM4 80GB$1.088/卡·时

    68GB 的 bf16 权重必须落在 80GB 显存上;要吃满 256K 窗口或做多卡训练,节点最多可挂 14 张卡、单节点显存上限 2,152GB。

03 —

从空实例到 OpenAI 兼容接口

混合架构的坑都在第一步和第二步,照做就不会 OOM

  1. 01

    开实例,装混合架构必需的两个内核包

    选 PyTorch 或 vLLM 预置镜像开机,2,000+ 镜像里已经带好 CUDA 与驱动。Falcon-H1 的 Mamba-2 层依赖 mamba-ssm 与 causal-conv1d,这两个包不在 vLLM 默认依赖里,必须用 --no-build-isolation 单独装,否则要么装不上,要么走进没有融合内核的慢速路径。

    pip install "vllm>=0.11.0" && pip install mamba-ssm causal-conv1d --no-build-isolation
  2. 02

    起 Falcon-H1R-7B 服务,务必手动压住 max-model-len

    这是自部署 Falcon-H1 最常见的翻车点:vLLM 读到模型配置里的 262144 就按 256K 去预分配 KV cache,任何 24GB 到 32GB 的卡都会直接 OOM。把 --max-model-len 压到你真正需要的长度,再用 --max-num-seqs 限住并发槽位数量(每个槽位都要独立持有一份 Mamba 循环状态)。推理版还要加 reasoning parser。

    vllm serve tiiuae/Falcon-H1R-7B --max-model-len 65536 --max-num-seqs 8 --reasoning-parser deepseek_r1 --gpu-memory-utilization 0.90 --port 8000
  3. 03

    34B 走 llama.cpp GGUF,单卡也能吃下

    llama.cpp 原生支持 Falcon-H1,官方 GGUF 就在 tiiuae/Falcon-H1-34B-Instruct-GGUF 下。用 --ngl 把所有层推上 GPU,温度按 TII 的建议压到 0.1——这个模型对高温度明显更敏感,调高会肉眼可见地掉质量。如果某个量化档位输出异常,换 Q5_K_M 或 Q6_K 复核一遍,社区确实反馈过个别档位的问题。

    ./build/bin/llama-server -m Falcon-H1-34B-Instruct-Q4_K_M.gguf -c 32768 --ngl 999 --temp 0.1 --host 0.0.0.0 --port 8080
  4. 04

    验证并接进你现有的 OpenAI 客户端

    两条路径都暴露 OpenAI 兼容端点,改个 base_url 就能接。通过 SSH 隧道、Jupyter 或 Web 终端都能访问,也可以直接用 REST API 与 CLI 把实例编排进 CI。确认输出正常后就可以停实例,计算按秒停止计费,只有存储会继续算到你销毁它为止。

    curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"tiiuae/Falcon-H1R-7B","messages":[{"role":"user","content":"用中文解释一下 Mamba-2 的状态空间层为什么不需要 KV cache"}],"temperature":0.1}'

一轮完整选型要花多少钱

假设你要从零把 Falcon 评估到能上线。跑通阶段:RTX 3090 24GB $0.193/卡·时 × 6 小时 = $1.16,拉下 Falcon-H1-7B-Instruct 的 Q4_K_M(4.6GB),llama.cpp 直接起来看中文和长文档表现。压测阶段:RTX 5090 32GB $0.723/卡·时 × 20 小时 = $14.46,换 H1R-7B bf16 开 64K 上下文,用 vLLM 压并发、量首 token 延迟。上线验证:RTX A6000 48GB $0.817/卡·时 × 30 小时 = $24.51,上 34B 的 Q4_K_M(20.3GB)跑真实业务样本做终选。算力合计 $1.16 + $14.46 + $24.51 = $40.13。权重常驻 30GB × $0.414/GB·月 = $12.42。整轮下来 $52.55,没有起租时长、没有开通费、不用提配额申请。

04 —

常见问题

Falcon-H1-7B 本地部署到底需要多大显存?

看你走哪条路。llama.cpp 的 Q4_K_M 是 4.6GB、Q5_K_M 5.39GB、Q8_0 8.07GB,这些是官方 GGUF 仓库的实际文件大小;走 bf16 全精度则是 15.2GB 权重,再加 32K 上下文约 6GB 的 KV 与状态缓存,实际占用会到 22GB 左右。也就是说量化版一张 24GB 卡轻松,bf16 加长上下文就该上 32GB。前者在 NexGPU 上是 RTX 3090 24GB $0.193/卡·时,后者是 RTX 5090 32GB $0.723/卡·时,按秒计费,跑完就停。

Falcon-H1-34B 单卡能跑吗?

量化后可以。Q4_K_M 是 20.3GB,塞进 24GB 卡能启动但几乎没有上下文余量;Q5_K_M 23.9GB、Q6_K 27.6GB 就需要 32GB 或 48GB 卡;Q8_0 35.8GB 要 48GB 卡;bf16 约 68GB 必须上 80GB 显存。我们的建议是 Q4/Q5 用 RTX A6000 48GB $0.817/卡·时,bf16 用 A100 SXM4 80GB $1.088/卡·时,两张卡在 NexGPU 的 1,175 个可租节点上都能随时开。

Falcon-H1 和 Falcon 3、Falcon 180B 是什么关系?新项目该用哪个?

Falcon 180B、Falcon 40B、Falcon 2 11B、Falcon Mamba 7B、Falcon 3 都还在 Hugging Face 上,但对新项目它们基本没有理由被选中。Falcon-180B 的序列长度只有 2048,而 Falcon-H1 家族原生 256K,7B 档在多数基准上直接压过前几代的大尺寸模型。新做私有化部署就从 Falcon-H1-7B-Instruct 起步,要推理能力就上 Falcon-H1R-7B,要最强效果就上 34B。三个尺寸在 NexGPU 上分别对应 RTX 3090 24GB、RTX 5090 32GB 和 RTX A6000 48GB。

为什么我用 vLLM 起 Falcon-H1 一启动就 OOM?

九成是 --max-model-len 没改。Falcon-H1 的配置里写的是 262144,vLLM 会照这个数字去预分配 KV cache,24GB 甚至 80GB 卡都可能直接爆。把它压到你真正需要的长度(比如 32768 或 65536),同时用 --max-num-seqs 限住并发槽位——混合架构每个槽位都要独立持有一份 Mamba 循环状态,并发数是实打实的显存成本。另一个常见原因是 mamba-ssm 和 causal-conv1d 没装好。NexGPU 的 vLLM 预置镜像可以让你少折腾编译环节,2,000+ 镜像开机即用。

Falcon 的中文能力怎么样?值得做中文私有化部署吗?

Falcon-H1 官方声明原生支持 18 种语言,中文(zh)在列,与英语、阿拉伯语、日语、韩语等并列,不是靠社区二次微调补上去的。TII 在阿拉伯语上做到了 OALL 榜首(34B 平均 75.36,超过 Qwen2.5-72B),说明它在非英语方向的投入是真实的。但中文场景仍然建议自己拉真实业务样本跑对比——这正是按秒计费的价值:RTX 3090 24GB $0.193/卡·时,花两三美元就能把 Falcon-H1-7B 和你现在用的模型做完一轮盲测。

Falcon 可以商用吗?许可证是什么?

当前主线 Falcon-H1、Falcon-H1R、Falcon-H1 Arabic、Falcon-H1-Tiny 用的是 Falcon LLM License,它基于 Apache 2.0 的原则,但附带一份 Acceptable Use Policy——这一点和很多人默认的"Falcon 都是 Apache 2.0"不一样,只有 2023 年的 Falcon-7B 和 Falcon-40B 是纯 Apache 2.0。要商用请自己完整读一遍条款。至于算力这一侧不用担心合规摩擦:NexGPU 覆盖 51 个国家和地区、1,175 个已验证可租节点、2,498 张 GPU、75 种型号,你可以按数据所在地挑节点,中英双语支持走 Telegram,没有工单排队。控制台在 console.nexgpu.net。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。