Falcon 是阿布扎比 TII(Technology Innovation Institute)的开源模型线,但别再用 2023 年 Falcon-180B 的印象去判断今天的 Falcon。180B 那一代的序列长度只有 2048,而当前主线 Falcon-H1 是把 Transformer 注意力头和 Mamba-2 状态空间头**并行**放进同一个 mixer block 的混合架构,两种头的比例可以独立调节。家族覆盖 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六个尺寸,base 与 instruct 双版本,原生支持 256K 上下文,18 种语言里明确包含中文。
混合架构对自部署最直接的收益就在显存曲线上。纯 Transformer 的 KV cache 随上下文长度线性膨胀,而 Falcon-H1 只有一部分层是注意力层,其余 Mamba-2 层携带的是固定大小的循环状态,不随 token 数增长。这就是一个 7B 模型敢开 256K 窗口的原因,也是 TII 宣称 Falcon-H1-34B 相比同级 Transformer 能拿到最高 4 倍输入吞吐、8 倍生成加速的来源。代价是你必须把 mamba-ssm 和 causal-conv1d 这两个 CUDA 内核包装好,否则会掉进慢速回退路径。
这条线上还长出了几个值得单独点名的分支:Falcon-H1R-7B 是基于 Falcon-H1-7B-Base 做 SFT(推理轨迹长达 48K token)加 GRPO 强化学习的推理版,AIME-24 拿到 88.1%、AIME-25 83.1%、LiveCodeBench v6 68.6%、GPQA-D 61.3%;Falcon-H1 Arabic 的 3B/7B/34B 在 Open Arabic LLM Leaderboard 上分别是 61.87/71.47/75.36;Falcon-H1-Tiny 一口气放了 15 个 90M 到 600M 的极小模型,含 Coder 与 Tool-Calling 专版;Falcon-E 用 BitNet 1.58bit 三值权重把 3B 压到 999MB;Falcon Perception 则是约 600M 的多模态视觉模型。许可证是 Falcon LLM License,不是 Apache 2.0——只有老的 Falcon-7B / Falcon-40B 才是 Apache 2.0,商用前务必自己读一遍随附的 Acceptable Use Policy。
01 —
Falcon 各版本显存对照
量化档位取自 tiiuae 官方 GGUF 仓库的实际文件大小,不是估算
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| Falcon-H1-7B-Instruct | 7B(权重实测约 7.6B) | bf16 15.2GB / Q8_0 8.07GB / Q5_K_M 5.39GB / Q4_K_M 4.6GB / Q2_K 2.89GB | 256K | 通用主力档。Q4_K_M 4.6GB 意味着一张 24GB 卡还能留出十几 GB 给长上下文,是最适合先跑通再决策的尺寸。 |
| Falcon-H1R-7B | 7B | bf16 权重约 14–15GB,FP8 约 7.9GB;32K 上下文的 KV 再吃约 6GB | 256K(vLLM 默认 max-model-len 262144) | 推理特化版,输出长思维链。vLLM 必须加 --reasoning-parser deepseek_r1 才能把 thinking 段和最终答案分开。 |
| Falcon-H1-34B-Instruct | 34B | bf16 ≈68GB / Q8_0 35.8GB / Q6_K 27.6GB / Q5_K_M 23.9GB / Q4_K_M 20.3GB / Q3_K_M 16.3GB | 256K | 开源权重里最强的一档。Q4_K_M 20.3GB 能塞进 24GB 卡但上下文窗口会很紧,32GB 起才算舒服。 |
| Falcon-H1-1.5B-Deep-Instruct | 1.5B(深而窄) | bf16 ≈3GB / Q8_0 ≈1.6GB | 256K | TII 称其对标当前主流 7B–10B 模型。适合做批量离线标注、路由分类这类不值得占大卡的活。 |
| Falcon-H1 Arabic 3B / 7B / 34B | 3B / 7B / 34B | 与同尺寸 Falcon-H1 一致(7B bf16 约 15GB、34B Q4_K_M 20.3GB) | 256K | 阿拉伯语方言与文化基准上的当前最强,OALL 平均分 61.87 / 71.47 / 75.36,34B 档超过 70B 级别的 Qwen2.5-72B。 |
| Falcon-E-1B / Falcon-E-3B(BitNet 1.58bit) | 1.8B / 3B | 665MB / 999MB(三值权重) | 短上下文边缘场景 | CPU 也能跑的档位。TII 同时放出 bf16 版和预量化 BitNet 版,后者是专门为低成本微调准备的。 |
02 —
配哪张 NexGPU 的卡
按显存诚实匹配,不把 34B 的全精度往 24GB 卡上塞
Falcon-H1-7B Q4_K_M / Q5_K_M 单卡跑通与效果评估
RTX 3090 24GB$0.193/卡·时
4.6GB 的权重加上 llama.cpp 的 32K 上下文,24GB 绰绰有余,而这是整个列表里每小时最便宜的现代 CUDA 卡之一。
Falcon-H1R-7B bf16 起 vLLM 服务,64K 上下文跑长思维链
RTX 5090 32GB$0.723/卡·时
15GB 权重加上 64K 的 KV 与 Mamba 状态缓存会顶到 24GB 卡的天花板,32GB 让你还能把 --max-num-seqs 开到有意义的并发。
Falcon-H1-34B Q4_K_M / Q5_K_M 单卡上线,长文档场景
RTX A6000 48GB$0.817/卡·时
Q5_K_M 就是 23.9GB,再要 128K 级别的上下文余量,48GB 是唯一不用做张量并行的单卡选择。
Falcon-H1-34B bf16 全精度推理或做 LoRA 微调
A100 SXM4 80GB$1.088/卡·时
68GB 的 bf16 权重必须落在 80GB 显存上;要吃满 256K 窗口或做多卡训练,节点最多可挂 14 张卡、单节点显存上限 2,152GB。
03 —
从空实例到 OpenAI 兼容接口
混合架构的坑都在第一步和第二步,照做就不会 OOM
- 01
开实例,装混合架构必需的两个内核包
选 PyTorch 或 vLLM 预置镜像开机,2,000+ 镜像里已经带好 CUDA 与驱动。Falcon-H1 的 Mamba-2 层依赖 mamba-ssm 与 causal-conv1d,这两个包不在 vLLM 默认依赖里,必须用 --no-build-isolation 单独装,否则要么装不上,要么走进没有融合内核的慢速路径。
pip install "vllm>=0.11.0" && pip install mamba-ssm causal-conv1d --no-build-isolation - 02
起 Falcon-H1R-7B 服务,务必手动压住 max-model-len
这是自部署 Falcon-H1 最常见的翻车点:vLLM 读到模型配置里的 262144 就按 256K 去预分配 KV cache,任何 24GB 到 32GB 的卡都会直接 OOM。把 --max-model-len 压到你真正需要的长度,再用 --max-num-seqs 限住并发槽位数量(每个槽位都要独立持有一份 Mamba 循环状态)。推理版还要加 reasoning parser。
vllm serve tiiuae/Falcon-H1R-7B --max-model-len 65536 --max-num-seqs 8 --reasoning-parser deepseek_r1 --gpu-memory-utilization 0.90 --port 8000 - 03
34B 走 llama.cpp GGUF,单卡也能吃下
llama.cpp 原生支持 Falcon-H1,官方 GGUF 就在 tiiuae/Falcon-H1-34B-Instruct-GGUF 下。用 --ngl 把所有层推上 GPU,温度按 TII 的建议压到 0.1——这个模型对高温度明显更敏感,调高会肉眼可见地掉质量。如果某个量化档位输出异常,换 Q5_K_M 或 Q6_K 复核一遍,社区确实反馈过个别档位的问题。
./build/bin/llama-server -m Falcon-H1-34B-Instruct-Q4_K_M.gguf -c 32768 --ngl 999 --temp 0.1 --host 0.0.0.0 --port 8080 - 04
验证并接进你现有的 OpenAI 客户端
两条路径都暴露 OpenAI 兼容端点,改个 base_url 就能接。通过 SSH 隧道、Jupyter 或 Web 终端都能访问,也可以直接用 REST API 与 CLI 把实例编排进 CI。确认输出正常后就可以停实例,计算按秒停止计费,只有存储会继续算到你销毁它为止。
curl http://localhost:8000/v1/chat/completions -H "Content-Type: application/json" -d '{"model":"tiiuae/Falcon-H1R-7B","messages":[{"role":"user","content":"用中文解释一下 Mamba-2 的状态空间层为什么不需要 KV cache"}],"temperature":0.1}'
一轮完整选型要花多少钱
假设你要从零把 Falcon 评估到能上线。跑通阶段:RTX 3090 24GB $0.193/卡·时 × 6 小时 = $1.16,拉下 Falcon-H1-7B-Instruct 的 Q4_K_M(4.6GB),llama.cpp 直接起来看中文和长文档表现。压测阶段:RTX 5090 32GB $0.723/卡·时 × 20 小时 = $14.46,换 H1R-7B bf16 开 64K 上下文,用 vLLM 压并发、量首 token 延迟。上线验证:RTX A6000 48GB $0.817/卡·时 × 30 小时 = $24.51,上 34B 的 Q4_K_M(20.3GB)跑真实业务样本做终选。算力合计 $1.16 + $14.46 + $24.51 = $40.13。权重常驻 30GB × $0.414/GB·月 = $12.42。整轮下来 $52.55,没有起租时长、没有开通费、不用提配额申请。
04 —
