01 — 适用情况
什么时候该微调,什么时候不该
先说不该:如果你的需求是让模型知道一批事实(产品文档、政策条款、历史记录),检索增强(RAG)比微调更合适 —— 更便宜、更新更快、出错时更容易定位。微调解决的是另一类问题:让模型学会一种输出格式、一种语气、一种领域推理方式。
该微调的典型信号是:你已经把 prompt 写得又长又复杂还是不稳定;或者你需要模型稳定输出某种结构化格式;或者通用模型在你这个领域的专业术语上频繁出错。这些都是知识需要进权重、而不是进上下文的场景。
成本上,LoRA 与 QLoRA 把微调的门槛拉得很低。7B 模型的 QLoRA 微调在单张 24GB 卡上就能跑,几小时的事,成本在个位数美元。这意味着你可以把微调当成一次实验而不是一个项目 —— 数据配比不对就重跑一次,试错成本几乎可以忽略。
02 — 典型负载
常见的微调任务
从改语气到教会一整套领域推理。
领域适配
医疗、法律、金融、制造 —— 让通用模型掌握本行业的术语体系与表达习惯。通常几千到几万条高质量样本就能看到明显改善。
结构化输出
需要模型稳定吐出 JSON、SQL、特定格式的报告。用 prompt 硬约束总有失败率,微调之后格式遵从度会显著提升。
语气与人设
客服助手、角色扮演、品牌口吻 —— 这类需求靠 system prompt 能做个七成,微调能把剩下三成补上,而且不占用上下文长度。
模型蒸馏与降本
用大模型的输出训练小模型,把 70B 的能力压进 7B。线上推理成本可以降一个数量级,这笔账在高并发场景下非常划算。
03 — 软件栈
预置好的微调框架
三个方向:最省事、最省显存、最灵活。
LLaMA Factory — 最省事
带 Web 界面的一站式微调工具,支持上百个模型、LoRA/QLoRA/全参数、SFT/DPO/PPO 多种训练方式。填几个参数就能开跑,适合快速验证。
LLaMA Factory · WebUI · SFT/DPO
Unsloth — 最省显存
对训练核做了深度优化,同样的卡能跑更大的模型或更长的序列,速度也更快。显存吃紧时优先选它。
Unsloth · 低显存 · 加速核
Axolotl — 最灵活
配置文件驱动,几乎所有训练细节都可调,社区配置模板丰富。适合已经明确知道要改什么、需要精细控制训练过程的场景。
Axolotl · YAML 配置 · 多卡
04 — 选卡
微调多大的模型租什么卡
微调的显存需求由模型大小、训练方式与序列长度共同决定。下表是常见组合的经验值。
| 训练任务 | 建议显存 | 当前最便宜可选 | 说明 |
|---|---|---|---|
| 7B 模型 · QLoRA | 16GB | RTX 4060 Ti$0.126/小时 | 4bit 量化加载,显存占用最低的方案。入门微调的标准配置。 |
| 7B 模型 · LoRA(bf16) | 24GB | Tesla V100$0.188/小时 | 不量化,训练更稳、收敛更好。24GB 消费级旗舰正好覆盖这一档。 |
| 32B 模型 · QLoRA | 48GB | Q RTX 8000$0.508/小时 | 需要 48GB 档显存。长序列训练时还要在此基础上再留余量。 |
| 70B 模型 · QLoRA | 80GB | A100 SXM4$1.088/小时 | 80GB 档单卡起步,多卡节点更从容。 |
「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。
05 — 上手
跑一次微调
01
准备数据再开机
微调的成败八成在数据上。先把训练集整理成标准格式(通常是 JSONL 的指令-回答对),确认没问题再租机器 —— 别让 GPU 空转着等你清洗数据。
02
选卡与镜像
按上表选显存档位,镜像选 LLaMA Factory 或 Axolotl。磁盘要给足:基础模型权重、检查点与日志都占空间。
03
训练、下载、销毁
LoRA 权重通常只有几十到几百 MB,训完直接下载。确认拿到权重后销毁实例 —— 停机不销毁的话磁盘费会继续走。
06 — FAQ
