跳到主要内容

AI 微调

让模型学会你的行话

通用模型不懂你的产品名、你的工单格式、你的行业黑话。微调是把这些知识压进权重里最直接的办法 —— 而它需要的算力,按小时租远比买一张卡划算。

7B QLoRA 每小时起
$0.723
QLoRA 常见显存门槛
24GB
单节点最大显存
2152GB

01 — 适用情况

什么时候该微调,什么时候不该

先说不该:如果你的需求是让模型知道一批事实(产品文档、政策条款、历史记录),检索增强(RAG)比微调更合适 —— 更便宜、更新更快、出错时更容易定位。微调解决的是另一类问题:让模型学会一种输出格式、一种语气、一种领域推理方式。

该微调的典型信号是:你已经把 prompt 写得又长又复杂还是不稳定;或者你需要模型稳定输出某种结构化格式;或者通用模型在你这个领域的专业术语上频繁出错。这些都是知识需要进权重、而不是进上下文的场景。

成本上,LoRA 与 QLoRA 把微调的门槛拉得很低。7B 模型的 QLoRA 微调在单张 24GB 卡上就能跑,几小时的事,成本在个位数美元。这意味着你可以把微调当成一次实验而不是一个项目 —— 数据配比不对就重跑一次,试错成本几乎可以忽略。

02 — 典型负载

常见的微调任务

从改语气到教会一整套领域推理。

  • 领域适配

    医疗、法律、金融、制造 —— 让通用模型掌握本行业的术语体系与表达习惯。通常几千到几万条高质量样本就能看到明显改善。

  • 结构化输出

    需要模型稳定吐出 JSON、SQL、特定格式的报告。用 prompt 硬约束总有失败率,微调之后格式遵从度会显著提升。

  • 语气与人设

    客服助手、角色扮演、品牌口吻 —— 这类需求靠 system prompt 能做个七成,微调能把剩下三成补上,而且不占用上下文长度。

  • 模型蒸馏与降本

    用大模型的输出训练小模型,把 70B 的能力压进 7B。线上推理成本可以降一个数量级,这笔账在高并发场景下非常划算。

03 — 软件栈

预置好的微调框架

三个方向:最省事、最省显存、最灵活。

  • LLaMA Factory — 最省事

    带 Web 界面的一站式微调工具,支持上百个模型、LoRA/QLoRA/全参数、SFT/DPO/PPO 多种训练方式。填几个参数就能开跑,适合快速验证。

    LLaMA Factory · WebUI · SFT/DPO

  • Unsloth — 最省显存

    对训练核做了深度优化,同样的卡能跑更大的模型或更长的序列,速度也更快。显存吃紧时优先选它。

    Unsloth · 低显存 · 加速核

  • Axolotl — 最灵活

    配置文件驱动,几乎所有训练细节都可调,社区配置模板丰富。适合已经明确知道要改什么、需要精细控制训练过程的场景。

    Axolotl · YAML 配置 · 多卡

04 — 选卡

微调多大的模型租什么卡

微调的显存需求由模型大小、训练方式与序列长度共同决定。下表是常见组合的经验值。

训练任务建议显存当前最便宜可选说明
7B 模型 · QLoRA16GBRTX 4060 Ti$0.126/小时4bit 量化加载,显存占用最低的方案。入门微调的标准配置。
7B 模型 · LoRA(bf16)24GBTesla V100$0.188/小时不量化,训练更稳、收敛更好。24GB 消费级旗舰正好覆盖这一档。
32B 模型 · QLoRA48GBQ RTX 8000$0.508/小时需要 48GB 档显存。长序列训练时还要在此基础上再留余量。
70B 模型 · QLoRA80GBA100 SXM4$1.088/小时80GB 档单卡起步,多卡节点更从容。

「当前最便宜可选」由实时库存推导,取显存达标机型中的最低单卡价,随市场浮动。多卡节点整机出租。

05 — 上手

跑一次微调

  • 01

    准备数据再开机

    微调的成败八成在数据上。先把训练集整理成标准格式(通常是 JSONL 的指令-回答对),确认没问题再租机器 —— 别让 GPU 空转着等你清洗数据。

  • 02

    选卡与镜像

    按上表选显存档位,镜像选 LLaMA Factory 或 Axolotl。磁盘要给足:基础模型权重、检查点与日志都占空间。

  • 03

    训练、下载、销毁

    LoRA 权重通常只有几十到几百 MB,训完直接下载。确认拿到权重后销毁实例 —— 停机不销毁的话磁盘费会继续走。

06 — FAQ

关于大模型微调

微调一次大概要多少钱?

7B 模型的 QLoRA 微调,几千条样本、跑三个 epoch,通常在 2 到 6 小时之间。按 $0.723/小时算,一次完整微调不到十美元。这个成本低到你可以把微调当实验做 —— 效果不好就换个数据配比重跑。

LoRA、QLoRA 和全参数微调怎么选?

绝大多数情况选 LoRA 或 QLoRA。它们只训练很小一部分新增参数,显存需求低、训练快、产出的权重只有几十 MB,而效果在多数任务上接近全参数微调。全参数微调需要数倍显存与时间,只在做深度领域适配或模型蒸馏时才值得。

要准备多少训练数据?

取决于任务。改输出格式或语气,几百到一千条高质量样本往往就够;领域适配通常需要几千到几万条。数据质量远比数量重要 —— 一千条精心标注的样本胜过一万条噪声数据。

训练中途实例被销毁怎么办?

余额充足时不会发生。系统会在余额偏低时提前发预警邮件,余额耗尽才会自动停机。建议开长任务前留足余额,并在训练脚本里配置定期保存检查点 —— 这是本地训练也应该做的事。

微调好的模型怎么部署?

LoRA 权重可以直接被 vLLM 加载,也可以先合并进基础模型再部署。具体做法见我们的大模型推理部署页面 —— 同一套账号、同一个市场,换个镜像就能拉起推理服务。

开始使用 NexGPU

无论你是企业研发团队还是独立开发者,都可以在几分钟内跑起第一个任务。

注册即可浏览全网实时价格,无需绑定支付方式。