MinerU 解决的是 RAG 流水线最脏的那一段:把版式复杂的 PDF、扫描件、DOCX / PPTX / XLSX 拆成有阅读顺序的 Markdown 和 JSON。它会主动剔掉页眉页脚、脚注和页码,把双栏、多栏排版按人眼的阅读顺序拼回去,公式转 LaTeX,表格转 HTML,图片连同题注一起抽出来。OCR 覆盖 109 种语言,扫描件和残缺 PDF 也能吃。
当前稳定线是 3.4.5。3.4 把 OCR 模型换成了 PP-OCRv6,OmniDocBench v1.6 上的 OCR 相关指标提升约 11%,OCR 环节速度大约翻倍;3.4.5 顺手修掉了「docx 表格里只要有非文本特殊字符就被静默丢弃」和 PDF 抽文本时代理对(surrogate pair)还原的两个老坑。3.3 引入的 hybrid-engine 现在是默认后端,带 --effort medium / high 两档。4.0.0a6 已经在 GitHub 上以 pre-release 形式滚动更新,doclib 还在重构,生产环境别碰。
MinerU 的甜点在于它便宜得不像个 SOTA。VLM 权重 MinerU2.5-Pro-2605-1.2B 只有 12 亿参数、Qwen2-VL 架构、bf16 存放,却在 OmniDocBench v1.6 上拿到 95.69 的总分,表格 TEDS 93.62、文本编辑距离 0.036,压过一票专用 OCR 模型和体量大得多的前沿 VLM。官方给的吞吐基线是 vllm-async-engine 在单张 A100 上 2.12 fps。换算下来,在 NexGPU 租一张 A100 PCIE 80GB 把 10 万页文档全跑一遍,账单大约 $11。
01 —
版本与后端:先搞清楚你要跑的是哪一套
MinerU 不是单一模型,而是「一个 CLI + 两条推理路线」,显存差一倍,分数差 9 分。
| 版本 | 参数量 | 显存 | 上下文 | 说明 |
|---|---|---|---|---|
| MinerU 3.4.5(当前稳定版) | 默认后端 hybrid-engine | pipeline 4GB / hybrid 与 vlm 8GB / http-client 2GB | PDF、DOCX、PPTX、XLSX、图片 | OCR 升级到 PP-OCRv6,OmniDocBench v1.6 的 OCR 指标 +11%、速度约翻倍;修复 docx 表格含特殊字符被静默丢弃。绝大多数人应该装这个。 |
| MinerU2.5-Pro-2605-1.2B(当前 VLM 权重) | 1.2B,Qwen2-VL 架构,bf16 safetensors | bf16 权重本体 8GB 可跑,vLLM 常驻建议 ≥16GB 留 KV cache | 两阶段:降采样图做全局版面分析 → 原生分辨率裁切做细粒度识别 | OmniDocBench v1.6 总分 95.69、表格 TEDS 93.62、文本编辑距离 0.036,Apache 2.0 协议。3.3 起随 hybrid / vlm 后端一起下发。 |
| MinerU2.5-2509-1.2B(上一代 VLM 权重) | 1.2B | bf16 ~8GB | 同样是两阶段版面 → 裁切识别 | OmniDocBench 总分 85.61,官方那条「A100 单卡 vllm-async-engine 2.12 fps」的吞吐基线就出自这一代。注意协议是 AGPL-3.0,和 Pro 版的 Apache 2.0 不一样,商用前务必看清你拉的是哪份权重。 |
| pipeline 后端(PP-DocLayoutV2 + MFD/MFR + PP-OCRv6 + TabCls/TabRec + OriCls + ReadingOrder) | 一组小模型串起来,不是单个大模型 | 最低 4GB,纯 CPU 也能跑 | 109 种语言 OCR,-l 参数只在这个后端生效 | OmniDocBench v1.6 得分 86.47。兼容性最好、显存最省,适合海量常规版式的批处理,也是唯一能输出 span.pdf 调试图的后端。 |
| hybrid-engine,--effort medium / high | pipeline 与 VLM 混合调度 | 8GB 起 | medium 档不做图片内容分析 | medium 95.26、high 95.39,纯 vlm-engine 是 95.30。默认 medium 已经足够;需要图注、图表内容理解时再切 high。 |
| MinerU 4.0.0a6(pre-release) | doclib 架构重构中 | 与 3.4 线一致 | 仅 GitHub Releases 提供 | 预发布分支,接口还在动(模型下载完成标记、doclib 视觉块 locator 暴露等)。想尝鲜可以单开一台按秒计费的机器试,别接生产流量。 |
02 —
MinerU 该租哪张卡
MinerU 官方要求 GPU 架构 Volta 及以后。显存不是瓶颈,吞吐才是——所以选卡的逻辑是「够用的显存 + 尽量便宜的算力密度」。
pipeline 后端批量把常规版式 PDF 转 Markdown(最省钱)
RTX 3090 24GB$0.193/卡·时
pipeline 只要 4GB 显存,3090 是全网价目表里最便宜的 Ampere 卡,剩下的 20GB 全部拿去堆并发和 batch,单页成本能压到极低。
hybrid-engine / vlm-engine 单卡在线服务,跑 MinerU2.5-Pro-2605-1.2B
RTX 4090 24GB$0.540/卡·时
8GB 是官方门槛,但 1.2B VLM 在 vLLM 连续批处理下真正吃的是带宽和 KV cache;4090 的 Ada 算力配 24GB 显存,是单卡在线解析服务的甜点位。
对齐官方 2.12 fps 吞吐基线,跑大规模文档入库
A100 PCIE 80GB$0.824/卡·时
官方那条 vllm-async-engine 吞吐数字就是在单张 A100 上测的,照抄参数不用重新调优;80GB 显存可以把 gpu-memory-utilization 拉满、多路并发一起上。
多卡集群跑 mineru-router,百万页级别文档流水线
A100 SXM4 80GB$1.088/卡·时
SXM4 的卡间互联更适合多实例常驻,单节点最多 14 张卡;配 mineru-router --local-gpus auto 自动分发任务,墙钟时间按卡数线性缩短。
03 —
在 NexGPU 上把 MinerU 跑起来
从开机到第一份 Markdown,正常十几分钟——大头是拉权重,不是装环境。
- 01
开一台 GPU 实例并装 MinerU
在 console.nexgpu.net 选 PyTorch 或 vLLM 预置镜像开机,2000+ 镜像里 CUDA 驱动和 CJK 字体都是配好的。Python 用 3.10–3.13(Windows 因为 Ray 依赖只能到 3.12)。mineru[all] 会把 pipeline 和 VLM 两条路线的依赖一次装齐;只用 pipeline 可以装 mineru[pipeline] 省磁盘。
pip install --upgrade pip uv && uv pip install -U "mineru[all]" - 02
拉权重,跑通第一份 PDF
国内节点把模型源切到 ModelScope,比 HuggingFace 稳得多;也可以设 local 用已经下好的目录,路径会自动写进用户目录下的 mineru.json。权重加上依赖预留 20GB SSD。跑完除了 .md,还会给 content_list.json、content_list_v2.json、middle.json、model.json 和 layout.pdf——排查阅读顺序错乱就看 layout.pdf,pipeline 后端还额外给 span.pdf。
export MINERU_MODEL_SOURCE=modelscope && mineru-models-download && mineru -p paper.pdf -o ./out -b hybrid-engine --effort high - 03
起成服务:FastAPI、WebUI 或 OpenAI 兼容接口
mineru-api 是 FastAPI 服务,--enable-vlm-preload true 会在启动时预热 VLM,避免第一个请求超时;想要个页面就用 mineru-gradio;要让别的 Agent 框架按 OpenAI 协议调用,起 mineru-openai-server,再让轻量客户端用 -b vlm-http-client 连过来——客户端侧只要 2GB 显存,连 torch 都不用装。
mineru-api --host 0.0.0.0 --port 8000 --enable-vlm-preload true - 04
扩到多卡,把墙钟时间打下去
NexGPU 单节点最多 14 张卡。mineru-router 用 --local-gpus auto 自动把本机所有 GPU 拉起来做实例分发,也能用 --upstream-url 把多台机器上的 mineru-api 聚合成一个入口。任务跑完停机,计算立刻停止计费;盘上的权重要么保留($0.414/GB·月)要么销毁,自己决定。
mineru-router --host 0.0.0.0 --port 8002 --local-gpus auto
10 万页文档,到底要花多少钱
拿官方公开的吞吐基线算一笔实账。MinerU2.5 在单张 A100 上用 vllm-async-engine 跑出 2.12 fps,也就是 2.12 × 3600 ≈ 7,632 页/小时。10 万页 ÷ 7,632 ≈ 13.1 小时。NexGPU 的 A100 PCIE 80GB 是 $0.824/卡·时,13.1 × 0.824 ≈ $10.8。存储按权重 20GB 加输出 20GB 共 40GB 算,$0.414/GB·月 折到 13.1 小时约 $0.30;把 20GB 结果拉回本地,出网 20 × $0.0081 ≈ $0.16。合计约 $11.3,折合每页 0.0001 美元出头。嫌 13 小时太久就横向扩:4 张 A100 SXM4 80GB 把墙钟压到约 3.3 小时,4 × $1.088 × 3.3 ≈ $14.4——多花 3 美元买回 10 小时。如果文档版式规整、只需要 pipeline 后端,换成 RTX 3090 24GB($0.193/卡·时)单页成本还能再降一个台阶。计费按秒计量、按小时定价,没有起租时长、没有开通费、不用申请配额,实例一停计算费就停。
04 —
