首页
/
工具详情
MinerU 使用指南
一、平台介绍
上海 AI 实验室开源的文档结构化解析引擎。其核心优势在于强大的内容还原能力,专为 RAG 知识库、学术论文、财报合同等复杂场景设计。
- 核心技术:采用 VLM(视觉语言模型)+ OCR 双引擎架构。
- 主要目标:精准还原复杂排版、表格及数学公式。
- 部署形态:提供在线网页工具、桌面客户端、云端 API、本地开源部署四种使用方式。
二、核心功能特性
1. 内容识别能力
- 版面智能还原:自动过滤页眉页脚,双栏论文按阅读顺序重组输出;精准区分标题/正文/列表/图片区域。
- 复杂表格解析:支持跨页、合并单元格及无框表格的识别与重绘。可转换为 Markdown / HTML / CSV 格式。
- 公式深度识别:自动将行内及多行数学公式还原为标准 LaTeX 语法。
- 高难度 OCR 扫描件:针对有阴影、畸变或手写印刷混合文档进行优化,支持全球 109 种语言。
2. 输入与输出规范
- 广泛文件格式:完美兼容 PDF / DOCX / PPTX / PNG/JPG 图片等格式。
- ⚠️ 限制提示:单文件上限通常为 200MB 或 200 页(云端版)。
- 结构化输出选项:支持导出 Markdown、layout.json、content_list.json 及带坐标的结构化数据,便于程序直接读取。
3. 生态与 API 集成
- 原生对接工具:无缝衔接 LangChain / Dify / FastGPT / MCP 等主流 AI 框架。
- 多语言 SDK:提供 Python、Go、TS (TypeScript) 开发包,方便开发者快速接入。
- 双 API 模式:
- 🟢 Agent 轻量版:免 Token,适合测试与小型文件(≤10MB/20页),响应速度快。
- 🔵 精准解析版:需申请 Token,支持大文件、批量处理及高精度模式需求。
三、适用人群分析
✅ 推荐使用场景
- 科研学生:批量提取论文数据、整理文献笔记、公式转 LaTeX 辅助写作。
- RAG 开发者:作为知识库预处理工具,负责文档向量化前的清洗与解析环节。
- 职场办公族:快速结构化财报分析、合同审查、技术手册拆解及招标文件处理。
- 数据分析师:将 PDF 中的复杂表格批量导出为可用数据进行二次加工。
❌ 不推荐/非核心场景
- 企业级超高并发:若需要 7×24 小时持续高流量跑通,免费额度可能受限(需商务定制)。
- 简单格式转换:如果仅需简单的 PDF 转 Word,使用轻量级工具即可满足。
四、资源获取与定价说明
🆓 免费资源(永久可用)
- 在线网页提取器 (Online):每日提供免费额度,支持单文件上传至 200MB/200 页。注册仅需邮箱,无需信用卡验证。
- 桌面客户端 (Win/Mac/Linux):完全免费无额度限制,数据本地运行不消耗云端配额。强烈推荐用于处理大文件或隐私敏感文档。
- 开源源码 (GitHub):提供 Docker/代码仓库支持私有化部署。零云服务费,算力自备(需显卡加速)。
- 云端 API 试用 Token:注册后可获得每日 1000 页免费额度,次日自动重置。
💰 付费与定制说明
- 订阅套餐:目前无公开月付/年付订阅。
- 触发收费场景:当免费额度耗尽、企业级高并发需求或需要私有化部署定制开发时。
- 计费方式:按量付费或联系客服进行商务询价。
🔗 官方地址(实时更新)
Token 申请 & 额度管理:https://mineru.net/apiManage/token
API 文档 & 计费说明:https://mineru.net/apiManage/docs
五、三种主流使用方式(图文步骤)
🌐 方式一:在线网页版
- 适用:临时少量文件处理,无需安装任何软件。
- 访问官网页面 https://mineru.net/OpenSourceTools/Extractor。
- 通过邮箱完成登录注册。
- 拖拽上传文件;若扫描 PDF 请勾选「OCR」选项;若是学术论文建议开启「公式识别」。
- 等待解析完成后,左侧预览原文右侧查看 Markdown,支持下载对应格式或 JSON 数据。
💻 方式二:本地客户端版(强烈推荐)
- 适用:重度个人用户、处理大文件/敏感文档、无需消耗云端额度。
- 访问官网首页点击“桌面端”图标,分别下载 Win/Mac/Linux版本安装包。
- 安装完成后直接拖拽任意文件夹内的文档进入软件窗口。
- 批量解析完全本地运行,图片原文件不生成网络链接(不会上传至服务器)。
- 导出时可选择保留完整离线素材包,方便备份或二次编辑。
🐍 方式三:API 开发者接入版
- 适用:系统集成、自动化脚本编写、后端服务对接。
- 访问 管理后台 注册并获取您的专属 API Token。
- 在代码中发起异步请求提交任务,通过轮询
task_id查询处理状态与结果。 - Python 极简调用示例:
json
{
"file_name": "paper.pdf",
"language": "ch", // 设置语言 (zh/en等)
"enable_table": true,
"is_ocr": true, // 扫描件必须开启此选项
"enable_formula": true // 论文建议开启公式识别
}
{
"file_name": "paper.pdf",
"language": "ch", // 设置语言 (zh/en等)
"enable_table": true,
"is_ocr": true, // 扫描件必须开启此选项
"enable_formula": true // 论文建议开启公式识别
}
六、避坑指南与注意事项
为避免使用过程中的常见问题,请仔细阅读以下核心提示:
- ⚠️ 图片链接失效问题:在线网页版导出的 Markdown 中,若包含图片通常为临时云链接。建议批量下载图片或在导出时保存本地副本;大量文件处理建议使用客户端模式。
- 💡 OCR 选项必选:对于扫描件(纯图像 PDF),解析界面必须勾选「OCR」功能,否则系统会将其识别为空白文本框而非内容。
- 📉 额度管理策略:云端 API 每日免费额上限固定(1000 页左右)。若需高频批量处理,请在次日重置前及时刷新 Token;长期高并发任务请直接部署本地客户端。
- 💻 硬件门槛提示:开源版本支持 Docker/源码运行。若无 NVIDIA 显卡 GPU,纯 CPU 模式的解析速度会非常慢,建议配置显存或购买服务器云部署加速服务。
- 🔒 数据合规安全:涉及涉密合同、内部财务资料等敏感信息,严禁上传至云端网页版。务必使用本地客户端(Local Version)或在企业内网进行私有化部署。
- ⏳ 异步处理机制:调用 API 提交大文件任务后是异步的,接口不会立即返回结果文本。程序需编写轮询逻辑查询
task_id状态直至完成。 - 🌐 网络稳定性:在国内大陆地区直接访问在线网页版偶尔会遇到上传超时或解析中断的情况。涉及关键工作流时建议走本地客户端方案,避免依赖外网服务。
💡 Token 安全警告:请务必保管好 API Token,禁止将其硬编码在前端页面代码中或推送到公开的 GitHub/GitLab 仓库中。Token 泄露可能导致免费额度被恶意消耗。
暂无评论