首页 / 详情
Site icon

PaddleOCR

基本信息

PaddleOCR 网站截图预览

工具详情

AI Studio PaddleOCR 使用指南

📚 简介:本文档旨在帮助用户全面了解百度 AI Studio 平台上的 PaddleOCR 工具,涵盖平台定位、核心功能、适用场景、费用说明、使用步骤及避坑指南,助您快速上手云端 OCR 训练与识别。

一、平台介绍

1. 核心构成

  • PaddleOCR:百度飞桨开源 OCR 算法套件,遵循 Apache2.0 协议,完全开源且免费。
  • AI Studio:百度云端在线算力与代码运行平台。
  • 环境优势:内置 PaddleOCR 全套环境,无需本地配置。
  • 运行模式:支持在线推理、模型微调、API 调用、可视化图片上传识别。

2. 平台定位

  • 首选方案:国内免费中文 OCR 首选的云端实训平台。
  • 一站式服务:提供从图片/PDF 文字识别、定制模型训练到线上接口调用的完整流程。
  • 网络优势:国内网络访问无障碍,延迟低,速度快。

3. 生态配套

  • 在线识别页:提供前端无代码识别体验。
  • Notebook 环境:支持代码开发与模型训练。
  • API 服务:开放接口供程序调用。
  • 案例库:提供行业微调案例库及完整教程。

二、主要功能

1. 网页端零代码识别

  • 操作方式:直接拖拽上传 JPG/PNG/PDF/TIFF 文件。
  • 核心能力:自动版面分析、文字提取、表格还原。
  • 后期处理:支持在线校对,并支持导出为 TXT / Markdown / JSON 格式。

2. Notebook 代码全流程能力

  • 基础推理:涵盖通用中英文、手写体、票据、表格等多种场景。
  • 模型微调:支持上传自定义数据集,训练专属模型(如车牌、证件、小票、古籍等)。
  • 数据工具:内置文字合成工具、标注工具及数据集预处理功能。
  • 模型导出:支持导出 Paddle 推理模型及 ONNX 格式,适配本地或移动端部署。

3. 开放 API/MCP 远程调用

  • 获取 Token:复制个人 Access Token 即可使用。
  • 批量服务:服务端支持批量识别 PDF/图片,适合程序自动化处理。
  • 返回结构:提供包含文字、坐标、置信度的结构化 JSON 数据。

4. 配套资源库

  • 预训练模型:预置 PP-OCRv4、PaddleOCR-VL 多模态文档解析模型。
  • 学习资源:提供免费数据集、完整教程及可直接 Fork 运行的案例项目。

三、适用人群与场景

✅ 适合人群

  1. 学生与算法新手:零成本学习 OCR 技术、深度学习模型训练。
  2. 个人办公用户:日常扫描 PDF、证件、票据的文字提取需求。
  3. 中小开发者:快速验证 OCR 需求、实现批量识别、进行私有化模型训练。
  4. 中小企业:内部文档数字化、票据识别场景,低成本验证业务方案。

❌ 不适合场景

  1. 高并发商用生产:免费 API 每日额度有限,高流量业务需切换至百度智能云付费 OCR。
  2. 离线无网环境:AI Studio 依赖云端算力,若需离线使用,必须本地部署 PaddleOCR。

四、免费 & 付费详情

1. AI Studio 云端算力(Notebook 运行)

  • 免费规则:每日发放 8 点 GPU 算力(对应 V100 16G),1 算力=1 小时。
  • 有效期:24 小时。
  • CPU 环境:永久不限时。
  • 额外获取:签到、做任务、参赛可兑换额外算力卡。
  • 存储空间:固定 100G 免费。
  • 付费扩容:算力不足时可购买付费算力卡。
  • 定价页:https://aistudio.baidu.com/aistudio/pay

2. PaddleOCR 网页在线识别(前端体验页)

  • 识别次数:登录账号后 无限次 免费识别。
  • 未登录状态:每日提供 3 次 试用,无收费项目。
  • 网址:https://aistudio.baidu.com/paddleocr

3. AI Studio 开放 API 调用

  • 免费额度:单模型每日 3000 页 PDF/图片识别。
  • 单次限制:单次最多处理 100 页。
  • 超量处理:超出额度将返回 429 限流错误。
  • 商用扩容:需跳转 百度智能云文字识别 按量计费。

4. 开源代码包(本地 pip 安装)

  • 费用:永久完全免费。
  • 限制:无任何调用额度、商用限制。

五、快速使用步骤

方式 1:零代码网页识别(最快上手)

  1. 打开网址:https://aistudio.baidu.com/paddleocr。
  2. 使用百度账号登录。
  3. 上传图片或 PDF 文件,系统自动执行版面解析与文字识别。
  4. 在线修改识别错误后,导出为 JSON/TXT/Markdown 格式。

方式 2:Notebook 代码训练/推理(开发模式)

  1. 进入 AI Studio 首页,创建新项目,选择 Python Notebook。
  2. 运行以下代码拉取 PaddleOCR 并安装依赖:
  3. python
!git clone https://gitee.com/paddlepaddle/PaddleOCR.git
%cd PaddleOCR
!pip install -r requirements.txt
from paddleocr import PaddleOCR
# 初始化模型,开启角度分类,选择中文语言包
ocr = PaddleOCR(use_angle_cls=True, lang="ch")
# 进行图片识别
res = ocr.ocr("test.jpg", cls=True)
!git clone https://gitee.com/paddlepaddle/PaddleOCR.git
%cd PaddleOCR
!pip install -r requirements.txt
from paddleocr import PaddleOCR
# 初始化模型,开启角度分类,选择中文语言包
ocr = PaddleOCR(use_angle_cls=True, lang="ch")
# 进行图片识别
res = ocr.ocr("test.jpg", cls=True)
  1. 上传自有数据集,执行微调训练脚本,最后导出模型权重。

方式 3:API 批量调用(自动化)

  1. 在控制台找到并复制个人 Access Token。
  2. 在程序中调用官方接口,将图片转为 Base64 编码传参。
  3. 接收包含结构化文字、坐标、置信度的 JSON 响应。

六、避坑点与注意事项

⚠️ 算力时效管理

  • 每日发放的算力 24 小时清零。
  • 建议:优先消耗快过期的算力;大模型训练建议集中当日算力一次性跑完,不要拆分多天。

⚠️ API 额度限制

  • 免费每日上限 3000 页。
  • 批量处理大批量文件容易触发 429 限流。
  • 建议:正式商用业务务必切换到百度智能云付费 OCR 服务。

⚠️ 文件大小与存储

  • PDF 限制:网页单 PDF 上限 500 页。
  • 图片限制:单图大小不超过 20MB。
  • 超大文件处理:建议本地分割后分块上传。
  • 存储上限:总存储空间 100G。数据集、模型占用过高会导致无法上传新文件,请定期清理无用图片和权重包。

⚠️ 网络与环境问题

  • 拉取代码:国内网络偶尔超时,建议切换 百度镜像源。
  • GPU 问题:若遇到 GPU 内核卡死,尝试重启内核即可恢复。

⚠️ 微调门槛与商用授权

  • 数据标注:自定义数据集需严格规范标注格式,标注错误会导致识别精度暴跌。新手建议优先使用预训练模型推理。
  • 授权区分:AI Studio 云端 API 仅用于学习验证;正式商用必须购买百度智能云 OCR 服务;本地开源 PaddleOCR 无商用限制。

⚠️ 移动端部署限制

  • AI Studio 仅负责训练和导出模型。
  • 注意:无法直接打包 APP,需自行搭配 Paddle Lite 进行移动端部署。

附:API 返回极简 JSON 示例

json

{
    "code": 0,
    "msg": "success",
    "data": [
        {
            "text_box": [[10,20],[300,20],[300,50],[10,50]],
            "text": "百度 AI Studio PaddleOCR",
            "score": 0.987
        }
    ]
}
{
    "code": 0,
    "msg": "success",
    "data": [
        {
            "text_box": [[10,20],[300,20],[300,50],[10,50]],
            "text": "百度 AI Studio PaddleOCR",
            "score": 0.987
        }
    ]
}


评论

暂无评论