关于python:大厂开源真香百度开源的超轻量级OCR工具库强大且实用

45次阅读

共计 671 个字符,预计需要花费 2 分钟才能阅读完成。

项目名称:PaddleOCR

我的项目作者:PaddlePaddle

开源许可协定:Apache-2.0

我的项目地址:https://gitee.com/paddlepaddle/PaddleOCR

我的项目简介

PaddleOCR 旨在打造一套丰盛、当先、且实用的 OCR 工具库,助力使用者训练出更好的模型,并利用落地。

PaddleOCR 是基于飞桨的 OCR 工具库,蕴含总模型仅 8.6M 的超轻量级中文 OCR,单模型反对中英文数字组合辨认、竖排文本辨认、长文本辨认。同时反对多种文本检测、文本辨认的训练算法。

我的项目个性

  • 超轻量级中文 OCR 模型,总模型仅 8.6M
  • 单模型反对中英文数字组合辨认、竖排文本辨认、长文本辨认
  • 检测模型 DB(4.1M)+ 辨认模型 CRNN(4.5M)
  • 应用通用中文 OCR 模型
  • 多种预测推理部署计划,包含服务部署和端侧部署
  • 多种文本检测训练算法,EAST、DB
  • 多种文本辨认训练算法,Rosetta、CRNN、STAR-Net、RARE
  • 可运行于 Linux、Windows、MacOS 等多种零碎

成果展现

算法介绍

1. 文本检测算法

2. 文本辨认算法

3. 端到端 OCR 算法

数据集

PaddleOCR 还为开发者们提供了多种数据集和工具供大家抉择应用

  • 通用中英文 OCR 数据集
  • 手写中文 OCR 数据集
  • 垂类多语言 OCR 数据集
  • 罕用数据标注工具
  • 罕用数据合成工具

有一说一,这次百度开源的这款 OCR 工具集的确十分不错,如果你对它也感兴趣,想要理解更多信息的话,那么就点击前面的链接返回我的项目主页看看吧:https://gitee.com/paddlepaddle/PaddleOCR

正文完
 0