您现在的位置是:亿华云 > 应用开发
Github Star 10k,超级好用的 OCR 数据合成与半自动标注工具
亿华云2025-10-09 12:56:48【应用开发】9人已围观
简介一、导读OCR方向的工程师,一定需要知道这个OCR开源项目:PaddleOCR短短几个月,累计Star数量已超过10k,频频登上Github Trending 日榜月榜,称它为 OCR方向目前最火的r
一、超成半导读
OCR方向的好据合工程师,一定需要知道这个OCR开源项目:PaddleOCR
短短几个月,自动累计Star数量已超过10k,标注
频频登上Github Trending 日榜月榜,工具
称它为 OCR方向目前最火的超成半repo绝对不为过。
最近,好据合它又带来四大新发布与升级:
核心内容先睹为快:
全新发布数据合成工具Style-Text: 可以批量合成大量与目标场景类似的自动图像,在多个场景验证,标注效果均提升15%以上。工具 全新发布半自动数据标注工具PPOCRLabel: 有了它数据标注工作事半功倍,超成半相比labelimg标注效率提升60%以上,好据合社区小规模测试,自动好评如潮。标注 多语言识别模型效果升级: 在开源测试集评估,工具中文、英文、韩语、法语、德语、日文识别效果均优于EasyOCR。 PP-OCR开发体验再升级: 支持动态图开发(训练调试更方便),静态图部署(预测效率更高),鱼与熊掌可以兼得。二、PaddleOCR历史表现回顾
先看下PaddleOCR自去年6月开源以来,短短几个月在GitHub上的表现:
6月,8.6M超轻量模型发布,GitHub Trending 全球趋势榜日榜第一。 8月,香港云服务器开源CVPR2020顶会SOTA算法,再上GitHub趋势榜单! 10月,发布PP-OCR算法,开源3.5M超超轻量模型,再登Paperswithcode 趋势榜第一。这个含金量,广大的GitHub开发者们自然懂,3.5M超超轻量模型的效果图大家直接看,绝对杠杠的。
火车票、表格、金属铭牌、翻转图片、外语都是妥妥的,3.5M的模型能达到这个识别精度,绝对是良心之作了!
传送门:
Github:https://github.com/PaddlePaddle/PaddleOCR
那么最近的12月份更新,又给大家带来哪些惊喜呢?
三、全新发布OCR数据合成工具:Style-Text
相比于传统的数据合成算法,Style-Text可以实现特殊背景下的图片风格迁移,只需要少许目标场景图像,就可以合成大量数据,企商汇效果展示如下:
1、相同背景批量数据合成
2、相同文字批量数据合成
3、图片分离前景背景
除了拉风的效果,采用这样的合成数据和真实数据一起训练,可以显著提升特殊场景的性能指标,分别以两个场景为例:
怎么样,绝对是黑科技了吧。
这项能力核心算法是基于百度和华科合作研发的文本编辑算法《Editing Text in the Wild》https://arxiv.org/abs/1908.03047
不同于常用的基于GAN的数据合成工具,Style-Text主要框架包括 ①文本前景风格迁移模块 ②背景抽取模块 ③融合模块。经过这样三步,就可以迅速实现图片文字风格迁移啦。
四、超强OCR数据标注工具:PPOCRLabel
除了数据合成,数据标注也一直是深度学习开发者关注的重点,无论是从成本还是时间上面,提高标注效率,降低标注成本太重要了。
PPOCRLabel通过内置高质量的PPOCR中英文超轻量预训练模型,可以实现OCR数据的亿华云计算高效标注。CPU机器运行也是完全没问题的。
话不多说,直接看PPOCRLabel效果演示:
用法也是非常的简单,标注效率提升60%-80%是妥妥的。只能说,真的太香了。
五、最好的多语言模型效果
简单对比一下目前主流OCR方向开源repo的核心能力:
中英文模型性能及功能对比
其中,部分多语言模型性能及功能(F1-Score)对比(仅EasyOCR提供)
值得一提的是,目前已经有全球开发者通过PR或者issue的方式为PaddleOCR提供多语言的字典和语料,在PaddleOCR上已经完成了全球主流语言的广泛覆盖:包括中文简体、中文繁体、英文、法文、德文、韩文、日文、意大利文、西班牙文、葡萄牙文、俄罗斯文、阿拉伯文、印地文、维吾尔文、波斯文、乌尔都文、塞尔维亚文(latin)、欧西坦文、马拉地文、尼泊尔文、塞尔维亚文、保加利亚文、乌克兰文、白俄罗斯文、泰卢固文、卡纳达文、泰米尔文,也欢迎更多开发者可以参与共建。
六、PP-OCR开发体验再升级
动态图和静态图是深度学习框架常用的两种模式。在动态图模式下,代码编写运行方式符合Python程序员的习惯,易于调试,但在性能方面, Python执行开销较大,与C++有一定差距。
相比动态图,静态图在部署方面更具有性能的优势。静态图程序在编译执行时,预先搭建好的神经网络可以脱离Python依赖,在C++端被重新解析执行,而且拥有整体网络结构也能进行一些网络结构的优化。
飞桨动态图中新增了动态图转静态图的功能,支持用户使用动态图编写组网代码。预测部署时,飞桨会对用户代码进行分析,自动转换为静态图网络结构,兼顾了动态图易用性和静态图部署性能两方面优势。
七、良心出品的中英文文档教程
别的不需要多说了,大家访问GitHub点过star之后自己体验吧:
https://github.com/PaddlePaddle/PaddleOCR
很赞哦!(852)
相关文章
- 便宜域名使用如何?小白可以买到便宜域名吗?
- 如果你还在为前端的布局和JS头疼,你应该看看这篇连载文章
- 用PyQt打造具有专业外观的GUI(中篇)
- 并发编程之定时任务&定时线程池原理解析
- 在更换域名后,并不是就万事大吉了,我们需要将旧域名做301重定向到新域名上,转移旧域名的权重到新域名上。
- 为什么说,CAP是分布式理论的基础?
- 改善 Java 代码质量的工具与方法
- 前端: JavaScript 中的二叉树算法实现
- 2、根据用户基础选择访问提供程序。由于互联问题的存在,接入商的选择也非常重要,如果用户群主要在联通,尽量选择联通接入较好的接入商,如果用户群主要在电信,那么选择电信接入较好的接入商。如果用户组位于国家/地区,则选择更好的访问提供程序进行交互。
- 如何破解加密 zip 文件的密码
热门文章
站长推荐
众所周知,com域名拥有最大的流通市场和流通历史。最好选择com域名,特别是在购买域名时处理域名。其次可以是cn域名、net域名、org域名等主流域名,现在比较流行的王域名和顶级域名,都是值得注册和投资的。
2020征文-手机地图组件TinyMap来啦!鸿蒙上第一个开源地图组件
免费Python机器学习课程七:如何应对算法效果不佳
Ticker Or Sleep?定时执行的新选择
4.选择顶级的域名注册服务商
花5分钟看这篇之前,你才发现你不懂RESTful
12 个 GitHub 上超火的 JavaScript 项目,找到写 JavaScript 的灵感!
Python带你理解用于信号同步的CAZAC序列