本次和大家分享一个非常热门强大的PDF文件内容OCR识别软件OCRmyPDF,这个软件可以将PDF内不可搜索的图片和文字识别转换为可复制可搜索的文本,并对PDF文件进行优化。

OCRmyPDF介绍
OCRmyPDF 为扫描的 PDF 文件添加 OCR 文本层,以便搜索
- 从常规 PDF生成可搜索的PDF/A文件
- 将 OCR 文本准确放置在图像下方,以方便复制/粘贴
- 保持原始嵌入图像的精确分辨率
- 如果可能,以“无损”操作插入 OCR 信息,而不会破坏任何其他内容
- 优化 PDF 图像,通常生成比输入文件更小的文件
- 如果需要,在执行 OCR 之前校正和/或清理图像
- 验证输入和输出文件
- 将工作分配到所有可用的 CPU 核心
- 使用Tesseract OCR引擎识别100多种语言
- 保护您的私人数据不受侵犯。
- 适当扩展以处理数千页的文件。
- 经过数百万份 PDF 的实战测试。
OCRmyPDF整合包使用说明
OCRmyPDF依赖其它外部程序Ghostscript和Tesseract,网盘内有安装程序,全程保持默认安装即可
安装Tesseract最后一步会自动下载英文的语言包文件,有的人可能会无法下载,可以直接cancel取消跳过,到我网盘里下载需要的语言包放到Tesseract安装目录内的tessdata文件夹内
然后将软件压缩包OCRmyPDF.7z下载到本地电脑上并解压,然后双击【启动软件.exe】打开软件
首先选择待处理文件,可以是PDF也可以是图片,也可以输入文件夹路径批量处理文件夹内所有文件。
批处理功能做的比较简单,所有文件是同时处理的,所以建议待处理的文件夹内不要有太多文件,否则可能会比较卡。而且待处理文件夹内不要有PDF和图片以外的文件。如果待处理的文件夹内有图片,批量处理还要设置【图片DPI】值
【OCR语言】默认只支持英文,识别其它语言的话需要下载支持文件.traineddata,常见语言网盘里有,把.traineddata格式文件下载到tesseract安装目录tessdata文件夹内,语言代码如下:
简体中文:chi_sim
繁体中文:chi_tra
德语:deu
法语:fra
日语:jpn
韩语:kor
俄语:rus
泰语:tha
缅甸语:vie
识别英语可以不用填写,识别其它语言的话需要在输入框中输入语言代码。如果是多种语言的话可以混合输入,识别中英文的话可以输入:eng+chi_sim
其它国家语言代码对照表:https://nuowa.net/1796
其它语言包文件下载链接:https://github.com/tesseract-ocr/tessdata
【重新OCR】强制对每页重新渲染并 OCR
【跳过文本】跳过已有文本的页面(仅处理纯图片页)
【重新OCR】和【跳过文本】不可同时选中
【校正倾斜】自动校正页面倾斜(提升 OCR 准确率),比如扫描出的PDF文档内容是倾斜的,可以开启此项功能
【清理伪影】清理扫描伪影(如黑边、噪点)并将处理后的图像嵌入最终 PDF
如果需要使用【清理伪影】功能,则电脑上需要安装unpaper,unpaper安装步骤如下:
首先安装Chocolatey,以 管理员身份 打开 PowerShell,运行以下命令:
Set-ExecutionPolicy Bypass -Scope Process -Force; [System.Net.ServicePointManager]::SecurityProtocol = [System.Net.ServicePointManager]::SecurityProtocol -bor 3072; iex ((New-Object System.Net.WebClient).DownloadString('https://chocolatey.org/install.ps1'))
安装完成后关闭终端,再重新打开终端,然后运行下面命令:
choco install unpaper
【图片DPI】处理图片文件的话要指定该值
【输出格式】默认输出 pdfa
存档,pdf
格式修改最小,还有pdfa-1,pdfa-2,pdfa-3等
【标题】自定义 PDF 元数据标题
【指定页面】只处理指定的PDF页面,填数字如1,2,5-8,逗号和连字符都要用英文符号
【线程数】设置并行线程数(默认使用所有 CPU 核心)
【输出txt】生成独立的txt格式的OCR 文本文件(用于校对或文本分析)
【图像压缩级别】0无压缩,3最高压缩(最大节省空间)
使用【图像压缩级别】功能的话,电脑上需要安装pngquant, PowerShell运行下面命令安装
choco install pngquant
视频教程及效果演示:https://nuowa.net/1799
注意事项
整合包只支持windows10或11
软件运行路径中不要有非英文字符和空格,待处理文件同样要注意
PDF OCR识别转文本软件OCRmyPDF下载链接
相关推荐
最近更新

免费在线视频去水印工具方法
本次分享一个免费的在线视频去水印工具–记灵 这个在线工具目前是完全免费的,上传mp4视频文件,然后鼠标框选去水印区域,然后点击处理等待处理完成就可以了,操作非常简单。 这个去水印工具是采用打码的方式覆盖原水印区域的,并不是AI智...

即梦AI(可灵)视频制作9种电影级运镜提示词,小白秒变大导演
视频制作方式多种多样,想做出一个观感体验极佳的精彩视频,运镜效果少不了。这里整理了9种实用的电影级运镜方式,学会这些运镜小白也可以成为大导演。你可以将这些运镜效果用在即梦或可灵AI中视频生成的时候,提供了运镜参考关键词,如果不会写关键词的,...

带声音克隆功能的对话型文字转语音软件higgs-audio免安装一键启动整合包下载
higgs-audio是本月刚发布的一款非常强大的文字转语音工具,上线不到一个月就获得了5.9K个星,可以说是非常热门的项目了。这个软件可以实现文字转语音及声音克隆功能,不过可以实现这个功能的这类软件很多,higgs-audio只是说好一点...

本地离线翻译软件LibreTranslate免安装一键启动包下载
LibreTranslate是一款热门的免费本地离线翻译软件,无需联网,方便某些电脑无法联网但需要进行翻译的场景使用。我制作了最新版免安装一键启动整合包,下载解压即用。 LibreTranslate介绍 免费开源机器翻译 API,完全自托管...

抖音出品高质量声音克隆文字转语音合成软件MegaTTS3整合包下载
MegaTTS3是抖音团队联合国内其他大学研发的一款语音合成及声音克隆应用,可实现零样本语音克隆及富有情感的自然语音合成。我基于当前最新版制作了免安装一键启动整合包。 MegaTTS3介绍 MegaTTS 3 是字节跳动(ByteDance...

副业变现项目分享20250709期

有声读物制作软件audiblez整合包下载,将epub电子书转为m4b有声书
和大家分享一个方便快捷的有声书制作软件audiblez,audiblez可以将epub格式电子书快速转为m4b有声书,支持合成中文,英语,日语等八国语言语音,本地离线操作,不依赖云端服务。我基于最新版制作了免安装一键启动整合包。 audib...

百度夸克webdav服务+alist+RaiDrive,将网盘挂载为本地电脑硬盘方法教程
由于每天都要操作网盘不下十几次,频繁启动网盘比较麻烦。 使用百度夸克网盘的webdav服务可以将百度夸克网盘挂载到本地电脑上,就像操作本地电脑硬盘一样操作网盘,非常方便。我们以alist+raidrive为例演示。 首先打开百度网盘pan....

Unreal Engine 5恐怖游戏设计制作教程,从入门到精通从零开始完整项目开发详细讲解,中英文字幕
和大家分享一个以前收集的UE5虚幻引擎恐怖游戏开发教程,这是国外一个大神制作的视频教程,教程从零开始到制作出一款完整的游戏。内容讲解全面,如蓝图基础知识讲解、角色控制、高级交互系统、高级库存系统、物品检查、恐怖环境氛围设计、过场动画、AI系...

PDF/图片转markdown软件MonkeyOCR整合包,文档图片解析工具下载
MonkeyOCR是上个月刚发布的一款文档解析工具,可以将PDF文档或图片识别转换为markdown格式文件。官方测试显示性能极佳。我基于当前最新版制作了免安装一键启动整合包,支持批量操作,并降低了显卡要求。 MonkeyOCR官方介绍 M...