本次和大家分享一个非常热门强大的PDF文件内容OCR识别软件OCRmyPDF,这个软件可以将PDF内不可搜索的图片和文字识别转换为可复制可搜索的文本,并对PDF文件进行优化。

OCRmyPDF介绍
OCRmyPDF 为扫描的 PDF 文件添加 OCR 文本层,以便搜索
- 从常规 PDF生成可搜索的PDF/A文件
- 将 OCR 文本准确放置在图像下方,以方便复制/粘贴
- 保持原始嵌入图像的精确分辨率
- 如果可能,以“无损”操作插入 OCR 信息,而不会破坏任何其他内容
- 优化 PDF 图像,通常生成比输入文件更小的文件
- 如果需要,在执行 OCR 之前校正和/或清理图像
- 验证输入和输出文件
- 将工作分配到所有可用的 CPU 核心
- 使用Tesseract OCR引擎识别100多种语言
- 保护您的私人数据不受侵犯。
- 适当扩展以处理数千页的文件。
- 经过数百万份 PDF 的实战测试。
OCRmyPDF整合包使用说明
OCRmyPDF依赖其它外部程序Ghostscript和Tesseract,网盘内有安装程序,全程保持默认安装即可
安装Tesseract最后一步会自动下载英文的语言包文件,有的人可能会无法下载,可以直接cancel取消跳过,到我网盘里下载需要的语言包放到Tesseract安装目录内的tessdata文件夹内
然后将软件压缩包OCRmyPDF.7z下载到本地电脑上并解压,然后双击【启动软件.exe】打开软件
首先选择待处理文件,可以是PDF也可以是图片,也可以输入文件夹路径批量处理文件夹内所有文件。
批处理功能做的比较简单,所有文件是同时处理的,所以建议待处理的文件夹内不要有太多文件,否则可能会比较卡。而且待处理文件夹内不要有PDF和图片以外的文件。如果待处理的文件夹内有图片,批量处理还要设置【图片DPI】值
【OCR语言】默认只支持英文,识别其它语言的话需要下载支持文件.traineddata,常见语言网盘里有,把.traineddata格式文件下载到tesseract安装目录tessdata文件夹内,语言代码如下:
简体中文:chi_sim
繁体中文:chi_tra
德语:deu
法语:fra
日语:jpn
韩语:kor
俄语:rus
泰语:tha
缅甸语:vie
识别英语可以不用填写,识别其它语言的话需要在输入框中输入语言代码。如果是多种语言的话可以混合输入,识别中英文的话可以输入:eng+chi_sim
其它国家语言代码对照表:https://nuowa.net/1796
其它语言包文件下载链接:https://github.com/tesseract-ocr/tessdata
【重新OCR】强制对每页重新渲染并 OCR
【跳过文本】跳过已有文本的页面(仅处理纯图片页)
【重新OCR】和【跳过文本】不可同时选中
【校正倾斜】自动校正页面倾斜(提升 OCR 准确率),比如扫描出的PDF文档内容是倾斜的,可以开启此项功能
【清理伪影】清理扫描伪影(如黑边、噪点)并将处理后的图像嵌入最终 PDF
如果需要使用【清理伪影】功能,则电脑上需要安装unpaper,unpaper安装步骤如下:
首先安装Chocolatey,以 管理员身份 打开 PowerShell,运行以下命令:
Set-ExecutionPolicy Bypass -Scope Process -Force; [System.Net.ServicePointManager]::SecurityProtocol = [System.Net.ServicePointManager]::SecurityProtocol -bor 3072; iex ((New-Object System.Net.WebClient).DownloadString('https://chocolatey.org/install.ps1'))
安装完成后关闭终端,再重新打开终端,然后运行下面命令:
choco install unpaper
【图片DPI】处理图片文件的话要指定该值
【输出格式】默认输出 pdfa 存档,pdf格式修改最小,还有pdfa-1,pdfa-2,pdfa-3等
【标题】自定义 PDF 元数据标题
【指定页面】只处理指定的PDF页面,填数字如1,2,5-8,逗号和连字符都要用英文符号
【线程数】设置并行线程数(默认使用所有 CPU 核心)
【输出txt】生成独立的txt格式的OCR 文本文件(用于校对或文本分析)
【图像压缩级别】0无压缩,3最高压缩(最大节省空间)
使用【图像压缩级别】功能的话,电脑上需要安装pngquant, PowerShell运行下面命令安装
choco install pngquant
视频教程及效果演示:https://nuowa.net/1799
注意事项
整合包只支持windows10或11
软件运行路径中不要有非英文字符和空格,待处理文件同样要注意
PDF OCR识别转文本软件OCRmyPDF下载链接
相关推荐
最近更新

FlashVSR低分辨率模糊视频高清放大工具整合包v1.1下载,免安装一键启动
FlashVSR-一款高性能可靠的视频超高分辨率放大工具。迈向基于扩散的实时流式视频超分辨率——一种高效的单步扩散框架,用于具有局部约束稀疏注意力和小型条件解码器的流式VSR。 FlashVSR官方介绍 扩散模型最近在视频修复方面取得了进展...

VibeVoice:富有表现力的长篇多人对话语音合成工具整合包下载
VibeVoice是微软开发的一款富有表现力的长篇多人对话语音合成工具。支持1-4个发音人,支持声音克隆自定义音色合成语音,我制作了最新的本地免安装一键启动整合包及云端在线版。 VibeVoice介绍 VibeVoice:一种前沿的长对话文...

多图编辑人物一致性图片合成处理工具Qwen-Image-Edit-2509整合包下载,人物换装换姿势动作软件
Qwen-Image 是一个功能强大的图像生成基础模型,能够进行复杂的文本渲染和精确的图像编辑。Qwen-Image-Edit-2509是Qwen-Image-Edit的月度更新版本,增加了多图编辑和单图一致性生成功能。 Qwen-Imag...
摸鱼神器windows电脑隐藏任务栏软件图标工具rbtray下载
本次和大家分享一个摸鱼神器rbtray。 windows电脑软件运行的时候会在屏幕底部的任务栏上有一个软件图标,如果你开了哪个软件又不想被别人看到你正在运行这个软件的话,那么这个神器rbtray就非常适合你了。 rbtray可以快速将软件图...

人物动作迁移及视频人物替换软件Wan2.2-Animate-14B整合包下载,动作模仿视频换主体工具在线一键启动
本次和大家分享一个非常强大的动作模仿及视频人物替换工具Wan2.2-Animate-14B,Wan-Animate接受一个视频和一个角色图像作为输入,并生成一个动作模仿或人物替换的视频,视频自然流畅,可玩性非常高。 Wan2.2-Anima...

无限长度的数字人对话视频生成软件InfiniteTalk整合包,图像转视频、视频配音对口型工具
InfiniteTalk是一款发布不久的数字人视频制作软件,软件可以通过音频驱动将一张图片合成为一段视频,或是将视频与音频整合成一段新视频,实现音频唇形同步,是一个非常强大的对口型工具。 InfiniteTalk官方介绍 我们提出了一种新颖...
UV包管理器用法基础教程
UV是一个用 Rust 编写的高性能工具,旨在替代 Python 传统的包管理工具链,速度比 pip 和 Conda 快数十甚至上百倍。 安装 uv 你可以通过一条命令安装 uv: 安装后,...

一句话编辑图片工具OmniGen2整合包下载,输入文本快速P图
和大家分享一个高效强大的一句话P图软件OmniGen2,这个软件可以通过输入一段描述词然后直接对图片内容进行修改,就像PS修图一样,但是操作起来更简单方便。我基于当前最新版本制作了windows版免安装一键启动整合包。 OmniGen2官方...

Wan2.2-S2V-14B:音频驱动图片转视频生成本地整合包及在线一键启动
Wan2.2-S2V-14B是阿里通义团队开源的一个视频生成模型,可以通过音频驱动将图片合成为一段人物讲话视频,人物讲话内容就是音频素材内容。同时支持cosyvoice声音克隆的文字转语音合成。 Wan2.2-S2V-14B官方介绍 Wan...
pixi包管理器简易教程系列:pypi方法安装pytorch
pytorch可以从conda-forge安装,也可以从Pypi安装,看到目前官方页面上安装命令里已经不提供conda的安装命令了,只有pip命令,所以这里用pypi方式安装。 打开项目文件夹内的pixi.toml文件,添加下面命令要求 执...











