文档工具 · OCR 识别

PDF OCR

扫描版 PDF→可搜索文本(Tesseract)

本地处理 · 不上传 免费 · 无需登录 无次数限制 累计 97 次使用
pdf.js · Tesseract · 浏览器本地
拖入 / 点击选择 PDF 文件

数字 PDF 直接提取文本层(快准)· 扫描件 PDF 自动用 OCR 识别
全程浏览器本地处理,文件不上传任何服务器

Processed locally in your browser — PDF never uploaded
上传一个 PDF 文件后,在此选择页范围并开始处理。
全程浏览器本地处理,PDF 不上传任何服务器。
隐私:PDF 渲染引擎(pdf.js)与 OCR 引擎(Tesseract WebAssembly)及中英文语言包均随本站本地分发, 全过程在你的浏览器内完成,文件不会上传任何服务器。关闭页面即清空。
就绪 · 拖入或选择一个 PDF 文件开始
第一节

关于本工具

About

扫描版 PDF 里那些清晰但无法选取的文字——合同、论文、古籍影印——等于一张不能搜索的图片。这个工具用 Tesseract 引擎在服务器端逐页识别,输出可复制、可检索的文本层。识别质量取决于原图清晰度:300 DPI 以上的扫描件准确率最高;手写体或低分辨率图会有漏字。文件上传后自动处理,处理完即删。

使用场景

合同扫描件检索

法务助理小陈收到客户发来的 30 页盖章合同扫描件,要找出其中关于「违约金」的条款。手动翻看每页图片耗时且容易漏看。将扫描件拖入本工具,Tesseract 引擎在 15 秒内将图片转为可搜索文本,直接 Ctrl+F 定位到第 17 页的违约金段落,比逐页翻看节省 80% 时间,且不丢失原排版。

古籍数字化整理

地方志研究者老赵手头有 200 页民国时期县志扫描件,需要提取其中「田赋」「户口」章节做数据分析。原计划外包给打字社,报价每页 3 元且需 3 天。用本工具批量上传后,Tesseract 自动识别繁体竖排文字,生成带原始页码的 TXT 文件,半小时完成,零成本,且识别出的数字可直接导入 Excel 做统计。

病历报告文字提取

患者家属王女士拿到三甲医院的出院小结和化验单扫描件,想发给外地医生看,但图片格式无法直接粘贴到微信聊天框。用本工具将 6 张图片转为纯文本后,直接复制到对话框,医生在手机端能直接搜索「白细胞」「转氨酶」等关键词,不用反复放大图片找数据,沟通效率提升一倍。

发票归档自动命名

会计小刘每月要处理 500 张电子发票扫描件,按「公司+日期+金额」手动重命名文件,每张耗时 30 秒。将扫描件批量导入本工具,Tesseract 识别出发票号、开票日期和金额后,用「复制文本」功能粘贴到 Excel 表格,配合公式自动生成文件名,批量重命名时间从 4 小时压缩到 20 分钟。

外文菜单翻译准备

餐厅老板老李拿到意大利供应商发来的 12 页进口食材清单扫描件,全是意大利语。想用翻译软件处理,但图片格式无法直接粘贴。先用本工具将扫描件转为可复制文本,再整段粘贴到谷歌翻译,15 分钟完成全部翻译,比逐字手打节省 90% 时间,且避免手动输入拼写错误。

第二节

使用指南

Getting Started

使用步骤

  1. 1上传扫描版 PDF 文件(支持单文件,大小不超过 50 MB),页面显示文件名与文件大小
  2. 2点击「开始识别」按钮,进度条显示 OCR 处理进度,完成后自动跳转至结果页
  3. 3在结果页预览识别后的可搜索文本,支持高亮显示识别出的文字区域
  4. 4点击「下载文本」按钮,将识别结果保存为 .txt 文件;或点击「复制全文」直接粘贴到其他应用

输入输出示例

输入输出说明
上传一份 3 页的扫描版合同 PDF(含手写签名和印刷体混合)输出一个可搜索的 PDF,其中印刷体文字(如“甲方”、“乙方”、“金额”)被准确识别为可选中文本,手写签名部分未识别为文字,仍为图像。常规:扫描件最常见的场景——印刷体为主、少量手写。Tesseract 对印刷体识别率高,但手写体基本不识别,用户需了解此限制。
上传一份 1 页的纯黑白扫描版报纸 PDF(字体为宋体,字号 10pt)输出可搜索 PDF,正文文字(如“新华社北京电”)被准确提取,但部分小字号标点(如句号、逗号)可能被误识别为空格或缺失。常规:黑白扫描件、标准字体。Tesseract 对常见字体识别良好,但极小字号或低对比度标点可能出错,提示用户检查标点。
上传一份 50 页的扫描版书籍 PDF(每页约 300KB,总大小约 15MB)输出可搜索 PDF,处理时间约 2-3 分钟(取决于服务器负载),所有页面文字被提取,但第 12 页因页面折痕导致部分文字(约 5 个汉字)被识别为乱码。边界:多页大文件。工具基于 Tesseract 逐页处理,总时间与页数正相关;物理缺陷(折痕、污渍)会导致局部识别错误,用户应检查关键页。
上传一份扫描版 PDF,内容为一张纯图片(如风景照,无文字)输出一个与原图相同的 PDF,无任何可选中文字。边界:无文字输入。工具不会报错,但输出无意义,用户需自行确认文件是否包含可识别文字。
上传一份扫描版 PDF,文字为竖排中文(如古籍排版,从右到左、从上到下)输出可搜索 PDF,但文字被按横排顺序提取,例如“君不见黄河之水天上来”被识别为“君不见黄河之水天上来”(顺序错误,实际应为竖排阅读顺序)。易错:竖排文字。Tesseract 默认不支持竖排文本方向检测,输出顺序混乱,用户需手动调整或使用专用竖排 OCR 工具。
上传一份扫描版 PDF,内容为英文与中文混合(如“PDF OCR 工具使用说明”)输出可搜索 PDF,中英文均被识别,但英文单词“OCR”可能被误识别为“0CR”(数字 0 代替字母 O)或“OCR”被完整保留。易错:中英文混合。Tesseract 的默认语言包(chi_sim+eng)对常见词识别较好,但特殊缩写(如 OCR、API)可能因字体或分辨率导致误识别。
上传一份扫描版 PDF,文字背景为深色(如红底白字)输出可搜索 PDF,但部分白色文字未被识别,背景红色区域被误判为图像噪声,导致文字缺失约 30%。易错:低对比度或反色文字。Tesseract 对高对比度(黑底白字或白底黑字)表现最佳,深色背景会显著降低识别率,用户应优先使用高对比度扫描件。

常见错误对照

1.扫描件分辨率过低导致 OCR 识别率骤降

✗ 错误用 72 DPI 的手机拍照扫描件直接上传
✓ 修复扫描或拍照时设置 300 DPI,或上传前用图像处理工具将分辨率提升至 300 DPI

Tesseract 的识别引擎对低分辨率(<200 DPI)图像特征提取困难,字符边缘模糊导致大量误识别。300 DPI 是文档 OCR 的行业推荐基线。

2.彩色背景/水印未预处理,文字被当成噪声过滤

✗ 错误上传带浅色水印或渐变背景的扫描 PDF
✓ 修复先用图像编辑软件或在线工具将图像转为二值(黑白)模式,去除背景干扰

Tesseract 内部二值化算法对复杂背景敏感,水印区域可能被误判为文字或直接丢弃,导致漏字。预处理成纯黑白可大幅提升召回率。

3.图像倾斜超过 5 度未校正,行识别串位

✗ 错误扫描时纸张歪斜 10 度,直接上传
✓ 修复先用工具做自动倾斜校正(如 OpenCV 的 deskew 函数),或手动旋转至水平

Tesseract 的版面分析假设文字行大致水平,倾斜角度过大时行分割失败,相邻行文字会混在一起,输出乱序。

4.中英文混排未指定语言参数,默认只识别英文

✗ 错误上传中英文混合的扫描件,不设置语言参数
✓ 修复在工具的语言下拉框中选择「chi_sim+eng」或手动传入 -l chi_sim+eng

Tesseract 默认语言包仅含英文。不指定中文语言包时,中文字符会被识别为乱码或空白。多语言需用 + 号组合。

5.表格/多栏排版未开启版面分析,文字顺序错乱

✗ 错误上传双栏排版的学术论文,直接获取识别结果
✓ 修复开启工具的「版面分析」选项(PSM 模式设为 4 或 6),或先手动裁剪分栏

Tesseract 默认按单栏顺序读取,双栏排版会被当成一列从左到右读取,导致栏间文字交叉错位。PSM 4 可自动检测多栏布局。

6.手写体/艺术字体当印刷体识别,结果不可用

✗ 错误上传手写签名或手写笔记的扫描件
✓ 修复仅上传印刷体文档;手写内容需使用专用手写识别引擎(如 MyScript)

Tesseract 基于印刷体字符特征训练,对手写体无专门模型。手写字符变形大、连笔多,识别准确率通常低于 30%。

7.PDF 本身已是文本层(非扫描),重复 OCR 产生双重重影

✗ 错误上传由 Word 直接导出的 PDF(含可选文字)
✓ 修复确认 PDF 属性中「是否包含文本层」;若已有文本层,直接复制文字即可,无需 OCR

Tesseract 在已有文本层的 PDF 上叠加 OCR 结果,会导致原文与识别文字重叠,输出混乱。可用 pdfinfo 命令检查是否有文本层。

8.输出格式选纯文本,丢失原有排版信息

✗ 错误需要保留表格结构或字体位置时,选择 .txt 输出
✓ 修复选择 .hocr 或 .pdf(可搜索 PDF)输出,保留坐标和段落信息

纯文本格式仅保留字符序列,丢弃所有坐标、字体、段落信息。后续排版重建需额外解析,增加工作量。

第三节

工作原理

How It Works

核心公式

置信度 = (匹配字符数 ÷ 总字符数) × 100%

变量说明

  • 匹配字符数OCR 识别后与原文一致的字符数
  • 总字符数扫描页中实际文本字符总数

示例

扫描页含 1200 个字符,Tesseract 识别后正确匹配 1140 个字符:置信度 = (1140 ÷ 1200) × 100% = 95%。该值用于衡量识别准确率,95% 以上通常无需人工校对。

上传扫描版PDF图像预处理去噪 / 二值化OCR识别Tesseract引擎文本提取按页排序生成可搜索PDF用户输入服务端处理输出结果
用户输入 服务端处理 输出结果
第五节

常见问题

Q & A
扫描的 PDF 图片转出来全是乱码,是不是工具坏了?

不是工具坏了,是图片本身质量不够。Tesseract OCR 对图片清晰度、对比度、文字排列都有要求。如果原 PDF 是手机拍的书页、有阴影或字体太小(<10px),识别率会骤降。建议先做两步:1) 用图片编辑软件把页面调成黑白高对比、旋转正;2) 如果原图分辨率低于 200 DPI,先用其他工具把 PDF 转成 300 DPI 的图片再上传。本工具后端接收图片后会做自动预处理,但底图太差也救不回来。

上传的 PDF 有几十页,处理到一半卡住不动了怎么办?

本工具每页独立处理,卡住通常是某一页图片体积过大(单页超过 10MB)或服务器资源排队。可以尝试:1) 把 PDF 拆成 10 页以内的子文件分批上传,每批处理时间约 30-60 秒;2) 检查原 PDF 是否加密或有保护,本工具无法处理有密码的文档;3) 如果卡顿超过 2 分钟,刷新页面重新上传即可,后端不会重复计算已完成的页。

为什么识别出来的文字里夹杂了很多符号和空格?

Tesseract 在处理扫描件中的噪点、水印、页眉页脚时,会把非文字区域误判为字符。例如浅色底纹上的斑点可能被识别为句号或逗号,页脚页码旁边的装饰线可能变成一串横线。解决办法:上传前先用 PDF 编辑器去除背景水印和页脚装饰;如果已经上传,可以在结果文本中用正则替换(如 `[^\u4e00-\u9fa5a-zA-Z0-9]` 批量去除非文字符号)。本工具暂不支持自动去噪。

这个工具的 OCR 和 Adobe Acrobat 自带的比,哪个准?

对于 300 DPI 以上的清晰扫描件,两者差距不大,Tesseract 的中文识别率在 95% 以上。但 Adobe Acrobat 有商业级的版面分析和字体还原能力,遇到复杂排版(多栏、表格、旋转文字)时准确率更高;本工具基于开源 Tesseract,适合纯文字段落、单栏排版的文档。如果追求版面还原(如保留表格结构),建议用 Acrobat;如果只是提取文字内容做搜索或复制,本工具免费且足够用。

上传的 PDF 是竖排繁体古籍,能识别吗?

Tesseract 默认训练模型主要针对横排简体,对竖排繁体古籍的识别率很低(通常低于 60%)。本工具没有专门训练竖排或古籍字体,遇到这类文档建议先做人工预处理:用图片编辑软件将页面旋转 90 度变成横排,再上传。如果原文是繁体字,可以在设置里选择繁体中文语言包(本工具支持),但竖排字符顺序仍可能错乱,需要后期手动调整。

为什么我上传的 PDF 只有几 KB,但提示文件太大?

本工具限制的是单文件大小(最大 50MB),而不是页数。几 KB 的 PDF 通常是纯文本生成的(不是扫描件),这类文件没有图片层,本工具无法处理。真正扫描版 PDF 即使只有 1 页,分辨率高时也可能超过 5MB。建议先确认文件属性:右键→属性→查看是否包含图片对象。如果不含图片,直接用其他工具复制文本即可,不需要 OCR。

处理完下载的文本里,英文单词被拆得乱七八糟,怎么办?

这是 Tesseract 的常见短板——中文模型遇到中英混排时,英文单词常被按字母拆分(如 'hello' 变成 'h e l l o')。如果文档以英文为主,上传前在工具设置里切换语言模型为 'eng'(纯英文)或 'chi_sim+eng'(中英混排),可以明显改善。如果已经处理完,可以在结果中手动用正则 `\b([a-zA-Z])\s+(?=[a-zA-Z])` 合并被拆散的字母。

这个工具会把我的 PDF 存到服务器吗?会不会泄露隐私?

后端处理流程是:上传→OCR 识别→返回文本→立即删除原始 PDF 和中间图片。服务器不保留任何文件,处理过程在内存中完成,完成后 30 分钟内自动清理临时目录。但注意:传输过程使用 HTTPS 加密,如果文档包含高度敏感信息(身份证、合同原件),建议在本地用离线 OCR 工具处理。本工具不记录上传者 IP 或文件名。

隐私保证所有计算与处理均在你的浏览器本地完成,输入数据不会上传服务器,也不会保存或共享。

选择 打开 +新窗口 esc关闭