← 返回工具

OCR 识别

让扫描 PDF 可搜索

此设备不支持 OCR

OCR 识别引擎需要较大的内存空间,iOS Safari、微信/QQ/抖音/小红书内置浏览器等环境会因为内存上限报错而无法运行。请用电脑浏览器(Chrome、Edge、Firefox 或 Mac 上的 Safari)打开本页面。

使用说明

用途

对扫描版 PDF 进行光学字符识别(OCR),把图像化的文字转换为真正的文字层,让 PDF 变为可全文搜索、可复制、可被「提取文字」处理的状态。识别模型在浏览器本地运行(首次下载约 5-35 MB 模型,之后可完全离线),文件不上传服务器,免费、无水印、无张数限制。常用于扫描合同的全文检索;图书古籍数字化存档;纸质笔记拍照后转可编辑文本。

操作步骤

  1. 拖入或点击选择扫描版 PDF
  2. 选择识别语言:中文 / 英文 / 中英混合 / 日文 / 韩文
  3. 首次使用会自动下载对应语言模型(英文 ~5MB,中文 ~30MB)
  4. 等待模型加载完成(约 5-15 秒)
  5. (可选)选择是否「保留原图作为背景」(生成可搜索 PDF 时建议保留)
  6. (可选)调节「DPI 重采样」(300 默认,平衡精度与速度)
  7. 点击「开始识别」
  8. 查看进度条:每页约 3-8 秒,依 CPU 而定
  9. 完成后输出可搜索 PDF(文字层覆盖在原扫描图上)或纯文本 TXT

常见问题

文件会上传到服务器吗?
不会。OCR 模型(Tesseract 引擎 + 训练数据)在浏览器本地通过 WebAssembly 运行,扫描件从未离开你的设备。这与多数云 OCR(百度 OCR、Google Vision)的服务端处理本质不同。
中文识别准确率如何?
印刷体中文识别率通常 95%+,扫描清晰、字体规整的文档接近 99%。手写体、模糊扫描、复杂版面(表格、多栏)准确率会下降,建议扫描时使用 300 DPI 以上分辨率。
为什么第一次很慢?
首次使用会下载语言模型(英文 ~5MB,中文 ~30MB,中英混合 ~35MB),下载完成后会缓存在浏览器,后续使用立即可用。下载速度受网络影响,国内一般 3-10 秒。
识别速度多少?
纯文字单页 A4 在普通笔记本(i5/8GB)约 3-5 秒。图文混排或高分辨率扫描约 8-12 秒/页。多页文档建议在挂机时间运行,100 页约 10-20 分钟。
支持手写体识别吗?
目前 Tesseract 引擎对手写体支持有限,识别率显著低于印刷体。规整的楷书可能识别 70-80%,连笔字几乎无法识别。

应用场景

  • 扫描的纸质合同 OCR 后可全文检索关键条款
  • 图书馆古籍数字化存档便于学术检索
  • 手机拍的会议笔记 OCR 后转可编辑文本
  • 扫描的财务报表 OCR 后导出文字供下游分析
  • 外文图书扫描件 OCR 后翻译软件直接处理

提示

扫描质量直接决定 OCR 效果。建议:1) 至少 300 DPI;2) 文档摆正不要倾斜;3) 避免阴影和反光;4) 黑白文档先二值化效果更好。中英混合的文档使用「中英混合」模型,单独中文或英文模型对外语字符识别率低。