← 返回工具

提取文字

把 PDF 中可选文本导出为 TXT

使用说明

用途

把 PDF 中所有可选文字按页提取出来,导出为纯文本 TXT 文件。整个提取在浏览器本地通过 pdfjs-dist 解析文本对象完成,文件不上传服务器,免费、无水印、无限制。常用于把 PDF 报告的正文复制到 Word 继续编辑;把电子书的某章节抽出做笔记;从合同 PDF 中提取条款文本进行检索;为内容分析提供原始语料。

操作步骤

  1. 拖入或点击选择 PDF 文件
  2. 查看左侧文件信息(页数、是否含文本层)
  3. (可选)勾选「保留分页符」让输出每页之间插入分隔
  4. (可选)勾选「保留段落换行」(关闭则按原始换行原样导出)
  5. 选择输出编码:UTF-8(推荐)或 GBK(兼容旧 Windows)
  6. 点击「开始处理」
  7. 等待按页拼接,文本预览出现在右侧
  8. 点击「复制全部」直接到剪贴板,或点击「下载 .txt」保存文件

常见问题

PDF 文件会上传到服务器吗?
不会。文字提取通过浏览器本地的 pdfjs-dist 解析 PDF 内部文字流,所有操作在本机内存中完成,源文件从未上传任何服务器。
扫描件 PDF 提取不到文字怎么办?
扫描件是图像形式的 PDF,没有可选文字层,本工具无法直接提取。需要先用「OCR」工具把扫描件转换为可搜索 PDF,再用「文字提取」就能拿到文字。
提取后排版会乱吗?
PDF 的视觉排版(多栏、表格、图文混排)在转纯文本时不可避免会丢失结构。本工具按 PDF 文本对象的阅读顺序输出,多栏排版的论文可能出现栏间错乱。需要保留排版的复制建议直接复制粘贴或用「PDF 转 Word」。
提取的文字带乱码怎么解决?
多半是 PDF 嵌入字体使用了自定义编码(CID)而未提供 ToUnicode 表。这种情况靠常规提取拿不到正确字符,需要用 OCR 重新识别。
可以只提取某几页吗?
可以。在「页面选择」中输入页范围(如 1-3,5),仅提取指定页的文本。

应用场景

  • 把 PDF 报告的核心段落抽到 Word 继续编辑
  • 电子书章节摘要做读书笔记或引用
  • 合同条款抽出后用编辑器全文检索关键字
  • 学术论文导出文本喂给摘要工具或翻译软件
  • 把多个 PDF 报表的文字内容批量抽出做数据分析

提示

如果导出后发现文字按列错乱,可在 PDF 阅读器中先把原文复制到记事本对比——错乱多半是 PDF 本身阅读顺序的问题,不是工具的 bug。需要严格保留表格结构请考虑「PDF → Excel」类专业工具。