← 返回工具
提取文字
把 PDF 中可选文本导出为 TXT
使用说明
用途
把 PDF 中所有可选文字按页提取出来,导出为纯文本 TXT 文件。整个提取在浏览器本地通过 pdfjs-dist 解析文本对象完成,文件不上传服务器,免费、无水印、无限制。常用于把 PDF 报告的正文复制到 Word 继续编辑;把电子书的某章节抽出做笔记;从合同 PDF 中提取条款文本进行检索;为内容分析提供原始语料。
操作步骤
- 拖入或点击选择 PDF 文件
- 查看左侧文件信息(页数、是否含文本层)
- (可选)勾选「保留分页符」让输出每页之间插入分隔
- (可选)勾选「保留段落换行」(关闭则按原始换行原样导出)
- 选择输出编码:UTF-8(推荐)或 GBK(兼容旧 Windows)
- 点击「开始处理」
- 等待按页拼接,文本预览出现在右侧
- 点击「复制全部」直接到剪贴板,或点击「下载 .txt」保存文件
常见问题
- PDF 文件会上传到服务器吗?
- 不会。文字提取通过浏览器本地的 pdfjs-dist 解析 PDF 内部文字流,所有操作在本机内存中完成,源文件从未上传任何服务器。
- 扫描件 PDF 提取不到文字怎么办?
- 扫描件是图像形式的 PDF,没有可选文字层,本工具无法直接提取。需要先用「OCR」工具把扫描件转换为可搜索 PDF,再用「文字提取」就能拿到文字。
- 提取后排版会乱吗?
- PDF 的视觉排版(多栏、表格、图文混排)在转纯文本时不可避免会丢失结构。本工具按 PDF 文本对象的阅读顺序输出,多栏排版的论文可能出现栏间错乱。需要保留排版的复制建议直接复制粘贴或用「PDF 转 Word」。
- 提取的文字带乱码怎么解决?
- 多半是 PDF 嵌入字体使用了自定义编码(CID)而未提供 ToUnicode 表。这种情况靠常规提取拿不到正确字符,需要用 OCR 重新识别。
- 可以只提取某几页吗?
- 可以。在「页面选择」中输入页范围(如 1-3,5),仅提取指定页的文本。
应用场景
- 把 PDF 报告的核心段落抽到 Word 继续编辑
- 电子书章节摘要做读书笔记或引用
- 合同条款抽出后用编辑器全文检索关键字
- 学术论文导出文本喂给摘要工具或翻译软件
- 把多个 PDF 报表的文字内容批量抽出做数据分析
提示
如果导出后发现文字按列错乱,可在 PDF 阅读器中先把原文复制到记事本对比——错乱多半是 PDF 本身阅读顺序的问题,不是工具的 bug。需要严格保留表格结构请考虑「PDF → Excel」类专业工具。