Extract 文本从一 PDF 在线

Pull 所有 selectable 文本外的一 PDF — 复制它或下载作为.txt.

最后更新:

Extract Text from PDF

Turn text-based or scanned PDFs into editable text, page by page, directly in your browser.

Upload a PDF

MAX 30 MB

Drop your PDF here

Choose a PDF up to 30 MB and 100 pages. Your document stays in your browser while it is processed.

Text extraction and OCR run in your browser. Do not upload documents you are not authorized to process. Verify names, dates, amounts, and OCR text against the original PDF.

Editable text preview

NO FILE
Choose a PDF to begin.
PAGES
DIRECT TEXT
OCR PAGES

Text PDFs are extracted directly. OCR is used only for pages with no usable embedded text when Auto mode is selected.

Extract 文本从 PDF 在线

使用这 PDF 文本 extractor 到 turn PDF 文档到 editable, searchable 文本. 上传一 regular PDF 与 selectable 文本或一已扫描文档那需要 OCR, 选择页面您需要, 和检查 extracted 内容之前复制或下载它.

它是有用用于 research 纸张, 报告, 发票, 手动, 表单, worksheets, 和其他文档您自己的或是已授权到过程. 而不是的手动 retyping 文本, 您可以 extract 它页面通过页面和制作 corrections 直接在预览.

如何到 extract 文本从一 PDF

  1. 上传或 drag 和 drop 您的 PDF 文件.
  2. 选择所有页面或输入一页面范围, 此类作为 3-8, 10.
  3. 选择自动 OCR, 始终使用 OCR, 或 embedded-文本 extraction 仅.
  4. 选择 OCR language 用于已扫描文档.
  5. Extract 文本和检查它在 editable 预览.
  6. 复制所有文本或下载结果作为一 TXT 文件.

工具 preserves 页面 separators 所以您可以查看其中每个部分的文本 came 从.

文本-基于 PDF 对比. 已扫描 PDF

不每 PDF stores 其文本在相同方式.

文本-基于 PDF

一文本-基于 PDF 包含 embedded, selectable 文本. 这是常见在报告, 数字手动, exported 文档, 和 research 纸张. 工具可以 read 这文本直接, 哪个是通常更快和更多准确比 OCR.

已扫描 PDF

一已扫描 PDF 是 made 从页面图像, 此类作为已扫描不, receipts, books, 或打印表单. 因为文本是 part 的一图像, 它 cannot 通常是已选择. OCR, 或 optical 字符 recognition, analyzes 页面图像和转换可见字符到 editable 文本.

OCR 是有用, 但它是不 perfect. 小文本, 手写, unusual fonts, low-质量 scans, tables, 公式, 和 blurred 图像可以生成 recognition 错误. 始终检查重要名称, 日期, 参考数字, 和数量针对原始文档.

Extract 已选择页面仅

您做不需要到 extract 每页面的一长文档. 输入一页面范围何时您仅需要一特定 chapter, 发票页面, appendix, 或部分.

例如:

  • all extracts 每页面
  • 3-8 extracts 页面 3 通过 8
  • 1, 4, 7 extracts 单个页面
  • 2-5, 9, 12-14 combines 多个范围

Extracting 仅页面您需要可以制作审查和 organizing 文本更容易.

Editable PDF 文本预览

之后 extraction, 输出显示在一 editable 文本区域. 您可以正确 OCR 错误, 移除 unwanted 行, 添加不, 或准备内容用于 translation, summarization, research, accessibility 工作, 或写作.

下载 TXT 文件 reflects 任何 edits 您制作在预览.

移除 repeated headers 和 footers

许多 PDF repeat 相同文档标题, 页面数字, company name, 或 footer 在每页面. 何时这选项是 enabled, 工具检查用于 repeated 第一和最后行跨多个页面和移除它们其中可能.

检查结果之后使用这选项因为一 repeated 行可能有时是 meaningful 内容.

隐私和文档处理

文档可以包含 confidential 信息. 这工具过程 PDF 内容在浏览器中用于文本 extraction 和 OCR; PDF itself 是不 sent 到一文档-过程 server 通过工具.

仅上传文档您是已授权到访问和过程. 避免分享 confidential 文件在公共或 untrusted 设备, 和清晰预览何时您是完成.

常见 PDF 文本 extraction 使用

  • 复制文本从 research 纸张和学术 articles
  • 转换已扫描不到 editable 学习材料
  • Extract 发票详情和 report 内容
  • 准备自己的文档用于 translation 或 summarization
  • 制作文档文本更容易到使用与 screen readers
  • Reuse 已授权手动, 表单, 或 policy 文本
  • 创建 searchable 不从已扫描页面
  • Export 已选择 PDF 页面作为 plain 文本

PDF 文本 extractor FAQs

可以我 extract 文本从一已扫描 PDF?

是. 选择自动 OCR 或 OCR 用于每页面. 工具使用 OCR 何时一页面会不包含 usable embedded 文本.

为什么会 extracted 文本有时 look 不同从 PDF?

PDF 可能使用 columns, floating 文本 boxes, tables, headers, 和 unusual layouts. extractor 使用一 sensible 行-基于阅读顺序其中可能, 但复杂页面可能需要手动编辑 afterward.

可以我复制文本从一密码-protected PDF?

您可以输入密码仅何时您是已授权到打开文档. 如果 PDF cannot 是打开或是 damaged, 工具将显示一 error.

可以我 extract 文本从仅一少数页面?

是. 使用一页面范围此类作为 3-8 或 combine 范围此类作为 1-3, 7, 10-12.

会 OCR guarantee perfect 文本?

否. OCR accuracy 取决于在 scan 质量, language, font, resolution, 手写, 和页面 layout. 验证 critical 详情之前 relying 在 extracted 文本.

什么是最佳输出格式用于简单 editable 文本?

TXT 是 ideal 用于清理, lightweight, searchable 文本. 您可以打开它在 Notepad, TextEdit, 词, Google Docs, 或大多数写作和 research 工具.