跳到主要内容
忆云竹

PDF 提取文字

本地读取 PDF 文字层,按页预览、复制与下载 TXT,明确标出需要 OCR 的无文字页面。

按页提取 PDF 已有的文字层;扫描件需要另做 OCR。

处理设置

    例如 1-3,5 或 3,1,1;保留输入顺序和重复页。

    单页最多 100 万字符,合计 800 万字符。阅读顺序取决于 PDF,表格与分栏内容请核对整理。

    预览

    缩放和旋转仅用于查看,不改变导出文件。

    提取的文字

    文件只在当前浏览器处理,不上传、不保存输入。不支持加密 PDF;任务可取消,最长处理 90 秒。 示例包含一页文字和一页特意留白的页面。

    内容只在当前浏览器中处理,不上传或保存。

    工具介绍

    本地读取 PDF 文字层,按页预览、复制与下载 TXT,明确标出需要 OCR 的无文字页面。

    使用说明

    添加 PDF 后自动提取文字,也可调整页码范围。展开各页检查内容,复制或下载带页面分隔的 TXT。没有文字层的页面会单独提示,不会冒充 OCR 成功;扫描件请先转成图片,再使用图片文字识别。文字按 PDF 内容流中的顺序输出,请对照页面核对分栏、表格、连字和特殊字体。工具不会重建 Word 排版,也不会上传或保存输入文件。

    常见问题

    页面明明有字,为什么提取结果为空?

    那些字可能是一张图片或已经转成轮廓,没有可用文字层。本工具不运行 OCR。可先把相应页转成图片,再做图片文字识别;真正的空白页也会显示没有文字层。

    提取后能保留表格和多栏排版吗?

    不能保证。输出遵循 PDF 内部保存的文字顺序,并利用已有换行与字间距;不会重建 Word 文档或表格。多栏、表格和特殊字体请对照页面预览核对。

    超过预览字数的内容会丢失吗?

    不会。每页预览最多展示 20,000 字符,复制和 TXT 下载仍保留全部已提取文字及页面标记。处理上限为单页 100 万、合计 800 万字符;输入和结果都不会上传或保存。

    评论

    0
    后参与评论。
    暂无评论
    回复讨论

    按时间查看完整回复脉络;每条回复都会标明它回应的具体内容。