跳到主要內容
忆云竹

PDF 文字擷取

在瀏覽器擷取 PDF 文字層,逐頁預覽、複製與下載 TXT,明確指出需要 OCR 的頁面。

逐頁擷取 PDF 既有的文字層;掃描文件需要另外使用 OCR。

處理設定

    例如 1-3,5 或 3,1,1;保留輸入順序及重複頁面。

    單頁最多 100 萬字元,總計 800 萬字元。閱讀順序取決於 PDF,表格與多欄內容請另行核對。

    預覽

    縮放與旋轉只影響預覽,不會變更匯出的檔案。

    擷取的文字

    檔案僅在目前瀏覽器處理,不上傳、不儲存輸入。不支援加密 PDF;可取消作業,最長處理 90 秒。 範例包含一頁文字及一頁刻意留白的頁面。

    內容僅在此瀏覽器處理,不會上傳或儲存。

    工具介紹

    在瀏覽器擷取 PDF 文字層,逐頁預覽、複製與下載 TXT,明確指出需要 OCR 的頁面。

    使用說明

    加入 PDF 後自動擷取文字,可再調整頁碼範圍。展開各頁檢查內容,複製或下載含頁面分隔的 TXT。沒有文字層的頁面會個別提示;掃描文件請先轉成圖片再進行 OCR。輸出遵循 PDF 內部文字順序,不會重建 Word 排版;表格、多欄與特殊字型請對照頁面確認。

    常見問題

    頁面看得到文字,為何無法擷取?

    內容可能是圖片或字型輪廓,並沒有可用文字層。本工具不執行 OCR;請先轉為圖片,再使用圖片文字辨識。空白頁也會標示沒有文字層。

    能保留表格與多欄排版嗎?

    不保證。輸出依 PDF 內部的文字順序,利用既有換行和字距,不會重建文件版面。請核對表格、多欄及特殊字型。

    預覽沒顯示的文字會遺失嗎?

    不會。每頁預覽最多 20,000 字元,複製與 TXT 下載仍含完整文字及頁面標記。擷取上限為單頁 100 萬、總計 800 萬字元,不上傳或儲存內容。

    評論

    0
    後參與評論。
    暫無評論
    回復討論

    按時間查看完整回復脈絡;每條回復都會標明它回應的具體內容。