メインコンテンツへ移動
忆云竹

PDF のテキスト抽出

PDF 内のテキストをページごとに抽出し、コピーや TXT 保存。OCR が必要なページを区別して表示します。

PDF に含まれるテキストをページごとに抽出します。スキャンには別途 OCR が必要です。

設定

    例:1-3,5 または 3,1,1。指定順と重複を保持します。

    1 ページ 100 万文字、合計 800 万文字まで。読み順は PDF に依存するため、表や段組みは確認が必要です。

    プレビュー

    拡大・縮小や回転はプレビューにのみ反映され、書き出すファイルには影響しません。

    抽出したテキスト

    処理はブラウザー内で完結し、アップロードや入力の保存は行いません。暗号化 PDF は非対応。キャンセル可能で、90 秒を超える処理は停止します。 サンプルはテキスト 1 ページと、意図的な空白 1 ページです。

    このブラウザー内で処理します。アップロードや保存は行いません。

    このツールについて

    PDF 内のテキストをページごとに抽出し、コピーや TXT 保存。OCR が必要なページを区別して表示します。

    使い方

    PDF を追加すると自動で抽出します。ページ範囲を変更し、各ページを展開して内容を確認してください。コピーや TXT 保存ではページ区切りを保持します。スキャン画像や輪郭化された文字には別途 OCR が必要です。読み順は PDF 内部の記録に従い、Word のレイアウトは再現しません。段組みや表、特殊なフォントは元のページと照合してください。

    よくある質問

    文字が見えるのに抽出できないのはなぜですか?

    画像や輪郭として保存され、テキスト情報がない場合があります。このツールでは OCR を実行しません。画像に変換して画像 OCR を使ってください。空白ページもテキストなしとして表示します。

    表や段組みのレイアウトは維持されますか?

    保証できません。PDF 内の文字の順序、改行、明確な字間を使って抽出し、文書のレイアウトは再構成しません。元ページのプレビューと比較してください。

    表示上限を超えた文字は消えますか?

    消えません。表示は各ページ 20,000 文字までですが、コピーと TXT 保存には全文とページ区切りが含まれます。抽出は 1 ページ 100 万文字・合計 800 万文字まで。内容は送信・保存しません。

    コメント

    0
    してディスカッションに参加してください。
    コメントはまだありません。
    返信スレッド

    会話全体を時系列で確認できます。各返信には、どのメッセージへの返信かが示されます。