Перейти к основному содержимому
忆云竹

Извлечь текст из PDF

Локально извлекайте текст PDF по страницам, копируйте или скачивайте TXT и узнавайте, каким страницам нужен OCR.

Извлеките имеющийся текст PDF по страницам. Для сканов нужен отдельный OCR.

Настройки

    Например: 1-3,5 или 3,1,1. Порядок и повторяющиеся страницы сохраняются.

    До 1 млн символов на страницу и 8 млн суммарно. Порядок чтения зависит от PDF: проверьте таблицы и колонки.

    Просмотр

    Масштаб и поворот меняют только вид при просмотре. Экспортируемый файл остаётся без изменений.

    Извлечённый текст

    Файлы обрабатываются в браузере без отправки и сохранения ввода. Зашифрованные PDF не поддерживаются. Можно отменить; через 90 секунд обработка останавливается. В примере одна страница текста и одна намеренно пустая страница.

    Обработка в браузере. Данные не отправляются и не сохраняются.

    Об инструменте

    Локально извлекайте текст PDF по страницам, копируйте или скачивайте TXT и узнавайте, каким страницам нужен OCR.

    Как пользоваться

    Добавьте PDF: извлечение начнётся автоматически. При необходимости измените диапазон и раскройте страницы для проверки. Копирование и TXT сохраняют разделители страниц. Сканы и буквы, превращённые в контуры, могут потребовать OCR после экспорта в изображения. Текст идёт в порядке, записанном внутри PDF; макет Word не восстанавливается. Сверяйте таблицы, колонки и необычные шрифты с оригиналом.

    Частые вопросы

    Почему видимый текст не извлекается?

    Он может быть изображением или контурами без текстового слоя. Здесь OCR не запускается. Преобразуйте страницы в изображения, затем используйте OCR. Пустые страницы также отмечаются как не содержащие текста.

    Сохраняется ли расположение таблиц и колонок?

    Это не гарантируется. Используются внутренний порядок текста, переносы строк и определимые пробелы. Документ Word или таблица не восстанавливаются. Сравните текст с изображением страницы.

    Текст за пределами просмотра теряется?

    Нет. Показывается до 20 000 символов на страницу, но копия и TXT включают всё и метки страниц. Извлечение ограничено 1 млн символов на страницу и 8 млн суммарно; данные не отправляются и не сохраняются.

    Комментарии

    0
    , чтобы присоединиться к обсуждению.
    Комментариев пока нет.
    Ветка ответов

    Просматривайте беседу в хронологическом порядке; у каждого ответа указано сообщение, на которое он дан.