Практический гайд

Как составить запрос для извлечения таблицы из PDF

Укажите точные PDF-страницы, нужную таблицу, порядок столбцов, единицы, правила для пустых и неразборчивых ячеек, формат CSV и способ проверки. Чем меньше решений сервис принимает сам, тем легче заметить смещение строк или придуманное значение. Добавьте название или положение таблицы, требование сохранять исходные значения и одинаковое число полей в каждой строке. После извлечения запросите число строк и столбцов, список сомнений и сверку нескольких записей с PDF.

Проверено 29 июля 2026 годаМатериал основан на официальной документации, проверенной 2026-07-29. Ручное тестирование сервисов не проводилось. Автоматическое извлечение не гарантирует точность, особенно для сканов, объединенных ячеек и многостраничных таблиц. Не загружайте документ, если у вас нет права на его обработку.
Важные ограничения

Что учесть до начала работы

Возможности загрузки PDF и создания файлов зависят от выбранного сервиса, плана и типа документа.

CSV реализуется программами по-разному, поэтому разделитель, кодировку и правила кавычек нужно задавать явно.

OCR и извлечение сложных таблиц требуют ручной сверки, особенно при объединенных ячейках и переносе на несколько страниц.

Перед началом

Что подготовить

Кому подойдет гайд

  • Пользователям, которым нужно перенести одну таблицу из отчета, счета, каталога или исследования в электронную таблицу.
  • Сотрудникам малого бизнеса, извлекающим цены, остатки, характеристики, платежи или показатели из PDF.
  • Тем, кто получает смещенные столбцы, потерянные пустые ячейки или лишний текст при автоматическом извлечении.

Что понадобится

  • Исходный PDF и рабочая копия документа.
  • Точные номера PDF-страниц, где начинается и заканчивается таблица.
  • Название таблицы или описание ее положения на странице.
  • Список ожидаемых столбцов, единиц измерения и пример одной правильной строки.
  • Решение о разделителе CSV, кодировке и обозначении неразборчивых значений.
Пошаговый процесс

Что делать

01

Укажите точные страницы и нужную таблицу

Откройте PDF и запишите номера страниц, которые показывает просмотрщик. Они могут не совпадать с напечатанной нумерацией из-за обложки и приложений. Назовите таблицу по заголовку или опишите положение: например, «нижняя таблица на PDF-странице 18». Если на странице несколько таблиц, добавьте первые два заголовка столбцов и первую видимую строку. Не используйте формулировку «найди нужную таблицу» без ориентиров.

Результат: Запрос однозначно указывает диапазон PDF-страниц и отличает целевую таблицу от соседних объектов.
02

Опишите границы и продолжение таблицы

Уточните, что считать частью таблицы: заголовок, тело, итоговую строку, сноски и примечания. Для многостраничной таблицы сообщите, повторяются ли шапки и нужно ли удалить их из середины результата. Отдельно задайте правило для строки, которая начинается на одной странице и продолжается на другой. Если нужны только строки между двумя известными значениями, укажите эти значения как начало и конец диапазона.

Результат: Понятно, какие строки включать, какие повторные заголовки пропускать и как объединять продолжение на следующей странице.
03

Задайте схему столбцов и единицы

Перечислите столбцы в требуемом порядке и сохраните исходные названия либо дайте явное соответствие новым названиям. Укажите, где находятся единицы: в заголовке, отдельной колонке или подписи над таблицей. Попросите не менять десятичный разделитель, знак минуса, проценты, валюту и скобки без отдельного разрешения. Полезно добавить технический столбец source_page, чтобы каждая строка сохраняла связь со страницей источника.

Результат: У результата заранее определены число, порядок и смысл полей, а единицы и исходные обозначения не теряются.
04

Определите правила для пустых и сложных ячеек

Напишите, что пустая ячейка должна оставаться пустым полем CSV, а не исчезать и не сдвигать соседние значения. Для неразборчивого текста задайте метку, например [неразборчиво], и запретите угадывать. Объясните, как обращаться с объединенными ячейками: повторять общее значение в каждой строке, оставлять его только в первой строке или переносить в отдельный столбец. Для сносок лучше создать поле review_note, а не смешивать пояснение с числом.

Результат: Пустоты, сомнения и объединенные области обрабатываются одинаково во всей таблице и не нарушают выравнивание столбцов.
05

Зафиксируйте формат CSV

Попросите вывести одну строку заголовков и затем по одной записи на строку. Укажите кодировку UTF-8 и разделитель, например запятую. Согласно распространенному формату CSV, все записи должны иметь одинаковое число полей, а значения с запятыми, переносами строк или кавычками нужно заключать в двойные кавычки; внутреннюю кавычку следует удваивать. Попросите поместить CSV в отдельный кодовый блок без пояснений внутри данных.

Результат: Вывод можно сохранить как CSV и открыть с предсказуемым разделителем, одинаковым числом столбцов и корректным экранированием.
06

Соберите ограничения в единый запрос

Используйте основу: «Извлеки только таблицу [название] с PDF-страниц [диапазон]. Включи [границы]. Столбцы строго в порядке: [список]. Сохрани исходные единицы и написание значений. Пустая исходная ячейка - пустое поле, неразборчивое значение - [неразборчиво], ничего не додумывай. Повторные шапки между страницами не включай. Верни CSV UTF-8 с разделителем запятая и столбцом source_page». Добавьте пример ожидаемой строки, если структура сложная.

Результат: Получен самодостаточный запрос, в котором нет скрытых решений о диапазоне, структуре и преобразовании данных.
07

Потребуйте контрольную сверку

После CSV попросите отдельный краткий отчет: число извлеченных строк и столбцов, список страниц, координаты неразборчивых ячеек и наличие повторных заголовков. Попросите сравнить с PDF первую, среднюю и последнюю строку, а также итоговую строку, если она есть. Все строки должны иметь одинаковое число полей. Итоги и суммы полезны как сигнал ошибки, но они не заменяют построчную проверку исходника.

Результат: Вместе с данными есть проверяемый отчет, по которому можно быстро найти пропуск, смещение или сомнительную ячейку.
Готовая основа

Запрос для извлечения таблицы из PDF

Извлеки только таблицу [название] с PDF-страниц [диапазон]. Включи [границы]. Столбцы строго в порядке: [список]. Сохрани исходные единицы и написание значений. Пустая исходная ячейка - пустое поле, неразборчивое значение - [неразборчиво], ничего не додумывай. Повторные шапки между страницами не включай. Верни CSV UTF-8 с разделителем запятая и столбцом source_page

Перед началом

Что проверить в готовом запросе

Указаны номера страниц именно в PDF-просмотрщике.
Таблица определена названием, положением или примерами заголовков.
Заданы первая и последняя нужные строки либо другие границы.
Перечислены столбцы в точном порядке и указаны единицы.
Есть правило для повторных шапок многостраничной таблицы.
Пустые ячейки не удаляются и не сдвигают соседние значения.
Неразборчивые данные отмечаются, а не угадываются.
Указаны разделитель CSV, кодировка и правила кавычек.
Запрещены незапрошенные исправления и нормализация значений.
Запрошены число строк, число столбцов и выборочная сверка с PDF.
Разбор ошибок

Что чаще всего портит результат

Просить извлечь все таблицы из документа

Сузьте задачу до одного диапазона страниц и одной таблицы, используя заголовок, положение и примеры полей.

Указывать только напечатанные номера страниц

Добавьте номера из PDF-просмотрщика и при необходимости соответствие между двумя системами нумерации.

Не задавать правила для пустых и объединенных ячеек

Опишите пустое поле, метку для сомнений и способ переноса общего значения до начала извлечения.

Просить одновременно исправить и структурировать данные

Сначала извлеките значения без изменений. Очистку, замену разделителей и исправление опечаток выполняйте отдельным шагом.

Не фиксировать разделитель и кавычки CSV

Назовите разделитель, кодировку и правило экранирования, особенно если значения содержат запятые или переносы строк.

Принимать результат без контрольных чисел

Сверьте число строк и столбцов, несколько строк из разных частей таблицы, единицы и итоговые значения.

Частые вопросы

Короткие ответы

Нужно ли сначала выполнять OCR?

Если текст нельзя выделить или найти, сначала выполните OCR с правильным языком. Затем проверьте числа и похожие символы.

Как извлечь таблицу, которая занимает несколько страниц?

Укажите диапазон, правила для повторных шапок и разорванных строк, добавьте source_page. Переходы между страницами сверяйте отдельно.

Что делать с объединенными ячейками?

Заранее выберите правило: повторять групповое значение в каждой строке либо оставлять его только в первой.

Можно ли запросить файл Excel вместо CSV?

Можно, если сервис поддерживает экспорт. CSV легче проверять, а Excel удобнее для нескольких листов и типов данных. Значения все равно нужно сверить.

Как отличить пустую ячейку от ошибки распознавания?

Пустое поле оставляйте только при визуально пустой ячейке. Нечеткий знак помечайте и указывайте страницу, строку и столбец.

Достаточно ли проверить сумму в итоговой строке?

Нет. Проверьте число записей, структуру и строки из начала, середины и конца: совпавший итог не исключает компенсирующие ошибки.

Главный вывод

Коротко

Надежный запрос превращает извлечение таблицы в формальную задачу: задан источник, диапазон, схема, правила для пустот и сложных ячеек, формат CSV и контроль результата. Сначала требуйте точную копию данных без догадок и исправлений, затем проверяйте строки по PDF и только после этого переходите к очистке или анализу.

Проверяемые данные

Источники