Как извлечь таблицу из PDF в Excel с помощью ИИ
Как перенести таблицу из обычного или сканированного PDF в Excel, сохранить связь со страницами и проверить числа, строки и структуру результата.

Короткий ответ
Чтобы извлечь таблицу из PDF в Excel с помощью ИИ, сначала определите, содержит ли файл настоящий текст или только изображения страниц. Затем задайте структуру будущей таблицы, попросите сохранить ссылки на страницы и отдельно отметить сомнительные значения. Готовым результатом следует считать не просто файл XLSX, а таблицу, которую можно сверить с источником: с устойчивыми колонками, исходными строками, журналом исключений и понятными правилами преобразования.
У PDF есть штатные способы импорта. Официальная документация PDF-коннектора Power Query описывает загрузку и преобразование найденных данных, а для больших файлов рекомендует обрабатывать страницы или небольшие диапазоны по частям. Скан устроен иначе: как поясняет руководство Adobe по распознаванию текста, бумажный документ в PDF сначала содержит только изображение, а OCR создаёт поисковый текстовый слой; после распознавания результат нужно проверить на точность и полноту.
Сначала определите тип PDF
Быстрая проверка экономит время и помогает выбрать правильный процесс:
- Если текст выделяется и находится через поиск, PDF, скорее всего, содержит текстовый слой. Таблицы можно извлекать напрямую, хотя объединённые ячейки и переносы строк всё равно требуют очистки.
- Если выделяется только вся страница, это скан или изображение. Сначала нужен OCR, а затем восстановление строк и колонок.
- Если часть страниц текстовая, а часть отсканирована, документ смешанный. Обрабатывайте диапазоны отдельно и объединяйте только после проверки схемы.
- Если файл защищён, повреждён или обрезан, не пытайтесь обходить ограничения. Запросите доступную копию или исходный экспорт.
Лучший источник — исходная выгрузка из системы в XLSX или CSV. PDF стоит извлекать, когда такой выгрузки нет либо она не соответствует переданному документу. Сохраните оригинал без изменений: он нужен как контрольная версия.
Какой Excel-файл считать хорошим результатом
Одна вкладка с числами часто недостаточна. Для проверяемой работы удобнее три листа:
| Лист | Содержимое | Зачем он нужен |
|---|---|---|
| Данные | Нормализованные строки и колонки | Для фильтров, формул и анализа |
| Источники | Номер страницы, таблицы и диапазон строк | Для возврата к оригиналу |
| Проверить | Нераспознанные, конфликтные или изменённые значения | Для проверки человеком |
В таблице полезно сохранять исходное значение рядом с преобразованным. Например, столбцы «Сумма как в PDF» и «Сумма числом» позволяют увидеть, где были удалены пробелы, изменён десятичный разделитель или потерян знак. Даты тоже лучше хранить в двух видах до приёмки.
Не объединяйте разные таблицы только потому, что у них похожие заголовки. Сначала сравните набор колонок, единицы измерения, валюту, период и смысл строки. Если схема меняется на середине документа, добавьте признак раздела или создайте отдельный лист.
Пошаговый сценарий в OpenCowork
В OpenCowork задачу можно поставить так:
- Загрузите исходный PDF в обычный проект и опишите, какие таблицы нужны.
- Укажите диапазон страниц, ожидаемые колонки, единицы измерения и желаемый формат XLSX.
- Попросите ИИ-агента определить тип страниц и перечислить те, которые не удалось прочитать уверенно.
- Поручите извлечение небольшими диапазонами, если документ большой или таблица продолжается на нескольких страницах.
- Задайте правила нормализации: формат дат, десятичный разделитель, пустые значения, переносы строк, повторяющиеся заголовки.
- Попросите создать листы «Данные», «Источники» и «Проверить», не удаляя спорные строки.
- Сверьте выборку с PDF, исправьте правила и только после этого используйте таблицу дальше.
Такой процесс подходит для прайс-листов, отчётов, реестров и спецификаций. Если цель — сопоставить готовую таблицу со счётом, полезен отдельный сценарий проверки спецификации и счёта. Другие варианты результатов собраны в примерах задач OpenCowork.
Как проверить числа и структуру
Перед использованием результата обязательна проверка человеком, особенно для бухгалтерских, финансовых и закупочных данных. Возьмите выборку из начала, середины и конца документа и проверьте:
- совпадает ли число строк на странице и в Excel;
- не превратился ли минус в тире или не исчез совсем;
- правильно ли распознаны запятая и точка в суммах;
- не перепутаны ли похожие символы;
- сохранились ли единицы измерения и валюта;
- не склеились ли две строки из-за многострочного описания;
- не повторился ли заголовок страницы как строка данных;
- сходятся ли итоги по группам и по документу.
Полезный контроль — пересчитать суммы независимо от PDF и сравнить их с напечатанными итогами. Расхождение не нужно автоматически «исправлять»: его следует записать в лист «Проверить» со страницей и исходной строкой. Решение о корректировке принимает владелец данных.
Когда нужно остановить извлечение
Процесс должен завершиться честной границей, а не правдоподобной таблицей. Остановитесь и запросите другой источник, если:
- страницы отсутствуют, обрезаны или имеют слишком низкое качество;
- шрифт или фон не позволяют различать значения;
- таблица содержит рукописные исправления без подтверждения;
- файл защищён от чтения или требует доступа, которого у команды нет;
- заголовки и единицы меняются, но правила их сопоставления неизвестны;
- контрольная выборка показывает систематические ошибки OCR.
В таких случаях правильный результат OpenCowork — список непрочитанных страниц и причин, а не заполнение пропусков догадками.
Следующий шаг
Возьмите один типовой PDF, определите нужные колонки и подготовьте небольшую контрольную выборку. Затем откройте рабочее пространство OpenCowork, приложите файл и запросите XLSX с картой страниц и листом исключений. После проверки шаблона теми же правилами можно обрабатывать следующий документ, не снижая требования к точности.
От практики к рабочей задаче
Как OpenCowork готовит отчёты и аналитику

