Направление конвертации
Конвертация PDF в Excel
Преобразование PDF → Excel на сервере, без установки программ
- Загрузить
- Выбрать формат
- Скачать
Загрузка файла
Область приёма файла
или
Файлы PDF. До 5 МБ. Изображение можно вставить из буфера обмена: Ctrl+V.
В PDF нет разметки строк и столбцов: там хранится только текст с координатами. Текст переносится в ячейки в порядке чтения, страница за страницей, а сетку таблицы — границы колонок, объединённые ячейки, многострочные заголовки — почти всегда приходится собирать вручную, например командой «Данные → Текст по столбцам».
Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.
PDF и XLSX: характеристики
| Характеристика | .pdfPDF | .xlsxXLSX |
|---|---|---|
| Полное название | Portable Document Format | Office Open XML Workbook |
| Разработчик | Adobe | Microsoft |
| Год появления | 1993 | 2007 |
| Расширение | .xlsx | |
| MIME-типы | application/pdf, application/x-pdf, application/acrobat | нет данных |
| Содержимое | Текст, вектор, растр, формы | Двоичное |
| Прозрачность | Поддерживается | нет данных |
| Несколько страниц в файле | Поддерживается | Поддерживается |
| Стандарт | ISO 32000-2 | ECMA-376 / ISO 29500 |
| Вёрстка | Фиксированная, не зависит от устройства | нет данных |
| Шрифты | Встраиваются в файл | нет данных |
| Защита | Пароль, права доступа, подпись | нет данных |
| Чем открыть | Adobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS) | Microsoft Excel, LibreOffice Calc, Google Таблицы, OnlyOffice, Apple Numbers, WPS Office |
| Спецификация | Описание формата | Описание формата |
| MIME-тип | нет данных | application/vnd.openxmlformats-officedocument.spreadsheetml.sheet |
| Структура | нет данных | ZIP-контейнер с XML |
| Размер листа | нет данных | 1 048 576 строк × 16 384 столбца |
| Формулы | нет данных | Хранятся вместе с результатами вычислений |
| Макросы | нет данных | Не поддерживаются, только в XLSM |
Преобразование PDF → XLSX
Прямого фильтра импорта PDF в табличный модуль LibreOffice не существует: PDF читают фильтры Writer, Impress и Draw, а запись XLSX принимает только документ типа «таблица». Поэтому маршрут составной — pdftohtml разбирает страницы в разметку, а модуль Calc читает её веб-запросом. Из PDF при этом извлекается текст с координатами, а не строки и столбцы: сетки таблицы в формате не существует.
Что попадает в книгу: текстовые фрагменты страниц в порядке чтения, разложенные по ячейкам настолько, насколько промежуточная разметка сумела распознать колоночную структуру. Что не попадает: формулы, поскольку в PDF хранятся только вычисленные значения; объединённые ячейки и многоэтажные шапки, поскольку признаков объединения в исходнике нет; оформление, изображения и подписи к диаграммам. Диаграмма в PDF — это векторный рисунок, а не ряд данных, и восстановить из неё числа нельзя.
Числовые колонки требуют отдельного внимания. Суммы, записанные с неразрывным пробелом между разрядами, с символом валюты или с запятой в роли десятичного разделителя, попадают в ячейку текстом: Calc и Excel считают такое значение строкой, и агрегатные функции по колонке дадут ноль. Признак опознаётся выравниванием — число прижимается вправо, текст влево. Приведение к числовому типу выполняется штатной заменой разделителей и повторным вводом формата ячейки.
Страница без текстового слоя даёт пустую книгу: извлекать из растра нечего, распознавания в сервисе нет. Маршрут проходит два движка подряд и стоит дороже обычной конвертации, поэтому предел размера входа понижен, на задание отведено 10 минут, а файлы обрабатываются по одному. Исходник и результат стираются через 60 минут.
Порядок преобразования PDF → XLSX
Шаг 1
Проверка извлекаемости
Выделите в исходном документе любое число мышью. Если выделение не встаёт, текстового слоя нет, и книга получится пустой — маршрут рассчитан на документы, сформированные программно, а не на сканы.
Шаг 2
Передача документа
Принимается один PDF за задание. Настроек у направления нет: разбор идёт по фиксированной связке pdftohtml и фильтра веб-запроса Calc, промежуточная разметка нигде не сохраняется.
Шаг 3
Выполнение
Первый шаг переводит страницы в единый документ разметки в UTF-8, второй читает его модулем таблиц и записывает XLSX. Отчёт на несколько десятков полос обрабатывается за десятки секунд.
Шаг 4
Разбор колонок
Откройте книгу и приведите числовые колонки к числовому формату, а слипшиеся значения разделите штатной командой разбора текста по столбцам. Это ожидаемый этап работы, а не признак сбоя конвертации.
Вопросы по работе сервиса
Почему таблица не восстановилась целиком?
В PDF нет разметки строк и столбцов — только текстовые фрагменты с координатами и отдельно нарисованные линии. Восстановление сетки означало бы угадывание границ колонок по расстояниям между словами, что на отчётах с выравниванием по правому краю ошибается систематически. Поэтому текст переносится в порядке чтения, а сборка структуры остаётся за вами.
Можно ли извлечь из документа сами формулы?
Нет, и восстановить их невозможно: PDF содержит результат вычисления, а не выражение. Даже исходная книга, напечатанная в PDF, теряет зависимости между ячейками безвозвратно. Если расчёты нужны рабочими, запрашивайте у отправителя исходный файл таблицы.
Почему числа не суммируются?
Они попали в ячейки текстом. Причина — разделитель разрядов, символ валюты или десятичная запятая при английской локали книги. Проверьте выравнивание в ячейке: прижатое влево значение — строка. После замены разделителей и назначения числового формата агрегатные функции начнут работать.
Почему направление принимает только один файл?
Маршрут составной: два движка последовательно, промежуточный документ разметки и повышенный расход памяти на разбор координат. Пакет из десяти отчётов занял бы очередь на десятки минут, поэтому задания на это направление выполняются по одному документу.