Перейти к содержимому

Направление конвертации

Конвертация PDF в Excel

Преобразование PDF → Excel на сервере, без установки программ

.pdf.xlsx

.pdf.xlsx
  1. Загрузить
  2. Выбрать формат
  3. Скачать

Загрузка файла

Область приёма файла

или

Файлы PDF. До 5 МБ. Изображение можно вставить из буфера обмена: Ctrl+V.

В PDF нет разметки строк и столбцов: там хранится только текст с координатами. Текст переносится в ячейки в порядке чтения, страница за страницей, а сетку таблицы — границы колонок, объединённые ячейки, многострочные заголовки — почти всегда приходится собирать вручную, например командой «Данные → Текст по столбцам».

Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.

PDF и XLSX: характеристики

Характеристики форматов PDF и XLSX рядом
Характеристика.pdfPDF.xlsxXLSX
Полное названиеPortable Document FormatOffice Open XML Workbook
РазработчикAdobeMicrosoft
Год появления19932007
Расширение.pdf.xlsx
MIME-типыapplication/pdf, application/x-pdf, application/acrobatнет данных
СодержимоеТекст, вектор, растр, формыДвоичное
ПрозрачностьПоддерживаетсянет данных
Несколько страниц в файлеПоддерживаетсяПоддерживается
СтандартISO 32000-2ECMA-376 / ISO 29500
ВёрсткаФиксированная, не зависит от устройстванет данных
ШрифтыВстраиваются в файлнет данных
ЗащитаПароль, права доступа, подписьнет данных
Чем открытьAdobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS)Microsoft Excel, LibreOffice Calc, Google Таблицы, OnlyOffice, Apple Numbers, WPS Office
СпецификацияОписание форматаОписание формата
MIME-типнет данныхapplication/vnd.openxmlformats-officedocument.spreadsheetml.sheet
Структуранет данныхZIP-контейнер с XML
Размер листанет данных1 048 576 строк × 16 384 столбца
Формулынет данныхХранятся вместе с результатами вычислений
Макросынет данныхНе поддерживаются, только в XLSM

Преобразование PDF → XLSX

Прямого фильтра импорта PDF в табличный модуль LibreOffice не существует: PDF читают фильтры Writer, Impress и Draw, а запись XLSX принимает только документ типа «таблица». Поэтому маршрут составной — pdftohtml разбирает страницы в разметку, а модуль Calc читает её веб-запросом. Из PDF при этом извлекается текст с координатами, а не строки и столбцы: сетки таблицы в формате не существует.

Что попадает в книгу: текстовые фрагменты страниц в порядке чтения, разложенные по ячейкам настолько, насколько промежуточная разметка сумела распознать колоночную структуру. Что не попадает: формулы, поскольку в PDF хранятся только вычисленные значения; объединённые ячейки и многоэтажные шапки, поскольку признаков объединения в исходнике нет; оформление, изображения и подписи к диаграммам. Диаграмма в PDF — это векторный рисунок, а не ряд данных, и восстановить из неё числа нельзя.

Числовые колонки требуют отдельного внимания. Суммы, записанные с неразрывным пробелом между разрядами, с символом валюты или с запятой в роли десятичного разделителя, попадают в ячейку текстом: Calc и Excel считают такое значение строкой, и агрегатные функции по колонке дадут ноль. Признак опознаётся выравниванием — число прижимается вправо, текст влево. Приведение к числовому типу выполняется штатной заменой разделителей и повторным вводом формата ячейки.

Страница без текстового слоя даёт пустую книгу: извлекать из растра нечего, распознавания в сервисе нет. Маршрут проходит два движка подряд и стоит дороже обычной конвертации, поэтому предел размера входа понижен, на задание отведено 10 минут, а файлы обрабатываются по одному. Исходник и результат стираются через 60 минут.

Порядок преобразования PDF → XLSX

  1. Шаг 1

    Проверка извлекаемости

    Выделите в исходном документе любое число мышью. Если выделение не встаёт, текстового слоя нет, и книга получится пустой — маршрут рассчитан на документы, сформированные программно, а не на сканы.

  2. Шаг 2

    Передача документа

    Принимается один PDF за задание. Настроек у направления нет: разбор идёт по фиксированной связке pdftohtml и фильтра веб-запроса Calc, промежуточная разметка нигде не сохраняется.

  3. Шаг 3

    Выполнение

    Первый шаг переводит страницы в единый документ разметки в UTF-8, второй читает его модулем таблиц и записывает XLSX. Отчёт на несколько десятков полос обрабатывается за десятки секунд.

  4. Шаг 4

    Разбор колонок

    Откройте книгу и приведите числовые колонки к числовому формату, а слипшиеся значения разделите штатной командой разбора текста по столбцам. Это ожидаемый этап работы, а не признак сбоя конвертации.

Вопросы по работе сервиса

Почему таблица не восстановилась целиком?

В PDF нет разметки строк и столбцов — только текстовые фрагменты с координатами и отдельно нарисованные линии. Восстановление сетки означало бы угадывание границ колонок по расстояниям между словами, что на отчётах с выравниванием по правому краю ошибается систематически. Поэтому текст переносится в порядке чтения, а сборка структуры остаётся за вами.

Можно ли извлечь из документа сами формулы?

Нет, и восстановить их невозможно: PDF содержит результат вычисления, а не выражение. Даже исходная книга, напечатанная в PDF, теряет зависимости между ячейками безвозвратно. Если расчёты нужны рабочими, запрашивайте у отправителя исходный файл таблицы.

Почему числа не суммируются?

Они попали в ячейки текстом. Причина — разделитель разрядов, символ валюты или десятичная запятая при английской локали книги. Проверьте выравнивание в ячейке: прижатое влево значение — строка. После замены разделителей и назначения числового формата агрегатные функции начнут работать.

Почему направление принимает только один файл?

Маршрут составной: два движка последовательно, промежуточный документ разметки и повышенный расход памяти на разбор координат. Пакет из десяти отчётов занял бы очередь на десятки минут, поэтому задания на это направление выполняются по одному документу.