Перейти к содержимому

Направление конвертации

Конвертация PDF в HTML

Преобразование PDF → HTML на сервере, без установки программ

.pdf.html

.pdf.html
  1. Загрузить
  2. Выбрать формат
  3. Скачать

Загрузка файлов

Область приёма файла

или

Файлы PDF. До 5 МБ, до 20 файлов за раз. Изображение можно вставить из буфера обмена: Ctrl+V.

Получается одна HTML-страница с картинками внутри файла. Текст расставляется абсолютным позиционированием, поэтому вёрстка не подстраивается под ширину экрана.

Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.

PDF и HTML: характеристики

Характеристики форматов PDF и HTML рядом
Характеристика.pdfPDF.htmlHTML
Полное названиеPortable Document FormatHyperText Markup Language
РазработчикAdobeWHATWG (изначально Тим Бернерс-Ли, CERN)
Год появления19931993
Расширение.pdfнет данных
MIME-типыapplication/pdf, application/x-pdf, application/acrobatнет данных
СодержимоеТекст, вектор, растр, формыТекстовое
ПрозрачностьПоддерживаетсянет данных
Несколько страниц в файлеПоддерживаетсяНет
СтандартISO 32000-2HTML Living Standard (WHATWG)
ВёрсткаФиксированная, не зависит от устройстванет данных
ШрифтыВстраиваются в файлнет данных
ЗащитаПароль, права доступа, подписьнет данных
Чем открытьAdobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS)Google Chrome, Mozilla Firefox, Microsoft Edge, VS Code, Notepad++, LibreOffice Writer
СпецификацияОписание форматаОписание формата
Расширениянет данных.html, .htm
MIME-типнет данныхtext/html
Структуранет данныхДерево элементов, DOM
Ресурсынет данныхСтили, скрипты и картинки — внешние файлы
Кодировканет данныхUTF-8
Просмотрнет данныхЛюбой браузер, без установки программ

Преобразование PDF → HTML

HTML — документ, расширение .html, тип text/html, текстовый файл. Текстовый слой PDF с координатами каждого фрагмента разбирается и восстанавливается в структуру HTML. PDF описывает положение текста на листе, а не структуру документа, поэтому абзацы, колонки и таблицы восстанавливаются эвристикой.

PDF — документ, расширение .pdf, тип application/pdf, поддерживает прозрачность, несколько страниц в одном файле. HTML — документ, расширение .html, тип text/html, текстовый файл. HTML применяется точечно — там, где его требует принимающая программа или площадка.

Фрагменты группируются в строки по базовой линии, строки — в абзацы по межстрочному расстоянию, колонки — по вертикальным разрывам. Одноколоночный текст восстанавливается практически без ошибок; многоколоночная вёрстка, врезки и таблицы без линеек дают смещения. Встроенные изображения переносятся вместе с текстом.

Параметры преобразования: диапазон страниц — список номеров и интервалов. За одно задание принимается несколько файлов, результат отдаётся отдельными файлами и общим ZIP-архивом. Предельный размер указан в форме загрузки: у каждого направления свой лимит, и он не превышает общего ограничения сервиса.

Вес HTML определяется содержимым — объёмом текста, числом изображений и встроенными шрифтами; отдельного параметра размера у направления нет. Преобразование выполняется на сервере и не зависит от установленного софта: результат одинаков при запуске с любого устройства.

Порядок преобразования PDF → HTML

  1. Шаг 1

    Исходный файл

    Поле загрузки принимает несколько файлов PDF за одно задание — перетаскиванием или выбором на диске. Формат определяется по сигнатуре содержимого, а не по расширению: переименованный файл распознаётся верно.

  2. Шаг 2

    Параметры

    Доступные значения: диапазон страниц — список номеров и интервалов. Значения по умолчанию рассчитаны на типовой файл и меняются в блоке дополнительных настроек.

  3. Шаг 3

    Обработка

    Задание ставится в очередь и выполняется на сервере; состояние отображается на странице. Обработка занимает от долей секунды до минуты в зависимости от объёма файла.

  4. Шаг 4

    Результат

    Файлы забираются по одному или общим ZIP-архивом. Ссылка действует один час, после чего исходный файл и результат удаляются с сервера.

Вопросы по работе сервиса

Почему из некоторых файлов не извлекается ничего?

Потому что в них нет текстового слоя: сканы и фотографии страниц содержат только изображения. Распознавание символов (OCR) сервис не выполняет, поэтому такие документы конвертируются в пустой или почти пустой результат.

Каков предел размера файла?

Действующее значение показано в форме загрузки: у каждого направления свой предел, он зависит от стоимости преобразования и не превышает общего ограничения сервиса. Ограничение применяется к каждому файлу задания отдельно.

Что требуется на стороне пользователя?

Только браузер: расчёты выполняются на сервере, локальные кодеки и установленные программы на результат не влияют. Регистрация не требуется, водяные знаки на результат не наносятся.

Сколько файлы хранятся на сервере?

Один час с момента загрузки: после этого исходный файл и результат удаляются, а ссылка перестаёт отвечать. Адрес содержит случайный идентификатор, поэтому перебор чужих файлов невозможен.