Направление конвертации
Конвертация PDF в HTML
Преобразование PDF → HTML на сервере, без установки программ
- Загрузить
- Выбрать формат
- Скачать
Загрузка файлов
Область приёма файла
или
Файлы PDF. До 5 МБ, до 20 файлов за раз. Изображение можно вставить из буфера обмена: Ctrl+V.
Получается одна HTML-страница с картинками внутри файла. Текст расставляется абсолютным позиционированием, поэтому вёрстка не подстраивается под ширину экрана.
Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.
PDF и HTML: характеристики
| Характеристика | .pdfPDF | .htmlHTML |
|---|---|---|
| Полное название | Portable Document Format | HyperText Markup Language |
| Разработчик | Adobe | WHATWG (изначально Тим Бернерс-Ли, CERN) |
| Год появления | 1993 | 1993 |
| Расширение | нет данных | |
| MIME-типы | application/pdf, application/x-pdf, application/acrobat | нет данных |
| Содержимое | Текст, вектор, растр, формы | Текстовое |
| Прозрачность | Поддерживается | нет данных |
| Несколько страниц в файле | Поддерживается | Нет |
| Стандарт | ISO 32000-2 | HTML Living Standard (WHATWG) |
| Вёрстка | Фиксированная, не зависит от устройства | нет данных |
| Шрифты | Встраиваются в файл | нет данных |
| Защита | Пароль, права доступа, подпись | нет данных |
| Чем открыть | Adobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS) | Google Chrome, Mozilla Firefox, Microsoft Edge, VS Code, Notepad++, LibreOffice Writer |
| Спецификация | Описание формата | Описание формата |
| Расширения | нет данных | .html, .htm |
| MIME-тип | нет данных | text/html |
| Структура | нет данных | Дерево элементов, DOM |
| Ресурсы | нет данных | Стили, скрипты и картинки — внешние файлы |
| Кодировка | нет данных | UTF-8 |
| Просмотр | нет данных | Любой браузер, без установки программ |
Преобразование PDF → HTML
HTML — документ, расширение .html, тип text/html, текстовый файл. Текстовый слой PDF с координатами каждого фрагмента разбирается и восстанавливается в структуру HTML. PDF описывает положение текста на листе, а не структуру документа, поэтому абзацы, колонки и таблицы восстанавливаются эвристикой.
PDF — документ, расширение .pdf, тип application/pdf, поддерживает прозрачность, несколько страниц в одном файле. HTML — документ, расширение .html, тип text/html, текстовый файл. HTML применяется точечно — там, где его требует принимающая программа или площадка.
Фрагменты группируются в строки по базовой линии, строки — в абзацы по межстрочному расстоянию, колонки — по вертикальным разрывам. Одноколоночный текст восстанавливается практически без ошибок; многоколоночная вёрстка, врезки и таблицы без линеек дают смещения. Встроенные изображения переносятся вместе с текстом.
Параметры преобразования: диапазон страниц — список номеров и интервалов. За одно задание принимается несколько файлов, результат отдаётся отдельными файлами и общим ZIP-архивом. Предельный размер указан в форме загрузки: у каждого направления свой лимит, и он не превышает общего ограничения сервиса.
Вес HTML определяется содержимым — объёмом текста, числом изображений и встроенными шрифтами; отдельного параметра размера у направления нет. Преобразование выполняется на сервере и не зависит от установленного софта: результат одинаков при запуске с любого устройства.
Порядок преобразования PDF → HTML
Шаг 1
Исходный файл
Поле загрузки принимает несколько файлов PDF за одно задание — перетаскиванием или выбором на диске. Формат определяется по сигнатуре содержимого, а не по расширению: переименованный файл распознаётся верно.
Шаг 2
Параметры
Доступные значения: диапазон страниц — список номеров и интервалов. Значения по умолчанию рассчитаны на типовой файл и меняются в блоке дополнительных настроек.
Шаг 3
Обработка
Задание ставится в очередь и выполняется на сервере; состояние отображается на странице. Обработка занимает от долей секунды до минуты в зависимости от объёма файла.
Шаг 4
Результат
Файлы забираются по одному или общим ZIP-архивом. Ссылка действует один час, после чего исходный файл и результат удаляются с сервера.
Вопросы по работе сервиса
Почему из некоторых файлов не извлекается ничего?
Потому что в них нет текстового слоя: сканы и фотографии страниц содержат только изображения. Распознавание символов (OCR) сервис не выполняет, поэтому такие документы конвертируются в пустой или почти пустой результат.
Каков предел размера файла?
Действующее значение показано в форме загрузки: у каждого направления свой предел, он зависит от стоимости преобразования и не превышает общего ограничения сервиса. Ограничение применяется к каждому файлу задания отдельно.
Что требуется на стороне пользователя?
Только браузер: расчёты выполняются на сервере, локальные кодеки и установленные программы на результат не влияют. Регистрация не требуется, водяные знаки на результат не наносятся.
Сколько файлы хранятся на сервере?
Один час с момента загрузки: после этого исходный файл и результат удаляются, а ссылка перестаёт отвечать. Адрес содержит случайный идентификатор, поэтому перебор чужих файлов невозможен.