Направление конвертации
Конвертация PDF в Word
Преобразование PDF → Word на сервере, без установки программ
- Загрузить
- Выбрать формат
- Скачать
Загрузка файлов
Область приёма файла
или
Файлы PDF. До 5 МБ, до 20 файлов за раз. Изображение можно вставить из буфера обмена: Ctrl+V.
PDF хранит готовую вёрстку, а не структуру документа, поэтому текст, изображения и расположение блоков переносятся приблизительно: колонки, сложные таблицы и нестандартные шрифты могут сместиться. Отсканированные PDF без текстового слоя останутся набором картинок.
Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.
PDF и DOCX: характеристики
| Характеристика | .pdfPDF | .docxDOCX |
|---|---|---|
| Полное название | Portable Document Format | Office Open XML Document |
| Разработчик | Adobe | Microsoft |
| Год появления | 1993 | 2007 |
| Расширение | .docx | |
| MIME-типы | application/pdf, application/x-pdf, application/acrobat | нет данных |
| Содержимое | Текст, вектор, растр, формы | Двоичное |
| Прозрачность | Поддерживается | нет данных |
| Несколько страниц в файле | Поддерживается | Поддерживается |
| Стандарт | ISO 32000-2 | ECMA-376 / ISO 29500 |
| Вёрстка | Фиксированная, не зависит от устройства | нет данных |
| Шрифты | Встраиваются в файл | нет данных |
| Защита | Пароль, права доступа, подпись | нет данных |
| Чем открыть | Adobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS) | Microsoft Word, LibreOffice Writer, OnlyOffice, WPS Office, Google Документы, Apple Pages |
| Спецификация | Описание формата | Описание формата |
| MIME-тип | нет данных | application/vnd.openxmlformats-officedocument.wordprocessingml.document |
| Структура | нет данных | ZIP-контейнер с XML |
| Редактирование | нет данных | Полное, с сохранением стилей |
| Макросы | нет данных | Не поддерживаются, только в DOCM |
| Совместимость | нет данных | Word 2007 и новее, LibreOffice |
Преобразование PDF → DOCX
PDF описывает лист как изображение из команд: в потоке содержимого записано, каким шрифтом и в какой точке страницы поставлен глиф, но сведений о том, где кончается абзац и начинается ячейка, там нет. Фильтр импорта LibreOffice восстанавливает структуру по геометрии — межстрочным расстояниям, координатам линеек, порядку фрагментов — и записывает её в OOXML. Точность реконструкции задаётся тем, насколько исходная полоса похожа на поток абзацев.
Уверенно переносятся текстовые фрагменты вместе с гарнитурой, кеглем и цветом, растровые вставки и таблицы с нарисованными линейками: линия в PDF — это графический объект с координатами, и границы ячеек собираются именно по ней. Таблица, свёрстанная отбивками без линеек, границ не содержит вовсе и распадается на независимые абзацы. Колонтитул для формата неотличим от текстового блока в верхней части листа, поэтому в DOCX он попадает в тело документа, а не в область колонтитула. Многоколоночная полоса делится по вертикальным просветам: при узком межколонном пробеле колонки сливаются в одну.
Шрифты внутри PDF почти всегда встроены подмножествами — только использованные глифы, нередко с переименованной гарнитурой. При импорте подбирается метрически совместимое семейство из установленных на сервере, из-за чего ширина строк смещается на доли миллиметра и переносы встают в других местах. Кернинг и трекинг не переносятся как свойства: в PDF они уже растворены в координатах глифов, а в DOCX задаются параметрами абзаца, которых в исходнике не существует.
Страница без текстового слоя даёт единственную картинку на всю полосу. Распознавания в сервисе нет, поэтому символам взяться неоткуда; такой файл опознаётся по нулевому объёму извлекаемого текста — поиск по документу в просмотрщике не находит ни одного слова. Импорт PDF существенно дороже открытия офисного файла: предел входа у направления понижен относительно остальных документных маршрутов, на задание отведено 10 минут, а несколько файлов обрабатываются в одном задании и возвращаются архивом ZIP.
Порядок преобразования PDF → DOCX
Шаг 1
Проверка текстового слоя
Откройте исходник в просмотрщике и выполните поиск по слову, которое видно на странице. Ноль совпадений означает, что перед вами растровая копия документа, и результатом станет DOCX с изображениями страниц.
Шаг 2
Передача файла
Тип входа определяется по сигнатуре — заголовку %PDF- в первых байтах, а не по расширению. В одно задание принимается набор документов; параметров у этого направления нет, реконструкция идёт по фиксированному набору правил фильтра.
Шаг 3
Выполнение
Документ разбирается фильтром импорта, раскладывается по модели Writer и сохраняется фильтром MS Word 2007 XML. Текстовая полоса на десяток страниц занимает секунды, насыщенная графикой вёрстка — до нескольких минут.
Шаг 4
Сверка структуры
Проверьте в результате три места, где реконструкция ошибается чаще всего: границы таблиц, области колонтитулов и нумерацию многоуровневых списков. Остальное правится обычными средствами редактора.
Вопросы по работе сервиса
Почему таблица превратилась в набор абзацев?
Потому что в исходнике её не было. PDF хранит текст с координатами и отдельно — нарисованные линии; понятия «строка таблицы» в формате нет. Если ячейки были разделены линейками, фильтр соберёт сетку по ним. Если таблица держалась на отступах, восстанавливать нечего, и фрагменты становятся отдельными абзацами.
Что получится из отсканированного документа?
DOCX, в котором на каждой странице лежит одно изображение. Оптического распознавания сервис не выполняет, и добавить его к этому маршруту нельзя: OCR — это отдельная задача с собственной моделью и собственной вероятностью ошибки, а выдавать её результат за точную конвертацию некорректно.
Останется ли исходная гарнитура?
Только если она установлена на сервере. Подмножество шрифта, встроенное в PDF, содержит контуры использованных глифов, но пригодно для отрисовки, а не для установки в систему. Стандартные семейства — Times New Roman, Arial, Calibri — подменяются метрически совместимыми аналогами без заметного сдвига строк.
Совпадёт ли разбивка на страницы с оригиналом?
Не обязательно. В PDF разбивка зафиксирована координатами, в DOCX она пересчитывается редактором из метрик шрифтов, полей и интерлиньяжа при каждом открытии. Расхождение в одну-две строки на страницу — обычное поведение потоковой модели, а не дефект конвертации.