Перейти к содержимому

Направление конвертации

Конвертация PDF в Word

Преобразование PDF → Word на сервере, без установки программ

.pdf.docx

.pdf.docx
  1. Загрузить
  2. Выбрать формат
  3. Скачать

Загрузка файлов

Область приёма файла

или

Файлы PDF. До 5 МБ, до 20 файлов за раз. Изображение можно вставить из буфера обмена: Ctrl+V.

PDF хранит готовую вёрстку, а не структуру документа, поэтому текст, изображения и расположение блоков переносятся приблизительно: колонки, сложные таблицы и нестандартные шрифты могут сместиться. Отсканированные PDF без текстового слоя останутся набором картинок.

Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.

PDF и DOCX: характеристики

Характеристики форматов PDF и DOCX рядом
Характеристика.pdfPDF.docxDOCX
Полное названиеPortable Document FormatOffice Open XML Document
РазработчикAdobeMicrosoft
Год появления19932007
Расширение.pdf.docx
MIME-типыapplication/pdf, application/x-pdf, application/acrobatнет данных
СодержимоеТекст, вектор, растр, формыДвоичное
ПрозрачностьПоддерживаетсянет данных
Несколько страниц в файлеПоддерживаетсяПоддерживается
СтандартISO 32000-2ECMA-376 / ISO 29500
ВёрсткаФиксированная, не зависит от устройстванет данных
ШрифтыВстраиваются в файлнет данных
ЗащитаПароль, права доступа, подписьнет данных
Чем открытьAdobe Acrobat Reader, Foxit Reader, SumatraPDF, Google Chrome, Microsoft Edge, Просмотр (macOS)Microsoft Word, LibreOffice Writer, OnlyOffice, WPS Office, Google Документы, Apple Pages
СпецификацияОписание форматаОписание формата
MIME-типнет данныхapplication/vnd.openxmlformats-officedocument.wordprocessingml.document
Структуранет данныхZIP-контейнер с XML
Редактированиенет данныхПолное, с сохранением стилей
Макросынет данныхНе поддерживаются, только в DOCM
Совместимостьнет данныхWord 2007 и новее, LibreOffice

Преобразование PDF → DOCX

PDF описывает лист как изображение из команд: в потоке содержимого записано, каким шрифтом и в какой точке страницы поставлен глиф, но сведений о том, где кончается абзац и начинается ячейка, там нет. Фильтр импорта LibreOffice восстанавливает структуру по геометрии — межстрочным расстояниям, координатам линеек, порядку фрагментов — и записывает её в OOXML. Точность реконструкции задаётся тем, насколько исходная полоса похожа на поток абзацев.

Уверенно переносятся текстовые фрагменты вместе с гарнитурой, кеглем и цветом, растровые вставки и таблицы с нарисованными линейками: линия в PDF — это графический объект с координатами, и границы ячеек собираются именно по ней. Таблица, свёрстанная отбивками без линеек, границ не содержит вовсе и распадается на независимые абзацы. Колонтитул для формата неотличим от текстового блока в верхней части листа, поэтому в DOCX он попадает в тело документа, а не в область колонтитула. Многоколоночная полоса делится по вертикальным просветам: при узком межколонном пробеле колонки сливаются в одну.

Шрифты внутри PDF почти всегда встроены подмножествами — только использованные глифы, нередко с переименованной гарнитурой. При импорте подбирается метрически совместимое семейство из установленных на сервере, из-за чего ширина строк смещается на доли миллиметра и переносы встают в других местах. Кернинг и трекинг не переносятся как свойства: в PDF они уже растворены в координатах глифов, а в DOCX задаются параметрами абзаца, которых в исходнике не существует.

Страница без текстового слоя даёт единственную картинку на всю полосу. Распознавания в сервисе нет, поэтому символам взяться неоткуда; такой файл опознаётся по нулевому объёму извлекаемого текста — поиск по документу в просмотрщике не находит ни одного слова. Импорт PDF существенно дороже открытия офисного файла: предел входа у направления понижен относительно остальных документных маршрутов, на задание отведено 10 минут, а несколько файлов обрабатываются в одном задании и возвращаются архивом ZIP.

Порядок преобразования PDF → DOCX

  1. Шаг 1

    Проверка текстового слоя

    Откройте исходник в просмотрщике и выполните поиск по слову, которое видно на странице. Ноль совпадений означает, что перед вами растровая копия документа, и результатом станет DOCX с изображениями страниц.

  2. Шаг 2

    Передача файла

    Тип входа определяется по сигнатуре — заголовку %PDF- в первых байтах, а не по расширению. В одно задание принимается набор документов; параметров у этого направления нет, реконструкция идёт по фиксированному набору правил фильтра.

  3. Шаг 3

    Выполнение

    Документ разбирается фильтром импорта, раскладывается по модели Writer и сохраняется фильтром MS Word 2007 XML. Текстовая полоса на десяток страниц занимает секунды, насыщенная графикой вёрстка — до нескольких минут.

  4. Шаг 4

    Сверка структуры

    Проверьте в результате три места, где реконструкция ошибается чаще всего: границы таблиц, области колонтитулов и нумерацию многоуровневых списков. Остальное правится обычными средствами редактора.

Вопросы по работе сервиса

Почему таблица превратилась в набор абзацев?

Потому что в исходнике её не было. PDF хранит текст с координатами и отдельно — нарисованные линии; понятия «строка таблицы» в формате нет. Если ячейки были разделены линейками, фильтр соберёт сетку по ним. Если таблица держалась на отступах, восстанавливать нечего, и фрагменты становятся отдельными абзацами.

Что получится из отсканированного документа?

DOCX, в котором на каждой странице лежит одно изображение. Оптического распознавания сервис не выполняет, и добавить его к этому маршруту нельзя: OCR — это отдельная задача с собственной моделью и собственной вероятностью ошибки, а выдавать её результат за точную конвертацию некорректно.

Останется ли исходная гарнитура?

Только если она установлена на сервере. Подмножество шрифта, встроенное в PDF, содержит контуры использованных глифов, но пригодно для отрисовки, а не для установки в систему. Стандартные семейства — Times New Roman, Arial, Calibri — подменяются метрически совместимыми аналогами без заметного сдвига строк.

Совпадёт ли разбивка на страницы с оригиналом?

Не обязательно. В PDF разбивка зафиксирована координатами, в DOCX она пересчитывается редактором из метрик шрифтов, полей и интерлиньяжа при каждом открытии. Расхождение в одну-две строки на страницу — обычное поведение потоковой модели, а не дефект конвертации.