Направление конвертации
Конвертация DOCX в TXT
Преобразование DOCX → TXT на сервере, без установки программ
- Загрузить
- Выбрать формат
- Скачать
Загрузка файлов
Область приёма файла
или
Файлы DOCX. До 5 МБ, до 20 файлов за раз. Изображение можно вставить из буфера обмена: Ctrl+V.
Остаётся только текст в кодировке UTF-8: изображения, таблицы, колонтитулы и любое форматирование отбрасываются.
Исходники и результаты хранятся 60 минут, затем стираются фоновым уборщиком. Предельный размер файла — 5 МБ, срок хранения — час.
DOCX и TXT: характеристики
| Характеристика | .docxDOCX | .txtTXT |
|---|---|---|
| Полное название | Office Open XML Document | Plain Text File |
| Разработчик | Microsoft | нет данных |
| Год появления | 2007 | нет данных |
| Расширение | .docx | .txt |
| MIME-тип | application/vnd.openxmlformats-officedocument.wordprocessingml.document | text/plain |
| Содержимое | Двоичное | Текстовое |
| Несколько страниц в файле | Поддерживается | Нет |
| Структура | ZIP-контейнер с XML | нет данных |
| Стандарт | ECMA-376 / ISO 29500 | нет данных |
| Редактирование | Полное, с сохранением стилей | нет данных |
| Макросы | Не поддерживаются, только в DOCM | нет данных |
| Совместимость | Word 2007 и новее, LibreOffice | Любая операционная система |
| Чем открыть | Microsoft Word, LibreOffice Writer, OnlyOffice, WPS Office, Google Документы, Apple Pages | Блокнот, Notepad++, VS Code, Sublime Text, TextEdit (macOS), gedit |
| Спецификация | Описание формата | нет данных |
| Форматирование | нет данных | Отсутствует |
| Кодировки | нет данных | UTF-8, Windows-1251, UTF-16 |
| Переводы строк | нет данных | CRLF (Windows) или LF (Unix, macOS) |
Преобразование DOCX → TXT
Обычный текстовый файл не хранит ничего, кроме последовательности символов: ни начертаний, ни размеров, ни таблиц, ни изображений — в нём нет места, где эти сведения могли бы находиться. Конвертация извлекает из DOCX содержимое абзацев и записывает его в UTF-8, где кириллический символ занимает два байта, а латиница и цифры — один. Всё остальное отбрасывается по устройству целевого формата.
В результат попадает основной текст в порядке следования абзацев. Отбрасываются гарнитуры, кегли, цвета, выравнивание, отступы, изображения, диаграммы, рамки, колонтитулы и нумерация страниц. Таблица разворачивается в последовательность строк, и колоночная структура при этом исчезает: чтобы сохранить деление на поля, нужен формат с разделителями — выгрузка в CSV или в книгу таблиц, а не в плоский текст.
Кодировка результата — UTF-8, набор, в котором работают современные редакторы, интерпретаторы и системы контроля версий. Приёмник, ожидающий однобайтовую кодировку Windows-1251, покажет кириллицу как пары посторонних символов: данные при этом целы, расходится только интерпретация байтов. Перекодировка выполняется сохранением файла из любого редактора с явным выбором набора символов.
Типовая задача направления — снять чужую разметку перед вставкой текста в другую систему, подготовить содержимое для обработки скриптом или отправить его туда, где вложения офисных форматов не принимаются. Объём результата обычно в десятки раз меньше исходника: почти весь вес DOCX создают описания стилей и вложенные изображения. Направление принимает несколько документов за задание.
Порядок преобразования DOCX → TXT
Шаг 1
Оценка потерь
Убедитесь, что таблицы и изображения в результате не нужны: восстановить их из текстового файла невозможно. Для табличных данных выбирайте маршрут в CSV или в книгу таблиц.
Шаг 2
Передача документов
В одно задание принимается набор файлов, ограничение действует на каждый отдельно. Настроек у направления нет: кодировка результата фиксирована фильтром экспорта.
Шаг 3
Извлечение
Документ открывается модулем Writer и сохраняется текстовым фильтром с кодировкой UTF-8. Обработка занимает секунды даже на сотнях страниц: разметка при этом не пересчитывается, а отбрасывается.
Шаг 4
Открытие результата
Используйте редактор, читающий UTF-8. Если принимающая система требует однобайтовую кодировку, пересохраните файл с явным указанием нужного набора символов — содержимое от этого не изменится.
Вопросы по работе сервиса
Каким набором символов записан результат?
В UTF-8. Кириллический символ занимает в ней два байта, латинский — один, поэтому русский текст в байтах примерно вдвое длиннее, чем в однобайтовых кодировках. Современные редакторы, браузеры и языки программирования читают этот набор без дополнительных указаний.
Что происходит с таблицами?
Они разворачиваются в последовательность строк: признака колонки в текстовом файле не существует. Если структура полей важна, используйте формат с разделителями — там границы ячеек кодируются символом-разделителем и сохраняются при чтении.
Что происходит с колонтитулами и сносками?
Они отбрасываются. Колонтитулы, номера страниц и сноски относятся к разметке полосы, которой в плоском тексте нет. Сохраняется только содержимое основного потока документа, включая текст врезок, если он входит в этот поток.
Почему файл получился в десятки раз меньше?
Потому что почти весь объём DOCX создают не символы, а описания стилей, нумерации, отношения между частями архива и вложенные изображения. После их отбрасывания остаётся чистая последовательность символов, и её размер считается прямо: примерно два байта на букву кириллицы.