Конвертировать PDF в Markdown
Превратите PDF в структурированный текст Markdown: заголовки, абзацы, списки, таблицы и ссылки восстанавливаются, а колонтитулы и номера страниц удаляются. Идеально, чтобы передать документ ChatGPT, Claude или в вашу вики.
- Бесплатно
- Заголовки, списки, таблицы
- Счётчик токенов
- Без отправки файла
100 % приватно — Всё обрабатывается прямо в вашем браузере: файлы, голос и изображение никогда не отправляются на серверы Chatzam.
Как конвертировать PDF в Markdown?
-
Загрузите PDF
Перетащите файл: его страницы читаются прямо в вашем браузере.
-
Настройте конвертацию
Оставьте весь документ или несколько страниц и выберите, удалять ли колонтитулы, отмечать ли начало страниц и обозначать ли изображения.
-
Скопируйте или скачайте
Проверьте результат в виде исходного Markdown или в предпросмотре, затем скопируйте его или скачайте файл .md.
Markdown, точно передающий структуру PDF
Заголовки и оформление
Размеры шрифта превращаются в заголовки #, ## и ###, жирный шрифт и курсив сохраняются.
Колонки и абзацы
Вёрстка в две колонки читается по порядку, строки склеиваются в абзацы, а слова с переносом в конце строки соединяются.
Списки, таблицы и ссылки
Маркеры, нумерованные списки, простые таблицы и активные ссылки конвертируются в синтаксис Markdown.
Создано для нейросетей
Повторяющиеся колонтитулы и номера страниц удаляются, а счётчик оценивает число токенов.
Зачем конвертировать PDF в Markdown?
Markdown — это простой текст с несколькими символами разметки: решётка для заголовка, дефис для пункта списка, вертикальные черты для таблицы. Его можно читать без специальных программ, править в любом редакторе, и он аккуратно отображается на GitHub, в Notion, Obsidian или корпоративной вики. Кроме того, это формат, который ИИ-ассистенты понимают лучше всего: когда вы вставляете отчёт в ChatGPT или Claude, иерархия заголовков и таблицы помогают им пересказать, сравнить или ответить на конкретный вопрос. Простое копирование из программы просмотра PDF часто смешивает колонки, рвёт фразы на каждой строке и повторяет колонтитулы; конвертация в Markdown избавляет от этих недостатков.
Как восстанавливается структура?
В PDF нет заголовков и абзацев — только фрагменты текста, размещённые по точным координатам. Инструмент определяет размер шрифта основного текста, а затем ранжирует более крупные размеры: самый крупный становится заголовком первого уровня, следующий — второго и так далее. Он находит колонки по пустому промежутку между ними, склеивает строки одного абзаца и убирает дефисы переноса. Строки, выровненные в несколько ячеек, образуют таблицу, а маркеры и номера начинают список. Тексты, повторяющиеся вверху или внизу большинства страниц, например название отчёта или «Страница 3 из 12», отбрасываются.
Токены, ограничения и отсканированные PDF
Нейросети измеряют длину текста в токенах — фрагментах слов. Счётчик даёт порядок величины, примерно один токен на четыре символа: удобно, чтобы понять, поместится ли документ в один диалог или лучше отправить только некоторые страницы. Изображения не конвертируются, но их место можно отметить. Сложная графическая вёрстка, например буклет или таблица с объединёнными ячейками, иногда требует вычитки. Наконец, отсканированный PDF содержит только изображения страниц: инструмент сообщит об этом и предложит сначала пропустить его через OCR, чтобы текст стал читаемым. Файл обрабатывается в вашем браузере и никогда не отправляется.
Частые вопросы
Как передать PDF в ChatGPT без потери форматирования?
Конвертируйте его в Markdown: заголовки, списки и таблицы останутся понятными для нейросети. Вставьте результат в диалог или прикрепите файл .md.
Сохраняются ли таблицы из PDF?
Простые таблицы с ровными столбцами становятся таблицами Markdown. Таблицы с объединёнными ячейками или сложным оформлением могут потребовать доработки.
Мой PDF загружается на сервер?
Нет. PDF читается и конвертируется полностью в вашем браузере; он не покидает ваше устройство.
Почему результат пустой?
Скорее всего, ваш PDF — это скан: его страницы являются изображениями без текста. Сначала сделайте его доступным для поиска инструментом «OCR PDF», а затем конвертируйте.
Что означает показанное число токенов?
Это оценка длины текста в том виде, в каком её считают нейросети, из расчёта примерно четыре символа на токен. Точное число зависит от используемой модели.