
Вы отсканировали документ телефоном, получили аккуратный PDF, открываете его на компьютере, пробуете найти в нём слово через поиск, и ничего. Текст не выделяется, поиск пустой. Файл выглядит как документ, а ведёт себя как картинка.
Так и есть. Обычный скан с телефона это картинка, завёрнутая в PDF. Разберёмся, почему так, как это проверить за десять секунд и что сделать, чтобы в скане наконец заработал поиск.
Почему скан это картинка, а не текст
Когда телефон «сканирует» лист, он его фотографирует. Просто аккуратно: выравнивает по краям, убирает фон, повышает контраст. Но внутрь PDF всё равно кладётся изображение, набор пикселей.
Для программы на этих пикселях нет ни букв, ни слов. Она видит цветные точки, а не текст. Поэтому по такому файлу не работает ни поиск, ни выделение, ни копирование. Глазами вы читаете, а компьютер нет.
Что такое текстовый слой
Текстовый слой это невидимая прослойка внутри PDF, где под картинкой лежат распознанные буквы, привязанные каждая к своему месту на странице. Визуально файл тот же самый, но теперь по нему работает поиск, а текст можно выделить и скопировать.
Такой PDF называют searchable, то есть с возможностью поиска. Именно его обычно и имеют в виду, когда говорят «нормальный скан» или «скан, из которого можно копировать».
Как проверить, есть ли текстовый слой
Это займёт несколько секунд:
- Откройте PDF в любой смотрелке или в браузере.
- Попробуйте выделить пару слов курсором или найдите любое слово через поиск (Ctrl+F, на телефоне через меню «Найти на странице»).
- Слова выделяются и находятся, значит слой есть. Курсор скользит по странице как по фото, а поиск ничего не находит, значит слоя нет.
Если проверяете чужой отсканированный документ и поиск по нему не работает, причина ровно эта.
Почему встроенные сканеры почти всегда отдают картинку
Штатные сканеры телефона («Заметки» и «Файлы» на iPhone, Google Диск на Android) заточены на то, чтобы быстро сделать опрятный снимок, а не разобрать текст. Готовый PDF у них остаётся картинкой, без текстового слоя внутри.
Функции распознавания рядом есть, но работают они мимо файла. Live Text на iPhone даёт выделить текст прямо на фото, Google индексирует содержимое, чтобы скан находился поиском по Диску. Это удобство внутри приложения, а не слой, вшитый в PDF: откройте тот же файл в другой программе, и поиск по нему снова молчит.
Так что дело не в том, что вы «неправильно сканировали». Штатный сканер по своей задаче и не должен встраивать текст в файл. Это отдельный шаг.
Как сделать из скана PDF с текстом
Тот самый отдельный шаг называется OCR: программа находит на изображении буквы и добавляет под картинку тот самый текстовый слой. Сам скан при этом можно сделать телефоном как обычно, пошагово это разобрано отдельно, а распознавание уже поверх готового файла.
Дальше всё зависит от того, что вам нужно:
- нужен редактируемый документ, где можно править текст и таблицы, значит скан стоит распознать PDF в Word;
- нужен просто текст, чтобы скопировать в письмо или заметку, проще распознать текст с фото.
В отличие от встроенных сканеров, тут распознаётся и печатный текст, и рукописный, включая заполненные от руки бланки.
Так что если от скана нужен живой текст, а не картинка, дело не в том, как вы держали телефон. Дело в распознавании: именно оно добавляет тот текстовый слой, ради которого весь скан обычно и затевается.
Проверьте на своём документе
10 токенов при регистрации · банковская карта не нужна