Конвертировать Изображение в Текст онлайн бесплатно

Конвертируйте файлы Изображение в Текст онлайн бесплатно. Загрузите файл и сразу получите чистый результат, готовый для LLM. Без регистрации, до 50 МБ, ничего не сохраняется.

Распознать текст с картинки онлайн: достать слова и работать дальше

Падает сборка. Ошибка — сорок строк стектрейса в терминале на машине, откуда нельзя копировать: удалённая консоль, залоченная виртуалка, скриншот коллеги, вставленный в чат. Прочитать вы всё прекрасно можете. Только выделить нельзя, а перепечатывание пути Java-пакета вручную — это как раз тот способ, которым изобретаются опечатки.

Для этого и существует эта страница. Загрузите скриншот — текст на нём распознаётся и возвращается как обычный текст, который можно вставить в поиск, ассистенту или в тикет. Настоящее OCR по пикселям, а не описание файла. Читает JPG, JPEG, PNG, GIF, BMP, TIFF, TIF и WebP. Бесплатно, без регистрации, 50 МБ на файл, после конвертации ничего не хранится. Это бесплатный конвертер фото в текст онлайн в самом буквальном виде: картинка на входе — слова на выходе.

Цикл «скриншот — поисковая строка»

Самая частая причина, по которой людям нужно извлечь текст со скриншота, — желание вставить этот текст туда, где принимают только текст. Поисковики картинки не берут. Как и поиск в вашем трекере задач, ваш агрегатор логов или поле, куда вы вставили бы исключение, чтобы спросить у модели, что оно значит.

Так что цикл такой: скриншот, конвертация, вставка. Десять секунд, а разница ощутимая — ассистент, получивший точный класс исключения и номера строк, даёт конкретный ответ, а получивший расплывчатый пересказ — общий чек-лист. То же самое с диалогами ошибок, выводом CI, сообщениями базы данных и крэш-репортами. Если это появилось на экране в виде символов, а выделить их было нельзя — вот способ это обойти.

Обычный текст или Markdown? Честный ответ

Большинство сайтов придумало бы здесь драматичное различие. Правда скромнее. На простой картинке — скриншот абзаца, окно терминала, заметка — обычный текст и Markdown возвращаются практически одинаковыми. Распознанный текст приходит строками, а в куске прозы нет скрытой структуры, которую Markdown мог бы добавить. Выберите любой вариант — не потеряете ничего.

Значение это приобретает, когда на картинке что-то с формой: таблица, бланк, страница документа с заголовками. Markdown способен передать такую компоновку; плоский текст может лишь намекнуть на неё пробелами. Для таких случаев лучше подходит страница картинка в Markdown. Для всего остального — а «всё остальное» это большинство скриншотов — обычный текст чище как артефакт: нет синтаксических символов, которые пришлось бы вычищать перед отправкой в скрипт, индекс или diff.

Переключатель формата наверху меняет один режим на другой и сохраняет уже выбранный файл, так что попробовать оба стоит одну загрузку, а не две.

Повседневные задачи, которые это незаметно решает

  • Вывод терминала и логи. Вывод команды из сессии, которую уже не отмотать, или окно лога, снятое до того, как он ротировался. Переведите в текст — и его можно грепать, диффать или спрашивать о нём.
  • Скриншоты чатов и писем. Переписки, пересланные картинками вместо текста, — то есть большинство переписок. Одна конвертация — и у вас есть что цитировать и по чему искать.
  • Вывески, этикетки, упаковка. Фото шильдика с серийным номером, маркировки провода, панели с характеристиками товара. Перепечатывать неудобно, конвертировать — секундное дело.
  • Рукописные заметки. Попробовать стоит, но с реалистичными ожиданиями — аккуратный печатный почерк читается куда лучше беглой скорописи, и результат всегда нужно сверять с оригиналом.
  • Код, который видно, но нельзя скопировать. Фрагмент в кадре видео, на слайде или в защищённом документе. Вытащите его текстом, а затем положите рядом с вашим репозиторием GitHub в виде текста или проектом GitLab, чтобы ассистент видел фрагмент и вашу кодовую базу вместе.
  • Всё, что вы заскриншотили с сайта. Привычка, от которой стоит избавиться: Web2Txt забирает страницу напрямую и сохраняет ссылки, а HTML в Markdown справится с сохранённой страницей. Вернуться к источнику всегда лучше, чем читать пиксели.

Где распознавание работает, а где нет

Есть одно правило, объясняющее все стоящие внимания сбои: OCR работает с файлом изображения, который вы загрузили, а не с картинками, зарытыми внутри других файлов. Изображение, едущее внутри большего контейнера, пропускается — конвертер читает контейнер.

  • Отсканированный PDF возвращает пустоту. В PDF из одних картинок текста нет, а OCR не пролезает сквозь PDF-обёртку к пикселям. Чините у источника: откройте его в Acrobat, «Просмотре» на macOS или почти любой современной PDF-читалке, запустите «распознать текст», чтобы получить PDF с поисковым слоем, и затем используйте PDF в текст или PDF в Markdown. Вот правильный дом для отсканированных документов.
  • Картинки внутри ZIP перечисляются, но не читаются. Конвертация архива даёт имя файла и ничего больше. ZIP в текст — верный инструмент для папки документов; картинки распакуйте и загружайте каждую по отдельности.
  • Изображения, встроенные в Word, PowerPoint, RTF, EPUB или письмо, не читаются. В выводе они проходят как заглушка. DOCX, собранный из скриншотов, конвертируется через Word в Markdown в окружающий текст с дырами на месте картинок. Сохраните изображения отдельно и конвертируйте их здесь.

Держите эту модель в голове — и ни одна загрузка не пропадёт зря: чтобы прочитать картинку, отдайте картинку.

Работа с объёмами и скармливание машинам

Обычный текст — тот самый формат, когда вывод предназначен не человеку. Распознанный текст из стопки изображений чисто склеивается, предсказуемо режется на фрагменты и векторизуется, не таща шум форматирования в вектор — именно это нужно, когда вы строите поисковый индекс по куче скриншотов или превращаете отснятый архивный материал во что-то доступное поиску.

Практический путь — по одному изображению на загрузку, поскольку архивы картинки пропускают: планируйте цикл, а не один пакет. Счётчик токенов под выводом здесь кстати: он показывает, во что реально обходится каждая конвертация, до того как вы начнёте складывать страницы в один промпт или считать бюджет стратегии нарезки. Для смешанных корпусов — документы вперемешку с картинками — File2Txt обрабатывает все поддерживаемые форматы в одном месте, а конвертация локального каталога расплющивает текстовую часть проекта за один проход.

Облегчите жизнь распознавателю

Точность настолько плотно следует за качеством изображения, что несколько привычек меняют результат сильнее любой настройки:

  • Делайте скриншот, а не фотографию экрана. Ни бликов, ни угла, ни смаза, ни муара от дисплея.
  • Обрезайте вплотную к нужному тексту. Больше пикселей на символ — в этом вся игра, а заодно вывод не забивается элементами интерфейса, о которых вы не просили.
  • Держите изображение правильной стороной вверх и примерно фронтально. Перекошенные строки читаются хуже прямых.
  • Избегайте трудных случаев, где можете: снимки в низком разрешении, текст поверх фотографий, рукописные и декоративные шрифты, всё наполовину в тени. Это может сработать, но именно там кучкуются ошибки.
  • Вычитывайте всё важное. Неверно распознанная цифра в номере документа — ошибка тихая и дорогая, а пятисекундный взгляд на вывод её ловит.

Частые вопросы

Как перевести JPG в текст?

Перетащите изображение в конвертер выше. OCR прогоняется по настоящим пикселям, и распознанные слова возвращаются обычным текстом, который можно выделять, искать и вставлять. Бесплатно, без регистрации, 50 МБ на изображение. Буквальный случай конвертера jpeg в текст — картинка на входе, слова на выходе, устанавливать нечего.

Работает ли это с PNG и другими форматами изображений?

Да: JPG, JPEG, PNG, GIF, BMP, TIFF, TIF и WebP — все работают. PNG — формат, в котором приходит большинство скриншотов, и для OCR это лучший случай: скриншот — это отрисованный текст, а не фотография бумаги — ни смаза камеры, ни изгиба страницы, ни неровного освещения.

Может ли он прочитать рукописные заметки?

Плохо, и лучше исходить из того, что нет. Модели OCR обучены в подавляющем большинстве на печатном тексте; скоропись и торопливые печатные буквы дают вывод, который выглядит правдоподобно и ошибается ровно в тех местах, которые вы не догадаетесь проверить. Аккуратные печатные буквы на разлинованной бумаге иногда проходят. Всё остальное требует вычитки по оригиналу, что обычно дороже перепечатывания.

Почему картинка вернулась с неправильными символами?

Почти всегда разрешение. OCR нужен эквивалент примерно 300 DPI, чтобы различать похожие формы, а ниже этого rn схлопывается в m, 1 и l меняются местами, а 0 становится O. Фото с телефона, снятое ближе, или скриншот в полном размере окна, а не уменьшенный, исправляют большую часть проблем.

Можно ли распознать текст с фото страницы документа?

Да, и работает это лучше, чем ожидают, — но сначала расправьте страницу. Держите камеру параллельно бумаге, а не под углом, добейтесь ровного света без тени поперёк текста и заполните кадр страницей. Снимки с перспективными искажениями или тенями теряют целые строки, и OCR при этом не сообщает ни о какой ошибке.

Хранится ли изображение где-то после конвертации?

Нет. Оно отправляется на распознавание, обрабатывается и удаляется, как только текст возвращён — не архивируется, не используется для обучения, не индексируется. К нему не привязан аккаунт, и копия на нашей стороне не остаётся.

Всё остальное здесь

Изображения — один из тринадцати поддерживаемых форматов, и все они доступны из File2Txt. Есть и более длинный разбор подготовки файлов для LLM, если нужен общий взгляд, а не только про картинки.

Repo2Txt разрабатывает и поддерживает v12hero — независимый разработчик, создающий нативные и веб-приложения с приоритетом приватности.