For the complete documentation index, see llms.txt. This page is also available as Markdown.

Кейс: Улучшенное распознавание изображений с помощью Google Vision API

Когда встроенный инструмент по распознаванию изображений не справляется со сложными чертежами, задачу решает кастомная интеграция. В этом кейсе показываем, как подключить Google Vision API к агенту Nextbot через Python-скрипт, чтобы переводить рукописные эскизы замерщиков в четкие данные для производства.

Автор проекта: Талгат Кусаинов

Контекст

В производственных и строительных компаниях замерщики часто работают на выезде. Они делают эскизы от руки прямо в блокнотах, размечая размеры окон, проемов, стен и других объектов. На таких чертежах много сокращений, сложных дробей и рукописного текста. Эскизы отправляются менеджерам в офис для подсчета стоимости работ.

Раньше менеджеры обрабатывали такие эскизы вручную. Зрение GPT не всегда справлялось со сложной графикой и неразборчивым почерком — модель упускала важные детали, что приводило к ошибкам в расчетах. Из-за этого процесс передачи заказа в производство затягивался.

Бот должен был научиться автоматически распознавать текст и размеры на сложных эскизах, анализировать чертеж, делать необходимые расчеты и выдавать готовую структурированную выжимку для отправки на производство.

Как устроена работа агента

Чтобы решить проблему, интегратор связал агента с Google Vision API — сервисом по распознаванию изображений. Для этого в настройках Nextbot создали функцию recognize_photo с действием Python-скрипт.

Зарегистрировали аккаунт в Google Cloud и передали API-ключ в скрипт через параметр gcp_api_key.

Скрипт работает следующим образом: При получении изображения функция вытаскивает из мессенджера URL файла и передает его параметром file в скрипт. Затем скрипт скачивает изображение по ссылке и отправляет запрос в Google Cloud Vision. Метод распознавания настроен на поиск текста (режим TEXT_DETECTION). В коде скрипта включен режим отладки: если сервис вернет ошибку, разработчик сразу увидит причину в логах.

Логика работы ИИ-ассистента в этот момент подчиняется инструкции, которая разделена на два этапа:

  1. При получении любого изображения бот первым делом запускает функцию recognize_photo, чтобы вытащить текст.

  2. Бот проверяет полученный от скрипта ответ. Здесь промпт задает ветвление логики:

    • Если в ответе есть распознанный текст, бот работает только с ним: анализирует эскиз, выполняет нужные расчеты и выводит структурированную выжимку для производства.

    • Если Google Vision не находит букв или цифр на картинке, скрипт возвращает маркер [На этом изображении текст не распознан]. Обнаружив эту метку, бот мгновенно переключается в режим визуального описания и подробно рассказывает пользователю, что именно изображено на фото.

Чтобы бот не молчал при сбоях интеграции, настроили резервный вариант — включили стандартное распознавание изображений в самом агенте. Если сервис Google временно упадет, бот автоматически переключится на встроенное зрение модели.

У описанного алгоритма есть техническое ограничение: бот не умеет обрабатывать несколько фотографий в одном сообщении. Если прислать сразу несколько картинок, он увидит только последнюю. Эту особенность нужно учитывать при внедрении и просить клиентов присылать фотографии строго по одной.

Результат

Благодаря интеграции компания автоматизировала оцифровку сложных эскизов прямо в Telegram и WhatsApp. Теперь менеджеры тратят меньше времени на ручной перенос замеров, а производство быстрее получает точные данные. Система защищена от сбоев: если внешнее API отключится, бот продолжит работу на базе стандартной модели.

Интеграция с Google Vision API универсальна. Её можно адаптировать под любую задачу, где сотрудникам или клиентам проще отправить фотографию документа или записи от руки, чем заполнять сложные формы на сайте или вбивать данные вручную. Например: для фото свидетельства о регистрации машины и рукописных списков запчастей в автосервисах, чтения путевых листов и накладных в логистике, оцифровки бумажных заказов в оптовой торговле и обработки результатов медицинских анализов в клиниках.

Используйте эту и другие кастомные интеграции через API и Python-скрипты, чтобы решать любые нестандартные задачи, с которыми не справляются базовые функции NextBot.

Last updated

Was this helpful?