> For the complete documentation index, see [llms.txt](https://doc.nextbot.ru/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://doc.nextbot.ru/functional/functions/sending-result/python-v.2/keisy-kastomnykh-integracii/keis-uluchshennoe-raspoznavanie-izobrazhenii-google-vision-api.md).

# Кейс: Улучшенное распознавание изображений с помощью Google Vision API

Когда встроенный инструмент по распознаванию изображений не справляется со сложными чертежами, задачу решает кастомная интеграция. В этом кейсе показываем, как подключить Google Vision API к агенту Nextbot через Python-скрипт, чтобы переводить рукописные эскизы замерщиков в четкие данные для производства.

#### Автор проекта: [Талгат Кусаинов](https://t.me/talgat5360001)

**Контекст**

В производственных и строительных компаниях замерщики часто работают на выезде. Они делают эскизы от руки прямо в блокнотах, размечая размеры окон, проемов, стен и других объектов. На таких чертежах много сокращений, сложных дробей и рукописного текста. Эскизы отправляются менеджерам в офис для подсчета стоимости работ.

Раньше менеджеры обрабатывали такие эскизы вручную. Зрение GPT не всегда справлялось со сложной графикой и неразборчивым почерком — модель упускала важные детали, что приводило к ошибкам в расчетах. Из-за этого процесс передачи заказа в производство затягивался.

Бот должен был научиться автоматически распознавать текст и размеры на сложных эскизах, анализировать чертеж, делать необходимые расчеты и выдавать готовую структурированную выжимку для отправки на производство.

**Как устроена работа агента**

Чтобы решить проблему, интегратор связал агента с Google Vision API — сервисом по распознаванию изображений. Для этого в настройках Nextbot создали функцию `recognize_photo` с действием Python-скрипт.

![](/files/VgTmsKsHbbwwFLnpWAfG)

Зарегистрировали аккаунт в Google Cloud и передали API-ключ в скрипт через параметр `gcp_api_key`.

Скрипт работает следующим образом: При получении изображения функция вытаскивает из мессенджера URL файла и передает его параметром `file` в скрипт. Затем скрипт скачивает изображение по ссылке и отправляет запрос в Google Cloud Vision. Метод распознавания настроен на поиск текста (режим `TEXT_DETECTION`). В коде скрипта включен режим отладки: если сервис вернет ошибку, разработчик сразу увидит причину в логах.

![](/files/8hMldJaMzFvaAW5eyf7e)

Логика работы ИИ-ассистента в этот момент подчиняется инструкции, которая разделена на два этапа:

1. При получении любого изображения бот первым делом запускает функцию `recognize_photo`, чтобы вытащить текст.
2. Бот проверяет полученный от скрипта ответ. Здесь промпт задает ветвление логики:
   * Если в ответе есть распознанный текст, бот работает только с ним: анализирует эскиз, выполняет нужные расчеты и выводит структурированную выжимку для производства.
   * Если Google Vision не находит букв или цифр на картинке, скрипт возвращает маркер `[На этом изображении текст не распознан]`. Обнаружив эту метку, бот мгновенно переключается в режим визуального описания и подробно рассказывает пользователю, что именно изображено на фото.

![](/files/Y8CfFRGna5rFyOPZMkf2)

Чтобы бот не молчал при сбоях интеграции, настроили резервный вариант — включили стандартное распознавание изображений в самом агенте. Если сервис Google временно упадет, бот автоматически переключится на встроенное зрение модели.

![](/files/5jHNo4juCgt4kjEKMuGZ)

У описанного алгоритма есть техническое ограничение: бот не умеет обрабатывать несколько фотографий в одном сообщении. Если прислать сразу несколько картинок, он увидит только последнюю. Эту особенность нужно учитывать при внедрении и просить клиентов присылать фотографии строго по одной.

**Результат**

Благодаря интеграции компания автоматизировала оцифровку сложных эскизов прямо в Telegram и WhatsApp. Теперь менеджеры тратят меньше времени на ручной перенос замеров, а производство быстрее получает точные данные. Система защищена от сбоев: если внешнее API отключится, бот продолжит работу на базе стандартной модели.

Интеграция с Google Vision API универсальна. Её можно адаптировать под любую задачу, где сотрудникам или клиентам проще отправить фотографию документа или записи от руки, чем заполнять сложные формы на сайте или вбивать данные вручную. Например: для фото свидетельства о регистрации машины и рукописных списков запчастей в автосервисах, чтения путевых листов и накладных в логистике, оцифровки бумажных заказов в оптовой торговле и обработки результатов медицинских анализов в клиниках.

Используйте эту и другие кастомные интеграции через API и Python-скрипты, чтобы решать любые нестандартные задачи, с которыми не справляются базовые функции NextBot.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://doc.nextbot.ru/functional/functions/sending-result/python-v.2/keisy-kastomnykh-integracii/keis-uluchshennoe-raspoznavanie-izobrazhenii-google-vision-api.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
