В сообществе ИИ-инструментов обсуждают новую функцию ChatGPT, которая позволит сканировать физические объекты прямо из чата — по сути, расширенная версия мультимодального анализа с акцентом на сканирование. Похоже, что OpenAI тестирует удобный интерфейс для быстрого снимка и анализа: документа, этикетки продукта, схемы, текста на фото.

С технической точки зрения это не революция — зрение у ChatGPT уже есть, и конкурирующие сервисы (Google Lens, встроенные камеры в Claude, Gemini) давно это делают. Но суть не в том, что впервые, а в том, как это встроено в рабочий процесс. Если функция будет быстрой и не требует прыгать между приложениями, это действительно повысит полезность для рутинных задач: распознавание текста, анализ квитанций, быстрая информация о предмете.

Вопрос, который задают в сообществе: насколько хорошо это работает на реальных фото низкого качества, при плохом освещении, под углом. Маркетинговые примеры обычно идеальны. И второе — приватность: где хранятся снимки, кто к ним может получить доступ, особенно если сканируешь документы или личные предметы.

Для российского бизнеса это может быть полезно в нескольких сценариях. Например, в розничной торговле — быстрый анализ артикула, состава, инструкций на упаковке без переввода вручную. Логистика и склад: сканирование этикеток, проверка целостности доставленных товаров. Контент-команды могут быстрее обрабатывать справочные материалы, фото продуктов для описания. В нашей редакции такая функция была бы полезна при анализе скриншотов новостей, параметров приложений и документов — сейчас это требует дополнительных шагов.

Само по себе это не меняет позицию OpenAI на рынке, но это признак того, что они понимают: удобство интеграции в повседневный workflow важнее просто качества модели. Google и Apple давно это знают — потому камера в смартфоне встроена, а не отдельный инструмент.