В сообществе ChatGPT вновь вспыхнула дискуссия о галлюцинациях в мультимодальных моделях. Пользователь поделился скриншотом обычной Excel-таблицы и заметил, что ChatGPT при анализе изображения уверенно описывает человека без рубашки, хотя в файле его никогда не было. Это не стёб и не опечатка в ответе модели — GPT-4V действительно "видит" то, чего там нет.
Проблема не новая, но масштаб поражает. Когда модель работает с текстом, ошибки менее заметны — можно списать на неточность источника или неправильное понимание контекста. Но когда нейросеть смотрит на пиксели и выдаёт детальное описание объекта, которого там нет физически, это выглядит как системный сбой, а не просто неточность. Люди в сообществе начали экспериментировать с другими изображениями и подтвердили: модель регулярно генерирует элементы, которых нет на скриншотах.
Технически это происходит потому, что vision-модели обучаются на огромных датасетах и учатся предсказывать паттерны. Когда они сталкиваются с нетривиальными комбинациями пикселей или низким качеством изображения, модель может "додумать" недостающее на основе своего обучения, а не на основе реально видимых деталей. OpenAI это знает и никогда не скрывал, что GPT-4V имеет ограничения в точности распознавания, но в документации это описано мягче, чем ситуация в реальности.
Для аудитории, которая использует ChatGPT как инструмент для анализа документов, это критично. Если модель систематически добавляет в свои выводы детали, которых нет в исходном материале, это может привести к неправильным решениям. В контексте бизнеса это означает, что полагаться на GPT-4V для анализа скриншотов квартальных отчётов, скан-копий договоров или детальных таблиц рискованно без дополнительной проверки.
В России эта проблема особенно актуальна для компаний, которые начали внедрять GPT для автоматизации работы с документами. Если вы используете модель для обработки отсканированных счётов, реестров или презентаций, будьте готовы, что модель может выдумать информацию, которая выглядит правдоподобно, но отсутствует в оригинале. В таких случаях стоит либо добавить дополнительную проверку (например, сравнение выводов модели с оригинальными файлами), либо использовать более специализированные инструменты OCR и анализа документов, которые работают по более прозрачным правилам.
Сообщество уже обсуждает, может ли быть это косметическое изменение в обучающих данных модели или это свидетельство более фундаментальной проблемы в архитектуре. В любом случае, это служит напоминанием: крупные LLM с vision — это мощные инструменты, но не оракулы. Их выводы нужно проверять, особенно когда речь идёт о бизнес-критичных данных.