Волна постов про фотореалистичность AI-портретов не утихает, и на этот раз речь не о том, что модель совсем не может рисовать людей, а о более тонком вопросе: где именно она сбивается, когда пользователь специально просит максимум естественности. Авторы тредов отмечают, что даже при таком запросе на выходе видны явные признаки синтеза.
Это показывает одну из фундаментальных проблем diffusion-моделей и трансформеров: они хорошо учатся на распределение пикселей в обучающих данных, но понимание физики лица, анатомии и того, как свет реально падает на кожу, остаются поверхностными. Сообщество уже стабильно выделяет несколько красных флагов: странная текстура кожи (часто слишком гладкая или наоборот пластичная), проблемы с рельефом и объёмом волос, иногда неестественная гладкость зубов и дёсен, асимметрия черт лица, которая выглядит «не совсем так». В глазах часто видны микроошибки в отражениях.
Почему это неожиданно упорно: на первый взгляд кажется, что это просто вопрос масштаба данных и вычислений. Но тут уже видна более скучная правда — модель может натренироваться копировать пиксельные паттерны, но не переносит глубокое понимание трёхмерной структуры. То есть это не про способность, а про то, что текущий подход к обучению не даёт моделям необходимых представлений. С каждым циклом утечек новых версий Dall-E и Midjourney эта разница становится меньше, но полностью не исчезает — потому что это не просто bug в коде, а следствие того, как вообще работает генеративный ML на образах.
В контексте российского бизнеса это напрямую касается всех, кто работает с автоматизацией контента или аватарами для сервисов. Если нужны просто условные иллюстрации или шумовое заполнение — работает, стоимость близка к нулю. Но если портрет должен убедить на секунду-две в рамках маркетинговой кампании или быть лицом бренда, лучше либо использовать реальные фото (с согласиями), либо заказывать стилизованную графику, где неестественность становится намеренной. Платформы типа AI Studio позволяют быстро перебирать варианты и комбинировать AI-контент с реальным, но под дебаг выходных файлов сверху все равно нужен человек.
Интересно, что сообщество уже привыкает к идее, что это нормально — фильтровать выходы нейросети вручную, как фотографа. Может быть, имеет смысл прекратить гнаться за «неотличимостью» и просто начать относиться к этому как к инструменту контролируемого вспомогательного контента.