Тема авторства и источников обучающих данных у крупных AI-лабораторий давит на сообщество уже полгода, но каждый новый цикл претензий показывает одно: никто толком не знает, на чём учились эти модели. OpenAI в очередной раз оказывается в центре внимания — на этот раз речь о совпадениях с работами математиков. Подробностей в самом посте мало, но контекст понятен: люди сравнивают опубликованные исследования с методами в GPT и находят слишком много совпадений, чтобы это быть случайностью.

Главное в этом цикле — не отдельные совпадения, а растущий скепсис к заявлениям OpenAI о том, что они якобы соблюдают авторское право и договорённости с издателями. В редакции ежедневно работаем с такими инструментами, и видно: компании просто не публикуют полный список источников обучения. OpenAI выбирает, что разглашать, а что нет. Это не нарушение закона в большинстве юрисдикций, но это нарушение доверия. Если ты не знаешь, на чём обучена модель, ты не можешь оценить ни её смещения, ни качество, ни честность разработчика.

Open-source сообщество ловит OpenAI на этом потому, что у них самих подход другой: модели вроде Llama, Mistral, их форков выкладываются с документацией о данных. Не идеальной, но хотя бы есть. Это создаёт асимметрию: большие лабы держат карты при себе, а независимые разработчики прозрачнее. Парадокс в том, что сообщество обвиняет OpenAI именно в том, в чём сама OpenAI обвиняет других — в использовании чужих работ без должного указания.

Волна критики может выглядеть как просто шум, но она работает. Регуляторы в ЕС и США всё больше интересуются именно источниками данных и прозрачностью обучения. Если OpenAI будет и дальше отмалчиваться, давление будет расти — и не только от редиторов, но и от парламентариев.

Для российского бизнеса это означает одно: если вы строите своё решение на GPT или других закрытых моделях через API, учитывайте, что доверие к провайдеру может упасть, и это повлияет на ваш продукт. Альтернатива — использовать open-source модели, где вы сами контролируете источники и можете ручаться перед своими клиентами. Инструменты вроде локально развёрнутых Llama или Mistral становятся не просто технической опцией, но и вопросом репутации. Для компаний, работающих с контентом, аналитикой или консультированием, это уже актуально.

Главное, что нужно понимать: эта тема не закроется быстро. OpenAI рано или поздно придётся либо публиковать источники, либо столкнуться с регуляторными расследованиями. А пока сообщество будет ловить каждое совпадение и создавать давление. Для пользователей это хороший знак — значит, за качеством и честностью инструментов следят.