В судебных документах, ставших доступными в результате рассекречивания, выявлены прямые высказывания руководителей Microsoft и OpenAI, которые существенно подрывают их позицию в деле The New York Times. Директор Applied Science в Microsoft Брент Хехт назвал массовый скрейпинг контента для обучения моделей «кражей беспрецедентных масштабов» и «крупнейшей кражей труда в истории человечества». Это признание особенно значимо, потому что прямо противоречит аргументам обороны о том, что такое использование защищено законом об авторском праве как добросовестное использование.

Документы раскрывают конкретные масштабы проблемы. В датасеты для обучения OpenAI вошло более 91 тысячи копий работ NYT, Daily News и Center for Investigative Reporting, плюс более 2 миллионов документов с nytimes.com в других датасетах. Компании обходили платные подписки незамеченными, намеренно удаляли уведомления об авторском праве из тренировочных данных и через проекты Taxi и Mango передавали друг другу огромные объёмы скрейпленного контента. Это не выглядит как техническая практика в серой зоне закона — это выглядит как сознательное скрывание масштаба заимствований.

Ещё более критичное признание касается экономического вреда. Внутренние данные Microsoft показывают, что её Copilot вызвал падение кликов на домены NYT на 93% по сравнению с обычным поиском Bing. Microsoft сама назвала это «петлёй гибели», которая вредит как моделям, так и всему вебу. Глава ChatGPT в OpenAI Ник Турли писал во внутренних коммуникациях, что издатели сталкиваются с «экзистенциальной угрозой» от чатботов, которые становятся всё более замещающими оригинальный контент. Это прямой удар по центральному критерию справедливого использования — требованию, чтобы новое использование не вредило рынку оригинального произведения.

Показательна позиция главного редактора SPV News Алексея Мартыненко: компании выстраивают классическую схему обогащения за чужой счёт — берут огромный объём качественного контента без компенсации, обходят защиту (платные подписки), намеренно скрывают масштабы, а потом создают продукт, который напрямую конкурирует с исходным источником, отбирая у него аудиторию и деньги. При этом судьям предлагают поверить, что это справедливое использование. Логика обороны начинает рассыпаться под весом собственных документов компаний.

Вопрос о том, можно ли использовать авторский контент для обучения ИИ без разрешения, до сих пор не имеет чёткого ответа в американском праве, и суды в целом благосклонны к аргументам ИИ-компаний. Однако эти новые признания ставят их в худшую позицию: труднее утверждать о добросовестности, когда внутренние документы говорят о краже, и гораздо сложнее доказывать отсутствие вреда рынку, когда твои же данные показывают 93-процентное падение трафика к издателю. Представленный в начале месяца бриф администрации Трампа в защиту OpenAI придётся переоценивать на фоне этих материалов.

Для российского бизнеса этот процесс — важный прецедент, даже если американское право работает иначе. Любая компания, которая строит свои продукты на данных конкурентов или контент-мейкеров без явного согласия и компенсации, должна понимать: масштаб даже при полной секретности рано или поздно может всплыть, а «это же стандартная практика» не защищает от судебных исков, если исходный источник экономически страдает. Для издателей и создателей контента это также сигнал: стоит задуматься о лицензировании своих архивов напрямую, контролировать скрейпинг и отслеживать, кто и как использует ваш материал. Инструменты в духе AI Studio для создания своего контента или блокчейн-решений типа Signum для фиксации авторства и лицензирования становятся более актуальными в такой юридической обстановке.

Судебный процесс ещё не завершён, но рассекреченные документы уже переломили нарратив. Если раньше можно было спорить о букве закона, теперь спорят о том, что компании знали и что они намеренно скрывали. Это куда более сложная позиция для защиты.