Sony Music Publishing, Warner Chappell и ещё десяток издателей подали иск против Anthropic в федеральный суд Северного округа Калифорнии. В исковом заявлении они обвиняют компанию в «наглой кампании» незаконного скачивания и скрейпинга тысяч защищённых произведений для обучения языковой модели Claude. По словам истцов, речь идёт о «бесстыдном пиратстве» через торрент-сети, которое позволило получить миллионы копий книг, включая издания с текстами песен и нотами.
Это уже третий крупный судебный процесс против лаборатории по вопросам авторского права. В январе Universal Music Group и Concord Music Group подали иск с похожими претензиями, а в прошлом году авторы во главе с автором Майклом Барцем обвинили Anthropic в использовании их произведений. Тогда судья постановил, что хотя сама идея использования защищённого контента для обучения может быть легальной, приобретение этого контента через пиратство — нет, и Anthropic была обязана выплатить $1,5 млрд.
Нынешний иск построен на схожих аргументах, но значительно шире. Он детально описывает масштаб предполагаемого нарушения и обвиняет компанию не только в использовании, но и в активном добывании пиратского контента. Тут важно отметить принципиальный момент: суды уже начали различать между самим использованием чужих данных для машинного обучения (что может быть в пределах законного) и методом их получения (когда применяется явное пиратство). Anthropic, похоже, наступила на те же грабли несколько раз подряд.
Для отрасли это становится паттерном: крупные издатели и авторы наконец скоординировали давление через судебную систему, и каждый новый иск расширяет теорию обвинения. Музыкальная индустрия, в отличие от авторов художественной литературы, имеет чёткую систему лицензирования и коллективного управления правами — поэтому претензии выглядят особенно обоснованными. Когда компании обучают модели на миллионах треков и книг, не заключив никаких лицензионных соглашений, это действительно выглядит как систематический уход от платежей правообладателям.
Вопрос о том, как именно компании должны готовить обучающие данные для ИИ, становится всё более острым. OpenAI, Google и другие также сталкиваются с исками, но Anthropic привлекает внимание своим масштабом нарушений, если претензии истцов подтвердятся. Компания может попытаться аргументировать это справедливым использованием или другими защитами, но предыдущие прецеденты работают против неё.
Для российского бизнеса вот какой вывод: если вы работаете с ИИ-системами для генерации контента или обучаете модели на собственных данных, убедитесь в легальности источников. На практике это означает либо лицензировать данные, либо работать с открытыми в согласии авторов наборами. При разработке своих ИИ-решений (как при подготовке моделей на платформе AI Studio для автоматизации контента) нужно соблюдать эти же принципы. Кроме того, рост таких исков будет давить на стоимость обучающих данных и лицензий, что через год-два повлияет на ценообразование ИИ-сервисов.
Исход этого дела вероятно определит, на какой практике будут настаивать регуляторы по всему миру. Если суд встанет на сторону издателей (что выглядит вероятнее, учитывая прецедент с Bartz), то ИИ-компаниям придётся либо лицензировать контент массивно, либо работать только с открытыми данными. Это может замедлить развитие некоторых приложений, но сделает индустрию более здравой и предсказуемой для авторов и издателей.