Anthropic опубликовала подробности о том, как будут функционировать водяные знаки в текстах, генерируемых её нейросетью Claude. Система призвана помогать людям отличать контент, созданный ИИ, от написанного человеком.
Компания ответила на главный вопрос: водяные знаки устойчивы к обычному редактированию текста. Если пользователь отредактирует сгенерированный текст, меняя отдельные слова или фразы, система всё равно сможет опознать его как созданный ИИ. Это делает водяные знаки куда более практичным инструментом, чем просто маркировка на уровне метаданных.
Отдельное внимание уделено коду. Anthropic пояснила, как водяные знаки работают с программным кодом, хотя технические подробности остаются под завесой. Компания учитывает, что код часто подвергается множественным изменениям и адаптациям, поэтому система должна быть достаточно гибкой.
Инициатива вписывается в более широкие усилия Anthropic по созданию инструментов, которые помогают отслеживать и контролировать использование ИИ-сгенерированного контента в интернете.