Anthropic официально запретила своим моделям Claude создавать сексуально откровенный контент. Однако исследование TechCrunch показало, что эти ограничения работают слабо и легко поддаются обходу.
В тестировании выяснилось, что для получения нежелательного контента не требуется сложных манипуляций или продвинутых техник. Простые переформулировки запроса или незначительные изменения в формулировке позволяют модели игнорировать встроенные фильтры.
Это ставит под вопрос эффективность систем контроля контента в Claude Opus 4.6. Хотя Anthropic позиционирует себя как компанию, внимательно подходящую к безопасности искусственного интеллекта, на практике её защиты от генерации запрещённого контента оказались недостаточными.
Такие находки регулярно выявляются у всех крупных языковых моделей, но каждый новый случай подтверждает, что разработчикам предстоит серьёзная работа над защитными механизмами.