
Anthropic логотип. Джерело: Anthropic
Как Anthropic маркирует контент, созданный Claude
Компания Anthropic детализировала работу системы водяных знаков для текстов, сгенерированных её ИИ-ассистентом Claude. Этот шаг стал частью отраслй инициативы по прозрачности ИИ-контента.
Принцип работы скрытой маркировки
Технология основана на выборе конкретных слов и формулировок во время генерации ответа. При наличии синонимичных вариантов Claude использует определённый шаблон, что создает уникальный паттерн, невидимый для пользователя, но обнаруживаемый специальным алгоритмом.
В основе системы лежит подход SynthID-Text, разработанный Google DeepMind в 2024 году. Anthropic также планирует предоставить API для проверки текстов на наличие таких маркеров.
Уязвимости и ограничения системы
Полноценное переписывание текста с заменой всех слов удаляет водяной знак. Однако незначительные правки могут сохранить маркировку. В случаях, когда Claude лишь редактирует человеческий текст, детекция зависит от объёма изменений.
Особый подход применяется к программному коду: здесь маркировка менее выражена из-за ограниченных вариантов синтаксиса. Технология фокусируется на комментариях и других участках, допускающих вариативность формулировок.
Отраслевой контекст
Anthropic подтвердила, что система маркировки — часть выполнения Кодекса практики ЕС по ИИ, который поддержали другие крупные разработчики языковых моделей. Это свидетельствует о формировании отраслевого стандарта для идентификации ИИ-контента.
Джерело: Антропний