Anthropic раскрыла механизм маркировки текстов Claude: как работают водяные знаки ИИ и можно ли их удалить

0
1

Логотип Anthropic: инновационный дизайн для технологического лидерства
Логотип Anthropic. Источник: Anthropic

Как Anthropic маркирует контент, созданный Claude

Компания Anthropic детализировала работу системы водяных знаков для текстов, сгенерированных её ИИ-ассистентом Claude. Этот шаг стал частью отраслй инициативы по прозрачности ИИ-контента.

Принцип работы скрытой маркировки

Технология основана на выборе конкретных слов и формулировок во время генерации ответа. При наличии синонимичных вариантов Claude использует определённый шаблон, что создает уникальный паттерн, невидимый для пользователя, но обнаруживаемый специальным алгоритмом.

В основе системы лежит подход SynthID-Text, разработанный Google DeepMind в 2024 году. Anthropic также планирует предоставить API для проверки текстов на наличие таких маркеров.

Уязвимости и ограничения системы

Полноценное переписывание текста с заменой всех слов удаляет водяной знак. Однако незначительные правки могут сохранить маркировку. В случаях, когда Claude лишь редактирует человеческий текст, детекция зависит от объёма изменений.

Особый подход применяется к программному коду: здесь маркировка менее выражена из-за ограниченных вариантов синтаксиса. Технология фокусируется на комментариях и других участках, допускающих вариативность формулировок.

Отраслевой контекст

Anthropic подтвердила, что система маркировки — часть выполнения Кодекса практики ЕС по ИИ, который поддержали другие крупные разработчики языковых моделей. Это свидетельствует о формировании отраслевого стандарта для идентификации ИИ-контента.

Источник: Anthropic

НОВОСТИ ПАРТНЕРОВ

БОЛЬШЕ НОВОСТЕЙ