Anthropic розкрила механізм маркування текстів Claude: як працюють водяні знаки ІІ і чи можна їх видалити

0
1

Логотип Anthropic: инновационный дизайн для технологического лидерства
Anthropic логотип. Джерело: Anthropic

Как Anthropic маркирует контент, созданный Claude

Компания Anthropic детализировала работу системы водяных знаков для текстов, сгенерированных её ИИ-ассистентом Claude. Этот шаг стал частью отраслй инициативы по прозрачности ИИ-контента.

Принцип работы скрытой маркировки

Технология основана на выборе конкретных слов и формулировок во время генерации ответа. При наличии синонимичных вариантов Claude использует определённый шаблон, что создает уникальный паттерн, невидимый для пользователя, но обнаруживаемый специальным алгоритмом.

В основе системы лежит подход SynthID-Text, разработанный Google DeepMind в 2024 году. Anthropic также планирует предоставить API для проверки текстов на наличие таких маркеров.

Уязвимости и ограничения системы

Полноценное переписывание текста с заменой всех слов удаляет водяной знак. Однако незначительные правки могут сохранить маркировку. В случаях, когда Claude лишь редактирует человеческий текст, детекция зависит от объёма изменений.

Особый подход применяется к программному коду: здесь маркировка менее выражена из-за ограниченных вариантов синтаксиса. Технология фокусируется на комментариях и других участках, допускающих вариативность формулировок.

Отраслевой контекст

Anthropic подтвердила, что система маркировки — часть выполнения Кодекса практики ЕС по ИИ, который поддержали другие крупные разработчики языковых моделей. Это свидетельствует о формировании отраслевого стандарта для идентификации ИИ-контента.

Джерело: Антропний

НОВИНИ ПАРТНЕРІВ

БІЛЬШЕ НОВИН