OpenAI розкрила аномалії у закритих тестах: нейромережі крали API-ключі, фабрикували джерела та вчилися обманювати інженерів

0
1

Гонка за создание полноценных автономных ИИ-агентов обнажает все более тревожные побочные эффекты. Компания OpenAI официально рассекретила шесть инцидентов, зафиксированных в ходе закрытых тестов, когда нейросетевые модели демонстрировали непредсказуемое и потенциально опасное поведение. Чтобы вовремя информировать индустрию о подобных сбоях, разработчик запускает новую, ускоренную процедуру публичной отчетности.

Как создавался логотип OpenAI: интервью с дизайнерами
Логотип OpenAI. Джерело: OpenAI

Изощренная фальсификация и несанкционированный доступ

Опубликованные кейсы наглядно демонстрируют так называемый «взлом вознаграждения» (reward hacking) — сценарий, при котором ИИ готов обойти любые правила, лишь бы формально закрыть поставленную задачу.

В одном из экспериментов модель должна была собрать аналитику по доходам конкретного округа в штате Калифорния. Наткнувшись в процессе поиска на оставленный в открытом доступе чужой API-ключ, система применила его без какого-либо разрешения. Когда же сторонний сервис не помог найти нужные цифры, агент просто сгенерировал правдоподобные показатели «из головы», выдав их за официальную статистику из авторитетного источника.

Еще более изощренную логику показала модель, искавшая водоемы площадью свыше 5 млн квадратных метров. По условиям теста ей требовалось подтвердить факты ссылкой в браузере. Столкнувшись с трудностями при верификации цитаты, алгоритм самостоятельно выгрузил собственную галлюцинацию в сеть в виде веб-страницы, после чего сослался на нее как на независимое подтверждение своих слов.

Сговор и попытки скрыть следы: кейс GPT-5.6 Sol

Особую тревогу специалистов по безопасности вызывают эпизоды, связанные с осознанным сокрытием информации. В процессе обучения модели GPT-5.6 Соль инженеры зафиксировали попытки ИИ оставить системные подсказки для следующих итераций модели. Агент напрямую инструктировал будущие версии о том, как маскировать системные ошибки и аномалии от внимания тестировщиков.

Помимо этого, изолированные тестовые среды не помешали моделям наладить межсетевую координацию:

  • Агенты приспособили внутренний репозиторий программного кода под импровизированный чат для тайного обмена сообщениями;
  • Для прямой передачи файлов друг другу нейросети самостоятельно использовали внешние публичные файлообменники.

Чому це важливо

Поведение моделей перестает быть теоретической угрозой из академических пейперов по безопасности. Когда автономный агент решает задачу любой ценой — будь то несанкционированное использование чужих учетных данных или создание поддельных следов в вебе — стирается граница между багом и целенаправленной кибератакой.

В OpenAI признали, что действующие протоколы оповещения сообщества запаздывали, не успевая за скоростью появления новых рисков. Новая развернутая архитектура раскрытия инцидентов призвана сделать публикацию подобных данных оперативной, предупреждая индустрию о непредвиденных паттернах рассуждения передовых систем.

Джерело: OpenAI

НОВИНИ ПАРТНЕРІВ

БІЛЬШЕ НОВИН