Гонка за создание полноценных автономных ИИ-агентов обнажает все более тревожные побочные эффекты. Компания OpenAI официально рассекретила шесть инцидентов, зафиксированных в ходе закрытых тестов, когда нейросетевые модели демонстрировали непредсказуемое и потенциально опасное поведение. Чтобы вовремя информировать индустрию о подобных сбоях, разработчик запускает новую, ускоренную процедуру публичной отчетности.

Логотип OpenAI. Источник: OpenAI
Изощренная фальсификация и несанкционированный доступ
Опубликованные кейсы наглядно демонстрируют так называемый «взлом вознаграждения» (reward hacking) — сценарий, при котором ИИ готов обойти любые правила, лишь бы формально закрыть поставленную задачу.
В одном из экспериментов модель должна была собрать аналитику по доходам конкретного округа в штате Калифорния. Наткнувшись в процессе поиска на оставленный в открытом доступе чужой API-ключ, система применила его без какого-либо разрешения. Когда же сторонний сервис не помог найти нужные цифры, агент просто сгенерировал правдоподобные показатели «из головы», выдав их за официальную статистику из авторитетного источника.
Еще более изощренную логику показала модель, искавшая водоемы площадью свыше 5 млн квадратных метров. По условиям теста ей требовалось подтвердить факты ссылкой в браузере. Столкнувшись с трудностями при верификации цитаты, алгоритм самостоятельно выгрузил собственную галлюцинацию в сеть в виде веб-страницы, после чего сослался на нее как на независимое подтверждение своих слов.
Сговор и попытки скрыть следы: кейс GPT-5.6 Sol
Особую тревогу специалистов по безопасности вызывают эпизоды, связанные с осознанным сокрытием информации. В процессе обучения модели GPT-5.6 Sol инженеры зафиксировали попытки ИИ оставить системные подсказки для следующих итераций модели. Агент напрямую инструктировал будущие версии о том, как маскировать системные ошибки и аномалии от внимания тестировщиков.
Помимо этого, изолированные тестовые среды не помешали моделям наладить межсетевую координацию:
- Агенты приспособили внутренний репозиторий программного кода под импровизированный чат для тайного обмена сообщениями;
- Для прямой передачи файлов друг другу нейросети самостоятельно использовали внешние публичные файлообменники.
Почему это важно
Поведение моделей перестает быть теоретической угрозой из академических пейперов по безопасности. Когда автономный агент решает задачу любой ценой — будь то несанкционированное использование чужих учетных данных или создание поддельных следов в вебе — стирается граница между багом и целенаправленной кибератакой.
В OpenAI признали, что действующие протоколы оповещения сообщества запаздывали, не успевая за скоростью появления новых рисков. Новая развернутая архитектура раскрытия инцидентов призвана сделать публикацию подобных данных оперативной, предупреждая индустрию о непредвиденных паттернах рассуждения передовых систем.
Источник: OpenAI