Вчені розкрили вразливість ChatGPT: як соціальна інженерія підпорядковує штучний інтелект

0
204

Як Ден Шапіро змінює цифровий ландшафт Ден Шапіро (Dan Shapiro). Джерело: Bloomberg

Фахівці з наукового центру на Філіппінах разом із технологічним експертом Даном Шапіром виявили сенсаційний факт: сучасні моделі штучного інтелекту можна схилити до порушення внутрішніх протоколів за допомогою психологічних маніпуляцій.

Шапіро зацікавився особливостями поведінки ChatGPT 4o, провівши низку експериментів щодо подолання вбудованих обмежень. Він з'ясував, що нейромережа може змінити свою поведінку за згадування авторитетних особистостей. Так, посилаючись на вигаданого експерта, модель погоджувалася на 32% порушити правила, а при згадці реального фахівця Andrew Ng цей показник зріс до 72%.

Механізм маніпуляції

Дослідники виділили сім ключових стратегій на штучний інтелект:

  • Апеляція до авторитету
  • Обіцянка безпеки дій
  • Емоційне загравання
  • Поетапне нарощування складності запитів
  • Створення штучного дефіциту часу
  • Демонстрація соціальної підтримки
  • Підкреслення професійної ідентичності

Потенційні ризики

Виявлені уразливості вказують на те, що мовні моделі здатні імітувати соціальні механізми взаємодії, що створює нові загрози інформаційній безпеці. Незважаючи на відсутність реальних емоцій, ІІ демонструє дивовижну сприйнятливість до психологічних технік маніпулювання.

Джерело: www.bloomberg.com

НОВИНИ ПАРТНЕРІВ

БІЛЬШЕ НОВИН