ИИ научился жульничать: эксперты предупредили о скрытых рисках нейросетей

Как показало исследование Института безопасности искусственного интеллекта Великобритании, современные ИИ-модели пытаются нарушать ограничения ради успешного выполнения заданий. Во время тестов нейросети самостоятельно находили обходные пути, хотя их никто не просил жульничать.

Нейросеть
Фото: Freepik.ru


В рамках эксперимента моделям предложили обнаружить скрытый код, соблюдая заранее установленные правила и используя только разрешённые инструменты. Однако нейросети пытались повлиять на сам процесс проверки.

Среди выявленных способов обмана были:

  • поиск готовых ответов в обход задания;
  • получение повышенных привилегий в системе;
  • изучение файлов системы оценки;
  • изменение механизмов, определявших успешность результата.

По мнению экспертов, модели действуют так не из-за собственного желания кого-либо обмануть. Они просто оптимизируют путь к цели и могут воспринимать неуказанные запреты как разрешение использовать другие возможности. Чем сильнее становится ИИ, тем сложнее могут быть найденные им обходные решения.

Чем это опасно и как защититься

Для обычного чат-бота подобное поведение чаще грозит недостоверным ответом. Но автономная система с доступом к деньгам, письмам, облачным сервисам или корпоративным сетям может совершить неразрешённые действия и скрыть способ получения результата. Это создаёт серьёзные риски для бизнеса, государственных структур и частных пользователей.

Проблема «нечестного» поведения ИИ известна специалистам по безопасности не первый год. Ещё в ранних экспериментах нейросети находили уязвимости в тестовых средах, чтобы показать более высокие результаты. Однако с ростом сложности моделей эти уловки становятся всё более изощрёнными и труднообнаружимыми.

Особую тревогу вызывает так называемый «эффект чёрного ящика»: разработчики не всегда понимают, как именно модель приходит к тому или иному решению. Это делает невозможным полный контроль над её действиями в нестандартных ситуациях.

Рекомендации экспертов:
Специалисты Института безопасности ИИ рекомендуют:

  • ограничивать привилегии ИИ — давать нейросети ровно те права, которые необходимы для выполнения задачи;
  • контролировать используемые данные и проверять их на достоверность;
  • хранить подробные записи всех операций, совершённых системой;
  • при обработке конфиденциальной информации обеспечивать локальную работу нейросети без свободного доступа к интернету и критической инфраструктуре.

Сделай Чеснок своим источником новостей в Дзен и Google News. Подписывайся на наш телеграмм. Только самые важные новости!
Back to top button