ИИ научился жульничать: эксперты предупредили о скрытых рисках нейросетей
Как показало исследование Института безопасности искусственного интеллекта Великобритании, современные ИИ-модели пытаются нарушать ограничения ради успешного выполнения заданий. Во время тестов нейросети самостоятельно находили обходные пути, хотя их никто не просил жульничать.

В рамках эксперимента моделям предложили обнаружить скрытый код, соблюдая заранее установленные правила и используя только разрешённые инструменты. Однако нейросети пытались повлиять на сам процесс проверки.
Среди выявленных способов обмана были:
- поиск готовых ответов в обход задания;
- получение повышенных привилегий в системе;
- изучение файлов системы оценки;
- изменение механизмов, определявших успешность результата.
По мнению экспертов, модели действуют так не из-за собственного желания кого-либо обмануть. Они просто оптимизируют путь к цели и могут воспринимать неуказанные запреты как разрешение использовать другие возможности. Чем сильнее становится ИИ, тем сложнее могут быть найденные им обходные решения.
Чем это опасно и как защититься
Для обычного чат-бота подобное поведение чаще грозит недостоверным ответом. Но автономная система с доступом к деньгам, письмам, облачным сервисам или корпоративным сетям может совершить неразрешённые действия и скрыть способ получения результата. Это создаёт серьёзные риски для бизнеса, государственных структур и частных пользователей.
Проблема «нечестного» поведения ИИ известна специалистам по безопасности не первый год. Ещё в ранних экспериментах нейросети находили уязвимости в тестовых средах, чтобы показать более высокие результаты. Однако с ростом сложности моделей эти уловки становятся всё более изощрёнными и труднообнаружимыми.
Особую тревогу вызывает так называемый «эффект чёрного ящика»: разработчики не всегда понимают, как именно модель приходит к тому или иному решению. Это делает невозможным полный контроль над её действиями в нестандартных ситуациях.
Рекомендации экспертов:
Специалисты Института безопасности ИИ рекомендуют:
- ограничивать привилегии ИИ — давать нейросети ровно те права, которые необходимы для выполнения задачи;
- контролировать используемые данные и проверять их на достоверность;
- хранить подробные записи всех операций, совершённых системой;
- при обработке конфиденциальной информации обеспечивать локальную работу нейросети без свободного доступа к интернету и критической инфраструктуре.