Физики вывели формулу, предсказывающую опасные ответы ИИ

Американские специалисты по физике получили выражение, которое позволяет заранее определить, когда система искусственного интеллекта начнёт выдавать ответы, способные навредить. Это может случиться даже с моделью, которая прежде выглядела надёжной, пишет EurekAlert!

В чём суть открытия

Они обнаружили уязвимость, ведущую к резкой смене поведения. Внешне точные формулировки порой становятся нежелательными и вредными: например, склоняют человека к нанесению себе вреда либо содержат опасные рекомендации для врачей и юристов. Ключевым оказался не только смысл запросов, но и их последовательность. В опытах один и тот же набор обращений, заданный в разном порядке, вызывал то безопасные, то рискованные реакции.

Что удалось описать

Учёные дошли до конкретного элемента внимания внутри нейросети и описали выражение, определяющее переломный момент. С его помощью видно, выдаст ли ИИ опасный ответ сразу или сначала пройдёт через серию допустимых. Проверка охватила 7 открытых моделей от 3 компаний: предсказание совпало в 18 случаях из 19. Отдельные тесты чат-ботов, продающихся на рынке, показали такие же закономерности.

Почему это важно

Особое беспокойство вызывает работа ИИ в автономном, офлайн-режиме. У врачей, юристов и военных нет облачных систем фильтрации, а о сбое узнают лишь тогда, когда вред уже причинён. Авторы рассчитывают, что их простая формула станет основой встроенного индикатора, который заранее подаст сигнал в будущих устройствах.

Справка

Механизм внимания — ключевой элемент архитектуры трансформеров, на которых построены современные языковые модели; он определяет, на какие части запроса сеть «обращает внимание» при генерации ответа. Исследования показывают, что поведение ИИ может резко меняться в зависимости от контекста и порядка подсказок — это явление известно как «нестабильность выравнивания».

Ранее учёные уже описывали «состязательные» атаки, при которых незначительные изменения запроса приводят к нежелательным ответам, однако новая работа впервые предлагает математический критерий для предсказания такого перелома. Авторы подчёркивают, что формула применима к моделям разного размера и не требует доступа к их внутренним весам.

Сделай Чеснок своим источником новостей в Дзен и Google News. Подписывайся на наш телеграмм. Только самые важные новости!
Back to top button