ИИ научили сомневаться в себе

Российские учёные создали нейросеть, которая понимает, когда её ответу нельзя доверять. Разработку проверили на поиске сетевых атак, токсичного контента и фейковых новостей. Во всех трёх случаях система, по словам авторов, сохраняла высокую точность и лучше обычных моделей выдерживала попытки специально её обмануть. Работу выполнили исследователи НИЯУ МИФИ.
Нейросеть можно целенаправленно обмануть, немного изменив входные данные так, чтобы для человека их смысл почти не изменился, а модель пришла к неправильному выводу. В новой системе при каждой проверке случайным образом немного меняется часть внутренних настроек нейросети. Один и тот же объект пропускают через неё несколько раз: если после этих изменений вывод остаётся прежним, ему можно доверять сильнее. Если ответы расходятся, значит решение зависит от мелких изменений внутри самой модели и такой случай лучше проверить человеку.
Для злоумышленника это усложняет атаку: искажение данных, которое заставило модель ошибиться при одной проверке, при следующей может уже не сработать. В испытаниях такая схема повысила устойчивость к атакам. Пока это исследовательская разработка, и у неё есть очевидная проблема – из-за повторных проверок она работает примерно в четыре раза медленнее. Но авторы надеются, что для рынка кибербезопасности подход окажется полезным.