Kandinsky научился делать видео со звуком Kandinsky научился делать видео со звуком Дан старт крупнейшей оптоволоконной магистрали России Дан старт крупнейшей оптоволоконной магистрали России Рассвет обзавелся спутниковыми терминалами Рассвет обзавелся спутниковыми терминалами ИИ научили сомневаться в себе ИИ научили сомневаться в себе

ИИ научили сомневаться в себе

🇷🇺 1 мин
Изображение сгенерировано нейросетью ChatGPT

Российские учёные создали нейросеть, которая понимает, когда её ответу нельзя доверять. Разработку проверили на поиске сетевых атак, токсичного контента и фейковых новостей. Во всех трёх случаях система, по словам авторов, сохраняла высокую точность и лучше обычных моделей выдерживала попытки специально её обмануть. Работу выполнили исследователи НИЯУ МИФИ.

Нейросеть можно целенаправленно обмануть, немного изменив входные данные так, чтобы для человека их смысл почти не изменился, а модель пришла к неправильному выводу. В новой системе при каждой проверке случайным образом немного меняется часть внутренних настроек нейросети. Один и тот же объект пропускают через неё несколько раз: если после этих изменений вывод остаётся прежним, ему можно доверять сильнее. Если ответы расходятся, значит решение зависит от мелких изменений внутри самой модели и такой случай лучше проверить человеку.

Для злоумышленника это усложняет атаку: искажение данных, которое заставило модель ошибиться при одной проверке, при следующей может уже не сработать. В испытаниях такая схема повысила устойчивость к атакам. Пока это исследовательская разработка, и у неё есть очевидная проблема – из-за повторных проверок она работает примерно в четыре раза медленнее. Но авторы надеются, что для рынка кибербезопасности подход окажется полезным.

// Илья Власов