В МИФИ создали нейросеть, которая знает, когда не уверена, и не поддается на обман
Новости Безопасность
Исследователи из Национального исследовательского ядерного университета МИФИ (НИЯУ МИФИ) разработали архитектуру нейронной сети, которая одновременно оценивает надежность собственных прогнозов и лучше сопротивляется состязательным атакам — целенаправленным искажениям входных данных, заставляющим ИИ ошибаться. Об этом сообщает Минобрнауки России.
Почему это проблема
Современные системы искусственного интеллекта — включая языковые модели — могут быть абсолютно уверены в неправильном ответе. Особенно опасным это становится, когда нейросеть пытаются обмануть сознательно: злоумышленник подбирает едва заметные изменения во входных данных, которые не меняют их смысл для человека, но сбивают модель с толку. Например, система обнаружения сетевых вторжений должна отличить нормальный трафик от атаки — но под воздействием состязательного примера она может не просто ошибиться, а сделать это с высокой степенью уверенности.
Стохастический трансформер
В основе решения — идея стохастического трансформера. В отличие от классического, у него веса нейронов не фиксированы: вместо одного значения у каждого нейрона есть «облако» возможных значений. При каждом запуске модель случайным образом выбирает веса в зависимости от входных данных. Это значит, что один и тот же объект при повторных прогонах может дать разные прогнозы. Если они совпадают — система считает решение надежным. Если заметно расходятся — это сигнал высокой неопределенности.
«Движущаяся мишень» для атакующего
Случайность весов создает злоумышленнику дополнительное препятствие. Если атакующий знает точную структуру и поведение модели, он может подобрать такое искажение входа, которое заставит ее ошибиться. Но когда внутренние параметры модели каждый раз меняются — авторы называют это «движущейся мишенью» — одна и та же атака уже не гарантирует успеха при повторном запуске.
Три задачи в одном решении
Разработка МИФИ решает сразу три задачи: повышает устойчивость к состязательным атакам, улучшает соответствие уверенности модели реальной точности прогноза и сокращает объем данных, требующих ручной разметки. Высокая неопределенность служит сигналом: такие случаи стоит передать человеку для проверки, а не тратить разметку на все подряд.
Где проверяли
Подход протестировали на девяти наборах данных в трех прикладных областях: обнаружение сетевых вторжений, выявление токсичного контента и распознавание фейковых новостей. Код и модели выложены в открытый доступ, чтобы мировое научное сообщество могло сразу использовать наработки российских ученых для создания более безопасного ИИ.
В дальнейшем авторы планируют адаптировать метод для больших языковых моделей с помощью технологии низкоранговой адаптации (LoRA) — это позволит применять стохастическую защиту к крупным нейросетям без полного переобучения.
|
|
|