Софтодром   




В МИФИ создали нейросеть, которая знает, когда не уверена, и не поддается на обман




Новости    Безопасность


Исследователи из Национального исследовательского ядерного университета МИФИ (НИЯУ МИФИ) разработали архитектуру нейронной сети, которая одновременно оценивает надежность собственных прогнозов и лучше сопротивляется состязательным атакам — целенаправленным искажениям входных данных, заставляющим ИИ ошибаться. Об этом сообщает Минобрнауки России.

Почему это проблема

Современные системы искусственного интеллекта — включая языковые модели — могут быть абсолютно уверены в неправильном ответе. Особенно опасным это становится, когда нейросеть пытаются обмануть сознательно: злоумышленник подбирает едва заметные изменения во входных данных, которые не меняют их смысл для человека, но сбивают модель с толку. Например, система обнаружения сетевых вторжений должна отличить нормальный трафик от атаки — но под воздействием состязательного примера она может не просто ошибиться, а сделать это с высокой степенью уверенности.

Стохастический трансформер

В основе решения — идея стохастического трансформера. В отличие от классического, у него веса нейронов не фиксированы: вместо одного значения у каждого нейрона есть «облако» возможных значений. При каждом запуске модель случайным образом выбирает веса в зависимости от входных данных. Это значит, что один и тот же объект при повторных прогонах может дать разные прогнозы. Если они совпадают — система считает решение надежным. Если заметно расходятся — это сигнал высокой неопределенности.

«Движущаяся мишень» для атакующего

Случайность весов создает злоумышленнику дополнительное препятствие. Если атакующий знает точную структуру и поведение модели, он может подобрать такое искажение входа, которое заставит ее ошибиться. Но когда внутренние параметры модели каждый раз меняются — авторы называют это «движущейся мишенью» — одна и та же атака уже не гарантирует успеха при повторном запуске.

Три задачи в одном решении

Разработка МИФИ решает сразу три задачи: повышает устойчивость к состязательным атакам, улучшает соответствие уверенности модели реальной точности прогноза и сокращает объем данных, требующих ручной разметки. Высокая неопределенность служит сигналом: такие случаи стоит передать человеку для проверки, а не тратить разметку на все подряд.

Где проверяли

Подход протестировали на девяти наборах данных в трех прикладных областях: обнаружение сетевых вторжений, выявление токсичного контента и распознавание фейковых новостей. Код и модели выложены в открытый доступ, чтобы мировое научное сообщество могло сразу использовать наработки российских ученых для создания более безопасного ИИ.

В дальнейшем авторы планируют адаптировать метод для больших языковых моделей с помощью технологии низкоранговой адаптации (LoRA) — это позволит применять стохастическую защиту к крупным нейросетям без полного переобучения.


Автор: Softodrom.ru
Дата:














Программы | Авторам | Рассылки | Реклама
Copyright © 1999-2026 Softodrom.ru
О проекте | О перепечатках | Пользовательское соглашение | Политика конфиденциальности | Карта сайта