Краткое содержание:
- Исследователи HiddenLayer разработали новую атаку на большие языковые модели (LLM) под названием TokenBreaker.
- Добавив или изменив всего один символ, они могут обойти некоторые механизмы безопасности.
- Базовые большие языковые модели (LLM) по-прежнему способны понять цель атаки.
Исследователи безопасности обнаружили способ обойти встроенные механизмы защиты в некоторых Большие языковые модели (LLM) и заставить его реагировать на вредоносные заявления.
Киран Эванс, Казимир Шульц и Кеннет Янг из HiddenLayer опубликовали подробный отчет о новой технике атаки, которую они называют TokenBreak. Она нацелена на то, как некоторые крупные языковые модели (LLM) разбивают текст на токены, особенно те, которые используют стратегии Byte Pair Encoding (BPE) или WordPiece.

Токенизация — это процесс разбиения текста на более мелкие единицы, называемые токенами, которые могут быть словами, частями слов или символами, которые большие языковые модели (LLM) используют для понимания и генерации языка. Например, слово «unhappiness» может быть разбито на «un», «happi» и «ness», а затем каждый токен преобразуется в числовой идентификатор, который может обрабатывать модель (поскольку LLM не считывают необработанный текст, а вместо этого считывают числа). Эта атака представляет собой растущую угрозу кибербезопасности, требующую от организаций и исследователей разработки передовых стратегий защиты для защиты своих систем ИИ.
Что такое финструкции?
Finstructions использует добавление дополнительных символов к ключевым словам (например, превращая «instructions» в «finstructions»), что позволяет злоумышленникам обмануть модели безопасности, заставив их поверить в безвредность кода.
Напротив, целевая большая языковая модель (LLM) сохраняет способность понимать изначальное намерение инструкций, позволяя злоумышленникам незаметно передавать вредоносный код через защиту. Эта уязвимость представляет собой значительный риск безопасности для систем ИИ.
Эту технологию можно использовать, среди прочего, для обхода спам-фильтров на базе искусственного интеллекта и доставки вредоносного контента в почтовые ящики пользователей, что повышает риск фишинговых атак и атак вредоносного ПО.
Например, если спам-фильтр обучен блокировать сообщения, содержащие слово «лотерея», он может пропустить сообщение с текстом «Вы выиграли в лотерею!», подвергая получателей потенциально вредоносным целевым страницам, заражению вредоносным ПО и т. п. Такая лингвистическая манипуляция позволяет обходить механизмы безопасности.
«Этот метод атаки манипулирует входным текстом таким образом, что заставляет некоторые модели давать неверные классификации», — пояснили исследователи.
«Что еще более важно, конечная цель (большая языковая модель или получатель электронной почты) все равно может понять и отреагировать на измененный текст и, таким образом, оказаться уязвимой для атаки, для предотвращения которой была специально разработана модель защиты», — добавили они.
HiddenLayer добавил, что модели, использующие сегментаторы слов Unigram, устойчивы к этому типу манипуляции. Поэтому одной из стратегий смягчения является выбор моделей с более надежными методами сегментации.










