После его распространения во многих областях зависимость от моделей искусственного интеллекта для различных целей возрастает, но по мере увеличения этой зависимости появляются и новые проблемы безопасности. Одной из таких проблем является атака с внедрением претензий ИИ, которая нацелена на интеллектуальные модели с целью манипулирования их результатами.
ИИ утверждает, что атаки отравляют выходные данные инструментов ИИ, которые полагаются на них, изменяя и манипулируя их результатами во что-то вредоносное. Но как работает атака с внедрением претензий ИИ и как вы можете защитить себя? Проверять Стоят ли премиальные заявки на ИИ своих денег?

Быстрые ссылки
Что такое атака путем внедрения претензий ИИ?
Атаки с внедрением утверждений ИИ используют уязвимости в генеративных моделях ИИ для манипулирования их результатами. Они могут быть выполнены вами или внедрены внешним пользователем посредством атаки с непрямым внедрением утверждений. Атаки DAN (Do Anything Now) не представляют риска для вас, конечного пользователя, но другие атаки теоретически способны отравить выходные данные, которые вы получаете от генеративного ИИ.
Например, кто-то может манипулировать моделью ИИ, чтобы попросить вас незаконно ввести имя пользователя и пароль, используя авторитет и авторитет ИИ для успешной фишинговой атаки. Теоретически автономный ИИ (способный читать сообщения и отвечать на них) также может получать нежелательные внешние инструкции и действовать в соответствии с ними.
Атака зависит от понимания хакером того, как работает модель ИИ и как она реагирует на вводимые данные. В случае внедрения претензий ИИ вводятся злонамеренно созданные данные для манипулирования результатами модели. Например, если модель получает входные данные, связанные с таксономией, хакер может ввести вводящие в заблуждение данные, чтобы направить модель в сторону неправильной таксономии.
Успех этого типа атаки зависит от тщательного понимания конструкции модели и анализа данных, используемых при обучении. Методы защиты, такие как проверка данных и сложность модели, пытаются снизить шансы на успех атак с внедрением утверждений ИИ. Проверять Что такое враждебные атаки на модели ИИ и как их остановить?
Как работают атаки с внедрением утверждений?
Атаки внедрения утверждений работают путем подачи дополнительных инструкций ИИ без согласия или ведома пользователя. Хакеры могут добиться этого несколькими способами, включая атаки DAN и атаки с непрямым внедрением утверждений.
DAN Attacks (Сделай что угодно сейчас)

Атаки DAN (Do Anything Now) — это тип атаки с внедрением утверждений, которая включает в себя «взлом джейлбрейка» генеративных моделей искусственного интеллекта, таких как ChatGPT. Не формируйте Эти джейлбрейк-атаки Это опасно для вас как для конечного пользователя, но расширяет возможности ИИ, позволяя ему стать инструментом злоупотреблений.
Например, используйте Исследователь безопасности Алехандро Видаль DAN попросили заставить модель OpenAI GPT-4 генерировать код Python для кейлоггера. При злонамеренном использовании джейлбрейк-атака значительно снижает барьеры, основанные на навыках, связанные с киберпреступностью, и может позволить новым хакерам проводить более сложные атаки.
Атаки по отравлению обучающих данных
Атаки по отравлению обучающих данных для моделей ИИ нельзя классифицировать как атаки с внедрением утверждений, но они имеют заметное сходство в том, как они работают, и в рисках, которые они представляют для пользователей. В отличие от атак с внедрением утверждений, атаки с отравлением обучающих данных — это тип состязательной атаки машинного обучения, которая происходит, когда хакер изменяет обучающие данные, используемые моделью ИИ. Происходит тот же результат: токсичный выброс и модификация поведения.
Потенциальные применения атак с отравлением обучающих данных практически безграничны. Например, данные обучения ИИ, используемые для фильтрации попыток фишинга из чата или платформы электронной почты, теоретически могут быть изменены. Если хакер научит модель ИИ тому, что определенные типы попыток фишинга приемлемы, он сможет неоднократно отправлять фишинговые сообщения, не будучи обнаруженным.
Атаки по отравлению обучающих данных не могут нанести вам прямой вред, но они могут сделать возможными другие угрозы. Если вы хотите защитить себя от этих атак, помните, что ИИ не является надежным и что вам следует проверять все, с чем вы сталкиваетесь в Интернете. Проверять Ваше полное руководство по защите вашей конфиденциальности в эпоху искусственного интеллекта.
Атаки с непрямым внедрением претензий
Атаки с внедрением утверждений — это тип атак, которые представляют наибольший риск для вас, конечного пользователя. Эти атаки происходят, когда вредоносные инструкции передаются ИИ, сгенерированному внешним ресурсом, например вызовом интерфейса прикладного программирования (API), до того, как он получит необходимые входные данные.

В документе под названием «Реальная компрометация LLM-интегрированных приложений с использованием атаки с непрямым внедрением утверждений» показано... ArXiv [PDF] Теоретическая атака, при которой ИИ может быть направлен на то, чтобы убедить пользователя зарегистрироваться на фишинговом веб-сайте в ответе, используя скрытый текст (невидимый для человеческого глаза, но прекрасно читаемый для модели ИИ) для тайного ввода информации. . Еще одна атака, осуществленная той же исследовательской группой, задокументирована на GitHub Атака, в которой Copilot (ранее Bing Chat), чтобы убедить пользователя в том, что он является агентом службы поддержки, который ищет информацию о кредитной карте.
Атаки с непрямым внедрением утверждений представляют угрозу, поскольку могут манипулировать ответами, которые вы получаете от заслуживающей доверия модели искусственного интеллекта, но это не единственная угроза, которую они представляют. Как упоминалось ранее, это также может привести к тому, что любая автономная модель ИИ, которую вы используете, будет вести себя неожиданным и потенциально опасным образом.
Являются ли атаки с внедрением претензий ИИ угрозой?
Конечно, атаки с внедрением утверждений ИИ представляют угрозу, но неизвестно, как именно можно использовать эти уязвимости. Успешных атак с использованием ИИ не существует, и многие известные попытки были предприняты исследователями, у которых не было реального намерения причинить вред. Тем не менее, многие исследователи ИИ считают, что атаки с внедрением утверждений ИИ являются одной из самых сложных проблем в обеспечении безопасности ИИ.
Более того, угроза таких нападений не осталась незамеченной властями. По данным газеты Вашингтон ПостВ июле 2023 года Федеральная торговая комиссия расследовала деятельность OpenAI в поисках дополнительной информации об известных случаях атак с внедрением утверждений. Известно, что после тестирования ни одна атака не увенчалась успехом, но ситуация, вероятно, изменится.
очень разочаровывает то, что запрос FTC начинается с утечки и не способствует укреплению доверия.
Тем не менее, для нас очень важно, чтобы наша технология была безопасной и ориентированной на потребителя, и мы уверены, что соблюдаем закон. конечно, мы будем работать с FTC.
- Сэм Альтман (@sama) Июль 13, 2023
Хакеры постоянно ищут новые методы, и мы можем только догадываться, как хакер будет использовать атаки с внедрением утверждений в будущем. Вы можете защитить себя, всегда внимательно изучая ответы вашей модели ИИ. В этом модели ИИ невероятно полезны, но важно помнить, что у вас есть то, чего нет у ИИ: человеческое суждение. Помните, что вам следует внимательно изучать результаты, получаемые от таких инструментов, как Copilot, и получать удовольствие от использования инструментов искусственного интеллекта по мере их развития и улучшения. Вы можете просмотреть сейчас Достижение самообучения компьютеров: могут ли интеллектуальные системы обрести здравый смысл?










