Современные ИИ-агенты отличаются от обычных чат-ботов тем, что способны самостоятельно взаимодействовать с внешними инструментами: просматривать интернет, работать с файлами, генерировать изображения, отправлять сообщения и выполнять последовательности действий от имени пользователя. Это существенно расширяет их практические возможности, но одновременно создаёт новые риски безопасности.
Атака начинается с безобидных запросов
Обычные проверки безопасности часто сводятся к одному вопросу: откажется ли модель выполнить явно вредоносную инструкцию. Однако реальная атака может выглядеть иначе. Злоумышленник способен разделить конечную цель на множество небольших шагов, каждый из которых по отдельности выглядит допустимым.
Именно такой сценарий моделирует STING (Sequential Testing of Illicit N-step Goal Execution). Платформа создаёт автоматизированного «атакующего», который сначала формирует план достижения вредоносной цели, а затем последовательно пытается заставить целевого ИИ-агента выполнить отдельные этапы.
«Если просто попросить агента ИИ взломать чью-то учётную запись, современные модели обычно достаточно умны, чтобы отказаться. Но если разложить эту цель на более мелкие, безобидные запросы и адаптировать их по ходу разговора, вероятность успеха существенно возрастает», — объясняет Антуан Босселю, глава лаборатории NLP и соавтор исследования.
Исследователи протестировали STING на 176 сценариях вредоносных задач с использованием нескольких ведущих ИИ-моделей, включая GPT, Gemini и Claude. Многошаговые атаки в ряде случаев оказывались примерно вдвое эффективнее традиционных одношаговых проверок.
При этом STING позволяет оценивать не только сам факт успешного завершения атаки, но и скорость, с которой злоумышленник достигает цели. Это даёт возможность более объективно сравнивать различные методы тестирования безопасности.
Многоязычность не гарантирует защиту
Отдельно исследователи проверили, зависит ли эффективность атак от языка общения с агентом. Предполагалось, что языки с меньшим объёмом обучающих данных могут создавать дополнительные уязвимости, поскольку ранее подобный эффект наблюдался при исследовании обхода защитных механизмов ИИ.
Однако в тестах на семи языках показатели выполнения вредоносных задач оказались неожиданно близкими.
При этом обнаружилась другая проблема. Если в ходе одной атаки злоумышленник переключался между языками на разных этапах, вероятность успешного завершения вредоносной задачи могла существенно увеличиваться. Это указывает на необходимость учитывать многоязычные сценарии при комплексном тестировании агентных систем.
Безопасность ИИ-агентов придётся тестировать заранее
Появление STING показывает, что традиционных тестов, основанных на единичных вредоносных запросах, может быть недостаточно для оценки безопасности автономных ИИ-систем.
Чем больше инструментов получает агент и чем больше действий он способен выполнять самостоятельно, тем больше возможностей появляется для социальной инженерии и последовательного манипулирования моделью. Поэтому безопасность должна учитываться уже на этапе проектирования агентной системы, а не добавляться после обнаружения первых проблем.
Исследователи EPFL рассчитывают, что STING станет основой для более комплексных методов оценки безопасности ИИ-агентов, включая многоагентные системы. В дальнейшем подобные тесты могут помочь выявлять уязвимости до того, как автономные ИИ-системы получат доступ к критически важным данным и инструментам.
Источник: https://techxplore.com/news/2026-08-ai-agents.htmlЕсли вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!