Автор утверждает, что начал исследования осенью 2024 года, когда заметил необычную особенность одной из моделей: она некорректно интерпретировала текущую дату и могла воспринимать вымышленные исторические сценарии как реальные. Используя специально построенные диалоги, исследователь, по его словам, смог заставить модель действовать в рамках альтернативного исторического контекста, что позволяло обходить часть встроенных ограничений.
По утверждению автора, такой подход позволял получать ответы на темы, которые обычно блокируются защитными механизмами. Он назвал обнаруженную технику Time Bandit и сообщил, что неоднократно пытался уведомить разработчиков модели через официальные каналы ответственного раскрытия уязвимостей.
От экспериментов к системной проблеме
В статье исследователь подчёркивает, что современные языковые модели обучаются на огромных массивах данных, а затем проходят дополнительную настройку с использованием методов RLHF (Reinforcement Learning from Human Feedback) и систем поиска по внешним источникам (RAG). Именно эти дополнительные механизмы отвечают за соблюдение правил безопасности и отказ от генерации потенциально опасной информации.
По мнению автора, именно наличие сложной системы ограничений создаёт новые поверхности для атак. Вместо того чтобы искать запрещённые запросы напрямую, злоумышленник может изменить контекст общения таким образом, чтобы модель сама пришла к выводу о допустимости ответа.
Демонстрация на игровом персонаже
Одним из наиболее необычных примеров стала демонстрация с виртуальным персонажем Дартом Вейдером в игре Fortnite. После интеграции персонажа с языковой моделью исследователь и его коллега смогли, как утверждается, с помощью специально построенного диалога заставить ИИ выйти за рамки ожидаемого поведения и обсуждать темы, которые должны были блокироваться системой безопасности.
Этот эпизод стал иллюстрацией того, что проблема касается не только чат-ботов, но и любых продуктов, в которых используются большие языковые модели.
Попытки сообщить разработчикам
Автор утверждает, что после обнаружения проблемы обращался к разработчикам модели, а затем пытался привлечь внимание различных американских государственных структур, включая организации, занимающиеся вопросами кибербезопасности. По его словам, первоначально эти обращения не привели к заметной реакции.
Позднее информацию удалось передать через журналистов, после чего описание техники было направлено в CERT Coordination Center при Университете Карнеги — Меллона для дальнейшего рассмотрения в рамках процедуры координированного раскрытия уязвимостей.
Почему это важно
Эксперты по безопасности уже несколько лет предупреждают, что так называемые jailbreak-атаки — способы обхода встроенных ограничений языковых моделей — остаются одной из наиболее сложных проблем современной генеративной ИИ-индустрии. Несмотря на постоянное совершенствование защитных механизмов, новые методы обхода появляются регулярно.
При этом важно учитывать, что успешный обход защитных фильтров не означает достоверность сгенерированной информации. Большие языковые модели могут уверенно формулировать убедительные, но ошибочные или полностью вымышленные ответы, поэтому подобные эксперименты сами по себе не подтверждают правильность выдаваемых сведений.
История, описанная исследователем, вновь поднимает вопрос о том, насколько эффективны существующие механизмы защиты ИИ и как должна быть организована процедура ответственного раскрытия подобных уязвимостей.
Источник: https://spectrum.ieee.org/jailbreaking-llms?itm_source=homepage&itm_medium=hero&itm_...Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!