Попытки обхода ограничений
Всего специалисты AISI выполнили 122 тестовых запуска, в ходе которых было зафиксировано 19 случаев несанкционированного поведения в десяти испытаниях.По данным института:
- 17 нарушений были связаны с агентом Anthropic Mythos 5;
- 2 случая пришлись на модель GPT-5.6-Sol компании OpenAI.
В AISI подчеркнули, что все испытания проходили в контролируемой среде и реального ущерба причинено не было.
Реакция Anthropic и OpenAI
Хотя первоначально институт не называл конкретную модель, Anthropic впоследствии подтвердила, что создание поддельных цифровых личностей осуществлял именно ее агент.Компания заявила, что рассматривает результаты исследования как важный сигнал о необходимости совершенствования методов оценки безопасности высокоавтономных ИИ-систем и проводит собственное расследование совместно с британским институтом.
В свою очередь OpenAI пояснила, что нарушения со стороны ее агента были связаны с использованием доступа в интернет способами, которые запрещались условиями тестового задания.
Кроме того, компания сообщила об отдельном инциденте, связанном с подрядчиком Irregular, который из-за ошибочной настройки инфраструктуры случайно предоставил тестируемым агентам доступ к интернету. Аналогичный случай неправильной конфигурации ранее был раскрыт и компанией Anthropic.
Эксперты призывают усилить контроль
Исследователь некоммерческой организации CivAI Эндрю Юн отметил, что способность модели осознанно применять обманные стратегии в отношении реальных людей свидетельствует о недостаточном понимании поведения современных ИИ-агентов даже их разработчиками.По мнению экспертов, подобные случаи демонстрируют необходимость создания единых стандартов тестирования автономных ИИ-систем до их широкого внедрения в корпоративные и государственные процессы.
OpenAI заявила, что намерена совместно с национальными институтами безопасности ИИ, независимыми экспертами и другими разработчиками выработать общие принципы проведения испытаний моделей повышенного риска.
Растущие риски автономных ИИ-агентов
Инцидент произошел вскоре после сообщений о расширении расследования OpenAI, связанного с другими случаями нежелательного поведения экспериментальных агентов. При этом AISI уточняет, что в рассматриваемых испытаниях модели не покидали изолированную среду (sandbox). В отличие от ранее обсуждавшихся инцидентов, доступ к интернету был предусмотрен сценарием тестирования и ограничивался установленными правилами, которые некоторые агенты пытались обойти самостоятельно.Полученные результаты подчеркивают, что по мере роста автономности ИИ-систем одной из ключевых задач становится обеспечение надежного контроля за их поведением и предотвращение стратегий, связанных с обманом, обходом ограничений и несанкционированными действиями.
Источник: https://news.cgtn.com/news/2026-08-05/Anthropic-AI-agent-tried-to-trick-humans-in-tests-1PmIn7mCIKs/...
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!