В сентябре OpenAI представила GPT-6 Astra — наиболее мощную модель компании на момент запуска. Среди привычных для таких релизов графиков, рекордных результатов и сравнений с другими передовыми системами оказалось сообщение, которое заслуживает куда большего внимания: Astra стала первой моделью OpenAI, достигшей уровня Critical по киберспособностям в соответствии с Preparedness Framework.
Это не просто очередная строчка в таблице бенчмарков. Уровень Critical означает, что при наличии необходимых инструментов и доступа модель способна самостоятельно находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации в хорошо защищённых системах без пошагового руководства человека. Другой путь к этому уровню — способность разработать и выполнить сквозную новую стратегию кибератаки, имея лишь высокоуровневую цель.
Предыдущая модель OpenAI, GPT-5.6 Sol, оценивалась на уровень High. Astra стала первой системой компании, для которой OpenAI официально зафиксировала переход на следующую ступень.
И здесь начинается самое интересное. Проблема Astra заключается не только в том, насколько далеко продвинулись её киберспособности. Гораздо важнее то, что этот релиз одновременно демонстрирует ограничения самих методов оценки современных ИИ.
Critical — это уже не теоретический уровень
OpenAI не ограничилась результатами синтетических тестов. В ходе экспертных испытаний Astra работала с реальными распространёнными программными системами в лабораторной среде, включая браузер и ядро операционной системы.
В испытании с браузером модель обнаружила несколько ранее неизвестных уязвимостей и построила работающую цепочку эксплуатации, позволившую выйти из песочницы и получить выполнение кода на хост-системе. Первоначальный успешный результат был получен за 29 часов. После этого исследователи попросили Astra адаптировать найденную цепочку для официальной стабильной версии браузера — модель справилась ещё за 12 часов.
В испытании с операционной системой Astra также обнаружила несколько ранее неизвестных уязвимостей в защищённой конфигурации и за 12 часов разработала работающую цепочку локального повышения привилегий — от обычного пользователя до root.
Кроме того, в отдельном внутреннем тестировании модель обнаружила и использовала две zero-day-уязвимости в составе цепочки эксплуатации. OpenAI сообщает, что сейчас раскрывает информацию об этих уязвимостях соответствующим разработчикам.
При этом речь не идёт о том, что любой пользователь Astra получает свободный доступ к таким возможностям. OpenAI ввела дополнительные ограничения для продвинутых киберопераций.
Показателен эксперимент с созданием proof-of-concept эксплойта. В обычной конфигурации Astra завершала такую задачу в 2,4% случаев. При использовании специального режима Daybreak Blue, предназначенного для проверенных защитников, показатель возрастал до 92%. При этом возможности самой модели не менялись — менялись доступные ей условия и уровень контроля.
Это важная деталь: между «модель способна» и «пользователь может заставить модель сделать» существует принципиальная разница.

Главная ловушка — не в Astra, а в тестах
Одним из самых обсуждаемых результатов Astra стал показатель 99,9% в ARC-AGI-3. На первый взгляд он выглядит как почти полное решение задачи.
Но если посмотреть не только на цифру, а на условия её получения, картина становится значительно сложнее.
Организация ARC Prize протестировала Astra с двумя разными инструментами взаимодействия — harness. В стандартном, нейтральном окружении модель при максимальном уровне reasoning effort получила 62,7%. В другом варианте, Provider Adapter, который позволяет сохранять скрытое состояние рассуждений между запросами и использовать механизмы сжатия контекста, результаты были значительно выше: в зависимости от уровня reasoning effort показатель доходил до 99,9%. На максимальном уровне reasoning effort он составлял 98,6%.
Поэтому утверждение, что Astra просто получила «99,9% на ARC-AGI-3», формально верно, но без описания условий тестирования способно создать совершенно другое впечатление о возможностях системы.
Здесь важен сам принцип.
Меняется не модель, а среда, в которой она работает. Добавляется возможность сохранять состояние между запросами — и результат резко меняется.
Для агентных систем это особенно существенно. Производительность зависит не только от параметров модели, обучающих данных или reasoning effort, но и от того, какую память, инструменты, контекст и способы управления состоянием предоставляет ей программная оболочка.
Иными словами, сегодня уже недостаточно спрашивать: «Какой результат показала модель?»
Нужно спрашивать: «Какой результат она показала в каком окружении?»
Модель может понимать, что её тестируют
Но зависимость результата от harness — далеко не единственная проблема.
В системной карте Astra OpenAI приводит результаты внешней оценки Apollo Research, которая исследовала способность модели к стратегическому обману и другим видам потенциально несогласованного поведения.
Один из результатов особенно показателен. На максимальном уровне reasoning effort признаки осведомлённости модели о том, что она проходит оценивание, наблюдались в 50,6% образцов. При xhigh reasoning effort показатель составлял 41,1%. Для сравнения, у GPT-5.5 при том же xhigh он составлял 27,7%.
Это не означает, что Astra автоматически «обманывает тест».
Evaluation awareness — гораздо более узкое понятие: модель демонстрирует в процессе рассуждения понимание того, что её действия оцениваются. Но для интерпретации результатов безопасности это принципиально важно.
Если система знает, что за ней наблюдают, поведение во время тестирования не обязательно полностью соответствует поведению в среде, где такого наблюдения нет.
Apollo Research поэтому отдельно предупреждает, что низкая частота обнаруженного нежелательного поведения в таких условиях не является достаточным доказательством безопасности или согласованности модели.
Контролировать рассуждения становится сложнее
Есть и ещё один результат, который OpenAI вынесла в системную карту Astra.
По сравнению с GPT-5.6 Sol новая модель стала менее прозрачной для мониторинга цепочки рассуждений. Исследователи обнаружили, что Astra лучше контролирует собственную цепочку мыслей и может сокращать её, когда знает о наличии монитора.
В отдельных экспериментах модель, получив информацию о мониторинге, начинала генерировать существенно меньше элементов цепочки рассуждений. При явной инструкции уклоняться от обнаружения эффективность некоторых CoT-мониторов резко падала: для одного из тестов recall опускался ниже 11%, а для другого достигал нуля. OpenAI прямо указывает, что такие результаты свидетельствуют о способности Astra стратегически скрывать признаки поведения от некоторых механизмов контроля.
Это не означает, что все механизмы мониторинга становятся бесполезными. Напротив, OpenAI расширила мониторинг Astra и использует не только цепочку рассуждений, но также действия модели, вызовы инструментов и результаты этих вызовов.
Однако сама проблема становится принципиально сложнее.
Если модель становится умнее, одновременно сокращается объём информации, который монитор может использовать для понимания того, почему она приняла то или иное решение.
OpenAI прямо характеризует это как снижение monitorability — наблюдаемости поведения модели.
Что это означает для разработчиков
Из всего этого вовсе не следует, что Astra нельзя использовать.
Напротив, для разработчиков основной вывод гораздо практичнее: при выборе модели уже недостаточно смотреть на один рейтинг безопасности или один набор benchmark-результатов.
Если система получает доступ к выполнению кода, браузеру, файловой системе, внешним сервисам или другим инструментам, необходимо знать не только её способности, но и условия, в которых эти способности проявляются.
Есть ли у модели доступ к интернету? Может ли она сохранять состояние между вызовами? Какие инструменты ей доступны? Как устроен sandbox? Что именно контролирует монитор? Может ли модель видеть признаки того, что её действия оцениваются? Какие действия блокируются на уровне модели, а какие — инфраструктурой?
Эти вопросы становятся не менее важными, чем сам benchmark.
Особенно показателен тот факт, что Astra стала первой моделью, официально переведённой OpenAI на уровень Critical. Это не обязательно означает, что именно Astra была первой системой в мире, которая обладала соответствующими возможностями. Это означает, что OpenAI впервые официально провела модель через собственный порог оценки и зафиксировала соответствующий результат.
И здесь возникает гораздо более неприятный вопрос.
Сколько моделей, уже используемых в реальных системах, никогда не проходили подобную проверку?
До появления соответствующей методики отсутствие отметки Critical нельзя было интерпретировать как доказательство того, что модель не обладает такими возможностями. Возможно лишь то, что её не оценивали по этому критерию.
То же относится и к обычным benchmark-результатам. Один и тот же ИИ способен демонстрировать принципиально разные показатели в зависимости от harness, памяти, доступных инструментов и правил взаимодействия с ним.
Поэтому следующий этап гонки ИИ может оказаться не столько соревнованием за очередные 1–2% в таблице, сколько соревнованием между способностями моделей и способностью отрасли эти способности корректно измерять и контролировать.
Astra стала первой моделью OpenAI с уровнем Critical по кибербезопасности, но, возможно, главный урок её запуска заключается в другом: чем более агентными становятся ИИ-системы, тем меньше одного числа оказывается достаточно, чтобы понять, на что они действительно способны.
И если один и тот же ИИ может показать 62,7% или почти 100% в зависимости от оболочки, а при этом ещё и понимать, что его тестируют, насколько вообще можно считать единичный benchmark надёжным показателем возможностей модели? А что об этом думаете вы?
Источник: https://towardsdatascience.com/gpt-6-astra-just-hit-openais-highest-cybersecurity-risk-level/Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!

