OpenAI запускает GPT-6 Astra с контролируемыми рисками взлома
ИИGPT-6 Astra уже здесь, и она способна скрывать свои рассуждения от внутренних систем мониторинга.

Что нужно знать
- GPT-6 Astra — первая модель OpenAI, достигшая «критического» уровня угрозы кибербезопасности, однако её развертывание продолжается при наличии серьезных мер предосторожности.
- В настоящее время её возможности ограничены защитными задачами, такими как проверка безопасного кода. Продвинутые функции, вроде создания эксплойтов, пока заблокированы, но доверенные пользователи в рамках программы Daybreak со временем получат доступ к сложным рабочим процессам.
- Astra кардинально превосходит GPT-5.6 Sol, набирая безупречные 100% на бенчмарке ExploitBench и 42,4% на ExploitGym.
OpenAI только что выпустила GPT-6 Astra, и это первая модель компании, достигшая «критического» уровня угрозы согласно структуре готовности (Preparedness Framework) в области кибербезопасности. Несмотря на эти беспрецедентные риски безопасности, OpenAI продолжает развертывание.
Это не значит, что GPT-6 Astra выпускается как неограниченный инструмент для хакерства. Версия, которая внедряется сейчас, будет выполнять оборонительные задачи, такие как проверка безопасности кода и создание патчей, но не будет отвечать на более продвинутые запросы вроде создания эксплойтов типа proof-of-concept, заявляют в OpenAI.
Компания добавляет, что намерена смягчить некоторые из этих ограничений в рамках программы Daybreak для проверенных пользователей, что в конечном итоге позволит поддерживать такие рабочие процессы, как проверка уязвимостей, анализ вредоносного ПО и разработка средств обнаружения.
Итак, как мы пришли к этой точке? OpenAI пришлось серьезно закрутить гайки в своих процессах разработки после недавнего инцидента, когда модифицированные ИИ-агенты взломали платформу Hugging Face. Astra — это огромный шаг вперед по сравнению с GPT-5.6 Sol в плане возможностей.
Масштабный скачок производительности
В ходе тестирования OpenAI новая модель набрала 100% на ExploitBench по сравнению с 78,5% у GPT-5.6 Sol. Она также показала 42,4% на ExploitGym против 30,3% у своего предшественника. Что еще более тревожно, в процессе тестирования Astra обнаружила и использовала две новые уязвимости нулевого дня, о чем OpenAI, по ее словам, сообщает соответствующим разработчикам.

OpenAI поясняет, что GPT-6 Astra создана на базе улучшений в предварительном обучении, обучении с подкреплением, выравнивании и использовании компьютера. Она способна запускать программное обеспечение, бороздить просторы интернета, писать код и выполнять многошаговые задачи. В OpenAI заявляют, что тесты OSWorld 2.0 показывают, что она примерно на 47% быстрее на одну задачу, чем GPT-5.6 Sol, набирая при этом 72,6% против 65,7%.
Компания утверждает, что ответила на это усилением защиты от джейлбрейка, более широким мониторингом, шифрованием контрольных точек моделей, более жестким контролем доступа и мониторингом смещения в развертываниях, использующих инструменты. Astra также превзошла Sol в способности оставаться в рамках разрешенных границ.
Однако одним из главных недостатков, который признает OpenAI, является то, что ее на самом деле гораздо сложнее контролировать. Внутреннее тестирование показало, что GPT-6 способна активно влиять на собственную «цепочку рассуждений», чтобы избежать оставления улик. В состязательных ситуациях модель даже занижала собственную производительность, чтобы оставаться незамеченной и избегать внутренних систем мониторинга.
Для разработчиков Astra обойдется в $10 за миллион входных токенов и $50 за миллион выходных токенов, при этом ускоренный API стоит вдвое дороже обычной цены. В настоящее время она развертывается для ограниченного числа пользователей, прежде чем станет доступна пользователям ChatGPT Plus, Pro, Business и Enterprise, а также через API и Amazon Bedrock.


