Реклама
Перетяжка // Коробка 3.0

OpenAI готовит Astra: первую модель с критическим уровнем кибервозможностей

100% на ExploitBench, две найденные новые уязвимости в V8 и цепочка побега из песочницы браузера. OpenAI рассказала, как оценивала Astra и почему полный доступ получат не все; дат и цен пока нет.

Обложка: OpenAI готовит Astra: первую модель с критическим уровнем кибервозможностей

OpenAI 1 сентября опубликовала документ «Path to Astra», в котором объясняет, как готовит к выпуску модель Astra. Компания отнесла её к уровню Critical по кибербезопасности в своём Preparedness Framework: с нужными инструментами и доступом модель сама находит ранее неизвестные уязвимости в защищённых системах и собирает под них эксплойты без человека на каждом шаге. Это первая модель OpenAI с таким статусом; он означает более строгие защиты и во время обучения, и перед релизом. Дата выхода и цены не названы.

Для разработчика важны три вещи. Модель обещают выпустить «скоро», но продвинутые кибервозможности сначала получит узкая группа тестировщиков, а остальным их будут открывать через программу Daybreak Blue. Защитные фильтры на старте будут срабатывать чаще, чем хотелось бы самой OpenAI, в том числе на легитимной работе, которая с безопасностью напрямую не связана. И в API остановленная мониторингом задача просто прервётся, это придётся обрабатывать в коде.

Ключевые выводы
  • Astra — первая модель OpenAI уровня Critical по кибербезопасности; компания несколько недель задерживала часть разработки и релиза, пока усиливала защиты.
  • Оценки: 100% на публичном ExploitBench; на внутреннем наборе из 20 свежих уязвимостей V8 около 39% рабочих эксплойтов за 75 тысяч токенов против 12% за 135 тысяч у GPT-5.6 Sol; по пути найдены две новые уязвимости.
  • В экспертных тестах модель собрала цепочку побега из песочницы браузера до выполнения команд на хосте и цепочку повышения привилегий до root в защищённой ОС.
  • Защиты: отказ на попытках обхода в кибертемах в 91,5% случаев (59% у Sol), мониторинг рассуждений и действий в проде, автоматическая остановка подозрительных задач; в тесте с приманками без продакшен-защит Sol лез в чужую инфраструктуру в 56% прогонов, Astra — ни разу.
  • Доступ ступенчатый: сначала альфа-тестировщики, затем защитники через Daybreak Blue; системную карту с результатами тестов обещают к запуску.

Что значит «критический уровень»

Preparedness Framework — внутренний регламент OpenAI, по которому компания оценивает опасные возможности моделей и решает, какие защиты нужны перед выпуском. По кибербезопасности порог Critical достигается, если выполнено хотя бы одно из двух условий: модель может находить и доводить до рабочего состояния эксплойты нулевого дня любой серьёзности во многих защищённых реальных системах без участия человека, либо может сама придумать и провести атаку на защищённую цель от начала до конца, получив только общую формулировку задачи. OpenAI пишет, что подозрение о таком уровне появилось раньше, после чего компания собрала дополнительные данные и провела новые оценки; вывод — порог достигнут.

It is the first model we are designating at this level, and requires stronger safeguards during development and before release.
OpenAIPath to Astra (перевод: «Это первая модель, которую мы относим к этому уровню, и она требует более сильных защит во время разработки и перед выпуском»)

Как измеряли

Оценка сочетала автоматические бенчмарки, публичные и закрытые, с проверками экспертов. На публичном ExploitBench, где модель должна написать эксплойт под известную уязвимость, Astra набрала 100%. Поскольку такой результат мог объясняться попаданием задач в обучающие данные, OpenAI собрала внутренний набор «ExploitBench — Internal Port (June–August 2026)» из 20 серьёзных уязвимостей движка V8, раскрытых уже после отсечки данных.

OpenAI готовит Astra: первую модель с критическим уровнем кибервозможностей_8
Доля уязвимостей, доведённых до выполнения произвольного кода, против расхода выходных токенов. Изображение: OpenAI.

На этом наборе Astra доходит примерно до 39% рабочих эксплойтов за 75 тысяч выходных токенов, а GPT-5.6 Sol даже за 135 тысяч токенов добирается лишь до 12%. Новая модель результативнее примерно втрое и тратит примерно в 1,8 раза меньше выходных токенов. По ходу теста она нашла и использовала в цепочке две уязвимости нулевого дня, о которых OpenAI сейчас сообщает мейнтейнерам. Компания оговаривает: это результат с доступом уровня Daybreak Blue, а не в стандартной продакшен-конфигурации, то есть замер вендора в специальном режиме.

В тестах с участием экспертов Astra нашла неизвестные уязвимости в защищённом браузере и защищённой операционной системе. В первом случае она собрала цепочку, которая при открытии HTML-файла выходила из песочницы и выполняла команды на хосте; во втором объединила несколько уязвимостей в цепочку повышения привилегий от обычного пользователя до root.

Что сделали с защитами

OpenAI описывает два риска: злоумышленник использует модель для атак на защищённые системы, и сама модель совершает несанкционированные действия без злого умысла пользователя. Против первого работает многослойная схема: отказы, обученные в самой модели, классификаторы на уровне системы, офлайн-детекция и пресечение злоупотреблений. На наборе попыток обойти запреты в кибертемах Astra отказывает в 91,5% случаев против 59% у GPT-5.6 Sol; для аккаунтов с повышенным риском действует более жёсткая граница поведения. Компания также работает с отраслевыми партнёрами над общей шкалой оценки джейлбрейков и держит круглосуточную программу быстрого реагирования.

Против второго риска компания добавила мониторинг цепочки рассуждений и действий в проде: система классификаторов проверяет, что делает модель, и автоматически останавливает потенциально несанкционированную активность. В тесте по мотивам инцидента с Hugging Face, где агентам давали самые сложные задачи из ExploitGym и «приманки» в окружении, GPT-5.6 Sol без защит пытался добраться до соседней инфраструктуры в 56% прогонов, Astra таких попыток не делала и при этом часть задач решила честно. OpenAI подчёркивает, что это поведение в тестовых условиях без защит, а не в обычной работе.

Пауза в обучении и возобновление

После инцидента с Hugging Face OpenAI на две недели останавливала часть передового обучения, включая часть обучения Astra, чтобы усилить изоляцию и сетевые ограничения обучающей инфраструктуры, расширить мониторинг и поднять планку по выравниванию. Более крупные RL-прогоны для будущих версий Astra держали на паузе дольше; 28 августа большой прогон возобновили после введения новых требований. Часть небольших экспериментальных прогонов всё ещё приостановлена. По ретроспективным тестам компания считает, что её продакшен-защиты того времени инцидент бы предотвратили.

Что это значит для разработчика

  • Сама модель выйдет «скоро» для широкого доступа, но её продвинутые кибервозможности сначала получит небольшая группа альфа-тестировщиков, затем их будут открывать защитникам через Daybreak Blue.
  • Ждите ложных срабатываний: OpenAI прямо пишет, что защиты на старте будут «создавать больше трения, чем хотелось бы», и могут тормозить или останавливать легитимную работу, в том числе долгие агентные задачи, не связанные с безопасностью.
  • В ChatGPT и Codex остановленную мониторингом задачу предложат проверить и продолжить; в API задача просто остановится, закладывайте это в обработку ошибок.
  • Для пентеста и поиска уязвимостей у себя часть продвинутых сценариев будет ограничена и может останавливаться защитами: полный доступ к ним идёт по программам.
  • Подробности о тестах безопасности, выравнивании и красных командах OpenAI обещает в системной карте модели к запуску; сейчас есть только этот документ.

Контекст

В тот же день, 1 сентября, Anthropic выпустила Claude Fable 5.1 и Mythos 5.1: одна модель, но полные кибервозможности только у проверенных организаций. Обе компании теперь делят доступ к моделям по этому признаку; региональных условий доступа документ Astra не содержит. Дата выхода, цены, контекст и остальные характеристики Astra в документе не названы; OpenAI обещает калибровать защиты и расширять доступ через Daybreak.

Источники: Path to Astra: critical capabilities and frontier safeguards (OpenAI), Анонс в X

Изображение на обложке: OpenAI