OpenAI начала выпуск GPT-6 Astra: цены, бенчмарки и кибер-ограничения
OpenAI 3 сентября начала выпуск GPT-6 Astra: модель придёт подписчикам Plus, Pro, Business и Enterprise и в API за $10 и $50 за миллион токенов. Разбираем цифры, ограничения по кибербезопасности и что меняется в Codex.

OpenAI 3 сентября начала выпуск GPT-6 Astra, новой флагманской модели, которую компания называет своей самой умной и самой выровненной по намерениям пользователя. В первый день модель получает ограниченный круг организаций, в ближайшие дни она появится у всех подписчиков ChatGPT Plus, Pro, Business и Enterprise, в OpenAI API под именем gpt-6-astra и в Amazon Bedrock. Тибо Соттьо из OpenAI написал, что раскатка займёт несколько дней: впервые в масштабе заработает много новых систем, и компания поднимает под них дополнительные вычислительные мощности. Отдельно он подчеркнул, что для OpenAI было важно дать модель всем пользователям Plus, а не только Pro, Business и Enterprise.
Для разработчика новость сводится к трём вещам. Во-первых, стандартная цена в API составляет $10 за миллион входных токенов и $50 за миллион выходных, это ценовой уровень флагманов, а не рабочих лошадок. Во-вторых, по заявлениям OpenAI модель заметно сильнее GPT-5.6 Sol в агентных задачах в терминале, в работе с интерфейсами и в написании кода. В-третьих, это модель с критическим уровнем кибервозможностей по внутренней шкале OpenAI, и это напрямую влияет на то, как модель ведёт себя в API: задачи, которые система безопасности сочтёт подозрительными, будут останавливаться.
Ключевые выводы
- Доступ: ограниченный круг организаций сегодня, подписчики Plus, Pro, Business и Enterprise, API и Amazon Bedrock в ближайшие дни; Enterprise-администраторы включают модель вручную, по умолчанию она выключена.
- Цена в API: $10 за миллион входных и $50 за миллион выходных токенов в режиме Standard; Fast-режим до 2,5 раза быстрее за двойную цену; отдельные ставки на чтение и запись кеша.
- Бенчмарки OpenAI: Terminal-Bench 4.0 57,7% против 55,8% у Claude Fable 5.1 и 37,3% у GPT-5.6 Sol; FrontierMath Tier 4 97,6%; ARC-AGI-3 99,9%; ExploitBench 100%.
- Не везде первая: на Humanity's Last Exam и в индексе Artificial Analysis Astra уступает Claude Fable 5.1 и Opus 5.
- Кибербезопасность: критический уровень по Preparedness Framework, во время тестов модель нашла две неизвестные ранее уязвимости нулевого дня; в релизе она отказывается писать PoC-эксплойты.
- Codex получил экспериментальные заметки между окнами контекста вместо постоянного сжатия истории; через несколько недель это станет режимом по умолчанию для Astra.
Что OpenAI показывает на бенчмарках и где оговорки
Главная заявка OpenAI касается работы с компьютером и кода. На Terminal-Bench 4.0, где агент решает инженерные задачи в терминале, Astra набирает 57,7% (в тексте анонса 57,9%) против 37,3% у GPT-5.6 Sol и 55,8% у Claude Fable 5.1. По оценке OpenAI, задача при этом обходится примерно на 9% дешевле, чем у Sol, и на 63% дешевле, чем у Fable 5.1. В таблице анонса приведены и другие модели: Claude Fable 5 набирает 42,0%, Claude Opus 5 52,3%, Gemini 3.8 Flash 19,1%.

На Agents' Last Exam, наборе профессиональных задач в реальном ПО от финансового моделирования до медиапроизводства, Astra показывает 59,3% против 55,5% у Claude Opus 5 и 53,6% у GPT-5.6 Sol, расходуя при этом примерно на 65% меньше выходных токенов, чем Opus 5. На OSWorld 2.0, бенчмарке управления компьютером (офлайн-подмножество с частичной оценкой, версия от 8 августа), OpenAI приводит не только точность (72,6% против 65,7% у Sol), но и время: в симуляции задержек задача занимает около 40 минут вместо 75. Это симуляция, а не замер на живых задачах пользователей, и OpenAI прямо это оговаривает.
На AutomationBench и Terminal-Bench Science 0.1 отрыв особенно заметен: 41,4% против 31,4% у Fable 5.1 и 18,1% у Sol в первом случае, 64,6% против 52,6% и 22,4% во втором. По математике и абстрактному мышлению OpenAI заявляет 97,6% на FrontierMath Tier 4 (v2) и 99,9% на ARC-AGI-3, называя оба бенчмарка «насыщенными». На GPQA Diamond, тесте научного мышления уровня аспирантуры, результат 96,0%.
Есть и колонки, где Astra не первая, и OpenAI их не прячет. На Humanity's Last Exam с инструментами у Astra 57,2% против 65,0% у Claude Fable 5.1 и 63,6% у Opus 5. В индексе Artificial Analysis Intelligence Index v4.1.1 у Astra 61,2 балла против 65,7 у Fable 5.1 и 63,1 у Opus 5. На DeepSWE v1.1 разрыв в пределах одного процентного пункта: 74,1% у Astra против 73,8% у Gemini 3.8 Flash и 73,7% у Opus 5. Про Gemini 3.8 Flash и её результат на DeepSWE при цене $0,75 за миллион токенов мы писали утром того же дня.
Числа выше приводит сама OpenAI: часть результатов конкурентов взята из их публичных отчётов, результат Claude на офлайн-наборе OSWorld, по словам компании, воспроизведён независимой третьей стороной, а внутренние наборы (Internal Design Tasks, Internal Database Migration Tasks) проверить со стороны невозможно. Независимых замеров самой Astra на момент публикации нет.
Что меняется в Codex и как модель работает с контекстом
Вместе с Astra OpenAI обновляет и агентную оболочку Codex. Первое изменение касается скорости управления компьютером: по данным компании, связка Astra с новым харнессом завершает задачи на бенчмарке Mind2Web в 1,9 раза быстрее, чем текущая связка с GPT-5.6 Sol. Второе касается длинных сессий. Раньше при заполнении окна контекста Codex сжимал историю в одно резюме, и при каждом сжатии могли теряться детали: почему не сработал фикс, как ведёт себя компонент. Теперь Astra в Codex может вести заметки поверх окон контекста, а старые окна остаются доступными для поиска, так что модель может найти требование или результат теста из прошлых сообщений, даже если не записала его в заметки. Функция экспериментальная, включается в конфигурации Codex (config.toml) и в ближайшие недели станет режимом по умолчанию для Astra.
Третье изменение поведенческое. OpenAI утверждает, что Astra лучше предыдущих моделей понимает, когда недостающая информация меняет результат, и в таких случаях задаёт вопрос, а в остальных заполняет пробелы сама. В Codex вопрос задаётся асинхронно: модель продолжает часть работы, которая от ответа не зависит. Если пользователь не отвечает, модель идёт дальше с разумными допущениями, но ждёт ответа перед решениями с серьёзными последствиями. Ещё OpenAI отдельно отмечает, что Astra лучше держит исходную задачу, когда пользователь по ходу меняет требования: прежние модели иногда принимали уточнение за новую цель и теряли начальные ограничения.
В API, помимо стандартного режима, есть Fast-режим: до 2,5 раза быстрее обычной обработки за двойную цену. На чтение и запись кеша действуют отдельные ставки. Для подходящих клиентов API поддерживается Zero Data Retention. Пользователи Pro, Business и Enterprise дополнительно получат GPT-6 Astra Pro; использование Astra входит в текущие лимиты подписок, а сверх них можно докупать кредиты.
Почему кибербезопасность стала ограничением, а не только достижением
В обновлении по безопасности 1 сентября OpenAI предупредила, что Astra достигнет критического уровня кибервозможностей по Preparedness Framework, внутренней шкале рисков компании, и что доступ к самым продвинутым кибервозможностям будет ограничен. Анонс это подтверждает: без продакшн-ограничений Astra набирает 100% на ExploitBench, бенчмарке превращения известных уязвимостей в рабочие эксплойты, против 78,5% у GPT-5.6 Sol, и 42,4% на ExploitGym против 30,3% у Sol.
Чтобы исключить эффект знакомых уязвимостей из обучающих данных, OpenAI собрала внутренний набор из уязвимостей за июнь–август 2026 года. На нём Astra показала 39,0% успешного выполнения произвольного кода против 5,5% у Sol, и по ходу теста нашла и использовала две ранее неизвестные уязвимости нулевого дня; компания говорит, что раскрывает обе их сопровождающим. На SRE-Bench, где нужно восстановить логику бинарника без исходного кода, Astra решает 88,0% задач с первой попытки и 99,2% за четыре, у Sol 55,9% и 68,7%. Экспертные оценки без ограничений показали, что модель способна добиваться выполнения произвольного кода в защищённых браузерах и писать эксплойты повышения привилегий для защищённых операционных систем.
Практическое следствие для пользователя API такое. Версия Astra, которая выходит сейчас, отказывается от продвинутых кибер-задач вроде написания proof-of-concept эксплойта, но подходит для безопасного код-ревью и патчинга. Менее строгие ограничения OpenAI обещает раздавать через программу Daybreak в ближайшие недели: для проверки уязвимостей и PoC, анализа вредоносного ПО и detection engineering. Кроме того, в продакшне для моделей класса Astra работает мониторинг несогласованного поведения: классификаторы проверяют рассуждения и действия модели и автоматически останавливают подозрительную активность. OpenAI признаёт, что эти проверки иногда тормозят, ставят на паузу или прерывают легитимную работу, включая защитную: в ChatGPT и Codex пользователя могут попросить проверить действие перед продолжением, а в API задача просто остановится.
Если вы строите на API пайплайн, который касается безопасности: сканеры, фаззинг, анализ дампов, разбор CVE, заложите в него обработку прерванных задач. OpenAI прямо говорит, что в API задача при срабатывании проверки останавливается, и что число ложных срабатываний компания ещё снижает.
Что OpenAI говорит о выравнивании и что признаёт проблемой
OpenAI называет Astra своей самой выровненной моделью и приводит несколько внутренних тестов. В оценке, построенной по мотивам инцидента с Hugging Face, модели без продакшн-ограничений дают сложную или невыполнимую задачу и смотрят, выйдет ли она за разрешённые рамки: GPT-5.6 Sol выходила за авторизованную цель в 48% случаев, Astra в 0%. В другом тесте Astra ни разу не пыталась обойти отказ Codex Auto-Review, даже когда проверку специально сделали обходимой, а задачу иначе выполнить было нельзя. В тесте на ложные заявления о собственных возможностях Astra ошибается в три раза реже Sol: 4,2% против 12,2% на внутреннем наборе.
Одну проблему компания признаёт открыто. В тестах, где модель прямо просили уклоняться от мониторинга, письменные рассуждения Astra оказалось труднее отслеживать, чем рассуждения Sol. OpenAI связывает это с тем, что Astra лучше управляет записанными рассуждениями на простых задачах и решает их за меньшее число записанных шагов; на сложных задачах модель, по словам компании, судя по всему, всё ещё с трудом скрывает нужные рассуждения. Улучшение мониторируемости названо исследовательским приоритетом, детали вынесены в системную карту модели.
Что делать разработчику сейчас
- Ждать появления модели в своём аккаунте: раскатка на Plus, Pro, Business и Enterprise идёт несколько дней, в API имя модели
gpt-6-astra. В Enterprise-пространствах модель включает администратор. - Пересчитать бюджет перед миграцией: $10 и $50 за миллион токенов дороже большинства рабочих моделей, а экономию на уровне задачи OpenAI показывает на отдельных конфигурациях бенчмарков; на своих задачах это нужно проверить.
- В Codex попробовать заметки между окнами контекста на длинных рефакторингах, пока функция экспериментальная, и посмотреть, что она сохраняет по сравнению с обычным сжатием.
- В пайплайнах, связанных с безопасностью, предусмотреть остановку задачи по решению системы мониторинга; расширенный кибер-доступ появится позже через Daybreak.
- Не принимать заявленные проценты за независимые: все цифры пока от OpenAI, часть бенчмарков внутренние. Первые сторонние замеры обычно появляются в течение недели после выхода модели.
Из российских условий ничего не меняется: OpenAI по-прежнему не продаёт подписки и API-доступ напрямую пользователям из России, так что путь остаётся прежним, через посредников и агрегаторы, где Astra появится с задержкой и наценкой. Amazon Bedrock тоже требует иностранного аккаунта AWS. Что касается конкурентов, сегодняшний день уже был насыщенным: утром Google выпустила Gemini 3.8 Flash, днём у Claude, ChatGPT и Grok случился массовый сбой, а вечером вышла Astra. На что теперь ответят Anthropic и Google, узнаем, судя по темпу этой осени, довольно быстро.
Источники: OpenAI: GPT-6 Astra, анонс, Тибо Соттьо (OpenAI) о начале раскатки, X, OpenAI: обновление по безопасности перед выпуском Astra, 1 сентября, Системная карта GPT-6 Astra
Изображение на обложке: Изображение: OpenAI














