Реклама
Перетяжка // Коробка 3.0

Google: Gemini 3.8 Flash догнала Opus 5 на DeepSWE при цене $0,75 за млн

Третий Flash-релиз Google за шесть недель: 73,7% на DeepSWE против 74,0% у Claude Opus 5 при цене $0,75 и $3,75 за миллион токенов, и отдельная киберверсия по заявкам.

Обложка: Google: Gemini 3.8 Flash догнала Opus 5 на DeepSWE при цене $0,75 за млн

Google 2 сентября представила Gemini 3.8 Flash, третью модель линейки Flash за шесть недель, и Gemini 3.8 Flash Cyber, специализированную версию для поиска и исправления уязвимостей. Основная модель уже доступна в Gemini API, Google AI Studio и Android Studio по той же вводной цене, что и 3.7 Flash: $0,75 за миллион входных токенов и $3,75 за миллион выходных. Киберверсию Google раздаёт только «доверенным защитникам» по заявке через новую программу Fairwind.

Для разработчика главное в анонсе одно число: по таблице Google, на DeepSWE v1.1, бенчмарке долгих задач по программной инженерии, 3.8 Flash набирает 73,7% против 74,0% у Claude Opus 5, который стоит в 6,7 раза дороже на входе и в 6,7 раза дороже на выходе. Если замер подтвердится независимо, дешёвая модель Google становится кандидатом на роль основной модели для кодовых агентов. Все цифры ниже опубликованы Google: часть из них снята на внешних бенчмарках (DeepSWE ведёт Datacurve AI, CWE-Bench проводит Collinear), часть на внутренних наборах компании; ссылку на методику Google приводит, независимых результатов на момент публикации нет.

Ключевые выводы
  • Gemini 3.8 Flash доступна со 2 сентября в Gemini API, Google AI Studio, Android Studio, Antigravity и Stitch; подписчикам Google AI Pro и Ultra в приложении Gemini, AI Mode в поиске и Google Sheets.
  • Цена $0,75 за 1 млн входных и $3,75 за 1 млн выходных токенов действует до 31 декабря 2026 года; с 1 января 2027 года Google обещает $1,50 и $7,50.
  • По замерам Google: DeepSWE v1.1 73,7% (Opus 5 74,0%, GPT-5.6 Sol 72,7%, 3.7 Flash 65,3%), Terminal-Bench 2.1 89,4%, HLE-Verified 54,9%; на Terminal-Bench 4.0 всего 19,1% против 51,8% у Opus 5.
  • Gemini 3.8 Flash Cyber на CyberGym показывает 86,2% pass@1 против 83,8% у Mythos 5 и 85,6% у GPT-5.5-Cyber; на CWE-Bench 47,2% при 47,8% у Claude Fable 5.
  • Модель «работает усерднее»: делает больше шагов рассуждения и вызовов инструментов, поэтому тратит больше токенов; 3.7 Flash остаётся поддерживаемой для экономных сценариев.

Что изменилось по сравнению с 3.7 Flash

Gemini 3.7 Flash вышла три недели назад, и 3.8 Flash построена на той же скорости и цене. Прирост Google показывает на длинных агентных задачах. На DeepSWE v1.1 результат вырос с 65,3% до 73,7%, на Terminal-Bench 2.1, где агент решает задачи в терминале, с 85,8% до 89,4%. По этой таблице 3.8 Flash опережает GPT-5.6 Sol (72,7% и 88,8%) и почти сравнивается с Claude Opus 5 (74,0% и 89,1%).

Google: Gemini 3.8 Flash догнала Opus 5 на DeepSWE при цене $0,75 за млн_5
Точность на DeepSWE v1.1 против средней стоимости одной задачи. Источник: Google по данным Datacurve AI

На прикладных бенчмарках Google выделяет области, где 3.8 Flash обходит и более дорогие модели: Vals Finance Agent v2 (задачи финансового аналитика) 61,4% против 58,6% у Opus 5, Harvey's Legal Agent Benchmark (юридические сценарии) 10,0% против 6,7%, CharXiv Reasoning (выводы по сложным графикам) 86,2% против 83,7%. На HLE-Verified, наборе экспертных вопросов из разных дисциплин, модель набирает 54,9%, на уровне Opus 5 (54,4%) и GPT-5.6 Sol (54,5%).

Слабые места в той же таблице Google не скрывает. На Terminal-Bench 4.0, который проверяет общие агентные способности, 3.8 Flash набирает 19,1% против 51,8% у Opus 5 и 37,3% у GPT-5.6 Sol. На GDPVal-AA v2 (офисная работа, рейтинг Эло) у неё 1545 против 1824 у Opus 5 и 1710 у Sol, на OSWorld-2.0 (управление компьютером) 59,0% против 75,4%. Иначе говоря, модель сильна там, где задача формализована, и заметно отстаёт в открытых сценариях.

Google объясняет прирост тем, что 3.8 Flash «работает усерднее»: на сложных задачах делает больше шагов рассуждения и итеративно вызывает инструменты. Компания прямо предупреждает, что модель может потратить больше токенов, особенно на высоких уровнях усилия. Для задач, где главное ограничение стоимость, Google предлагает снижать уровень усилия или оставаться на 3.7 Flash, которая продолжает поддерживаться.

Цена прежняя, но с 2027 года удвоится

Вводная цена $0,75 за миллион входных токенов и $3,75 за миллион выходных совпадает с 3.7 Flash и действует до 31 декабря 2026 года. С 1 января 2027 года, по сноске в анонсе, вступает в силу регулярная цена: $1,50 и $7,50. Для сравнения, в той же таблице Google указывает $5,00 и $25,00 у Claude Opus 5, $2,00 и $10,00 у Claude Sonnet 5, $4,00 и $20,00 у GPT-5.6 Sol. Даже по регулярной цене 3.8 Flash останется дешевле Sonnet 5 на входе и выходе.

Модель доступна разработчикам через Gemini API в Google AI Studio и Android Studio, в агентной среде Antigravity и генераторе интерфейсов Stitch, корпоративным клиентам в Gemini Enterprise, подписчикам Google AI Pro и Ultra в приложении Gemini, AI Mode в поиске и Google Sheets. О региональных ограничениях и условиях оплаты в анонсе ничего не сказано.

Flash Cyber: поиск уязвимостей на уровне фронтира, но только по заявке

Вторая модель анонса, Gemini 3.8 Flash Cyber, построена на том же ядре, но с более мягкими ограничениями в области кибербезопасности. Именно поэтому Google не выкладывает её в общий API: доступ получают государственные органы, операторы критической инфраструктуры и мейнтейнеры ПО через программу Fairwind, заявку нужно подать отдельно. Google подчёркивает, что приоритетом было исправление уязвимостей, а не эксплуатация.

Google: Gemini 3.8 Flash догнала Opus 5 на DeepSWE при цене $0,75 за млн_14
Автономный поиск уязвимостей в C/C++ на CyberGym, pass@1. Источник: Google

На CyberGym, отраслевом бенчмарке автономного поиска уязвимостей в коде на C и C++, 3.8 Flash Cyber набирает 86,2% pass@1. Предыдущая киберверсия 3.5 Flash Cyber давала 77,5%, GPT-5.6 Sol 83,6%, Anthropic Mythos 5 83,8%, GPT-5.5-Cyber 85,6%. На внутреннем наборе Google, где надо находить уязвимости в сложных кодовых базах на 20 языках программирования, доля успеха, по словам компании, превысила 70%; состав и размер этого набора не раскрыты.

Google: Gemini 3.8 Flash догнала Opus 5 на DeepSWE при цене $0,75 за млн_16
Исправление уязвимостей на CWE-Bench: точность против стоимости одного прогона. Источник: Google

За исправление отвечает внешний бенчмарк CWE-Bench от компании Collinear: 47,2% pass@1 у 3.8 Flash Cyber против 47,8% у Claude Fable 5, при этом, по графику Google, прогон Flash Cyber стоит около $3,6 против более $10 у Fable 5. Google приводит и три внутренних примера: команда безопасности Chrome получила от модели в 2,6 раза больше корректных патчей к уязвимостям Chrome, чем от «лучших коммерческих моделей», компания Wiz на своём наборе для пентеста увидела рост полноты на 7,5–9,7 процентных пункта при стоимости в 2,3–5,2 раза ниже, а команда Cloud Vulnerability Research нашла критическую уязвимость меньше чем за два часа. Ни одно из этих утверждений пока не проверено вне Google и партнёров.

Что делать разработчику

  • Если вы уже используете 3.7 Flash в агентах для кода, попробуйте 3.8 Flash на своих задачах и сравните не только точность, но и расход токенов: Google предупреждает, что модель думает дольше.
  • Считайте стоимость по регулярной цене $1,50 и $7,50: через четыре месяца именно она станет реальной.
  • Для коротких и дешёвых запросов оставайтесь на 3.7 Flash или снижайте уровень усилия у 3.8, это рекомендация самой Google.
  • Flash Cyber сейчас в общем API не представлена: если вам нужен поиск уязвимостей, ориентируйтесь на заявку в Fairwind или на обычную 3.8 Flash, которая, по словам Google, тоже обучалась на задачах кибербезопасности, но с ограничениями на наступательные сценарии.

Google публикует ссылки на методику замеров, но сравнения с конкурентами пока остаются её собственными; редакция вернётся к цифрам, когда появятся независимые результаты. Отдельный вопрос, ответа на который в анонсе нет: сколько токенов 3.8 Flash реально тратит на тех же задачах по сравнению с 3.7, ведь при удвоенной цене с января это определит, останется ли она самой выгодной.

Источники: Google: Introducing Gemini 3.8 Flash and 3.8 Flash Cyber, Google DeepMind: методика замеров Gemini 3.8 Flash, Google DeepMind: методика замеров Gemini 3.8 Flash Cyber

Изображение на обложке: Изображение: Google