LIVE
Новость

Google представила Gemini 3.8 Flash: новая модель для сложных агентских пайплайнов

По данным Habr, 2 сентября Google выпустила наиболее интеллектуальную модель линейки Flash в статусе General Availability.

Эрнест Литвиненко·обновлено 04 сентября 2026 г.

Google представила Gemini 3.8 Flash: новая модель для сложных агентских пайплайнов

$1,50 за 1 млн входных токенов и $7,50 за 1 млн выходных — таков тариф Gemini 3.8 Flash с 1 января 2027 года. По данным Habr, 2 сентября Google выпустила наиболее интеллектуальную модель линейки Flash в статусе General Availability. Это третий апдейт серии за шесть недель, и для архитекторов enterprise-решений релиз сдвигает cost-per-task любого агентского пайплайна в режиме high.

Архитектура и API-стек

Модель построена поверх Gemini 3.7 Flash, вышедшей тремя неделями ранее. Базовые параметры:

  • Контекстное окно: 1 048 576 токенов
  • Выход за один ответ: до 65 536 токенов
  • Только текст. Генерация изображений и аудио не поддерживается
  • Статус: General Availability

Функции через Gemini API:

  • Кэширование контекста
  • Исполнение кода
  • Поиск по файлам
  • Function calling
  • Структурированный вывод
  • Работа с URL
  • Подключение Google Search и Google Maps
  • Экспериментальное управление компьютером

Live API для модели не поддерживается.

Метрики vs Gemini 3.7 Flash

Официальные тесты Google:

  • Terminal-Bench 2.1: +9,2 п.п. — агентские задачи в терминале
  • Vals Finance Agent v2: 61,4% против 59,0%
  • SWE-Atlas: рост
  • τ³-bench, банковская часть: рост
  • Humanity's Last Exam: −0,3 п.п. — регрессия на общем бенчмарке знаний

Архитектурная логика изменений: модель разбивает задачи на более мелкие шаги, повторно вызывает инструменты и валидирует промежуточные результаты. Это сценарий для агентских пайплайнов с длинным горизонтом планирования, не для коротких чат-сессий.

Параметр thinking_level и стоимость владения

Три режима рассуждений:

  • low — чаты, черновики, latency-sensitive задачи
  • medium — режим по умолчанию
  • high — сложное программирование, математика, длительные цепочки с активным tool use

В режиме high расход токенов выше, чем у 3.7 Flash. Google прямо рекомендует сценариям с приоритетом cost/latency оставаться на 3.7 Flash или понижать thinking_level.

Ценообразование:

  • До 31.12.2026 — на уровне Gemini 3.7 Flash
  • С 01.01.2027 — $1,50 за 1 млн входных, $7,50 за 1 млн выходных токенов

Чек-лист для архитектурного комитета

  • Зафиксировать профиль нагрузки по режимам thinking_level. По умолчанию medium — не оптимален для SLA-задач.
  • Для image/audio пайплайнов заложить fallback на другую модель: мультимодальный вывод отсутствует.
  • Пересчитать cost-per-task с тарифом $1,50/$7,50 с января 2027 года. Критично для сценариев high.
  • Оценить vendor lock-in: GA + расширенный API-стек увеличивают стоимость миграции на альтернативы.
  • Live API недоступен — исключить модель из real-time голосовых сценариев.
  • Контекст 1 048 576 токенов и активный tool use требуют пересмотра лимитов concurrency и таймаутов на уровне оркестратора.