Google представила Gemini 3.8 Flash: новая модель для сложных агентских пайплайнов
По данным Habr, 2 сентября Google выпустила наиболее интеллектуальную модель линейки Flash в статусе General Availability.
Эрнест Литвиненко·обновлено 04 сентября 2026 г.

$1,50 за 1 млн входных токенов и $7,50 за 1 млн выходных — таков тариф Gemini 3.8 Flash с 1 января 2027 года. По данным Habr, 2 сентября Google выпустила наиболее интеллектуальную модель линейки Flash в статусе General Availability. Это третий апдейт серии за шесть недель, и для архитекторов enterprise-решений релиз сдвигает cost-per-task любого агентского пайплайна в режиме high.
Архитектура и API-стек
Модель построена поверх Gemini 3.7 Flash, вышедшей тремя неделями ранее. Базовые параметры:
- Контекстное окно: 1 048 576 токенов
- Выход за один ответ: до 65 536 токенов
- Только текст. Генерация изображений и аудио не поддерживается
- Статус: General Availability
Функции через Gemini API:
- Кэширование контекста
- Исполнение кода
- Поиск по файлам
- Function calling
- Структурированный вывод
- Работа с URL
- Подключение Google Search и Google Maps
- Экспериментальное управление компьютером
Live API для модели не поддерживается.
Метрики vs Gemini 3.7 Flash
Официальные тесты Google:
- Terminal-Bench 2.1: +9,2 п.п. — агентские задачи в терминале
- Vals Finance Agent v2: 61,4% против 59,0%
- SWE-Atlas: рост
- τ³-bench, банковская часть: рост
- Humanity's Last Exam: −0,3 п.п. — регрессия на общем бенчмарке знаний
Архитектурная логика изменений: модель разбивает задачи на более мелкие шаги, повторно вызывает инструменты и валидирует промежуточные результаты. Это сценарий для агентских пайплайнов с длинным горизонтом планирования, не для коротких чат-сессий.
Параметр thinking_level и стоимость владения
Три режима рассуждений:
- low — чаты, черновики, latency-sensitive задачи
- medium — режим по умолчанию
- high — сложное программирование, математика, длительные цепочки с активным tool use
В режиме high расход токенов выше, чем у 3.7 Flash. Google прямо рекомендует сценариям с приоритетом cost/latency оставаться на 3.7 Flash или понижать thinking_level.
Ценообразование:
- До 31.12.2026 — на уровне Gemini 3.7 Flash
- С 01.01.2027 — $1,50 за 1 млн входных, $7,50 за 1 млн выходных токенов
Чек-лист для архитектурного комитета
- Зафиксировать профиль нагрузки по режимам thinking_level. По умолчанию medium — не оптимален для SLA-задач.
- Для image/audio пайплайнов заложить fallback на другую модель: мультимодальный вывод отсутствует.
- Пересчитать cost-per-task с тарифом $1,50/$7,50 с января 2027 года. Критично для сценариев high.
- Оценить vendor lock-in: GA + расширенный API-стек увеличивают стоимость миграции на альтернативы.
- Live API недоступен — исключить модель из real-time голосовых сценариев.
- Контекст 1 048 576 токенов и активный tool use требуют пересмотра лимитов concurrency и таймаутов на уровне оркестратора.