Android Bench 2: как новый бенчмарк Google оценивает реальную эффективность ИИ в мобильной разработке
Разработчики, которые подбирают ИИ-ассистента под мобильный проект, давно знают слабое место бенчмарков: бинарная отметка «решил / не решил» не показывает, где именно модель ломается внутри пользовательского флоу.
Фаина Королёва·обновлено 17 сентября 2026 г.

Google закрывает эту брешь Android Bench 2 — по данным Rozetked.me, обновлённый бенчмарк оценивает работу ИИ в Android-разработке не по принципу «лайт-свича», а по разложенным на категории критериям вроде функциональности получившегося ПО. Для команд, выбирающих модель под реальные задачи, это переход от усреднённой оценки к детальной диагностике.
Что меняется в Pass Rate
Главное отличие второй версии — Pass Rate теперь многоуровневый. Система разбирает задачу по осям: насколько работоспособен собранный интерфейс, держится ли бизнес-логика, не теряются ли данные между шагами флоу. Задача может быть засчитана как частично решённая — например, если онбординг собрался, а обработка ошибок просела. Раньше такая модель просто получила бы ноль. Фокус сместился и на сами задачи: в Android Bench 2 они длиннее и ближе к тем, на которые у человека уходит несколько дней.
Кто в топе
По актуальным замерам, лидер рейтинга — GPT-6 Astra с Pass Rate 28%. За ней идут Claude Fable 5.1 и GPT-5.6 Sol. Цифры скромные: даже лучшие модели закрывают меньше трети сложных сценариев. Полезный сигнал — рассчитывать на полностью автономную сборку приложения пока рано. Свежий рейтинг доступен на официальном сайте проекта.
Что отслеживать на практике
Android Bench 2 — прикладной инструмент: он показывает не «умность» модели в вакууме, а её поведение в длинном пользовательском флоу — где она теряет контекст, где схлопывает переходы, где забывает про edge-кейсы. При выборе модели под мобильную задачу стоит смотреть не на общий балл, а на профиль по категориям. Логика та же, что и в других областях, где важна детализация, а не обобщение: например, в материале о здоровье после родов разбирают, какие симптомы нельзя списывать на обычную усталость, — и подход тот же, не округлять, а разбирать по составляющим.
Главный практический вывод простой: при оценке ИИ-ассистента под Android смотрите на частичные результаты и распределение по категориям, а не на сухой вердикт «прошёл / не прошёл». Это даст более честную картину того, что модель реально умеет собирать, а что — только обещает по общему баллу.