Эволюция методов измерения LLM для Android: новая эра Android Bench
3 мин чтения
В марте мы представили Android Bench — наш рейтинг LLM для реальных задач разработки под Android. Наша цель заключалась в обеспечении прозрачности возможностей моделей в разработке под Android и в стимулировании улучшений моделей, чтобы предоставить вам больше полезных вариантов ИИ для вашей повседневной работы. С тех пор мы улучшили бенчмарк на основе ваших отзывов, включая оценку моделей с открытым весом и добавление в рейтинг параметров стоимости и эффективности.
Однако возможности ИИ постоянно развиваются, и методы измерения должны соответствовать этому развитию. В рамках нашего июльского релиза мы внедрили фреймворк Harbor , который включает в себя обновленную версию агента бенчмаркинга, используемого для оценки моделей.
Наряду с этим изменением в нашей системе оценки, в июльском релизе мы добавляем в таблицу лидеров 8 новых моделей ( Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus и Qwen 3.7 Max ). Мы также предоставляем вам, сообществу разработчиков Android, возможность внести свой вклад в бенчмарк.
Усовершенствуем нашу методологию с помощью платформы Harbor.
При разработке Android Bench мы опирались на ведущие отраслевые стандарты, доступные на тот момент. Мы использовали mini-swe-agent v1, универсальный агент для бенчмаркинга, и адаптировали его к особенностям разработки Android, чтобы обеспечить базовую оценку возможностей моделей для решения распространенных задач разработки Android.
Чтобы и дальше предоставлять вам самые современные инструменты оценки, точно измеряющие возможности новейших моделей разработки под Android, мы стандартизируем наш бенчмарк в соответствии с фреймворком Harbor . Harbor определяет стандарты и интеграции, которые позволяют любому легко запустить бенчмарк, оценить предпочитаемую конфигурацию или поделиться результатами, обеспечивая вам дополнительную прозрачность и наглядность.
Это обновление позволяет нам более тщательно оценивать модели и их возможности, и мы повторно запустили тест производительности для всех моделей, чтобы установить обновленный базовый уровень. Это означает, что произошли незначительные изменения в системе оценки, но вы по-прежнему сможете просматривать исторические результаты в архиве на нашем веб-сайте.
Мы хотим, чтобы Android Bench был вам полезен, поэтому будем постоянно обновлять его по мере проведения наших тестов и развития отрасли.
В таблице лидеров появились 8 новых моделей.
В рамках нашего стремления поддерживать актуальность таблицы лидеров, мы добавили в нее Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus и Qwen 3.7 Max.
Вы увидите, что «Басня 5» Клода находится на вершине таблицы лидеров с результатом 84,5 балла, за ней следует «GPT 5.5» с 80,2 баллами, а «Сонет 5» Клода занимает 3-е место с результатом 76,2 балла.
Если сравнивать только модели с открытым весом, то GLM 5.2 занимает первое место с результатом 72,2, за ней следует Kimi K2.7 Code с показателем 70,4.
В обновленной таблице лидеров вы можете ознакомиться с показателями производительности и эффективности моделей, чтобы увидеть, как эти новые и предыдущие модели справляются со специфическими для Android проблемами, такими как миграция Jetpack Compose, сетевые возможности носимых устройств и обновления API платформы.

Открытие Android Bench для участия сообщества.
С самого начала мы ценили открытый и прозрачный подход, поэтому сделали нашу первоначальную методологию и тестовую среду общедоступными на GitHub. Вы просили предоставить возможность оставлять отзывы о нашем наборе данных, поэтому теперь мы выводим сотрудничество на новый уровень, предоставляя вам, сообществу разработчиков Android, возможность влиять на Android Bench.
Начиная с сегодняшнего дня, вы можете внести свой вклад в Android Bench двумя способами:
- Разрабатывайте и отправляйте собственные задания по разработке под Android, чтобы оценить, как модели обрабатывают сценарии, которые важны для вас.
- Проводите и делитесь результатами сравнительных оценок , тестируя предпочитаемые модели на нашем наборе данных или на собственных задачах.
Мы рассмотрим представленные задания и оценим, будут ли они включены в бенчмарк. Мы надеемся создать бенчмарк, который действительно отражает разнообразные повседневные реалии глобального сообщества разработчиков Android.
Взгляд в будущее
В условиях постоянно растущего числа вариантов разработки агентских систем поддержание передовых стандартов гарантирует, что ИИ-помощник, на которого вы полагаетесь, будет становиться все умнее, полезнее и эффективнее. Перейдите в наш репозиторий GitHub , чтобы ознакомиться с задачами. Мы приглашаем вас отправить задачу на рассмотрение нашей команде, а также вы можете изучить набор данных или отправить оценки в Harbor Hub .
Как всегда, вы можете найти обновленную таблицу лидеров или ознакомиться с методикой на нашем сайте.
Новости о продуктахСегодня мы выпускаем первый набор задач с длительным горизонтом планирования (LHT), которые представляют собой задачи высокой сложности, выполнение которых занимает у инженера несколько дней или даже неделю. Мы также представляем агентную оценку, начиная с агентов от соответствующих поставщиков моделей.
Matthew McCullough • 3 мин чтения
Новости о продуктахСегодня мы с радостью объявляем о стабильном выпуске библиотек AndroidX Security State версии 1.1.0 и Security State Provider версии 1.0.0.
Maunik Shah , Alec Garcia , Joseph Yong • чтение 4 минуты
Новости о продуктахПредставляем быструю и надежную беспроводную отладку с помощью Android Debug Bridge (ADB) Wi-Fi 2.0.
Беспроводная отладка на Android теперь стала быстрее, надежнее и проще в настройке, чем когда-либо. С ADB Wi-Fi 2.0 мы внедрили новый стек серверов и более интеллектуальную обработку сети, чтобы напрямую учитывать отзывы разработчиков о недостатках в удобстве использования.
Steven Jenkins , Sherif Eid , Fabien Sanglard • Чтение 1 мин.
Получайте еженедельно самые свежие новости о разработке Android прямо на свою электронную почту.


