Nowości dotyczące produktów

Ewolucja sposobu pomiaru modeli LLM na Androidzie: nowa era Android Bench

3 minuty czytania
Wyświetl profil użytkownika Zoe Lopez-Latorre
Zoe Lopez-Latorre Starszy inżynier ds. relacji z programistami na Androida

W marcu wprowadziliśmy Android Bench – nasz ranking modeli LLM do zadań związanych z tworzeniem aplikacji na Androida w rzeczywistych warunkach. Naszym celem było zapewnienie przejrzystości w zakresie możliwości modeli w tworzeniu aplikacji na Androida oraz zachęcanie do ich ulepszania, aby zapewnić Ci bardziej przydatne opcje AI w codziennej pracy. Od tego czasu ulepszyliśmy test porównawczy na podstawie Twoich opinii, w tym oceniliśmy modele o otwartych wagach i dodaliśmy do rankingu wymiary kosztów i wydajności. 

Możliwości AI stale się rozwijają, a pomiary muszą za nimi nadążać. W ramach lipcowej wersji wprowadziliśmy platformę Harbor, która zawiera zaktualizowaną wersję agenta testów porównawczych używanego do oceny modeli. 

Oprócz tej zmiany w ocenie w lipcowej wersji dodajemy do rankingu 8 nowych modeli (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max). Udostępniamy też możliwości, dzięki którym Ty, społeczność deweloperów Androida, możesz przyczynić się do rozwoju testu porównawczego. 

Ulepszanie metodologii za pomocą platformy Harbor

Projektując Android Bench, oparliśmy naszą metodologię na wiodących standardach branżowych dostępnych w tamtym czasie. Użyliśmy mini-swe-agent v1, agenta testów porównawczych do zwykłych obciążeń, i dostosowaliśmy go do niuansów tworzenia aplikacji na Androida, aby zapewnić podstawowy pomiar możliwości modeli w przypadku typowych zadań związanych z tworzeniem aplikacji na Androida.

Aby nadal zapewniać Ci najnowocześniejsze oceny, które dokładnie mierzą najnowsze możliwości modeli w tworzeniu aplikacji na Androida, standaryzujemy nasz test porównawczy do platformy Harbor. Harbor określa standardy i integracje, które ułatwiają każdemu przeprowadzenie testu porównawczego, ocenę preferowanej konfiguracji lub udostępnienie wyników, co zapewnia dodatkową przejrzystość i widoczność.

Ta aktualizacja umożliwia nam bardziej rygorystyczną ocenę modeli i ich możliwości. Ponownie przeprowadziliśmy test porównawczy na wszystkich modelach, aby ustalić zaktualizowaną linię bazową. Oznacza to niewielką zmianę w punktacji, ale nadal będziesz mieć dostęp do historycznych wyników w archiwum na naszej stronie.

Chcemy, aby Android Bench był dla Ciebie przydatny, dlatego będziemy go stale aktualizować w miarę rozwoju naszych ocen i branży.

Poszerzanie rankingu o 8 nowych modeli

W ramach naszego zobowiązania do utrzymywania aktualności rankingu Android Bench dodaliśmy do niego modele Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus i Qwen 3.7 Max. 

Zobaczysz, że Claude Fable 5 jest na szczycie rankingu z wynikiem 84,5, a za nim GPT 5.5 z wynikiem 80,2 i Claude Sonnet 5 na 3. miejscu z wynikiem 76,2.

Jeśli porównamy tylko modele o otwartych wagach, GLM 5.2 jest na szczycie z wynikiem 72,2, a za nim Kimi K2.7 Code z wynikiem 70,4.

Możesz sprawdzić wskaźniki wydajności i efektywności modeli w zaktualizowanym rankingu, aby zobaczyć, jak te nowe i poprzednie modele radzą sobie z wyzwaniami związanymi z Androidem, takimi jak migracje Jetpack Compose, sieci na urządzeniach do noszenia i aktualizacje interfejsu API platformy.  

image1.png

Otwieranie Android Bench na wkład społeczności

Od początku cenimy otwarte i przejrzyste podejście, dlatego udostępniliśmy naszą oryginalną metodologię i platformę testową w GitHubie. Prosiliście o możliwość przekazywania opinii na temat naszego zbioru danych, dlatego teraz robimy kolejny krok w kierunku współpracy, dając Wam, społeczności deweloperów Androida, możliwość kształtowania Android Bench.

Od dziś możesz przyczynić się do rozwoju Android Bench na 2 sposoby:

  1. Zaprojektuj i prześlij własne zadania związane z tworzeniem aplikacji na Androida, aby ocenić, jak modele radzą sobie w scenariuszach, które są dla Ciebie ważne.
  2. _Przeprowadzaj i udostępniaj oceny testów porównawczych_ z pierwszej ręki, testując preferowane modele na podstawie naszego zbioru danych lub własnych zadań niestandardowych.

Będziemy sprawdzać przesłane zadania i oceniać, czy zostaną dodane do testu porównawczego. Mamy nadzieję, że uda nam się stworzyć test porównawczy, który będzie odzwierciedlać różnorodne, codzienne realia globalnej społeczności deweloperów Androida.

Co dalej

W miarę jak pojawia się coraz więcej opcji rozwoju agentów, utrzymywanie najnowocześniejszego testu porównawczego zapewnia, że pomoc AI, na której polegasz, staje się coraz inteligentniejsza, bardziej przydatna i skuteczniejsza. Aby sprawdzić zadania, przejdź do naszego repozytorium GitHub. Zachęcamy do przesłania zadania do naszego zespołu do sprawdzenia. Możesz też przejść do Harbor Hub, aby zapoznać się ze zbiorem danych lub przesłać oceny.

Jak zawsze, zaktualizowany ranking i metodologię znajdziesz na naszej stronie. 

Napisane przez:
Czytaj dalej