Produktneuheiten

Weiterentwicklung der LLM-Messung für Android: die nächste Ära von Android Bench

3 Minuten Lesezeit
Profil von Zoe Lopez-Latorre ansehen
Zoe Lopez-Latorre Senior Developer Relations Engineer, Android

Im März haben wir Android Bench eingeführt, unsere LLM-Bestenliste für reale Android-Entwicklungsaufgaben. Unser Ziel war es, Transparenz hinsichtlich der Modellfunktionen in der Android-Entwicklung zu schaffen und Modellverbesserungen zu fördern, um Ihnen hilfreichere KI-Optionen für Ihren täglichen Workflow zu bieten. Seitdem haben wir den Benchmark anhand Ihres Feedbacks verbessert, einschließlich der Bewertung von Modellen mit offenem Gewicht und der Hinzufügung von Kosten- und Effizienzkriterien zur Bestenliste. 

Die KI-Funktionen entwickeln sich jedoch ständig weiter und die Messung muss entsprechend angepasst werden. Im Rahmen unserer Veröffentlichung im Juli haben wir das Harbor-Framework eingeführt, das eine aktualisierte Version des Benchmark-Agents enthält, der zur Bewertung von Modellen verwendet wird. 

Neben dieser Änderung an unserer Bewertung fügen wir in dieser Veröffentlichung im Juli acht neue Modelle (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus und Qwen 3.7 Max) zur Bestenliste hinzu. Außerdem möchten wir Ihnen, der Android-Entwickler-Community, Möglichkeiten aufzeigen, wie Sie zum Benchmark beitragen können. 

Aktualisierung unserer Methodik mit dem Harbor-Framework

Bei der Entwicklung von Android Bench haben wir unsere Methodik an den führenden Branchenstandards ausgerichtet, die zu diesem Zeitpunkt verfügbar waren. Wir haben mini-swe-agent v1 verwendet, einen Allzweck-Benchmark-Agenten, und ihn an die Besonderheiten der Android-Entwicklung angepasst, um eine Baseline-Messung für die Funktionen von Modellen für gängige Android-Entwicklungsaufgaben zu ermöglichen.

Um Ihnen weiterhin modernste Bewertungen zu bieten, mit denen die neuesten Modellfunktionen in der Android-Entwicklung genau gemessen werden können, standardisieren wir unseren Benchmark auf das Harbor-Framework. Harbor definiert Standards und Integrationen, die es jedem ermöglichen, den Benchmark auszuführen, die bevorzugte Einrichtung zu bewerten oder Ergebnisse zu teilen. So erhalten Sie zusätzliche Transparenz und Sichtbarkeit.

Durch dieses Upgrade können wir Modelle und ihre Funktionen genauer bewerten. Wir haben den Benchmark für alle Modelle noch einmal ausgeführt, um eine aktualisierte Baseline zu erstellen. Das bedeutet, dass es eine geringfügige Änderung bei der Bewertung gibt. Sie können jedoch weiterhin die bisherigen Ergebnisse im Archiv auf unserer Website einsehen.

Wir möchten sicherstellen, dass Android Bench für Sie hilfreich ist. Daher werden wir es kontinuierlich aktualisieren, wenn sich unsere Bewertungen und die Branche weiterentwickeln.

Erweiterung der Bestenliste um acht neue Modelle

Im Rahmen unseres Engagements, die Bestenliste auf dem neuesten Stand zu halten, haben wir Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus und Qwen 3.7 Max zur Android Bench-Bestenliste hinzugefügt. 

Sie werden sehen, dass Claude Fable 5 mit einem Ergebnis von 84,5 an der Spitze der Bestenliste liegt, gefolgt von GPT 5.5 mit 80,2 und Claude Sonnet 5 mit 76,2.

Wenn wir nur Modelle mit offenem Gewicht vergleichen, liegt GLM 5.2 mit 72,2 an der Spitze, gefolgt von Kimi K2.7 Code mit 70,4.

Auf der aktualisierten Bestenliste können Sie die Leistungs- und Effizienzmesswerte der Modelle einsehen, um zu sehen, wie diese neuen und bisherigen Modelle mit Android-spezifischen Herausforderungen wie Jetpack Compose-Migrationen, Wearable-Netzwerken und Plattform-API-Updates umgehen.  

image1.png

Android Bench für Beiträge aus der Community öffnen

Von Anfang an haben wir einen offenen und transparenten Ansatz verfolgt. Deshalb haben wir unsere ursprüngliche Methodik und Testumgebung auf GitHub öffentlich zugänglich gemacht. Sie haben uns gebeten, Feedback zu unserem Dataset zu geben. Deshalb gehen wir jetzt einen Schritt weiter und geben Ihnen, der Android-Entwickler-Community, die Möglichkeit, Android Bench mitzugestalten.

Ab heute können Sie auf zwei Arten zu Android Bench beitragen:

  1. Entwerfen und reichen Sie eigene Android-Entwicklungsaufgaben ein, um zu bewerten, wie Modelle mit den für Sie wichtigen Szenarien umgehen.
  2. _Führen Sie Benchmark-Bewertungen selbst aus und teilen Sie sie_, indem Sie Ihre bevorzugten Modelle mit unserem Dataset oder Ihren eigenen benutzerdefinierten Aufgaben testen.

Wir werden die eingereichten Aufgaben prüfen und bewerten, ob sie zum Benchmark hinzugefügt werden. Wir hoffen, einen Benchmark zu entwickeln, der die vielfältigen, alltäglichen Realitäten der globalen Android-Entwickler-Community widerspiegelt.

Wie geht es weiter?

Mit immer mehr Optionen für die agentische Entwicklung sorgt ein hochmoderner Benchmark dafür, dass die KI-Unterstützung, auf die Sie sich verlassen, immer intelligenter, hilfreicher und effektiver wird. In unserem GitHub-Repository finden Sie die Aufgaben. Sie können eine Aufgabe zur Überprüfung einreichen und im Harbor Hub das Dataset erkunden oder Bewertungen einreichen.

Wie immer finden Sie die aktualisierte Bestenliste oder die Methodik auf unserer Website. 

Geschrieben von:
Weiterlesen