Novità sui prodotti

Evoluzione della misurazione degli LLM per Android: la prossima era di Android Bench

3 minuti di lettura
Visualizza il profilo di Zoe Lopez-Latorre
Zoe Lopez-Latorre Senior Developer Relations Engineer, Android

A marzo abbiamo introdotto Android Bench, la nostra classifica degli LLM per le attività di sviluppo Android reali. Il nostro obiettivo era fornire trasparenza sulle funzionalità dei modelli nello sviluppo Android e incoraggiare i miglioramenti dei modelli, per offrirti opzioni di AI più utili per il tuo flusso di lavoro quotidiano. Da allora, abbiamo migliorato il benchmark in base ai tuoi feedback, ad esempio valutando modelli open-weight e aggiungendo le dimensioni di costo ed efficienza alla classifica. 

Tuttavia, le funzionalità di AI sono in continua evoluzione e la misurazione deve fare altrettanto. Nell'ambito della release di luglio, abbiamo adottato il framework Harbor, che include una versione aggiornata dell'agente di benchmarking utilizzato per valutare i modelli. 

Oltre a questa modifica alla nostra valutazione, nella release di luglio aggiungeremo 8 nuovi modelli (Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus e Qwen 3.7 Max) alla classifica. Stiamo anche condividendo le opportunità per te, la community di sviluppatori Android, di contribuire al benchmark. 

Upgrade della metodologia con il framework Harbor

Quando abbiamo progettato Android Bench, abbiamo ancorato la nostra metodologia agli standard di settore leader disponibili all'epoca. Abbiamo utilizzato mini-swe-agent v1, un agente di benchmarking per uso generico, e lo abbiamo adattato alle sfumature dello sviluppo Android per fornire una misurazione di base delle funzionalità dei modelli per le attività di sviluppo Android comuni.

Per continuare a fornirti valutazioni all'avanguardia che misurino con precisione le funzionalità dei modelli più recenti nello sviluppo Android, stiamo standardizzando il nostro benchmark al framework Harbor. Harbor definisce standard e integrazioni che consentono a chiunque di eseguire il benchmark, valutare la configurazione preferita o condividere i risultati, offrendoti maggiore trasparenza e visibilità.

Questo upgrade ci consente di valutare in modo più rigoroso i modelli e le loro funzionalità e abbiamo eseguito di nuovo il benchmark su tutti i modelli per stabilire una baseline aggiornata. Ciò significa che si verifica un leggero spostamento nel punteggio, ma potrai comunque visualizzare i punteggi storici nell'archivio sul nostro sito web.

Vogliamo assicurarci che Android Bench sia utile per te, quindi lo aggiorneremo continuamente man mano che le nostre valutazioni e il settore maturano.

Espansione della classifica con 8 nuovi modelli

Nell'ambito del nostro impegno a mantenere aggiornata la classifica, abbiamo aggiunto Claude Fable 5, Claude Sonnet 5, Claude Opus 4.8, GLM 5.2, Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus e Qwen 3.7 Max alla classifica di Android Bench. 

Vedrai che Claude Fable 5 è in cima alla classifica con un punteggio di 84,5, seguito da GPT 5.5 con 80,2 e da Claude Sonnet 5 al terzo posto con un punteggio di 76,2.

Se si confrontano solo i modelli open-weight, GLM 5.2 è in cima con 72,2, seguito da Kimi K2.7 Code con un punteggio di 70,4.

Puoi consultare le metriche di prestazioni ed efficienza dei modelli nella classifica aggiornata per vedere come questi nuovi e precedenti modelli affrontano le sfide specifiche di Android, come le migrazioni di Jetpack Compose, le reti indossabili e gli aggiornamenti delle API della piattaforma.  

image1.png

Apertura di Android Bench ai contributi della community

Fin dall'inizio, abbiamo apprezzato un approccio aperto e trasparente, motivo per cui abbiamo reso pubblicamente disponibili su GitHub la nostra metodologia originale e il nostro test harness. Ci hai chiesto un modo per fornire feedback sul nostro set di dati, quindi ora stiamo facendo un passo avanti nella collaborazione offrendo a te, la community di sviluppatori Android, la possibilità di dare forma ad Android Bench.

A partire da oggi, puoi contribuire ad Android Bench in due modi:

  1. Progetta e invia le tue attività di sviluppo Android per valutare come i modelli gestiscono gli scenari che ti interessano.
  2. _Esegui e condividi le valutazioni dei benchmark_ in prima persona, testando i modelli che preferisci rispetto al nostro set di dati o alle tue attività personalizzate.

Esamineremo le attività inviate e valuteremo se aggiungerle al benchmark. Ci auguriamo di creare un benchmark che rifletta davvero le diverse realtà quotidiane della community globale di sviluppatori Android.

Prospettive future

Con sempre più opzioni per lo sviluppo agentico, il mantenimento di un benchmark all'avanguardia garantisce che l'assistenza dell'AI su cui fai affidamento continui a diventare più intelligente, utile ed efficace. Visita il nostro repository GitHub per consultare le attività. Ti invitiamo a inviare un'attività al nostro team per la revisione e puoi consultare Harbor Hub per esplorare il set di dati o inviare valutazioni.

Come sempre, puoi trovare la classifica aggiornata o leggere la metodologia sul nostro sito web. 

Scritto da:
Continua a leggere