Android Bench ile yapay zeka destekli Android geliştirmeyi iyileştirme ve LLM'leri geliştirme
Okuma süresi: 2 dk.
Yüksek kaliteli Android uygulamalarını daha hızlı ve kolay bir şekilde geliştirmenizi istiyoruz. Üretkenliğinizi artırmanıza yardımcı olmanın bir yolu da yapay zekayı parmaklarınızın ucuna getirmektir. Android platformunun nüanslarını gerçekten anlayan bir yapay zeka istediğinizi biliyoruz. Bu nedenle, büyük dil modellerinin Android geliştirme görevlerindeki performansını ölçüyoruz. Bugün, Android geliştirme için LLM'lerin resmi skor tablosu olan Android Bench'in ilk sürümünü yayınladık.
Amacımız, model oluşturuculara Android geliştirme için LLM özelliklerini değerlendirebilecekleri bir kıyaslama sunmaktır. Yüksek kaliteli Android geliştirmenin nasıl göründüğüne dair net ve güvenilir bir temel oluşturarak model oluşturucuların eksiklikleri belirlemesine ve iyileştirmeleri hızlandırmasına yardımcı oluyoruz. Bu sayede geliştiriciler, yapay zeka desteği için daha geniş bir faydalı model yelpazesi arasından seçim yaparak daha verimli çalışabiliyor. Sonuç olarak, Android ekosisteminde daha yüksek kaliteli uygulamalar geliştiriliyor.
Gerçek hayattaki Android geliştirme görevleri için tasarlandı
Karşılaştırmayı, çeşitli yaygın Android geliştirme alanlarına yönelik bir görev grubu oluşturarak yaptık. Bu zorluklar, herkese açık GitHub Android depolarından alınan ve zorluk seviyeleri değişen gerçek zorluklardan oluşur. Android sürümlerindeki önemli değişiklikleri çözme, giyilebilir cihazlarda ağ oluşturma gibi alana özgü görevler ve Jetpack Compose'un en yeni sürümüne geçiş gibi senaryolar bunlardan bazılarıdır.
Her değerlendirmede, bir LLM'nin görevde bildirilen sorunu düzeltmesi denenir. Ardından, birim veya enstrümantasyon testleri kullanarak bunu doğrularız. Modele özgü olmayan bu yaklaşım, bir modelin karmaşık kod tabanlarında gezinme, bağımlılıkları anlama ve her gün karşılaştığınız sorunları çözme becerisini ölçmemize olanak tanır.
Bu metodolojiyi JetBrains dahil olmak üzere çeşitli LLM üreticileriyle doğruladık.
"Yapay zekanın Android üzerindeki etkisini ölçmek büyük bir zorluktur. Bu nedenle, bu kadar sağlam ve gerçekçi bir çerçeve görmek harika. Kendimizi karşılaştırma konusunda aktif olsak da Android Bench, benzersiz ve memnuniyet verici bir ektir. Bu metodoloji, Android geliştiricilerin şu anda ihtiyaç duyduğu titiz değerlendirme türüdür."
- Kirill Smelov, JetBrains'te Yapay Zeka Entegrasyonları Başkanı.
İlk Android Bench sonuçları
Bu ilk sürümde, tamamen model performansını ölçmek istedik ve ajan veya araç kullanımına odaklanmadık. Modeller, görevlerin% 16-72'sini başarıyla tamamlayabildi. Bu geniş aralık, bazı LLM'lerin Android bilgisi konusunda güçlü bir temele sahip olduğunu, bazılarının ise iyileştirme için daha fazla alana sahip olduğunu gösteriyor. Modeller şu anda nerede olursa olsun, LLM üreticilerini modellerini Android geliştirme için geliştirmeye teşvik ettiğimizden sürekli iyileşme bekliyoruz.
Bu ilk sürümde en yüksek ortalama puana sahip LLM, Gemini 3.1 Pro oldu. Bunu Claude Opus 4.6 yakından takip etti. Android Studio'nun en yeni kararlı sürümünde API anahtarlarını kullanarak Android projelerinizde yapay zeka yardımına yönelik olarak değerlendirdiğimiz tüm modelleri deneyebilirsiniz.
Geliştiricilere ve LLM üreticilerine şeffaflık sağlama
Açık ve şeffaf bir yaklaşımı benimsediğimiz için metodolojimizi, veri kümemizi ve test düzeneğimizi GitHub'da herkese açık olarak paylaştık.
Herkese açık tüm karşılaştırma testlerinde, modellerin eğitim sürecinde değerlendirme görevlerini görmüş olabileceği veri kirlenmesi riski vardır. Sonuçlarımızın ezberleme veya tahmin yerine gerçek muhakemeyi yansıtmasını sağlamak için önlemler aldık. Bu önlemler arasında ajan yörüngelerinin kapsamlı bir şekilde manuel olarak incelenmesi veya eğitimi engellemek için bir kanarya dizesinin entegrasyonu yer alıyor.
Önümüzdeki dönemde, veri kümesinin bütünlüğünü korumak için metodolojimizi geliştirmeye devam edeceğiz. Ayrıca, karşılaştırma ölçütünün gelecekteki sürümlerinde iyileştirmeler yapacağız. Örneğin, görevlerin miktarını ve karmaşıklığını artıracağız.
Android Bench'in uzun vadede yapay zeka yardımını nasıl iyileştireceğini merak ediyoruz. Vizyonumuz, konsept ile kaliteli kod arasındaki boşluğu kapatmaktır. Hayal ettiğiniz her şeyi Android'de oluşturabileceğiniz bir geleceğin temelini atıyoruz.
-
Ürün HaberleriBugün, mühendislerin tamamlaması birkaç gün hatta bir hafta süren, büyük ölçüde karmaşık görevler olan uzun vadeli görevlerin (LHT) ilk grubunu yayınlıyoruz. Ayrıca, ilgili model sağlayıcıların temsilcileriyle başlayarak temsilci tabanlı değerlendirmeyi de kullanıma sunuyoruz.
Matthew McCullough • Okuma süresi: 3 dk. -
Ürün HaberleriBugün Android 17'yi yayınlıyor ve desteklenen çoğu Pixel cihazda kullanıma sunuyoruz. Önümüzdeki aylarda Android 17'nin yüklü olduğu yeni cihazlar satışa sunulacak.
Matthew McCullough • Okuma süresi: 13 dakika -
Ürün HaberleriGoogle I/O 2026 'da Android geliştiriciler için 17 önemli duyuru yapıldı. Bu duyurularda, ajan tabanlı üretkenlik, kullanıcı arayüzü standardımız olarak Compose First ve genişleyen ekosistem için yüksek performanslı medya ve uyarlanabilir geliştirme konularına odaklanıldı.
Matthew McCullough • Okuma süresi: 8 dk.
Android geliştirmeyle ilgili en son analizleri haftalık olarak gelen kutunuza alın.