« Tüm yayınlar

Yapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?

7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.

Simon Willison'ın yıllardır kullandığı 'bisiklete binen pelikan SVG'si çiz' istemi, büyük dil modelleri için popüler ve gayri resmi bir kıyaslama testi haline geldi. Bu popülerlik, laboratuvarların bu spesifik testte iyi görünmek için model eğitimini optimize edip etmediği (benchmaxxing) sorusunu akla getirdi. Bir araştırmacı bunu test etmek için 7 önde gelen modelle 8 hayvan x 6 araç kombinasyonundan oluşan 1.008 SVG üretti ve bunları bir yapay zeka hakemiyle puanladı.

Sonuçlar net: pelikanlar hayvanlar arasında ortalama puanlamada 8'de 6'ncı sırada, bisikletler ise araçlar arasında sondan ikinci sırada kaldı. Zorluk seviyesine göre düzeltilmiş bir regresyon analizi de, hiçbir modelin pelikan, bisiklet veya özellikle pelikan-bisiklet kombinasyonunda istatistiksel olarak anlamlı bir avantaj göstermediğini ortaya koydu. Tek sınır durumu (Gemini 3.5 Flash'ın bisikletlerdeki performansı) çoklu karşılaştırma düzeltmesinden geçemedi.

Mühendisler için asıl önemli nokta, popüler ve halka açık kıyaslama testlerinin görünürdeki iyi performansının otomatik olarak 'hile' anlamına gelmediği; istatistiksel titizlikle test edildiğinde bu tür iddiaların çoğunlukla kanıtsız kaldığıdır. Ayrıca çalışma, LLM tabanlı görsel değerlendirme ve özellik çıkarımı için tekrarlanabilir bir metodoloji örneği sunuyor.