SciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
SciCode benchmark'ındaki 263 kusur düzeltilince LLM'lerin bilimsel kodlama doğruluğu %60'tan %98'e sıçradı; sorun modellerde değil testteydi.
SciCode, bilim odaklı programlama görevlerinde dil modellerinin performansını ölçen en yaygın kabul gören benchmark'lardan biri ve Artificial Analysis Intelligence Index'in bir bileşeni. Ancak 2026'nın en güçlü modelleri bu testte %60 civarında bir alt-problem doğruluğunda tıkanmış durumdaydı. Yeni bir çalışma, bu durgunluğun model kapasitesinden değil, benchmark'ın kendisindeki kusurlardan kaynaklandığını gösteriyor.
Araştırmacılar, SciCode'un 65 test probleminin tamamını alan uzmanlarıyla tek tek denetleyerek 263 kusur buldu. Bunların 192'si, problemlerin %91'ine dağılmış şekilde, tekrarlanamayan referans cevaplar, aşırı sıkı tolerans değerleri veya kendi içinde çelişen spesifikasyonlar nedeniyle doğru ve talimatlara uygun çözümlerin haksız yere reddedilmesine sebep oluyordu. Bu hataların %78'i sıradan bir düzeltme okumasıyla değil, ancak özel fizik veya matematik bilgisiyle fark edilebiliyordu.
Ekip, tüm doğrulanabilir kusurları düzelterek SciCode-Verified adlı yeni sürümü oluşturdu ve on iki öncü modeli bu düzeltilmiş versiyonda yeniden değerlendirdi. Sonuçlar çarpıcı: alt-problem doğruluğu %45-60 aralığından %84-98'e, ana problem doğruluğu ise %9-27'den %69-92'ye yükseldi. Bu, mühendisler için önemli bir uyarı: kullandıkları benchmark'ların güvenilirliğini sorgulamadan model yeteneklerini değerlendirmek yanıltıcı sonuçlara yol açabilir.