SciCode Benchmark'ındaki Kusurlar LLM Performansının Sanıldığından Daha İyi Olduğunu Gösteriyor; Yeni Spectre ve LLM Yan Kanal Saldırıları Tespit Edildi
LLM'lerin bilimsel kodlama performansını ölçen en yaygın kıyaslama olan SciCode'da büyük bir revizyon yaşandı. Araştırmacılar, 65 test probleminin tamamını denetleyerek 263 kusur tespit etti; bu kusurların %91'i problemlerin kendisindeydi. Bu bulgu, son dönemde %60 civarında tıkanmış gibi görünen model performansının aslında kıyaslama kaynaklı olduğunu ortaya koyuyor. Bu arada Allen Institute for AI, dil modellerinin gerçek öğretmenlerin pedagojik kararlarını ne ölçüde taklit edebildiğini test eden TutorMoments adlı yeni bir benchmark yayımladı.
Güvenlik cephesinde ise iki kritik araştırma öne çıktı. TONTOU adı verilen yeni bir CPU saldırısı, Spectre v2 için uygulanan en güncel önlemleri aşarak AMD ve Intel işlemcilerden Linux şifrelerini sızdırabiliyor. Benzer şekilde SparSEEty, LLM servis sistemlerindeki aktivasyon seyrekliği optimizasyonlarından yararlanarak giriş token'larını yan kanal analiziyle yeniden yapılandıran bir saldırı yöntemi olarak tanımlandı.
Sistem ve performans alanında önemli hız kazanımları rapor edildi. Llama.cpp'ye eklenen x86 VNNI optimizasyonu sayesinde AMD EPYC işlemcilerde Q2_0 modelleri 3 ila 3.6 kat daha hızlı çalışmaya başladı; bu durum özellikle Intel'in 12. ve 14. nesil işlemcilerinde eksik olan VNNI desteğinin önemini vurguluyor. Google araştırmacıları ise bellek katmanlamadaki 'ısı parçalanması' sorununu çözmek için nesneleri erişim sıklığına göre yerleştiren OBASE tasarımını önerdi; veri merkezlerinde aktif sayfalardaki baytların %97'sinin soğuk ve geri kazanılamaz olduğu belirtiliyor.
Web geliştirme topluluğu için önemli iki haber var. iOS'ta ana ekrana eklenmiş PWA'larda klavye açıldığında mesaj kutusunun kaybolması sorunu hâlâ çözülebilmiş değil; interactive-widget meta etiketi WebKit tarafından yok sayılıyor ve 100dvh birimi klavyeye tepki vermiyor. Pozitif tarafta ise JavaScript için en soldaki en uzun eşleşmeyi bulan posix-regex motoru ve Linux'tan Apple TV'ye AirPlay 2 ile ekran yansıtma sağlayan Doubletake aracı mühendislerin kullanımına sunuldu.
» İstatistikler
- Yayın
- 20
- Okunma
- 0
- Ort. puan
- 7.6
» En çok okunan
- Eşzamanlılık ve Verim: Daha Fazla Paralellik Veritabanlarını Yavaşlatabilir
- TutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
- LLM ile Üretilen Testler Uygulama Seçimini Nasıl Değiştirir?
- Netflix'in Gerçek Zamanlı Dağıtık Grafiği: gRPC ile Sorgulama
- Doubletake – Linux için AirPlay/TV Ekran Yansıtma Gönderici
- Llama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
- Yapay Zeka Otomasyonu Yanlış Şeyleri Ölçtüğünde Ne Olur?
- Uygulama Ajan İzleri için Ucuz LLM'lerin Performans Testi
- HTTP Uzantı Tasarımını Verilerle Bilgilendirmek
- Show HN: posix-regex – JavaScript için POSIX standart regex motoru
» En yüksek puan
- SciCode-Verified: LLM'lerin Bilimsel Kodlama Yeteneği Hafife Alınmış
- iOS PWA'da klavye üstünde sabit composer: dvh ve interactive-widget çözüm değil
- TutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?
- OBASE: Bellek Katmanlamasını İyileştiren Nesne Tabanlı Adres Alanı Tasarımı
- Show HN: posix-regex – JavaScript için POSIX standart regex motoru
- Doubletake – Linux için AirPlay/TV Ekran Yansıtma Gönderici
- Llama.cpp PR ile Q2_0, x86 CPU'larda 3.0–3.6 kat hızlandı
- 2026 WebAssembly Çalışma Zamanlarının Performansı
- Yeni TONTOU CPU saldırısı, Spectre v2 önlemlerini aşarak Linux şifrelerini sızdırıyor
- SparSEEty: Sparsity Kullanan LLM Servis Sistemlerinden Token Çıkartma