» Etiket
llm
476 yayınLLM Hakem Testleri Neden Çalıştırmalar Arası Kararsız?
Aynı kod, aynı girdi, farklı LLM hakem skoru: CI gate'lerinde flapping sorununun kaynakları; sıcaklık, model pinleme, k-örnekleme ve kuantalama ile çözüm.
TaxCalcBench: Açık Kaynak Testte Yapay Zeka Vergi Hesaplıyor
TaxCalcBench, LLM'lerin gerçek vergi beyannamelerini doğru doldurup dolduramadığını ölçen açık kaynaklı bir test; en iyi model bile yüzde 54 doğruluk sağlıyor.
LLM gerekmez: Regex, ajan bağlam yönlendirmede 45 puan önde
Ajan kod asistanlarında bağlam seçimi için basit regex kuralları, öğrenilmiş sınıflandırıcıları 45 puan farkla geçti; LLM çağrısı çoğu istekte gereksiz kalıyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comFine-Tuning Tıkandığında: Recall'u %45'ten %92'ye Taşıyan Mimari
Sağlık taleplerinde CPT/ICD kodlamasında %45 recall'da tıkanan bir LLM, deterministik NCCI doğrulama katmanıyla %92'ye ulaştı. Mimari ders burada.
MCP Sunucularını Production'da Neler Bozar?
Bir ekibin production'daki MCP sunucularında karşılaştığı hata yönetimi, token rotasyonu, şema doğrulama ve boyut sınırı sorunlarını ve bunlardan doğan standartlaştırılmış çözümleri ele alıyoruz.
AI SDK v7'de Deprecated Erişimci Ajan Belleğini Sessizce Siliyor
AI SDK v7'de result.response.messages artık sadece son adımı döndürüyor; bu sessiz değişim çok turlu araç çağrılarını tarihçeden siliyor ve küçük modelleri çökertiyor.
LLM Değerlendiricileriniz İçin Regresyon Testi Şart
rubric-bench v0.1, LLM tabanlı değerlendiricileri altın veri setleriyle test eden açık kaynak bir araç. CI'da regresyonları yakalayıp model sürüklenmesini önlüyor.
Yerel Yapay Zeka: Bazı İşler Neden Cihazdan Çıkmamalı
Gizlilik, maliyet ve gecikme nedeniyle sık tekrarlanan AI görevleri yerelde çalıştırılmalı. Ollama ve faster-whisper ile kurulan pratik örnek.
Metis: Arm'ın açık kaynak ajanik güvenlik denetim aracı
Arm'ın Ürün Güvenliği Ekibi'nin geliştirdiği Metis, LLM tabanlı derin akıl yürütmeyle kod tabanlarında güvenlik açıklarını tespit eden açık kaynaklı bir çerçeve.
Claude ile Kod Denetimi: Üretimde Bulunan 15 Güvenlik Açığı
Bir LLM kullanılarak yapılan güvenlik denetiminde SQL/NoSQL injection, IDOR, path traversal gibi 15 OWASP açığı ve düzeltmeleri örnek kodlarla incelendi.