» Etiket
llm
26 yayınAltı LLM değerlendirme aracını CI'a bağladık, sadece ikisi ayakta kaldı
Sekiz aylık gerçek CI testinde altı LLM eval aracından sadece Promptfoo ve DeepEval merge queue gate'i olarak güvenilir çıktı; nedeni determinizm.
LLM Değerlendiricilerde Kırılamayan %75 Yanlış Negatif Duvarı
LLM tabanlı reviewer'ların çözülemeyen %75 yanlış negatif sorununu ve neden oylama, prompt kalibrasyonu gibi standart çözümlerin işe yaramadığını inceliyoruz.
10 AI Kodlama Modeli, 5 Görev: Fiyat Performans Kalitesi Belirlemiyor
10 LLM'in 5 kodlama görevindeki performansı karşılaştırıldı: fiyat-kalite korelasyonu zayıf, ucuz modeller premium'a rakip çıktı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.com"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
LLM'in Eğitim Verisi Bayatlayınca: Nijerya Araç Fiyatlama Motoru Nasıl Düzeltildi
Bir LLM, Nijerya araç fiyatlarını eski dolar kuruyla hatırlayınca fiyatlama motoru bozuldu; canlı veri zorunluluğu ve önbellek kirliliği dersleri.
Kodlama Ajanlarını Model Değil, Harness Tasarımı İyileştiriyor
LangChain bir kodlama ajanını modeli değiştirmeden Terminal-Bench'te ilk 5'e taşıdı; kazanç tamamen harness tasarımından geldi.
Qwen kendi uygulamasını yazdı: QuotePilot'ta insan onayı şart kaldı
Qwen modelleriyle hem çalışan hem büyük ölçüde yazılan QuotePilot projesi: insan onay noktası, Decimal aritmetik ve gerçek geliştirme hataları.
Qwen2-VL'yi AMD MI300X'te İnce Ayarlamak: ROCm'in Söylemedikleri
Qwen2-VL ile blockchain grafik sınıflandırması: AMD MI300X + ROCm'de karşılaşılan gerçek ince ayar sorunları ve çözümleri.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Qwisp: MoE uzmanlarını flash'ten akıtan motor, Qwen3.6-35B-A3B'yi 8GB Mac'te çalıştırıyor
Qwisp, Qwen3.6-35B-A3B MoE modelini flash'ten uzman akışıyla 8GB Mac'lerde çalıştıran açık kaynaklı, bit-tam kayıpsız bir yerel çıkarım motoru.