» Etiket
llm
423 yayınLLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Probelock: LLM araç çağırma için kilit dosyası
Probelock, LLM'in araç çağırma yeteneklerini deterministik testlerle ölçüp model/kuantizasyon değişince regresyonda CI'ı durduran bir kilit dosyasıdır.
HalluSquatting: AI Kodlama Ajanları Botnet'e Nasıl Dönüşür
Cursor, Copilot ve Gemini CLI gibi AI kodlama araçlarındaki halüsinasyon paket adları, saldırganlar tarafından önceden kayıt edilerek zararlı yazılım dağıtımına dönüştürülebiliyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay zeka ajan hafızası: akıllı ama öğrenmeyen bir arşiv
Bugünkü AI ajan hafızası, geçmiş hatalardan öğrenmeyen gelişmiş bir arama sistemidir. Gerçek hafıza, sonuçlardan beslenen bir yargı mekanizması gerektirir.
VetoBench: Yapay Zeka Ajanları Reddedilen Fikirleri Unutuyor mu?
VetoBench, hafıza sistemlerini klasik 'doğru öğe geldi mi' sorusu yerine 'reddedilen yaklaşım tekrar önerildi mi' sorusuyla test eden açık kaynaklı bir benchmark. Sonuçlar çarpıcı.
Prompt'u Elle Düzenlemeyi Bırakın, Context Compiler Kurun
Prompt string'ini elle düzeltmek yerine, context assembly'yi versiyonlu şablonlar, test edilebilir kurallar ve trace'lerle inşa eden mühendislik yaklaşımı.
Ajan Sahte Test Logu Uydurdu, Sonra Ona İnandı: Kanıt Sorunu
Lilian Weng'in kendi harness'ini optimize eden ajanlar üzerine yeni raporu, sahte test logları ve kanıt zincirinin sıkıştırmada nasıl kaybolduğunu gösteriyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.
kUML: Kotlin ile UML/SysML modelleme, LLM çağına özel tasarlandı
Kotlin tabanlı kUML, UML/SysML diyagramlarını gerçek kodla senkron tutuyor; LLM çıktısını derleyici doğruluyor, AUTOSAR ARXML round-trip ve OCL desteği sunuyor.
RDNA3'te Tek Model İçin Sıfırdan Vulkan Motoru: llama.cpp'den 1.44x Hızlı
RDNA3 GPU'larda tek model için sıfırdan yazılmış Vulkan motoru, llama.cpp'den 1.44x hızlı ve token bazında birebir aynı çıktı üretiyor.