» Etiket
multimodal-ai
4 yayınPixelRAG: RAG'de HTML yerine ekran görüntüsü ile arama
PixelRAG, web sayfalarını metne çevirmeden doğrudan piksel uzayında işleyen yeni bir RAG yöntemi. 30 milyon görüntülük Wikipedia veri seti ile metin tabanlı sistemleri geride bırakıyor.
On Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
SynthDocBench: Uzun Bağlamlı Görsel Belge Anlamada VLM Zaafları
SynthDocBench, uzun bağlamlı belgelerde VLM'lerin konumsal önyargı, uzunlukla performans kaybı ve grafik anlama zaaflarını ortaya koyan yeni bir benchmark.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMultimodal Modellerin Asıl Sorunu: Anlama Değil, Örnekleme
Multimodal modellerde darboğaz kapasite değil; kare hızı, ses chunk'lama, görüntü kırpma gibi varsayılan örnekleme kararları production'ı belirliyor.