» Etiket
llm
136 yayınOn Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
VoltMem: LLM Ajanları için Değişkenlik Duyarlı Bellek Katmanı
VoltMem, LLM ajan belleklerinde bilgi türüne göre değişen 'volatilite' skorlarıyla güncel ve kararlı gerçekleri ayırt eden açık kaynaklı bir katman.
120B parametreli LLM, expert akışıyla Android telefonda çalışıyor
Açık kaynaklı bir Android uygulaması, MoE uzmanlarını flash depodan akıtarak 120B parametreli LLM'i telefon CPU'sunda çalıştırıyor, 30B modeller kullanılabilir hızda.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comSDABench: LLM'leri Bilimsel Keşifte Test Eden Yeni Kıstas
SDABench, LLM'leri kod çalıştırma yerine altı bilimsel yetenek üzerinden test eden yeni bir kıstas; sonuçlar ciddi eksiklikleri ortaya koyuyor.
Devrede Yalan Söyleyemeyen Yapay Zeka Öğretmeni
digiwleea'nın yapay zeka devre öğretmeni, netlist doğrulama ve simülasyon geri bildirimiyle her üretilen devrenin doğruluğunu garanti ediyor.
Multi-Agent AI Sistemi Bir Haftasonu 1.847 Dolara Mal Oldu
Multi-agent LLM oyunu bir haftasonu 1.847 dolara mal oldu. Maliyet formülü, kök nedenler ve LLM çağrılarını azaltan optimizasyon teknikleri.
Bankacılık RAG Chatbot'unda PDF Çıkarma Üç Haftayı Nasıl Yuttu
Bankacılık RAG chatbot'unda PDF çıkarma, tablo bozulması, OCR ve chunking sorunlarının üretim mühendisliğine etkisi.
32 Gerçek AI Ajan Hatası Kataloglandı, Kapsam Dışılar da Açıklandı
ARE Incident Database, OWASP ASI Top 10'a eşlenen 32 gerçek AI ajan hatasını çalıştırılabilir kod örnekleri ve dürüst kapsam boşluklarıyla listeliyor.
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
Harness Pretraining'den Önce mi Gelmeli? Veri Çarkı Perspektifi
AI ajanlarında harness ve pretraining ilişkisini, veri çarkı ve model önyargıları üzerinden inceleyen teknik bir analiz.