» Etiket
llm
28 yayınOn Yılda Görsel-Dil Modelleri: Kolay Testlerde Yanılan İlerleme Gerçeği
On yıllık vision-language modelleri karşılaştırması: kolay MS-COCO verisinde 'insan seviyesi' iddiaları, karmaşık sosyal sahnelerde nasıl çöküyor?
VoltMem: LLM Ajanları için Değişkenlik Duyarlı Bellek Katmanı
VoltMem, LLM ajan belleklerinde bilgi türüne göre değişen 'volatilite' skorlarıyla güncel ve kararlı gerçekleri ayırt eden açık kaynaklı bir katman.
Değerlendirme Odaklı Açık Kaynak Kurs: doerkit ve rubric-bench
doerkit ve rubric-bench: LLM'yi rubrik yargıcı olarak kullanan açık kaynak bir istatistik kursu ve genel amaçlı yargıç test çerçevesi.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAgent Araç Çağrılarında Boş Sonucu Kim Yorumlar?
Agent araç çağrılarında boş sonuçların üç farklı kök nedeni ve bunları ayırt etmek için tipik durum, kanıt ve retry_after tasarımı.
Bağlam Mühendisliği: Prompttan Daha Fazlası Gerekiyor
Yapay zeka ajanlarında çıktıyı belirleyen artık prompt değil bağlam: araç tasarımı, hafıza ve kürasyon prompt mühendisliğinden neden daha etkili.
Forge3D Spaces: Cümleden 3D Eve, Tarayıcıda Parametrik CAD
Forge3D Spaces, metinden 3D bina üreten tarayıcı CAD aracı: LLM+slicing-tree solver, WebGPU/WebGL fallback ve CSG mimarisi incelemesi.
CodeGraph: Kodun Neyi Kıracağını Önceden Gösteren Bilgi Grafiği
CodeGraph, GitHub depolarını Neo4j tabanlı bir bilgi grafiğine dönüştürerek kod değişikliklerinin etkisini GraphRAG ile önceden tahmin ediyor.
PromptLedger v0.7: Prompt değişiklikleri için regresyon kapıları
PromptLedger v0.7, prompt sürümlerine evaluation run, metrik karşılaştırma ve politika tabanlı CI regresyon kapıları ekliyor.
LLM Maliyet Takibinizin Sizi Yanılttığı Beş Nokta
LLM maliyet metering katmanlarındaki beş sessiz hata: streaming, cache, serverless flush, iptal edilen akışlar ve eskiyen fiyat tabloları.
Küçük Modelleri Bilinçli Tercih: 16GB M1'de Otonom Ajan İnşası
Bir mühendis neden 16GB M1 Mac ve küçük modellerle otonom ajan çalıştırmayı bilinçli olarak tercih ediyor? Tasarım disiplini üzerine bir vaka analizi.