» Etiket
llm
473 yayınQwen2-VL'yi AMD MI300X'te İnce Ayarlamak: ROCm'in Söylemedikleri
Qwen2-VL ile blockchain grafik sınıflandırması: AMD MI300X + ROCm'de karşılaşılan gerçek ince ayar sorunları ve çözümleri.
Airbnb LLM Değerlendirmesini Haftalardan Bir Güne Nasıl İndirdi
Airbnb'nin dört katmanlı LLM değerlendirme altyapısı, deterministik önbellekleme ve micro LoRA adaptörleriyle iterasyon süresini haftalardan bir güne indiriyor.
Qwisp: MoE uzmanlarını flash'ten akıtan motor, Qwen3.6-35B-A3B'yi 8GB Mac'te çalıştırıyor
Qwisp, Qwen3.6-35B-A3B MoE modelini flash'ten uzman akışıyla 8GB Mac'lerde çalıştıran açık kaynaklı, bit-tam kayıpsız bir yerel çıkarım motoru.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comContext Warp Drive: LLM'siz, Deterministik Bağlam Sıkıştırma
Context Warp Drive, LLM çağrısı yapmadan bağlamı deterministik olarak katlar; maliyeti %72'ye kadar düşürüp %94 bilgi koruması sağlar.
Değerlendirme Odaklı Açık Kaynak Kurs: doerkit ve rubric-bench
doerkit ve rubric-bench: LLM'yi rubrik yargıcı olarak kullanan açık kaynak bir istatistik kursu ve genel amaçlı yargıç test çerçevesi.
Agent Araç Çağrılarında Boş Sonucu Kim Yorumlar?
Agent araç çağrılarında boş sonuçların üç farklı kök nedeni ve bunları ayırt etmek için tipik durum, kanıt ve retry_after tasarımı.
LLM'leri Yazılım Gibi Test Etmek: QA için Promptfoo Rehberi
QA mühendisleri için Promptfoo ile LLM test etme: versiyonlanmış evaller, deterministik assertion'lar, model-graded rubric'ler ve sağlayıcı karşılaştırması.
Bellek krizi ve açık modeller yapay zeka sektörünü yeniden şekillendiriyor
Bellek fiyat krizi, açık ağırlıklı modeller ve çıkarım verimliliği 2026-2030'da yapay zeka ekonomisini nasıl dönüştürüyor; yeni araştırma bunu modelliyor.
LLM-as-a-Verifier: Doğrulamayı Yeni Bir Ölçekleme Ekseni Yapıyor
Yeni araştırma, LLM'lerin çözüm doğruluğunu değerlendirme yeteneğini eğitimsiz bir doğrulama çerçevesiyle ölçeklendiriyor; SWE-Bench ve Terminal-Bench'te SOTA sonuçlar elde ediyor.
Probelock: LLM araç çağırma için kilit dosyası
Probelock, LLM'in araç çağırma yeteneklerini deterministik testlerle ölçüp model/kuantizasyon değişince regresyonda CI'ı durduran bir kilit dosyasıdır.