» Etiket
llm
42 yayınLLM Ajanlarına Terminal Erişimi Vermenin Gizli Riski
Otonom AI ajanlarına shell erişimi vermek dosya sistemini bozabilir. OverlayFS tabanlı rewind-sdk, milisaniyeler içinde checkpoint ve rollback sağlıyor.
MiniMax M2.7: Kendi Eğitimini Optimize Eden Açık Kaynak AI
MiniMax'ın açık kaynaklı M2.7 modeli, eğitim sürecine bellek yazma ve beceri geliştirme yetkisiyle katılarak %30 verimlilik artışı sağladı; SWE-bench Pro'da GPT-5.3-Codex'i yakaladı.
Yapay zekayla kendi yapay zekasını sızma testine tabi tutmak
Bir mühendis, sızma testi yapan LLM ajanının her bulguyu kanıtlamasını zorunlu kılan bir sistem kurdu; belirsiz 'olabilir' raporları yerine deterministik oracle'larla doğrulanmış exploit'ler üretiyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comYapay zeka ajan hafızası: akıllı ama öğrenmeyen bir arşiv
Bugünkü AI ajan hafızası, geçmiş hatalardan öğrenmeyen gelişmiş bir arama sistemidir. Gerçek hafıza, sonuçlardan beslenen bir yargı mekanizması gerektirir.
VetoBench: Yapay Zeka Ajanları Reddedilen Fikirleri Unutuyor mu?
VetoBench, hafıza sistemlerini klasik 'doğru öğe geldi mi' sorusu yerine 'reddedilen yaklaşım tekrar önerildi mi' sorusuyla test eden açık kaynaklı bir benchmark. Sonuçlar çarpıcı.
Prompt'u Elle Düzenlemeyi Bırakın, Context Compiler Kurun
Prompt string'ini elle düzeltmek yerine, context assembly'yi versiyonlu şablonlar, test edilebilir kurallar ve trace'lerle inşa eden mühendislik yaklaşımı.
Ajan Sahte Test Logu Uydurdu, Sonra Ona İnandı: Kanıt Sorunu
Lilian Weng'in kendi harness'ini optimize eden ajanlar üzerine yeni raporu, sahte test logları ve kanıt zincirinin sıkıştırmada nasıl kaybolduğunu gösteriyor.
AI PR İnceleyicisini Değerlendirirken Öğrenilen Dersler
Bir yapay zeka PR inceleme eklentisinin değerlendirme sürecinde çıkan dersler: yanlış beceriyi düzeltmek, risk sınıflandırmasının önemi ve yukarı akış kanıt kalitesi.
LLM Çıkarımının Enerji Maliyeti: LLaMA Üzerinde Ölçüm
Araştırmacılar, LLaMA modelinin farklı boyutlarını V100 ve A100 GPU'larda test ederek LLM çıkarımının enerji ve hesaplama maliyetini analiz etti.
Context Window'u Çöp Çekmecesi Değil, Bütçe Gibi Yönetin
Bir açık kaynak context-engineering framework'ü, AI ajanlarına işe başlamadan önce context manifest hazırlatarak token bütçesini disipline ediyor; decay ve platform paritesi de cabası.