» Etiket
verification
28 yayınLLM ile Üretilen GPU Çekirdeklerinde Gizli Hatalar Bulundu
12 kapılı yeni bir doğrulayıcı, LLM üretimi GPU çekirdeklerinin %39,5'inin standart testleri geçmesine rağmen bozuk olduğunu ortaya koyuyor.
Yapay Zekanın Sessiz İhmallerini Yakalayan Yeni Doğrulama Katmanı
Yapay zeka modellerinin öne sürmesi gereken iddiaları sessizce atlamasını yakalayan katmanlı bir doğrulama sistemi geliştirildi.
Raft, Ajanlar İçin Bildirim Mimarisini Neden Yeniden Tasarladı
Raft ekibi, yapay zeka ajanlarının insanlar gibi mesaj görmezden gelemediğini keşfedip bildirim mimarisini ve önbellek tasarımını yeniden kurdu.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comDevrede Yalan Söyleyemeyen Yapay Zeka Öğretmeni
digiwleea'nın yapay zeka devre öğretmeni, netlist doğrulama ve simülasyon geri bildirimiyle her üretilen devrenin doğruluğunu garanti ediyor.
Yapay Zekada Doğrulamanın Gerçek Sınırı: Kod mu, Muhakeme mi?
Bir AI ajanının 'hatırlarım' vaadinin boş çıkması, doğrulamanın neden kod tabanlı olması gerektiğini ve muhakemenin neden yetersiz kaldığını gösterdi.
Matematikçiler İçin AI Ajanları: Sohbetin Ötesinde Otonom Kanıt Arayışı
Matematikte AI kullanımını sohbet penceresinden otonom ajan iş akışlarına taşıyan Codex/ChatGPT Work tabanlı yöntem ve doğrulama disiplini.
Kodlama Ajanları İçin Döngü Tasarımı: Hedef, Doğrulama, Durdurma
Kodlama ajanlarında hedef, doğrulama ve durdurma döngüsü nasıl tasarlanır? Verifikasyon merdiveni, izole denemeler ve sonlanma durumları üzerine rehber.
LLM Çıkarımını Güvenilir Hale Getirmek
Honeycomb, LLM çıkarımının güvenilirliğini artırmak için doğrulama süreçlerini ele alıyor.
Vero: AI Ajanları Formally Doğrulanmış Yazılım Depoları Oluşturabilir mi?
Vero, AI ajanlarının çok modüllü yazılım depolarında uygulama ve kanıt sentezini değerlendiren bir benchmark sunuyor.
ISNAD: Çok Ajanlı LLM Sistemleri için Güven Katmanı
ISNAD, çok ajanlı LLM sistemlerinde bilgi doğrulama için yeni bir güven katmanı sunuyor.