» Etiket
ai
105 yayınYayına Alınmadan Önce Geçmesi Gereken 7 Regresyon Testi
AI ajanları için kritik regresyon testlerini öğrenin. Başarılı bir dağıtım için gerekenleri keşfedin.
Büyük Dil Modellerinde RL ile Akıl Yürütme: Politika Seçimi
Pekiştirme öğrenimi, büyük dil modellerinde akıl yürütmeyi geliştirmekte ancak yeni stratejiler öğretmemektedir.
Yapay Zeka Artık Fonksiyonel Virüsler Tasarlayabiliyor
Stanford'da yapay zeka ile tasarlanan 16 virüs, antibiyotiklere dirençli bakterileri enfekte edebiliyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comÖzel LLM API'lerinden Akıl Yürütme İzlerini Çalma
Sınır AI modellerinin API'lerinde bulunan güvenlik açığı ile akıl yürütme izlerini çıkarmayı başardık. Bu durum mühendisler için önemli güvenlik riskleri oluşturuyor.
Açık Modelin Bilim Yapma Yeteneği Geliştirildi
Loka ve Arcee AI işbirliğiyle geliştirilen açık model, bilimsel araştırmalarda araç kullanma ve mantıksal çıkarım yapma yeteneği kazandı.
NVIDIA Alpamayo 2 Super: 34B Açık Görüş-Dil-Eylem Modeli
NVIDIA, Alpamayo 2 Super modelini tanıttı. 34B açık görüş-dil-eylem modeli, robotaksiler için önemli bir adım.
Kendi güvenlik aracımı test ettim ve dört hata buldum
Agentmetry, AI kodlama ajanları için bir kayıt cihazıdır. Bu yazıda, dört hata buldum ve bunların güvenlik araçlarının kendilerini nasıl etkilediğini açıklıyorum.
Zihin Virüsleri: Çoklu Ajan LLM Sistemlerinde Kendini Yayma
Zihin virüsleri, çoklu ajan sistemlerinde yayılan fikirlerdir. Otonom yapay zeka ajanları için riskler ve çözüm önerileri sunulmaktadır.
Cursor, GitHub Sorununu Fırsata Çevirerek Origin'i Lansmanını Yaptı
Cursor, GitHub kesintisi sırasında Origin kod barındırma platformunu tanıttı. AI ile yeni bir deneyim sunuyor.
Vero: AI Ajanları Formally Doğrulanmış Yazılım Depoları Oluşturabilir mi?
Vero, AI ajanlarının çok modüllü yazılım depolarında uygulama ve kanıt sentezini değerlendiren bir benchmark sunuyor.