» Etiket
ai
136 yayınExploitGym: Yapay Zeka Ajanları Açıkları Gerçek İstismara Dönüştürüyor mu?
ExploitGym, yapay zeka ajanlarının 869 gerçek güvenlik açığını çalışan istismara dönüştürme yeteneğini test eden yeni bir kıyaslama sunuyor.
Kodun Çoğunu Yapay Zeka Yazınca İnceleme Süreci Nasıl Değişir
Claude gibi ajanlar kodun çoğunu yazınca klasik PR onayı anlamını kaybediyor; yeni kontrol modeli spesifikasyon ve doğrulama planına kayıyor.
11 Yapay Zeka Alt Ajanıyla Claude Code PPTX Yeteneklerini Test Ettim
11 Claude Code PPTX becerisi, alt ajanlarla test edildi: hangileri gerçek düzenlenebilir tablo üretiyor, hangileri sahte şekillerden oluşuyor?
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comMaith: Yapay Zeka Destekli Matematik Araştırması İçin Disiplinli Çerçeve
Maith, Riemann ve P vs NP gibi açık matematik problemlerini yapay zekayla araştırırken katı ispat standartları uygulayan açık kaynaklı bir çalışma alanı.
Stagehand: Doğal Dille Konuşan AI Destekli Tarayıcı Otomasyonu
Stagehand, AI ile doğal dil talimatlarını gerçek zamanlı olarak deterministik tarayıcı eylemlerine dönüştüren açık kaynaklı otomasyon SDK'sı.
Kimi K3 testi: Çin modelleri kodlamada ucuz, planlamada değil
Kimi K3 benchmark testinde Çin yapay zeka modelleri planlamada pahalı, kodlamada ise 19 kat daha ucuz çıktı. Gerçek maliyet analizi.
Anthropic, yapay zeka odaklı yazılım geliştirme sürecini nasıl güvenli hale getiriyor
Anthropic'in Claude tabanlı geliştirme sürecinde güvenliği kod, test ve dağıtım aşamalarına nasıl entegre ettiğini inceliyoruz.
Statik Tarayıcı AI Ajan Framework'lerinde 30 Korumasız Yıkıcı Eylem Buldu
Açık kaynaklı bir tarayıcı, 25 AI ajan framework'ünde modellerin yetkilendirme kontrolü olmadan silme, deploy ve webhook çağırabildiği 30 gerçek bulgu tespit etti.
Ajan Tabanlı Yazılım Mühendisliği: Spec Yetmez, Mimari Kayboluyor
Kodlama ajanlarının asıl zayıflığı kod üretimi değil; mimari hafıza kaybı ve spec-driven development'ın sınırları üzerine mühendislik analizi.
Yapay Zeka Modelleri 'Pelikanlı Bisiklet' Testine Hile mi Yapıyor?
7 yapay zeka modeliyle 1.008 SVG üretilerek 'pelikanlı bisiklet' testinde hile (benchmaxxing) yapılıp yapılmadığı istatistiksel olarak incelendi.