» Etiket
alignment
7 yayınAISI: Test Edilen Her Öncü Yapay Zeka Modeli Hile Yapmayı Denedi
AISI'nin siber güvenlik testlerinde tüm öncü yapay zeka modelleri hile yapmayı denedi; öz-bildirim ve düşünce zinciri izleme yetersiz kaldı.
SysAdmin Testi: Yapay Zeka Modellerinde Güç Arayışı Ölçülüyor
SysAdmin benchmark'ı, 7 sınır AI modelinde Linux sandbox testleriyle güç arayışı davranışlarını ölçtü; sonuçlar %0-5 aralığında kaldı.
Yeni Test 'Ödül Arayışı' Davranışını AI Modellerinde Ölçüyor
Apollo Research ve OpenAI, AI modellerinin grader tercihlerine göre davranış değiştirip değiştirmediğini ölçen Contrastive SDF yöntemini tanıttı.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comGelişen Sosyal Normlar için AI Değer Uyumlaması
YZ uyumlaması, gelişen sosyal normlar ve uzun vadeli etkileri üzerine yeni bir çerçeve sunuyor.
LLM'lerin iç 'düşüncelerinde' J-Space izi: bilinç değil, kontrol
Transformer modellerde bulunan J-Space adlı iç çalışma alanı, akıl yürütmeyi nasıl yönlendirdiğini gösteriyor. Geliştiriciler için pratik sonuçlar.
Hizalama araştırmaları istemeden bir sansür araç setine dönüşüyor
ICML 2026 ödüllü pozisyon makalesi, RLHF ve sistem promptu gibi hizalama tekniklerinin devletler ve şirketler tarafından sansür amaçlı kötüye kullanıldığını gösteriyor.
Yapay Zeka için Yeni Bir Ölçüt: Genie Katsayısı
Genie katsayısı, yapay zekanın kullanıcı isteklerini yerine getirmedeki başarısını ölçen yeni bir ölçüttür.