» Etiket
machine-learning
185 yayınKendi Kendine Ödüllenen LLM'ler: Doğruluk Değil İkna Kazanıyor
Referanssız LLM hakemleriyle kendi çıktısını değerlendiren modeller doğruluğu değil ikna ediciliği ödüllendiriyor; GSM8K deneyinde hakem onayı artarken gerçek doğruluk sabit kalıyor.
1 milyon token başına fiyat neden yanıltıcı bir metrik
AI modellerini token başına fiyatla karşılaştırmak yanıltıcı olabilir. Tokenizer farkları ve chain-of-thought verimliliği, gerçek görev maliyetini token fiyatından çok daha fazla etkiliyor.
Mnemiq: Kendi Veritabanınıza Uygun Açık Kaynak Metin-İfade SQL
Mnemiq, veritabanınıza özel ayarlarla doğal dil sorularını yanıtlayan açık kaynaklı bir metin-SQL motorudur.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comBüyük Dil Modellerinde RL ile Akıl Yürütme: Politika Seçimi
Pekiştirme öğrenimi, büyük dil modellerinde akıl yürütmeyi geliştirmekte ancak yeni stratejiler öğretmemektedir.
Açık Modelin Bilim Yapma Yeteneği Geliştirildi
Loka ve Arcee AI işbirliğiyle geliştirilen açık model, bilimsel araştırmalarda araç kullanma ve mantıksal çıkarım yapma yeteneği kazandı.
NVIDIA Alpamayo 2 Super: 34B Açık Görüş-Dil-Eylem Modeli
NVIDIA, Alpamayo 2 Super modelini tanıttı. 34B açık görüş-dil-eylem modeli, robotaksiler için önemli bir adım.
Thinking Machines, Inkling Small ile Açık Kaynak AI Modelini Tanıttı
Thinking Machines, Inkling-Small modelini tanıttı. Daha küçük boyutla yüksek performans sunuyor.
LLM'lerin Kriptanaliz Yeteneğini Ölçme
Yeni benchmark, LLM'lerin kriptanaliz yeteneğini ölçüyor. Anthropic'in modeli yeni saldırılar keşfetti.
PyTorch'ta Profil Oluşturma (Bölüm 3): Dikkat Profilinizdir
PyTorch'ta dikkat mekanizmasını profil oluşturma ile ele alıyoruz. Performans iyileştirmeleri için in-place operasyonlar kullanıyoruz.
Yapay Zeka Tersine Mühendislik Ölçeği
AgentRE-Bench, AI ajanlarının tersine mühendislik yeteneklerini değerlendiriyor. Kalibrasyon, akıl yürütme derinliğinden daha etkili.