» Etiket
llm
423 yayınGPT-5.6 mi, Claude Fable 5 mi: Fiziksel AI simülasyon testi
JuliaHub'ın Dyad ajanıyla GPT-5.6 ve Claude Fable 5, beş fiziksel modelleme probleminde karşılaştırıldı; maliyet, hız ve doğrulama tarzları analiz edildi.
LLM Destekli Formal Doğrulama nftables'ta İki Kritik Hata Buldu
Basis, LLM destekli formal doğrulama ile Linux'un nftables optimizasyoncusunda 2022'den beri süregelen iki kritik hata keşfetti.
NVIDIA Nemotron 3 Super, Kodlamada GPT-OSS-120B'yi Geride Bıraktı
NVIDIA'nın açık modeli Nemotron 3 Super, SWE-Bench'te GPT-OSS-120B'yi 20 puan geçti ve 2,2x daha hızlı çıkarım sunuyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comLinkedIn için açık kaynak AI beceri seti: linkedin-skills
LinkedIn paylaşım sürecini sekiz göreve bölüp Claude Code/Codex için açık kaynak on beceri haline getiren linkedin-skills projesinin teknik analizi.
10 AI Kodlama Modeli, 5 Görev: Fiyat Performans Kalitesi Belirlemiyor
10 LLM'in 5 kodlama görevindeki performansı karşılaştırıldı: fiyat-kalite korelasyonu zayıf, ucuz modeller premium'a rakip çıktı.
"Halüsinasyon" Tek Bir Hata Değil, Üç Farklı Hata
Halüsinasyon üç ayrı sorun: düzeltilebilir bağlam eksikliği, doğrulanamaz akıcılık ve ulaşılamaz gelecek bilgisi. Mühendisler için ayrım rehberi.
AI Model Fiyatlarındaki Gizli Maliyet: Tokenizer Farkı Faturayı Nasıl Şişiriyor
AI model fiyat kartları $/token gösterir ama tokenizer farkları TypeScript'te faturayı %73'e kadar şişirebilir. Gerçek maliyet analizi.
AEGIS Açık Kaynak Oldu: Kendi Sunucunda Çalışan Kişisel AI Orkestrasyon Platformu
AEGIS, FastAPI, Postgres ve Temporal ile kurulmuş, MIT lisanslı, kendi sunucunda çalışan kişisel AI orkestrasyon platformu olarak açık kaynak yayınlandı.
VetoBench: Ajan Belleği Reddedilen Kararları Hatırlıyor mu?
VetoBench, ajan bellek sistemlerinin reddedilen kararları (vetoları) hatırlayıp hatırlamadığını test eden açık kaynaklı bir kıyaslama.
Claude Code, Prompt'u Okumadan Önce 33 Bin Token Harcıyor
Wire-level analiz: Claude Code, prompt okunmadan önce ~33K token harcıyor; OpenCode'a göre 4,7 kat fazla, gerçek görevlerde 3,7 kat maliyet farkı.