» Etiket
coding-agents
25 yayınSWE-Bench Pro'da Görevlerin %30'u Bozuksa, Skor Tablosuna Belirsizlik Payı Gerekir
OpenAI'nin SWE-Bench Pro denetimi görevlerin %30'unun bozuk olduğunu gösterdi; geçerlilik sürümleme ve belirsizlik aralığı için pratik rehber.
Kimi K3 testi: Çin modelleri kodlamada ucuz, planlamada değil
Kimi K3 benchmark testinde Çin yapay zeka modelleri planlamada pahalı, kodlamada ise 19 kat daha ucuz çıktı. Gerçek maliyet analizi.
GhostCommit: AI kod inceleyicilerinin göremediği sızıntı
GhostCommit saldırısı, zararlı talimatları PNG görsellerine gizleyerek Cursor Bugbot ve CodeRabbit'i nasıl atlattığını gösteriyor.
CommitBrief — terminalde yapay zekâ destekli kod incelemesi
Staged değişiklikleri, bir commit aralığını ya da bütün bir GitHub pull request'ini yerelde inceleyen sağlayıcı bağımsız CLI. Sıfır telemetri, sunucu yok. Açık kaynak, GPL-3.0.
commitbrief.comAjan Tabanlı Yazılım Mühendisliği: Spec Yetmez, Mimari Kayboluyor
Kodlama ajanlarının asıl zayıflığı kod üretimi değil; mimari hafıza kaybı ve spec-driven development'ın sınırları üzerine mühendislik analizi.
MiniMax M2.7: Kendi Eğitimini Optimize Eden Açık Kaynak AI
MiniMax'ın açık kaynaklı M2.7 modeli, eğitim sürecine bellek yazma ve beceri geliştirme yetkisiyle katılarak %30 verimlilik artışı sağladı; SWE-bench Pro'da GPT-5.3-Codex'i yakaladı.
Yerel Model Showdown 9. Tur: Qwen 3.6, Nemotron ve Qwythos Kod Testinde
RTX 5090'da llama.cpp ile beş LLM'in gerçek kodlama görevinde karşılaştırıldığı Local Model Showdown 9. tur analizi ve bulguları.
Sophos: Kodlama Asistanları Saldırgan Tespit Kurallarını Tetikliyor
Sophos raporu: Claude Code, Cursor ve Codex, EDR'nin saldırganları yakalamak için tasarlanmış kurallarını tetikliyor. Operatörler için öneriler.
Yapay Zeka Kodlama Ajanları: Ağacın Dalını mı, Kökünü mü Alıyor?
SWE-bench ve METR verileri AI kodlama ajanlarının ilerleyişini gösteriyor; ama doğrulama maliyeti mühendislik için hâlâ belirleyici sınır.
Harness Engineering: Yapay Zeka Ajanlarını Bağlamla Güçlendirmek
Harness engineering, yapay zeka modelini sabit tutup bağlam ve araçları optimize ederek güvenilir ajan çıktıları için gereksinimleri kodlar.
Kodlama Ajanları İçin Döngü Tasarımı: Hedef, Doğrulama, Durdurma
Kodlama ajanlarında hedef, doğrulama ve durdurma döngüsü nasıl tasarlanır? Verifikasyon merdiveni, izole denemeler ve sonlanma durumları üzerine rehber.