« Tüm yayınlar

GPT-5.6 mi, Claude Fable 5 mi: Fiziksel AI simülasyon testi

JuliaHub'ın Dyad ajanıyla GPT-5.6 ve Claude Fable 5, beş fiziksel modelleme probleminde karşılaştırıldı; maliyet, hız ve doğrulama tarzları analiz edildi.

JuliaHub, Dyad ajan altyapısını sabit tutarak OpenAI'nin GPT-5.6 ailesi (terra, sol, luna) ile Anthropic'in claude-fable-5 modelini beş kapalı modelleme ve simülasyon probleminde karşılaştırdı. Toplam 52 değerlendirilmiş koşuda claude-fable-5 en yüksek ağırlıklı skoru (0.889) alırken, deneme başına 9.60$ ve 16.1 dakika ile en pahalı ve en yavaş seçenek oldu. gpt-5.6-terra ise 0.786 skorla en ucuz (1.25$) ve en hızlı (12.6 dk) model olarak öne çıktı.

Çalışma, kodun derlenip çalışması ile fiziğin doğru olmasının aynı şey olmadığını vurguluyor: ajanlar kendi yazdıkları testlerle yönlendiği için, basitleştirilmiş varsayımlara dayanan testler geçse bile model gerçek dünyayı yanlış temsil edebiliyor. Her modelin iş tarzı incelendiğinde farklı karakterler ortaya çıkıyor - Fable kendi sonucunu kırmaya çalışarak doğruluyor, Sol görevin ötesine geçen bağımsız kontroller kuruyor ama bazen spesifikasyonu yanlış okuyor, Luna dış referans olmadan kendi denklemlerini tekrar tekrar doğruluyor, Terra ise düzenleme üzerinde ekonomik davranıp bazen simülasyon ufkunu sessizce kısaltıyor.

En zorlu problem olan NASA HL-20 uçuş aracının tam simülasyonunu hiçbir model çözemedi; terra, NASA teknik notlarını okumadan kontrol yüzeyi karışım mantığını tahminle türetti. Mühendisler için sonuç: model seçimi yalnızca maliyet ve hıza değil, fiziksel doğrulama disiplinine göre yapılmalı.