Matematikçiler İçin AI Ajanları: Sohbetin Ötesinde Otonom Kanıt Arayışı
Matematikte AI kullanımını sohbet penceresinden otonom ajan iş akışlarına taşıyan Codex/ChatGPT Work tabanlı yöntem ve doğrulama disiplini.
Çoğu matematikçi yapay zekayı hâlâ bir sohbet penceresine soru yapıştırıp cevabı değerlendirmek şeklinde kullanıyor ve birkaç denemede sonuç alınamayınca modelin o problemi hiçbir zaman çözemeyeceği sonucuna varıyor. Bu yaklaşımın kısıtlı olduğu, çünkü sohbet tabanlı kullanımın AI'nin asıl potansiyelini test etmediği öne sürülüyor.
Bunun yerine Codex veya ChatGPT Work gibi ajan tabanlı bir 'harness' kurulması öneriliyor: problem tanımı, kanıtlanmış lemmalar, başarısız denemeler ve durum takibi dosyalarda (STATEMENT.md, REGISTRY.md, FAILED.md, PROVED.md) kalıcı olarak tutuluyor. Ajan Python, LaTeX, SAGE, LEAN gibi araçları kullanabiliyor, saatlerce otonom çalışabiliyor ve konuşma hafızasına değil dosya sistemine dayanıyor.
En kritik kısım ise iddiaların doğruluk seviyesine göre etiketlenmesi: candidate, self-audited, verifier-backed, promoted, independently audited. Bu disiplin, kanıtlanmamış ara adımların 'rutin' diye geçiştirilmesini önlüyor ve birden fazla alt-ajanın (en fazla 6 eşzamanlı) farklı yaklaşımları bağımsız şekilde denemesine, ardından taze ajanlarca doğrulanmasına imkan tanıyor. Mühendisler için bu, LLM'lerin açık problemler üzerinde güvenilir, izlenebilir ve tekrarlanabilir şekilde kullanılabileceği somut bir iş akışı sunuyor.