« Tüm yayınlar

OpenAI Ajan Döngüsünü Nasıl Hızlandırıyor: Harness, API, Çıkarım

OpenAI'nin harness, API ve çıkarım katmanlarındaki ajan döngüsü optimizasyon tekniklerini ve maliyet-verimlilik yaklaşımını inceliyoruz.

OpenAI mühendisleri, Codex ve ChatGPT Work'ün arkasındaki mimariyi ve maliyet-verimlilik tekniklerini paylaştı. Bir ajan isteği doğrudan modele gitmiyor; sırasıyla harness (orkestrasyon), API (uygulama) ve çıkarım (inference) katmanlarından geçiyor. Harness konuşma geçmişini tutar, araç çağrılarını sandbox içinde çalıştırır ve görev bitene kadar döngüyü tekrarlar; ağır görevlerde bu döngü yüzlerce kez tekrarlanabilir, her turdaki gecikme toplamda ciddi zaman kaybına dönüşür.

Bu tekrarlayan işi azaltmak verimliliğin ana kaynağı. Harness katmanında kalıcı WebSocket bağlantıları, sabit prompt önekleri, geciktirilmiş araç keşfi ve Code Mode gibi teknikler kullanılıyor. API katmanı yalnızca değişen kısmı (delta) tokenize ediyor ve güvenlik kontrollerini çıkarımla paralel çalıştırıyor. Çıkarım katmanında ise cache-farkında yönlendirme, KV cache yönetimi, spekülatif kod çözme ve prefill/decode ayrımı gibi yöntemlerle GPU kullanımı optimize ediliyor.

Bu detaylar önemli çünkü model yetenekleri kadar başarılı görev başına maliyet de rekabetin merkezinde. Örneğin GPT-5.6 Sol, maksimum akıl yürütme modunda Artificial Analysis Coding Agent Index'te Fable 5'ten daha yüksek puan alırken maliyeti yarısından az. Bu mimari dersler, kendi ajan sistemlerini kuran mühendisler için doğrudan uygulanabilir optimizasyon fırsatları sunuyor.