PyTorch tarzı API ile LLM 'harness' eğitimi: model donuk, çevresi öğreniyor
LLM ağırlıkları donuk kalırken promptlar, araçlar ve onarım döngüsünü PyTorch benzeri bir eğitim döngüsüyle geliştiren açık kaynak harness-training çerçevesi.
Yeni bir açık kaynak çerçeve, LLM ağırlıklarını sabit tutup modelin etrafındaki 'harness'i -promptlar, bağlam yönetimi, araç çağrıları ve onarım döngüsü- PyTorch'un eğitim döngüsüne benzer bir API ile eğitiyor. trainer.epochs() üzerinde dönen her epoch'ta bir Estimator, tek dosyalık harness'e (src/policy/core.py) sınırlı bir diff öneriyor; bu aday, sabit bir görev panelinde mevcut baseline'a karşı ölçülüyor.
loss.backward() ölçüm sonucunu kaydediyor, optimizer.step() ise StrictPareto gibi bir kritere göre HEAD'i ilerletip diff'i promote ediyor ya da reddediyor. Her aday commit refs/candidates/ altında, her ölçüm koşusu refs/experiments/runs/ altında saklanıyor; böylece git log doğrudan promosyon geçmişine dönüşüyor.
Mühendisler için asıl kritik nokta determinizm: eş zamanlı istek sayısı 1'e sabitlenmezse (ör. llama.cpp'de --parallel 1) batch decode gürültüsü ölçüm sonucunu adaydan bağımsızlaştırıyor ve eğitim sinyali anlamsızlaşıyor. Ayrıca Estimator'ın gerçek kod diff'i önerdiği göz önüne alınarak framework, izole bir host veya sandbox'ta çalıştırılmasını öneriyor. Terminal-Bench ve SWE-bench görev ortamları, herhangi bir OpenAI-uyumlu endpoint ile hazır geliyor; yeni benchmark veya model sağlayıcı eklemek tek bir alt sınıf yazmaktan ibaret.