« Tüm yayınlar

TutorMoments: Yapay Zeka Öğretmenler Ne Zaman Yardım Etmeli?

Allen AI'nin TutorMoments benchmark'ı, LLM öğretmenlerin ne zaman destek olup ne zaman öğrenciyi zorlaması gerektiğini bilip bilmediğini test ediyor.

Allen Institute for AI, TutorMoments adlı bir ön izleme benchmark'ı yayınladı; bu çerçeve, büyük dil modellerinin gerçek öğretmenlerin karşılaştığı pedagojik kararları -- bir öğrenciye ne zaman destek olacağını, ne zaman geri çekilip kendi başına düşünmesine izin vereceğini -- verip veremediğini test ediyor. 2-7. sınıf öğrencileriyle yapılan 462 gerçek birebir matematik özel ders oturumunun kimliği gizlenmiş transkriptleri üzerine kurulan sistem, deneyimli öğretmenlerin işaretlediği kritik karar noktalarını yeniden oynatıyor; bu noktalarda bir LLM, simüle edilmiş bir öğrenciyle beş tur boyunca öğretmen rolünü üstleniyor.

Yalnızca "iyi öğretmenlik yap" talimatıyla test edilen yedi modelde, LLM'lerin tutarlı bir şekilde fazla yardım ettiği, öğrencileri daha zorlu akıl yürütmeye nadiren ittiği görüldü. İstemde destekleme ile zorluk artırma arasındaki dengeyi açıkça belirtmek performansı artırsa da, modeller ile insan öğretmenlerin duruma göre tutarlı kararları arasındaki fark kapanmadı; modeller arasında da güvenilirlik açısından büyük farklar gözlendi.

AI özel ders sistemleri geliştiren mühendisler için TutorMoments, tek bir sabit davranışı ödüllendiren benchmark'lardan daha nüanslı bir değerlendirme sunuyor. Allen AI, transkriptleri, replay kodunu ve puanlama hattını açık kaynak olarak yayınlayarak, AI öğretmenlerin öğrencinin gerçek ihtiyacına uyum sağlayıp sağlayamadığını ölçmek için bir altyapı sunuyor.