mcpgrade testi: 36 MCP sunucusunun üçte biri D/F aldı
mcpgrade aracı 36 MCP sunucusunu taradı: üçte biri D/F aldı. Eksik parametre açıklamaları ve model testleri ajan kullanılabilirliğini nasıl etkiliyor?
mcpgrade adlı yeni bir statik analiz aracı, protokol uyumluluğunu değil ajanların bir MCP sunucusunu gerçekten kullanabilirliğini ölçüyor. 36 popüler sunucu taranmış; 15'i A almışken MongoDB, Notion, Airtable, Todoist ve firecrawl dahil 11 sunucu D veya F ile en alta düşmüş. Ortak neden neredeyse hepsinde aynı: parametrelerin açıklaması yok, zod/OpenAPI şemaları .describe() eklenmeden otomatik üretilmiş.
Geliştirici ayrıca canlı bir model üzerinde --eval modu ile testleri doğrulamış. İyi belgelenmiş sunucularda araç seçim doğruluğu %100 iken firecrawl'da %84'e düşmüş; hatalar tam olarak statik analizin işaret ettiği isim çakışmalarında (extract/scrape gibi) yoğunlaşmış. Daha kritik bulgu ise reddetme oranı: kapsam dışı görevlerde küçük, temiz kataloglarda model %100 doğru şekilde 'hayır' derken, firecrawl'ın 26 belirsiz aracında bu oran %50'ye iniyor — yani model yarı yarıya alakasız bir aracı çağırıyor.
Sonuç mühendisler için net: MCP spesifikasyonuna uymak yeterli değil. Ajan kullanılabilirliği büyük ölçüde bir yazım ve isimlendirme disiplini meselesi; şema, açıklama ve hata mesajı kalitesi, protokol katmanından çok daha belirleyici.