Kimi K3 testi: Çin modelleri kodlamada ucuz, planlamada değil
Kimi K3 benchmark testinde Çin yapay zeka modelleri planlamada pahalı, kodlamada ise 19 kat daha ucuz çıktı. Gerçek maliyet analizi.
Moonshot'ın yeni amiral gemisi Kimi K3, gerçek bir test setine tabi tutuldu: Supabase üzerinde bir CRM veritabanı kurulumu, geçme notu net — test paketi yeşil dönmeden hiçbir şey 'bitti' sayılmıyor. Sonuç, 'ucuz Çin yapay zekası' anlatısını ikiye bölüyor.
Planlayıcı rolünde (görevi görevlere bölen model) Kimi K3 beklenmedik şekilde pahalı çıkıyor: liste fiyatı Batılı rakiplerin üzerinde, çünkü gizli 'düşünme' token'ları tam çıkış fiyatından faturalandırılıyor. GLM-5.2 daha ucuz ama planları zayıf, daha az test üretiyor. DeepSeek V4-Pro makul bir Çin seçeneği ama değer açısından Grok-4.5'e yeniliyor.
Kodu yazan 'doer' rolünde tablo tamamen tersine dönüyor: DeepSeek'in hafif modeli, rakibinden yaklaşık 19 kat daha ucuza aynı testleri geçiyor. Mühendisler için pratik ders net: rolleri ayırın, token başına değil geçen test başına maliyeti ölçün ve kendi araç zincirinizde 'boş yanıt' riskini önceden kontrol edin.