BenchmarkMetodoloji

Bir ajan tablosu dürüstçe nasıl okunur

Hata payları, oturum sayıları ve neden %4,8 net iyileşme yuvarlama hatası değil.

18 Eylül 2026 · 6 dk okuma · Vincent Loveqcn · Yiğido Lab, İstanbul

Benchmark sayfamızdaki her sayı, Agent Arena “Overall” tablosunun 15 Eylül 2026 anlık görüntüsünden kopyalanmıştır — 46 modelde 1.850.083 oturum. Dört sütun önemli:

  • Net iyileşme — modelin gerçek ajan görevlerinde ürettiği deltalar, işleri kötüleştiren deltalar çıkarılarak.
  • Doğrulanmış başarı — sonucu bağımsız olarak kontrol edilmiş görevler; kendi beyanı değil.
  • Övgü / şikâyet — oturum dökümlerinden çıkarılan duygu oranı.
  • Yönlendirilebilirlik — modelin görev ortasındaki düzeltmeleri ne kadar iyi benimsediği.

± işaretini sayı kadar dikkatli okuyun

GPT 6 Astra %0,47 yönlendirilebilirlik ± 4,67 alıyor. Claude Fable 5.1 ise %3,88 ± 3,61. İki sınır modeli ve iki hata payı da komşu satırlar arasındaki sıralamayı tek bir anlık görüntüde neredeyse anlamsız kılacak kadar büyük. Bu tablonun kusuru değil; ajanları ölçmenin gerçeği.

Bir modelin sahte ilerleme kaydedebileceği tek yer

Övgü-şikâyet oranı, kullanıcıya iltifat eden modelleri ödüllendirir. Net iyileşmeyi taklit etmek daha zordur, çünkü bozuk bir araç çağrısı bozuk bir araç çağrısıdır. Model karşılaştırırken ortadaki iki sütuna ağırlık verin ve en soldaki sütunu hak ettiği şekilde — manşet olarak — değerlendirin.

Kendi satırımızı, kaybettiğimiz satırların yanında ve hata paylarıyla birlikte yayınlamaya devam edeceğiz.