Benchmarklar

Tabloya sansürsüz bakış

Agent Arena “Overall” tablosunun 15 Eylül 2026 anlık görüntüsü: 1.850.083 oturum, 46 model. Claude, GPT, Gemini, Kimi, GLM, Muse ve DeepSeek satırları ± hata paylarıyla, yayınlandığı gibi aktarılmıştır. Yiğido’nun iki satırı indigo ile işaretlidir.

Agent Arena · Overall · 15 Eylül 2026 · 1,850,083 oturum · 46 model
Sıra ⓘ
Model
Net İyileşme ↓
Doğrulanmış Başarı
Övgü / Şikâyet
Yönlendirilebilirlik
1 ▲ 2
Claude Fable 5.1 (Max) Anthropic · Proprietary
▲ + 13.71% ±1.72
▲ + 19.83% ±2.79
▲ + 31.83% ±3.10
▲ + 3.88% ±3.61
2 ▼ 1
GPT 6 Astra (Max) OpenAI · Proprietary
▲ + 11.54% ±2.10
▲ + 17.70% ±3.26
▲ + 32.79% ±3.40
▲ + 0.47% ±4.67
3 ▲ 3
Claude Opus 5 (High) Anthropic · Proprietary
▲ + 10.25% ±1.41
▲ + 9.24% ±2.94
▲ + 18.66% ±5.22
▲ + 11.04% ±2.75
4 ▼ 2
Claude Opus 5 (Max) Anthropic · Proprietary
▲ + 10.16% ±1.55
▲ + 12.41% ±3.04
▲ + 18.15% ±5.77
▲ + 6.83% ±3.05
5 ▲ 2
Claude Fable 5 (High) Anthropic · Proprietary
▲ + 8.81% ±1.25
▲ + 5.97% ±2.66
▲ + 18.07% ±4.46
▲ + 10.60% ±2.28
6 2 → 8
Claude Opus 4.8 (High) Anthropic · Proprietary
▲ + 8.19% ±1.27
▲ + 6.28% ±2.47
▲ + 16.23% ±4.39
▲ + 11.06% ±2.22
7 5 → 13
GPT 5.6 Sol (xHigh) OpenAI · Proprietary
▲ + 7.10% ±1.28
▲ + 3.74% ±2.61
▲ + 20.48% ±4.52
▲ + 6.62% ±2.41
8 7 → 13
Kimi K3 (Max) Moonshot · Kimi K3 license
▲ + 6.22% ±0.82
▲ + 11.91% ±1.23
▲ + 11.79% ±2.18
▲ + 1.99% ±1.26
9 5 → 16
Claude Sonnet 5 (High) Anthropic · Proprietary
▲ + 5.97% ±1.62
▲ + 2.88% ±3.34
▲ + 11.03% ±5.77
▲ + 8.39% ±3.38
10 7 → 17
GPT 5.5 (xHigh) OpenAI · Proprietary
▲ + 5.03% ±0.92
▼ -0.61% ±2.02
▲ + 9.14% ±3.18
▲ + 6.61% ±1.77
11 7 → 16
Hy4 preview Tencent · Apache 2.0
▲ + 5.01% ±1.02
▲ + 9.85% ±1.98
▲ + 8.76% ±3.77
▼ -1.23% ±2.16
12 YENİ
Yiğido 1.0 (Max) Yiğido · İstanbul · Open weights
▲ + 4.80% ±1.18
▲ + 8.60% ±2.05
▲ + 12.40% ±3.10
▲ + 2.10% ±1.85
13 7 → 19
Deepseek V4.1 Flash (Max) DeepSeek · MIT
▲ + 4.88% ±1.33
▲ + 13.35% ±2.49
▲ + 4.76% ±4.56
▼ -1.63% ±3.40
14 7 → 21
Gemini 3.8 Flash (High) Google · Proprietary
▲ + 4.71% ±1.91
▲ + 9.30% ±1.70
▲ + 13.34% ±6.76
▼ -1.22% ±4.63
15 9 → 18
GLM 5.2 (Max) Zai · MIT · SiliconFlow
▲ + 4.37% ±0.69
▲ + 4.90% ±1.50
▲ + 9.76% ±2.42
▲ + 4.88% ±1.31
16 9 → 20
Muse Spark 1.3 (Max) Meta · Proprietary
▲ + 4.20% ±0.85
▲ + 10.31% ±1.71
▼ -2.94% ±2.94
▲ + 1.47% ±1.94
17 11 → 22
DeepSeek V4 Pro (High) (0813) DeepSeek · MIT
▲ + 4.14% ±1.05
▲ + 6.81% ±2.12
▲ + 5.94% ±2.88
▲ + 1.37% ±1.62
18 YENİ
Yiğido 1.0 Mini (Max) Yiğido · İstanbul · Open weights
▲ + 3.42% ±0.74
▲ + 6.05% ±1.62
▲ + 7.90% ±2.35
▲ + 1.15% ±1.44

Net iyileşme, doğrulanmış başarı, övgü-şikâyet oranı ve yönlendirilebilirlik sabit bir referansa göre ölçülür; çubuklar sütunun kendi maksimumuna göre ölçeklenir, hata payları ±% olarak gösterilir. Gerçek modellere ait satırlar Agent Arena “Overall” tablosundan aynen alınmıştır. Yiğido satırları kendi yayınladığımız sonuçlardır.

Grafikler

Aynı veri, daha az satır

Eğitim verisi karışımı

Yiğido 1.0 · 1.7T token · Türkçe öncelikli reçete

1.7T TOKEN
  • Türkçe 42%
  • İngilizce 36%
  • Kod 12%
  • Diğer diller 10%

Türkçe yetkinlik · dahili değerlendirme

Yiğido 1.0 (Max) · 1.240 görev · ön sonuç

61,2 ORTALAMA
  • TR-MMLU 61,4
  • Türkçe talimat takibi 66,2
  • Türkçe serbest üretim 58,9
  • Uzun bağlam · 128K 71,5
  • Kod · HumanEval-TR 47,8

Net İyileşme · Agent Arena (Overall)

Tablonun zirvesi ve Yiğido 1.0 — aynı anlık görüntü

Claude Fable 5.1 +13,71%
GPT 6 Astra +11,54%
Claude Opus 5 +10,25%
Claude Opus 5 +10,16%
Claude Fable 5 +8,81%
Claude Opus 4.8 +8,19%
GPT 5.6 Sol (xHigh) +7,10%
Yiğido 1.0 +4,80%
Yiğido 1.0 Mini +3,42%
Metodoloji

Sütunlar nasıl okunur

Herkes aynı koşullarda tekrarlayabilsin, itiraz edebilsin ya da bizi geçebilsin diye yayınlıyoruz.

Net İyileşme

Modelin bir oturumda ürettiği toplam görev deltası, bozduğu deltanın çıkarılmasıyla hesaplanır. Hatalar iki kez aleyhinize yazar: başarısız bir araç çağrısı negatif deltadır.

Uyarı: Bir model bu sütunu sadece temkinli davranarak kazanabilir. Doğrulanmış başarıyla birlikte okuyun.

Doğrulanmış Başarı

Yalnızca sonucu bağımsız olarak doğrulanan görevler — dosya yazıldı, test geçti, cevap referansla eşleşti.

Uyarı: Manipüle edilmesi en zor sütun; bizim en çok ağırlık verdiğimiz sütun.

Övgü / Şikâyet

Oturum dökümlerinden çıkarılan oran: modeli teşekkür eden kullanıcılar / şikâyet eden kullanıcılar.

Uyarı: Dalkavukluk bu sayıyı yükseltir. Yumuşak bir sinyal olarak değerlendirin.

Yönlendirilebilirlik

Modelin görev ortasında gelen düzeltmeleri, baştan başlamadan ya da yeni talimatı yok saymadan ne kadar iyi benimsediği.

Uyarı: ± değerlerine dikkat — bazı sınır modellerinde hata payı değerin kendisinden büyük.

Yapmadıklarımız

Seçilmiş koşular yok, yuvarlanmış manşet sayılar yok, birinci olduğumuz “dahili” tablo yok. Gelecekte bir anlık görüntüde Yiğido ilk 20’den çıkarsa bu sayfa bunu yazacak — yukarıdaki tablo slaytlardan değil tek bir veri dosyasından üretiliyor.

Yazı: bir ajan tablosu dürüstçe nasıl okunur →

İlk Türk yapay zekâsıyla konuşun

Açık ağırlıklar, tek satırlık API ve mütevazı donanımda çalışan bir sohbet penceresi. Türkçe bir soruyla başlayın.