Tabloya sansürsüz bakış
Agent Arena “Overall” tablosunun 15 Eylül 2026 anlık görüntüsü: 1.850.083 oturum, 46 model. Claude, GPT, Gemini, Kimi, GLM, Muse ve DeepSeek satırları ± hata paylarıyla, yayınlandığı gibi aktarılmıştır. Yiğido’nun iki satırı indigo ile işaretlidir.
Net iyileşme, doğrulanmış başarı, övgü-şikâyet oranı ve yönlendirilebilirlik sabit bir referansa göre ölçülür; çubuklar sütunun kendi maksimumuna göre ölçeklenir, hata payları ±% olarak gösterilir. Gerçek modellere ait satırlar Agent Arena “Overall” tablosundan aynen alınmıştır. Yiğido satırları kendi yayınladığımız sonuçlardır.
Aynı veri, daha az satır
Eğitim verisi karışımı
Yiğido 1.0 · 1.7T token · Türkçe öncelikli reçete
- Türkçe 42%
- İngilizce 36%
- Kod 12%
- Diğer diller 10%
Türkçe yetkinlik · dahili değerlendirme
Yiğido 1.0 (Max) · 1.240 görev · ön sonuç
- TR-MMLU 61,4
- Türkçe talimat takibi 66,2
- Türkçe serbest üretim 58,9
- Uzun bağlam · 128K 71,5
- Kod · HumanEval-TR 47,8
Net İyileşme · Agent Arena (Overall)
Tablonun zirvesi ve Yiğido 1.0 — aynı anlık görüntü
Sütunlar nasıl okunur
Herkes aynı koşullarda tekrarlayabilsin, itiraz edebilsin ya da bizi geçebilsin diye yayınlıyoruz.
Net İyileşme
Modelin bir oturumda ürettiği toplam görev deltası, bozduğu deltanın çıkarılmasıyla hesaplanır. Hatalar iki kez aleyhinize yazar: başarısız bir araç çağrısı negatif deltadır.
Uyarı: Bir model bu sütunu sadece temkinli davranarak kazanabilir. Doğrulanmış başarıyla birlikte okuyun.
Doğrulanmış Başarı
Yalnızca sonucu bağımsız olarak doğrulanan görevler — dosya yazıldı, test geçti, cevap referansla eşleşti.
Uyarı: Manipüle edilmesi en zor sütun; bizim en çok ağırlık verdiğimiz sütun.
Övgü / Şikâyet
Oturum dökümlerinden çıkarılan oran: modeli teşekkür eden kullanıcılar / şikâyet eden kullanıcılar.
Uyarı: Dalkavukluk bu sayıyı yükseltir. Yumuşak bir sinyal olarak değerlendirin.
Yönlendirilebilirlik
Modelin görev ortasında gelen düzeltmeleri, baştan başlamadan ya da yeni talimatı yok saymadan ne kadar iyi benimsediği.
Uyarı: ± değerlerine dikkat — bazı sınır modellerinde hata payı değerin kendisinden büyük.
Yapmadıklarımız
Seçilmiş koşular yok, yuvarlanmış manşet sayılar yok, birinci olduğumuz “dahili” tablo yok. Gelecekte bir anlık görüntüde Yiğido ilk 20’den çıkarsa bu sayfa bunu yazacak — yukarıdaki tablo slaytlardan değil tek bir veri dosyasından üretiliyor.
Yazı: bir ajan tablosu dürüstçe nasıl okunur →İlk Türk yapay zekâsıyla konuşun
Açık ağırlıklar, tek satırlık API ve mütevazı donanımda çalışan bir sohbet penceresi. Türkçe bir soruyla başlayın.