TRLawBench
Türk hukuku LLM benchmarkı: Büyük dil modellerinin Türkçe hukuki bilgi ve muhakeme yetkinliğini 3 aşamada ölçer. ÖSYM soruları, ileri düzey muhakeme ve açık uçlu analizle toplam 297 soru üzerinde kapsamlı değerlendirme.
Genel Bakış
TRLawBench, büyük dil modellerinin (GPT, Claude, Gemini, Gemma, Qwen, Grok, DeepSeek, Mistral, Llama ve diğerleri) Türk hukuku üzerindeki yetkinliğini ölçmek için tasarlanmış üç aşamalı açık bir benchmark projesidir. Avukat Esat Erbil Tavus ile ortak hazırlanan Aşama 2 ve Aşama 3 soruları, basılı kaynaklardan derlenip internete hiç düşmediği için modellerin eğitim verilerine sızma riski bulunmamaktadır.
Neden TRLawBench?
- Türkçe hukuki muhakeme odağı: Genel dil becerisi değil, Türk Borçlar Kanunu, TCK, Anayasa gibi ulusal mevzuat üzerinden değerlendirme.
- Kirlilikten arınmış test seti: 200 soru basılı kaynaklardan geliyor; model eğitim verisinde olma olasılığı yok.
- Şeffaf metodoloji: Doğru cevap tespiti deterministik; LLM yargıç yalnızca muhakeme kalitesini puanlıyor ve hangi modelin cevap verdiğini bilmiyor.
Değerlendirme Metodolojisi
- Aşama 1: Temel Hukuki Bilgi. ÖSYM hukuk sınavlarından 97 çoktan seçmeli soru. Doğru cevap ÖSYM anahtarı baz alınarak belirlenir.
- Aşama 2: Türk Hukuku İleri Muhakeme. 14 kategoride 100 ileri düzey çoktan seçmeli soru. Basılı kaynak, internet dışı.
- Aşama 3: Açık Uçlu Sorular. 100 açık uçlu soru, 14 hukuk dalı. Deterministik doğru-cevap kontrolü + Gemini 3.1 Pro kör yargıç puanlaması (0 ile 10 arasında).
Her aşama için sıralama, doğruluk oranı ve örnek soru-cevaplar yukarıdaki interaktif panelde yer almaktadır.
Açık Uçlu Sorular
Av. Esat Erbil Tavus ile hazırladığımız üçüncü aşama, 14 farklı hukuk dalında kategorize edilmiş 100 açık uçlu hukuki sorudan oluşur. Sorular çeşitli basılı kaynaklardan derlendiği ve internette yer almadığı için modellerin eğitim verilerine dahil olma ihtimali bulunmuyor. Her bir soru; gerekçelendirme, mevzuat ve içtihat atfı içeren serbest metin formatında yanıtlar üretilmesini gerektirir.
Doğru cevap sayısı deterministik olarak belirlenir: Her sorunun soru bankasında kesin bir doğru cevabı vardır ve modelin ulaştığı harf bu cevapla karşılaştırılır. Değerlendirmede LLM yargıç devrede olmadığı için self-bias olasılığı yoktur. Gemini 3.1 Pro (kör yargıç olarak, cevabı veren modelin kimliğini bilmeden) her yanıtı ayrıca 0 ile 10 arasında puanlar: İstenen muhakeme yolunu eksiksiz takip eden doğru cevaplar 10 alır; muhakeme sürecinde eksiklik bulunan doğru cevaplar 10'dan az alır; yanlış sonuca ulaşsa bile muhakemesi büyük ölçüde doğru olan yanıtlar ise 0'ın üzerinde puan alabilir. Değerlendirme Nisan 2026'da yapıldı.