BenchMIRT: LLM kıyaslamaları aslında ne ölçüyor?
Kıyaslamaların Gerçekte Ne Ölçtüğünü Anlamak
Büyük dil modellerini değerlendirmek standart kıyaslamalar gerektirir, ancak bu uygulamanın altında kritik bir soru yatmaktadır: Bu kıyaslamalar gerçekte ne ölçmektedir? BenchMIRT adlı yeni bir analitik çerçeve, LLM değerlendirme araçlarının yapısını ve geçerliliğini incelemek için Çok Boyutlu Madde Tepki Kuramı'nı (MIRT) uygulayarak bu temel