İçeriğe geç
SkillCort

30 Temmuz 2026 · 7 dk okumaDeğerlendirme kalitesi

Soru kalitesi sinyalleri: değerlendirmenizi sessizce zayıflatan sorular

Değerlendirmenizdeki her soru küçük bir ölçme aracıdır ve her araç gibi bazıları hassastır, bazıları ayarsızdır, birkaçı da hiçbir şey ölçmez. Sorun şu ki bozuk bir soru kâğıt üzerinde iyi bir sorudan ayırt edilemez — kusurlu olduğunu ancak gerçek adayların onu nasıl yanıtladığına bakarak öğrenirsiniz. Madde analizi bunun içindir ve okunması, ününün ima ettiğinden daha basittir.

By Daniel Whitmore, MSc in Industrial and Organizational Psychology

Kısaca

Soru kalitesi sinyalleri, gerçek aday yanıtlarından hesaplanan ve bir sorunun işini yapıp yapmadığını söyleyen istatistiklerdir. En önemli ikisi güçlük — doğru yanıtlayan adayların oranı — ve ayırt ediciliktir — sorunun güçlü adayları zayıflardan ne kadar iyi ayırdığı. Neredeyse herkesin doğru ya da yanlış yaptığı bir soru az bilgi taşır; ayırt ediciliği düşük olan bir soru ise adayları hiç sıralamaz. İkisi de, soru bir kararı daha şekillendirmeden önce cevap anahtarını kontrol etmek ve ifadeyi gözden geçirmek için birer işarettir.

İyi görünen bir soru yine de hiçbir şey ölçmüyor olabilir

Çoğu değerlendirme sorusu bir kez yazılır, ifadesi açısından gözden geçirilir ve sonra sonsuza dek güvenilir sayılır. Bu güven yersizdir — yazarlar özensiz olduğu için değil, bir sorunun kalitesi metninde görünmediği için. İki soru eşit derecede iyi okunabilir ve adaylar yanıtladığı anda tamamen farklı davranabilir: biri konuyu bilenleri bilmeyenlerden temizce ayırır, diğeri odayı rastgele böler.

Madde analizi, soruları görünüşlerine göre değil davranışlarına göre yargılama disiplinidir. Klasik test kuramından gelir ve bir iş örneği bankası için, size sessizce zarar veren soruları yakalamaya ölçütlerinden yalnızca ikisi yeter: sorunun ne kadar zor olduğu ve ne kadar iyi ayırt ettiği. İkisi de kendi adaylarınızın çoktan verdiği cevaplardan hesaplanır; onları güvenilir kılan da budur — bir ders kitabı idealini değil, sizin testinizi kendi kitleniz üzerinde tarif ederler.

Amaç her maddede kusursuz bir sayı kovalamak değildir. Amaç, sonuçlarınızı fiilen bozan küçük soru kümesini yüzeye çıkarmaktır; böylece bir insan onlara bakıp her birini düzeltmeye, tutmaya ya da emekliye ayırmaya karar verebilir. İyi bir banka her sorusu kusursuz olan değil, kusurlu soruları bilinen bankadır.

Güçlük: çok kolay da çok zor da size bilgi kaybettirir

Kafa karıştırıcı biçimde adlandırılmış olan güçlük, aslında bir soruyu doğru yanıtlayan adayların oranıdır — insanların %70'inin doğru yanıtladığı bir sorunun güçlüğü 0,70'tir. İşi yüksek ya da düşük olmak değil, bilgilendirici olmaktır; uçlar ise neredeyse hiç bilgi taşımaz. Adayların %95'i veya fazlası bir soruyu doğru yaptığında, o soru artık kimseyi ayırmaz: güçlü de zayıf da geçer, yani madde sinyal eklemeden uzunluk ekler. Bir değerlendirmenin başında ısınma olarak yeri olabilir, ama ölçme işi yapmıyordur.

Diğer uç daha tehlikelidir. Yalnızca %20 veya daha azı doğru yanıtladığında, dürüst ilk şüphe adaylarınızın zayıf olduğu değil — sorunun bozuk olduğudur. Yanlış anahtarlanmış bir cevap, muğlak bir kök, iki savunulabilir seçenek ya da rolün hiç ihtiyaç duymadığı bir şeyi sınayan bir görev; hepsi doğru oranını dibe indirir. Güçlü bir havuzun beşte birinin hâlâ çözebildiği gerçekten zor bir soru meşru ve değerlidir; neredeyse kimsenin çözemediği bir soruda ise genellikle bakmaya başladığınız an bir dakikada düzeltebileceğiniz bir sorun vardır.

Yani güçlük en iyi bir hedef olarak değil, bir çift korkuluk olarak okunur. Çok kolay sorular emekliye ayrılmaya ya da yer değiştirmeye adaydır; çok zor sorular ise anahtar-ve-ifade kontrolüne. Arada kalan her şey işini yapıyordur ve dikkatinizi gerektirmez.

Ayırt edicilik: soru güçlüyü zayıftan ayırıyor mu?

Ayırt edicilik iki sinyalin daha güçlü olanıdır ve ekiplerin en sık kaçırdığıdır. Tek bir soru sorar: bu maddede iyi yapan adaylar, değerlendirmenin genelinde de iyi yapma eğiliminde mi? Yanıt evetse madde testin geri kalanıyla aynı yöne çekiyordur — ayırt ediyordur. Hiçbir ilişki yoksa, madde başka bir şeyi ya da hiçbir şeyi ölçüyordur; ne kadar makul okunursa okunsun.

Somut olarak ayırt edicilik, bir maddeyi doğru yapmak ile adayın toplam puanı arasındaki ilişkidir. Yüksek değerler güçlü adayların yaptığı, zayıfların kaçırdığı anlamına gelir; tam olarak istediğiniz şey. Sıfıra yakın bir değer, maddenin adayları hiç sıralamadığı anlamına gelir. Negatif bir değer ise hemen harekete geçmeye değer alarmdır: daha güçlü adaylarınızın maddeyi yanlış yapma olasılığının daha yüksek olduğunu söyler — yanlış anahtarlanmış bir cevabın ya da konuyu en derinden anlayanları cezalandıran bir kurnazlığın klasik parmak izi.

Yaygın bir pratik kural, yaklaşık 0,20'nin altındaki ayırt ediciliği zayıf sayar — madde güçlüyü zayıftan zar zor ayırıyordur ve gözden geçirilmeye adaydır. Ama ayırt edicilik ancak yeterli sayıda kişi yanıtladığında anlamlıdır; üç yanıtta gürültüdür. Sorumlu bir işaretlemenin sayıya güvenmeden önce asgari bir örneklemi beklemesinin ve yeni bir sorunun ilk birkaç adayında asla mahkûm edilmemesinin nedeni budur.

Bu sinyaller tahmin edilmez, kazanılır

Madde analizinin dürüst sınırı, bir soruyu yazdığınız gün size hiçbir şey söyleyememesidir. Güçlük ve ayırt edicilik yanıtların özellikleridir; dolayısıyla yepyeni bir maddenin, adaylar gerçek bir şey söyleyecek kadar yanıtlayana dek hiçbir sağlık değeri yoktur. Bu bir boşluk değil bir özelliktir: sinyalleri görüşe değil kanıta bağlı tutar ve yeni bir soruyu adil bir koşu yapmadan yargılanmaktan korur.

Ayrıca madde kalitesinin bir kerelik kapı değil, bir bakım alışkanlığı olduğu anlamına gelir. Bir yıl önce temiz olan bir banka; rol değiştikçe, aday havuzu kaydıkça ve sorular değerlendirmeler arasında yeniden kullanıldıkça kayar. İzlemeye değer sorular, gerçek kullanımı ve güvenecek kadar yanıtı olanlardır — pratikte bu, bankanın tamamı değil, küçük ve değişen bir alt kümesidir. Her şeyi denetlemiyorsunuz; verinin işaretlediği bir avuç maddeyi okuyorsunuz.

SkillCort bunu nasıl gösteriyor: "İlgi bekliyor" işareti

SkillCort madde sağlığını, bir sorunun göründüğü her değerlendirmedeki gerçek aday yanıtlarından hesaplar ve iki sinyali soru bankanızda tek ve sade bir filtreye çevirir: İlgi bekliyor. Bir madde, veri üç somut sorundan birini gösterdiğinde oraya düşer — en az beş kişi yanıtladıktan sonra düşük ayırt edicilik, %95 ve üzeri güçlük (çok kolay) ya da %20 ve altı güçlük (çok zor). Hiçbir şey sezgiyle işaretlenmez ve hiçbir şey gerekçelendirecek yanıtlar birikmeden işaretlenmez.

İşaretlenen her madde gerekçesini sorunun yanında bir etiket olarak taşır: Düşük ayırt edicilik, Çok kolay ya da Çok zor; üzerine gelindiğinde altındaki sayılarla. Yani banka size bir sorunun zayıf olduğunu söylemekle kalmaz — nedenini de söyler; bir uyarıyı bir sonraki eyleme çeviren de budur. Bir soru bankası analitiği görünümü aynı sinyalleri bankanın tamamında toplar ve hangi maddelerin yargılanacak kadar verisi olduğunu, hangilerinin hiç kullanılmadığını ekler; böylece ölçmenizin sağlığını soru soru değil, tek bakışta görürsünüz.

Bütün bunların arkasındaki tasarım kuralı, platformun geri kalanını yöneten kuralla aynıdır: sistem sinyali ve gerekçeyi gösterir, kararı bir insan verir. SkillCort size bir sorunun çok zor olduğunu söyler ve yalnızca %12'sinin doğru yanıtladığını gösterir; soruyu sessizce silmez ve o güçlüğün bir sorun mu yoksa asıl mesele mi olduğuna dair muhakemenizi geçersiz kılmaz.

Bir soru işaretlendiğinde ne yapmalı

Cevap anahtarıyla başlayın; özellikle çok zor ve negatif ayırt edicilikli maddelerde. Endişe verici sayıların şaşırtıcı bir kısmı, anahtarlanmış cevabı yeniden okuyup ikinci bir seçeneğin de doğru olduğunu ya da amaçlanan cevabın yanlış olduğunu fark ettiğiniz anda çözülür. Bu tek kontrol, işaretlenmiş maddelerin çoğunu her türlü yeniden yazmadan daha fazla düzeltir.

Anahtar doğruysa, maddeyi kafası karışmış bir aday gibi okuyun. Çok zor ve düşük ayırt edicilikli sorular çoğu zaman aynı kökü paylaşır: muğlak ifade, iki savunulabilir cevap ya da ölçmek istediğiniz becerinin dışındaki bir şeyi sessizce sınayan bir kök. Dili yalnızca tek bir okuma ayakta kalacak biçimde sıkılaştırmak genellikle sayıları oynatmaya yeter. Çok kolay maddeler daha yumuşak durumdur — bu işlevi görüyorlarsa ısınma olarak tutun ya da emekliye ayırın ki değerlendirme zamanını ölçmenin gerçekten gerçekleştiği yerde harcasın.

Son olarak, küçük örneklemlere aşırı tepki verme dürtüsüne direnin. Bir avuç yanıtın gücüyle işaretlenmiş bir soru, mahkûm edilecek değil izlenecek bir sorudur; harekete geçmeden önce ona daha çok aday verin. Madde kalitesi yavaş ve birikimli bir okumadır; hedef, kusurlu her sayıdan arındırılmış bir banka değil, zayıf soruları bilinen ve yönetilen bir bankadır.

Öne çıkanlar

  • Bir sorunun kalitesi nasıl okunduğunda değil, adayların onu nasıl yanıtladığında yaşar — eşit derecede temiz iki soru tamamen farklı davranabilir.
  • Güçlük bir çift korkuluktur: çok kolay maddeler (%95 ve üzeri doğru) sinyal katmaz; çok zor maddeler (%20 ve altı doğru) genellikle anahtarı yanlış ya da muğlak bir soruya işaret eder.
  • Ayırt edicilik — güçlü adayların maddeyi yapıp zayıfların kaçırması — en keskin sinyaldir; yaklaşık 0,20'nin altı zayıftır ve negatif bir değer neredeyse her zaman yanlış anahtarlanmış bir cevap demektir.
  • Bu istatistikler gerçek yanıtlardan kazanılır; yani yeni sorular yeterli aday yanıtlayana kadar hiçbir sağlık değerine sahip değildir — sorumlu bir işaretleme asgari bir örneklemi bekler.
  • SkillCort'un "İlgi bekliyor" filtresi işaretlenmiş maddeleri gerekçesiyle birlikte gösterir (Düşük ayırt edicilik / Çok kolay / Çok zor) — sistem sinyali gösterir, düzeltmeye bir insan karar verir.

Sık sorulan sorular

Bir değerlendirme sorusu için iyi bir ayırt edicilik değeri nedir?
Pratik kural olarak yaklaşık 0,30'un üzeri sağlıklı, 0,20–0,30 sınırda ve 0,20'nin altı zayıf ve gözden geçirmeye değerdir. Hemen harekete geçilecek olan negatif değerdir — daha güçlü adayların maddeyi yanlış yaptığı anlamına gelir; bu da genellikle yanlış anahtarlanmış bir cevaba ya da yanıltıcı bir köke işaret eder.
Neredeyse herkesin doğru yaptığı bir soru neden sorun olsun?
Çünkü artık adayları ayırmıyor. %95 veya fazlası doğru yanıtlıyorsa güçlü de zayıf da geçiyordur; yani madde bilgi eklemeden değerlendirmeyi uzatır. Böyle sorular ısınma olarak iş görebilir, ama ölçme yapmıyorlardır — ve bunlarla dolu bir banka, hassas görünen ama pek az şeyi ayıran puanlar üretir.
Bir maddenin istatistiklerine güvenmem için kaç yanıt gerekir?
Sayıların gürültü olmayacağı kadar. Özellikle ayırt edicilik bir avuç cevapta kararsızdır; SkillCort'un düşük ayırt ediciliği işaretlemeden önce asgari bir örneklemi — en az beş yanıtı — beklemesinin ve yepyeni bir sorunun ilk birkaç adayında yargılanmamasının nedeni budur. Güçlük daha erken oturur ama yine de harekete geçmeden önce mütevazı bir örneklemi hak eder.
Çok zor bir soru adaylarımın zayıf olduğu anlamına mı gelir?
Nadiren. Yalnızca küçük bir kesim doğru yanıtladığında ilk şüphe havuz değil soru olmalıdır: yanlış anahtarlanmış bir cevap, muğlak bir kök ya da iki savunulabilir seçenek doğru oranını aşağı çeker. Önce anahtarı ve ifadeyi kontrol edin; güçlü adayların beşte birinin hâlâ çözebildiği gerçekten zor bir soru meşru ve yararlıdır.
Zayıf soruları otomatik düzeltmek için yapay zekâya güvenebilir miyim?
Yapay zekâ bulmanıza ve taslak çıkarmanıza yardım edebilir — tuhaf görünen maddeleri işaretleyerek ve daha net ifadeler önererek — ama bir soruyu değiştirme, tutma ya da emekliye ayırma kararı sizde kalır. SkillCort sinyali ve gerekçeyi gösterir; cevap anahtarını bir insan doğrular ve zor bir sorunun bir kusur mu yoksa amaçlanan zorluk mu olduğuna o karar verir. Ölçme kararı asla otomatikleştirilmez.

İşe alım ekipleri için

Soru bankanızın sağlığını tek bakışta görün

SkillCort güçlüğü ve ayırt ediciliği gerçek aday yanıtlarından okur ve bakılması gereken soruları gerekçesiyle birlikte işaretler; böylece neyi düzelteceğinizi bilirsiniz. Madde analitiğini ve "İlgi bekliyor" filtresini gerçek bir banka üzerinde görmek için demo planlayın.