By Daniel Whitmore, MSc in Industrial and Organizational Psychology
Kısaca
Değerlendirici kalibrasyonu, puanlayıcıların aynı örnek yanıtları ortak bir rubriğe göre bağımsız puanladığı, puanlarını ölçüt ölçüt karşılaştırdığı ve hiçbir gerçek aday incelenmeden önce her düzeyin ne anlama geldiğinde anlaştığı kısa bir çalışma oturumudur. Rubrik puanlarını değerlendiriciler arasında tutarlı kılmanın en etkili yoludur — ve periyodik yeniden kontroller gerektirir; çünkü puanlayıcı kayması zamanla geri sızar.
Rubrik puanları neden kayar
Puanlayıcı kayması bir karakter kusuru değil; çok değerlendiricili her sürecin varsayılan hâlidir. Her inceleyici, en son işe aldığı ekibin, hatırladığı en güçlü adayın ve kusurlu cevaplara kendi toleransının biçimlendirdiği özel bir iç ölçütle gelir. Bir rubrik bu değişkenliği daraltır, ama "net bir sonraki adım" ya da "uygun üslup" gibi sözcükler yine de yoruma yer bırakır — ve kayma, yorumun yaşadığı yerdir.
Kayma zamanla da birikir. Bir haftada yirmi iç satış rol-oyunu puanlayan bir değerlendirici, rubriğe göre değil partiye göre not vermeye başlar: üç zayıftan sonra vasat bir keşif görüşmesi güçlü görünür. Başkaları teslim tarihi baskısı altında sertliğe ya da cömertliğe kayar. Bunların hiçbiri puanların kendisinde görünmez; tehlikeli olmasının nedeni de tam budur — bir inceleyiciden gelen 4 ile bir başkasından gelen 4 iki farklı adayı tarif edebilir.
Çözüm daha ayrıntılı bir rubrik değildir. Belirli bir noktadan sonra ek rubrik ayrıntısı, uyum eklemeden okuma yükü ekler. Çözüm kalibrasyondur: değerlendiricilere aynı işi puanlatmak, farklarını yüzeye çıkarmak ve hepsinin sonradan gösterebileceği ortak bir ölçütte anlaşmalarını sağlamak — hem de canlı bir adayın sonucu, kimin okumasının baskın geldiğine bağlanmadan önce.
Kalibrasyon oturumu, adım adım
Herhangi bir canlı puanlama başlamadan önce yapılandırılmış tek bir oturum yürütün. Asıl göreve verilmiş iki ya da üç gerçek yanıt seçin — diyelim ki bir adayın öfkeli bir müşteriye yazdığı yanıt ya da bir satış rolü için kaydedilmiş bir itiraz karşılama alıştırması. Bilinçli seçin: biri açıkça güçlü, biri açıkça zayıf, biri gerçekten sınırda. Kalibrasyonun hakkını verdiği yer sınırdaki örnektir.
Oturumun kendisi basit bir sırayı izler ve sıra önemlidir. Bağımsız puanlama önce gelmelidir; bir değerlendirici konuştuğu anda diğerleri o görüşe demir atar ve alıştırma uyumu değil uymayı ölçmeye başlar. Üç dört değerlendiricilik bir panel için yaklaşık bir saat ayırın ve oturumu isteğe bağlı bir ek değil, değerlendirmeyi yayına almanın parçası sayın.
- Her değerlendirici her örneği rubriğe göre bağımsız puanlar; ölçüt başına yazılı gerekçeyle — henüz tartışma yok.
- Tüm puanları aynı anda açın ve yalnızca aday başına değil, ölçüt başına farkları hesaplayın.
- Yalnızca puanların bir düzeyden fazla ayrıştığı ölçütleri tartışın; uyuşmanın söze ihtiyacı yok.
- Her anlaşmazlık için rubrik düzeyinin gerçekte ne gerektirdiğine karar verin ve sözcükler iki okumaya izin verdiyse tanımı yeniden yazın.
- Tartışılan örnekleri, üzerinde anlaşılan puanları ve gerekçeleriyle birlikte rubriğe iliştirilmiş çıpa örnekler olarak saklayın.
İnsanları değil, farkları tartışın
Puanlar açıldıktan sonraki konuşma asıl meseledir ve öngörülebilir bir biçimde bozulur: kimin haklı olduğu tartışmasına döner. Yeniden çerçeveleyin. Soru asla "bunu neden 2 puanladın?" değil, "yanıtta ne, rubrikte ne seni oraya götürdü?" olmalıdır. İki değerlendirici de genellikle rubriği sadakatle uyguluyordur — ama onun farklı okumalarına.
Farkların çoğu üç nedenden birine gider: rubrik tanımı muğlaktır, değerlendiriciler alt ölçütleri farklı ağırlıklandırır ya da bir inceleyici rubriğin hiç kapsamadığı bir şeyi puanlıyordur; muhakemeyi ölçmesi gereken bir görevde yazım hataları gibi. Hangi nedene baktığınızı adlandırmak, bir tartışmayı bir düzenlemeye çevirir. Muğlaklık yeniden yazılmış bir tanım alır; gizli ağırlıklandırma açık edilir; kapsam dışı ölçütler açıkça dışarıda bırakılır.
Her tartışmayı bir ürünle bitirin. Yalnızca hoş bir sohbet üreten bir kalibrasyon oturumunun bir ay içinde tekrarlanması gerekecektir. Daha keskin tanımlar ve saklanmış çıpa örnekler üreten bir oturum ise panele her yeni değerlendirici katıldığında ve sınırdaki her aday grubu bir düzeyin tam ifadesine geri döndürdüğünde karşılığını verir.
Rubriği gerçek yanıtlarla çıpalayın
Soyut tanımlar kaymayı davet eder; somut örnekler ona direnir. Önemli olan her puan düzeyi için — genellikle işe alım kararlarının asıl döndüğü "kabul edilebilir" ile "güçlü" arasındaki sınır — kalibrasyondan gerçek ve anonimleştirilmiş bir yanıtı ve neden o düzeyde durduğunu açıklayan bir cümleyi iliştirin. "3, çözüm önermeden önce müşterinin öfkesini kabul eder; bu yanıt bunu yapıyor ama sonraki adımı gömüyor" bir paragraf dolusu sıfattan değerlidir.
Çıpalar değerlendiricilerin çalışma biçimini değiştirir. "Bu cevap ne kadar iyi?" — kişisel ölçütleri davet eden bir soru — sormak yerine "bu, 3'ün çıpasına mı yoksa 4'ün çıpasına mı daha yakın?" diye sorarlar. Karşılaştırma, mutlak derecelendirmeden çok daha güvenilir bir muhakemedir ve paneldeki herkes için aynı muhakemedir; altı ay sonra katılıp özgün oturuma hiç girmemiş değerlendirici dahil.
Sürekli örneklem kontrolleri: kalibrasyon tek seferlik bir olay değil
Tek bir kalibrasyon oturumu ölçütü kurar; onu korumaz. Kayma hacimle, zamanla ve panelde değişimle geri sızar. Bakım ritüeli hafiftir: düzenli bir kadansla, zaten puanlanmış az sayıda yanıtı ikinci bir değerlendiriciye kör olarak yönlendirin ve karşılaştırın. Hattı yeniden puanlamıyorsunuz — anlaşmazlık için örnekliyorsunuz.
Tek tek kaçırmaları değil, örüntüyü izleyin. Sınırdaki bir yanıtta iki puanlık tek bir fark normaldir; aynı değerlendirici çifti arasındaki tutarlı bir düzeylik boşluk kaymadır ve çiftler arasında sürekli anlaşmazlık üreten bir ölçüt, insan sorunu değil rubrik sorunudur. Bir örüntü belirdiğinde yalnızca o ölçütte kısa bir yeniden kalibrasyon yürütün — bir örneği puanlayın, tartışın, tanımı sıkılaştırın. Yirmi dakika; bir atölye değil.
Bir değerlendirme platformunun hakkını verdiği yer de burasıdır: her puan gerekçesiyle birlikte rubriğe karşı kaydedildiğinde, değerlendirici bazlı örüntüler anekdot olmaktan çıkıp görünür olur ve örneklem kontrolü, uzun bir puanlama döngüsünün sonunda kurduğunuz bir tablo değil, okuduğunuz bir rapor hâline gelir. Ritüel ne kadar hafifse, yoğun bir işe alım sezonuyla temasta hayatta kalma ihtimali o kadar yüksektir.
İki puanlayıcı canlı bir adayda anlaşamadığında
Gerçek bir adayda anlaşmazlık sürecin başarısızlığı değildir — sürecin gerçekten sınırda bir kararı yüzeye çıkarmasıdır. Yanlış tepkiler tembel olanlardır: puanları sessizce ortalamak ya da kıdemli değerlendiricinin varsayılan olarak kazanmasına izin vermek. Ortalama anlaşmazlığı gizler; kıdem, meseleyi kanıtla değil hiyerarşiyle çözer. İkisi de sizi puanı sonradan açıklayamaz durumda bırakır.
Bunun yerine, kayda değer bir anlaşmazlığı bir tetikleyici sayın. İki değerlendirici gerekçelerini rubriğe ve çıpalarına karşı karşılaştırır; ikisi de aynı tanımı gösterdiğinde boşlukların çoğu dakikalar içinde çözülür. Yine anlaşamazlarsa, yanıtı ilk iki puanı görmeden kör puanlayan üçüncü bir değerlendirici katın ve tartışma üç bağımsız okumadan yürüsün.
Çözüm ne olursa olsun kaydedin: özgün puanlar, gerekçeler ve nihai puanın neden orada durduğu. O kayıt, sınırdaki bir kararı bir işe alım yöneticisine — ya da adayın gelecekteki savunucusuna — açıklanabilir kılan şeydir ve çözülen her anlaşmazlık çıpa kütüphanesine aday olur; böylece aynı tartışmanın iki kez yapılması gerekmez.
Öne çıkanlar
- Puanlayıcı kayması, çok değerlendiricili her süreçte varsayılan durumdur; rubrikler bunu daraltır, ama yalnızca kalibrasyon kapatır.
- Canlı puanlamadan önce bir kalibrasyon oturumu yürütün: önce bağımsız puanlar, sonra yalnızca farkların tartışılması, sonra sözcüklerin iki okumaya izin verdiği yerde rubriğin düzeltilmesi.
- Çıpa örnekler — puan düzeylerine iliştirilmiş gerçek yanıtlar — mutlak derecelendirmeyi karşılaştırmaya çevirir; karşılaştırma çok daha tutarlıdır.
- Uyumu hafif ve düzenli kör örneklem kontrolleriyle koruyun ve bir örüntü belirdiğinde tek bir ölçütü yeniden kalibre edin.
- Canlı bir anlaşmazlığı asla ortalamayla yok etmeyin: gerekçeleri karşılaştırın, gerekirse kör bir üçüncü okuma ekleyin ve nasıl çözüldüğünü kaydedin.
