İçeriğe geç
SkillCort

7 min · 7 stepsDeğerlendirme eğitimi

Değerlendirici kalibrasyon oturumu nasıl yürütülür

Ortak bir rubrik değerlendiricileri aynı sayfaya getirir; kalibrasyon ise onu gerçekten aynı biçimde okuduklarını kanıtlar. Bu eğitim kısa ve yapılandırılmış bir oturumu anlatıyor — referans yanıtların bağımsız puanlanması, ölçüt bazlı bir karşılaştırma ve belgelenmiş anlaşmalar — ve bu oturum, gerçek adaylar onlara bağlı hâle gelmeden önce çok değerlendiricili puanları karşılaştırılabilir kılar.

What you'll need

  • Değerlendirmeye iliştirilmiş bitmiş bir rubrik (dondurulmuş bir anlık görüntü)
  • Farklı kalite düzeylerini kapsayan 2–3 referans yanıt
  • Adayları puanlayacak tüm değerlendiriciler, birlikte 45–60 dakika
  • Üzerinde anlaşılan yorumları kaydedecek, panelle paylaşılan bir yer

Step 1: İki ya da üç referans yanıt seçin

Anlaşmazlığı görünür kılacak yanıtlar seçin: biri açıkça güçlü, biri açıkça zayıf ve — en önemlisi — biri gerçekten sınırda. Meslektaşlardan gelen pilot koşu yanıtları iyi çalışır; inceleme pencereniz puanlamanın kalibrasyondan sonra başlamasına izin veriyorsa erken aday yanıtları da işe yarar.

Kalibrasyonun hakkını verdiği yer sınırdaki yanıttır. Herkes mükemmellikte ve başarısızlıkta anlaşır; paneller bir ölçütte güçlü, bir başkasında sallantılı olan yanıtta ikiye bölünür. Referanslarınızın hiçbiri bu gerilimi üretmiyorsa üreten bir tane yazın.

Step 2: Kimse puanlamadan önce paneli rubrik konusunda bilgilendirin

Paneli rubrikte birlikte gezdirin: her ölçüt, çıpalanmış düzey tarifleri ve ağırlığı. Amaç herhangi bir yanıt üzerinde değil, ölçüt üzerinde ortak anlayıştır — referansları henüz tartışmayın. Muğlak çıpa diline dair soruları şimdi, hiçbir puan söz konusu değilken davet edin.

Panele SkillCort'ta matris puanlamanın nasıl işlediğini hatırlatın: her ölçüt için tarifi yanıtla eşleşen düzey kartına tıklarsınız ve o düzeyin puanı kaydedilir. En önemli yönerge şudur: iyi bir cevabın nasıl görünmesi gerektiğine dair kendi özel hissinize göre değil, yazılı çıpalara göre puanlayın.

Step 3: Referansları bağımsız puanlayın

Her değerlendirici her referans yanıtı, tartışmadan, ortak rubriği kullanarak yalnız puanlar. Bütün mesele bağımsızlıktır — oturum panelin doğal olarak nasıl ayrıştığını ölçer ve puanlar kesinleşmeden önce yapılan her istişare bu ölçümü yok eder. Herkese çalışmak için aynı sessiz pencereyi verin ve her puan gelene kadar tüm karşılaştırmaları bekletin.

Değerlendiricilerden her ölçüt puanına, seçtikleri düzeyi gerekçelendiren kanıtı yanıttan alıntılayan kısa bir not eklemelerini isteyin. SkillCort'ta notlar puanlara kanıt olarak iliştirilir ve bu oturumda "anlaşamıyoruz"u "bu çıpayı farklı okuyoruz"a — verimli anlaşmazlık türüne — çeviren şey onlardır.

Step 4: Puanları toplam üzerinden değil, ölçüt bazında karşılaştırın

Puanları bir araya getirin ve ölçüt ölçüt karşılaştırın. Toplamlar hikâyeyi gizler: iki değerlendirici iki ölçütü zıt biçimde okuyarak benzer genel puanlara varabilir; bu da uyuşmalarının kalibrasyon değil şans olduğu anlamına gelir. Ölçüt bazlı farklar yorumların tam olarak nerede ayrıldığını gösterir.

Yayılım gösteren her ölçütte, ayrışan değerlendiricilerin kanıt notlarını yüksek sesle okumasını isteyin — notlar, her kişinin bir düzey seçerken gerçekte neye baktığını gösterir ve bu, sayıları tartışmaktan çok daha yararlıdır. Neredeyse her boşluk birkaç örüntüden birine çözülür ve örüntüyü adlandırmak size neyi düzelteceğinizi söyler.

  • İki okumayı da destekleyen muğlak bir çıpa — dilin yorumunu sıkılaştırın
  • Komşu bir ölçütün kanıtını puanlayan bir değerlendirici — sınırı yeniden ifade edin
  • Geçmiş deneyimden getirilmiş özel bir ölçüt — yazılı çıpaya dönün
  • Sınırdaki işte gerçek muhakeme farkları — bir teamülde anlaşın

Step 5: Çıpalarda anlaşın ve her yorumu belgeleyin

Her ayrışmayı açık bir anlaşmaya bağlayın: bu tür bir yanıt hangi düzeyi hak eder ve neden. Anlaşmaları ortak bir kalibrasyon notuna yazın — çıpa açıklamaları, ölçütler arası sınır kuralları, yinelenen sınır durumları için teamüller. Belgelenmemiş anlaşmalar bir hafta içinde buharlaşır ve sonradan katılan bir değerlendiriciye asla ulaşmaz.

İliştirilmiş rubriğin dondurulmuş bir anlık görüntü olduğunu unutmayın; yani değerlendirme ortasında çıpaları yeniden yazmıyor, yorumlarını belgeliyorsunuz — hâlihazırda değerlendirilmiş adaylar için puanlamayı tutarlı tutan şey de budur. Gerçek ifade düzeltmelerini bankanızdaki rubriğe geri besleyin ki bir sonraki değerlendirme daha keskin bir sürüm iliştirsin.

Step 6: Hizalanmayı doğrulamak için bir referansı yeniden puanlayın

Oturumu, herkesin belgelenmiş anlaşmaları uygulayarak bir yanıtı daha bağımsız puanlamasıyla kapatın — varsa taze bir referans, yoksa yine sınırdaki vaka. Ölçüt bazlı yayılım gözle görülür biçimde daraldıysa panel adayları puanlamaya başlayacak kadar kalibredir.

Bir ölçüt hâlâ paneli ikiye bölüyorsa sorunu ortalamayla yok etmeyin. Süregelen bir bölünme, çıpanın ya da anlaşmanın hâlâ muğlak olduğu anlamına gelir; çözülmemiş bir anlaşmazlığı her adayın puanına göndermek yerine o tek ölçüde on dakika daha harcayın.

Step 7: İnceleme penceresi boyunca kayma kontrolleri planlayın

Kalibrasyon çürür. Uzun bir inceleme penceresinde değerlendiriciler kayar — güçlü yanıtlar beklentileri yeniden ayarladıkça ölçütler yükselir ya da yorgunlukla gevşer. Kısa kayma kontrolleri planlayın: periyodik olarak yakın zamanda puanlanmış bir yanıt seçin, ikinci bir değerlendirici onu kör puanlasın, sonra tam oturumdaki gibi ölçüt bazlı farkları karşılaştırın.

Yapay zekâ desteğinin kendi şeridinde kaldığı yer de burasıdır. SkillCort'un yapay zekâsı özetler ve ölçüt düzeyinde puan önerileri taslayabilir; bu incelemeyi hızlandırır — ama her puanı adı belli bir kişi onaylar ya da geçersiz kılar ve kayma kontrolleri insanları doğrular; çünkü karar onların muhakemesine dayanacaktır. Bir kayma kontrolü yeni bir ayrışma ortaya çıkarırsa kısaca yeniden toplanın.

Pro tips

  • İnceleme penceresi açılmadan önce kalibre edin, adayların yarısı puanlandıktan sonra değil — yarı yolda yeniden kalibre etmek iki ayrı puan popülasyonu yaratır.
  • Oturumu 45–60 dakikada tutun; üç yanıt üzerinde sıkı bir oturum, rubrik yeniden tasarımına dağılan uzun bir oturumu yener.
  • En kıdemli kişinin ilk puanlamasına ya da karşılaştırmalarda ilk konuşmasına asla izin vermeyin — mekanizma bağımsızlıktır, düşmanı hiyerarşidir.
  • Kalibrasyon notunu değerlendirmenin yanında saklayın ki gelecekteki her değerlendirici üzerinde anlaşılan yorumları devralsın.
  • Bir değerlendiricinin tüm ölçütlerde tutarlı biçimde daha sert olmasına dikkat edin — bu bir rubrik sorunu değil, konuşulacak kişisel bir taban çizgisidir.

Sık sorulan sorular

Kaç referans yanıta ihtiyacımız var?
İki ya da üç yeter: bir güçlü, bir zayıf ve bir sınırda olan. İşin çoğunu sınırdaki yanıt yapar; çünkü değerlendiricilerin çıpa yorumlarının gerçekten ayrıştığı yer orasıdır. Daha fazla referans, sinyalden hızlı biçimde zaman ekler.
Neden toplam puanları değil ölçüt bazını karşılaştırıyoruz?
Toplamlar, altındaki muhakemeler çelişirken uyuşabilir — iki değerlendirici iki ölçütü zıt okuyarak aynı sayıya varabilir. Değerlendirici puanları ağırlıklar birleştirmeden önce her ölçüt içinde ortalandığı için, nihai puanları anlamlı kılan şey ölçüt düzeyindeki uyuşmadır.
Kalibrasyon kötü bir çıpayı açığa çıkarırsa rubriği değiştirebilir miyiz?
Canlı bir değerlendirmeye iliştirilmiş rubrik dondurulmuş bir anlık görüntüdür; bu yüzden mevcut değerlendirme için üzerinde anlaşılan yorumu belgeleyin ve ifadeyi gelecekteki değerlendirmeler için rubrik bankanızda düzeltin. Bu, adaylar için puanlamayı tutarlı tutarken iyileştirmenin de yerine ulaşmasını sağlar.
Yapay zekâ puan önerileri kalibrasyon ihtiyacını ortadan kaldırır mı?
Hayır. Yapay zekâ özet ve ölçüt düzeyinde öneri taslayabilir; ama her puanı adı belli bir kişi onaylar ya da geçersiz kılar — kararın dayandığı şey insan muhakemesidir, dolayısıyla kalibre edilmesi gerekenler insanlardır. Yapay zekâ taslakları incelemeyi hızlandırır; tutarlı kılmaz.
Kayma kontrollerini ne sıklıkla yapmalıyız?
İnceleme penceresine göre: birkaç günlük bir pencere yalnızca pencere ortasında tek bir kör yeniden puanlama gerektirebilirken, birkaç haftalık bir pencere periyodik bir ritmi hak eder. Kontrolün kendisi ucuzdur — bir yanıt, bir kör ikinci puan, bir ölçüt bazlı karşılaştırma.

For hiring teams

Her değerlendiriciyi — en iyi anlamda — birbirinin yerine geçebilir kılın

SkillCort'un ortak rubriklerinin, kanıt notlarının ve adı belli değerlendirici puanlamasının çok inceleyicili bir paneli ilk adaydan sonuncuya kadar nasıl tutarlı tuttuğunu görün. Demo planlayın.

Değerlendirici Kalibrasyon Oturumu Nasıl Yürütülür | SkillCort