By Daniel Whitmore, MSc in Industrial and Organizational Psychology
باختصار
مؤشرات جودة الأسئلة إحصاءات تحسب من إجابات مرشحين حقيقيين لتخبرك ما إذا كان السؤال يؤدي عمله. وأهمها اثنتان: الصعوبة — نسبة المرشحين الذين يجيبون إجابة صحيحة — والتمييز — مدى قدرة السؤال على فصل المرشحين الأقوياء عن الضعفاء. فالسؤال الذي يصيبه الجميع تقريبا أو يخطئه الجميع تقريبا يحمل معلومة قليلة، والسؤال ضعيف التمييز يعجز عن ترتيب المرشحين أصلا. وكلاهما إشارة إلى مراجعة مفتاح الإجابة وتنقيح الصياغة قبل أن يشكل السؤال قرارا آخر.
السؤال الذي يبدو سليما قد لا يقيس شيئا
أغلب أسئلة التقييم تكتب مرة، وتراجع صياغتها، ثم يوثق بها إلى الأبد. وهذه الثقة في غير محلها — لا لأن المؤلفين مهملون، بل لأن جودة السؤال غير مرئية في نصه. فسؤالان قد يقرآن قراءة حسنة سواء ثم يسلكان سلوكين مختلفين تماما في اللحظة التي يجيب عنهما المرشحون: أحدهما يفصل بنظافة من يعرفون المادة عمن لا يعرفونها، والآخر يشطر القاعة عشوائيا.
وتحليل الأسئلة هو انضباط الحكم على الأسئلة بسلوكها لا بمظهرها. وهو آت من نظرية الاختبار الكلاسيكية، ولبنك عينات عمل لا تحتاج إلا إلى مقياسين منه لالتقاط الأسئلة التي تؤذيك بهدوء: كم السؤال صعب، وكم يميز جيدا. وكلاهما يحسب من إجابات أعطاها مرشحوك أنت سلفا، وهذا ما يجعلهما جديرين بالثقة — فهما يصفان اختبارك أنت، على جمهورك أنت، لا مثالا في كتاب.
وليس المقصود مطاردة رقم مثالي في كل بند. بل إظهار المجموعة الصغيرة من الأسئلة التي تشوه نتائجك فعلا، ليطلع عليها إنسان ويقرر لكل واحدة: إصلاحا أو إبقاء أو إحالة إلى التقاعد. فالبنك الجيد ليس بنكا كل أسئلته بلا عيب؛ بل بنكا أسئلته المعيبة معروفة.
الصعوبة: السهل جدا والصعب جدا كلاهما يكلفك معلومة
الصعوبة، على غرابة تسميتها، ليست إلا نسبة المرشحين الذين يجيبون عن سؤال إجابة صحيحة — فالسؤال الذي يصيبه 70% من الناس صعوبته 0.70. وعملها ليس أن ترتفع أو تنخفض بل أن تكون مفيدة، والطرفان لا يحملان معلومة تذكر. فحين يصيب 95% من المرشحين أو أكثر سؤالا، فهو لم يعد يفصل أحدا: الأقوياء والضعفاء يتجاوزونه جميعا، فيضيف البند طولا بلا إشارة. وقد يظل مكانه في بداية التقييم بوصفه تسخينا، لكنه لا يؤدي عمل قياس.
والطرف المقابل أخطر. فحين يجيب 20% أو أقل إجابة صحيحة، فالشك الأول الصادق ليس أن مرشحيك ضعفاء — بل أن السؤال معطوب. فمفتاح إجابة خاطئ، أو متن ملتبس، أو خياران يمكن الدفاع عنهما، أو مهمة تختبر شيئا لا يحتاجه الدور قط، كلها تدفع نسبة الصواب إلى القاع. والسؤال الصعب فعلا الذي يحله خمس مجموعة قوية سؤال مشروع ونفيس؛ أما السؤال الذي لا يحله أحد تقريبا فله عادة مشكلة تصلحها في دقيقة متى بحثت عنها.
فالصعوبة تقرأ خير ما تقرأ بوصفها زوجا من الحواجز لا هدفا. الأسئلة السهلة جدا مرشحة للتقاعد أو لإعادة التموضع؛ والأسئلة الصعبة جدا مرشحة لفحص المفتاح والصياغة. وكل ما بينهما يؤدي عمله ولا يحتاج إلى انتباهك.
التمييز: هل يفصل السؤال القوي عن الضعيف؟
التمييز أقوى الإشارتين وأكثرهما إفلاتا من انتباه الفرق. وهو يسأل سؤالا واحدا: هل يميل المرشحون الذين يبلون حسنا في هذا البند إلى أن يبلوا حسنا في التقييم كله؟ فحين تكون الإجابة نعم، فالبند يشد في الاتجاه نفسه الذي يشد فيه بقية الاختبار — أي إنه يميز. وحين لا تكون ثمة علاقة، فالبند يقيس شيئا آخر، أو لا يقيس شيئا، مهما بدت قراءته معقولة.
وعمليا، التمييز هو الارتباط بين إصابة بند واحد وبين درجة المرشح الكلية. فالقيم العالية تعني أن الأقوياء يصيبونه والضعفاء يخطئونه، وهذا بالضبط ما تريده. والقيمة القريبة من الصفر تعني أن البند لا يرتب المرشحين البتة. أما القيمة السالبة فهي الإنذار الجدير بالتصرف فورا: فهي تعني أن مرشحيك الأقوى أميل إلى الخطأ في البند — وهي البصمة الكلاسيكية لمفتاح إجابة خاطئ أو حيلة تعاقب من يفهمون المادة أعمق فهم.
وثمة قاعدة إبهام شائعة تعد التمييز دون 0.20 تقريبا رديئا — إذ يكاد البند لا يفصل القوي عن الضعيف ويصير مرشحا للتنقيح. لكن التمييز لا يصير ذا معنى إلا بعد أن يجيب ما يكفي من الناس؛ فهو على ثلاث إجابات ضجيج. ولهذا ينتظر الوسم المسؤول عينة دنيا قبل أن يثق بالرقم، ولهذا لا يدان سؤال جديد قط على مرشحيه الأوائل.
هذه الإشارات تكتسب ولا تخمن
الحد الصادق لتحليل الأسئلة أنه لا يستطيع أن يخبرك بشيء يوم تكتب السؤال. فالصعوبة والتمييز خاصيتان للإجابات، ولذلك فالبند الجديد تماما لا صحة له البتة حتى يجيب عنه المرشحون مرات تكفي ليقول شيئا حقيقيا. وهذه ميزة لا ثغرة: فهي تبقي الإشارات مرتكزة على الأدلة لا على الرأي، وتحمي سؤالا جديدا من أن يحكم عليه قبل أن ينال فرصة عادلة.
وهي تعني أيضا أن جودة الأسئلة عادة صيانة لا بوابة تعبر مرة. فالبنك الذي كان نظيفا قبل سنة ينجرف مع تغير الدور، ومع تحول مجموعة المرشحين، ومع إعادة استعمال الأسئلة عبر التقييمات. والأسئلة الجديرة بالمراقبة هي ذات الاستعمال الحقيقي والإجابات الكافية للثقة — وهي عمليا مجموعة فرعية صغيرة متغيرة من البنك لا البنك كله. فأنت لا تدقق كل شيء؛ بل تقرأ حفنة البنود التي وسمتها البيانات.
كيف تظهر SkillCort هذا: وسم «يحتاج انتباها»
تحسب SkillCort صحة السؤال من إجابات مرشحين حقيقيين عبر كل تقييم يظهر فيه السؤال، وتحول الإشارتين إلى مرشح واحد صريح على بنك أسئلتك: «يحتاج انتباها». ويحط البند هناك حين تظهر البيانات إحدى ثلاث مشكلات ملموسة — تمييز منخفض بعد أن يجيب خمسة أشخاص على الأقل، أو صعوبة عند 95% أو فوقها (سهل جدا)، أو صعوبة عند 20% أو دونها (صعب جدا). ولا يوسم شيء بالحدس، ولا يوسم شيء قبل أن تتوفر له الإجابات التي تبرره.
وكل بند موسوم يحمل سببه في مكانه، مؤشرا إلى جانب السؤال: تمييز منخفض، أو سهل جدا، أو صعب جدا، والأرقام تحته عند التحويم. فالبنك لا يخبرك بأن السؤال ضعيف فحسب — بل يخبرك لماذا، وهذا ما يحول التحذير إلى خطوة تالية. وثمة عرض لتحليلات بنك الأسئلة يجمع الإشارات نفسها على البنك كله، ويضيف أي البنود لديه بيانات تكفي للحكم وأيها لم يستعمل قط، فترى صحة قياسك في لمحة بدل سؤال في كل مرة.
وقاعدة التصميم خلف هذا كله هي القاعدة التي تحكم بقية المنصة: النظام يظهر الإشارة والسبب، والإنسان يتخذ الحكم. ستخبرك SkillCort بأن سؤالا صعب جدا وتريك أن 12% فقط أجابوا عنه إجابة صحيحة؛ ولن تحذف السؤال بصمت ولن تنقض حكمك في ما إذا كانت تلك الصعوبة عيبا أم هي المقصد.
ماذا تفعل حين يوسم سؤال
ابدأ بمفتاح الإجابة، لا سيما في البنود الصعبة جدا وذات التمييز السالب. فنسبة مفاجئة من الأرقام المقلقة تنحل في اللحظة التي تعيد فيها قراءة الإجابة المفتاحية فتدرك أن خيارا ثانيا صحيح أيضا، أو أن الإجابة المقصودة خاطئة. وهذا الفحص الواحد يصلح من البنود الموسومة أكثر مما يصلحه أي قدر من إعادة الكتابة.
وإن كان المفتاح صحيحا، فاقرأ البند كما يقرؤه مرشح مرتبك. فالأسئلة الصعبة جدا وضعيفة التمييز تشترك غالبا في سبب جذري: صياغة ملتبسة، أو إجابتان يمكن الدفاع عنهما، أو متن يختبر بهدوء شيئا خارج المهارة التي قصدت قياسها. وإحكام اللغة حتى تنجو قراءة واحدة فقط يكفي عادة لتحريك الأرقام. أما البنود السهلة جدا فحالتها أرفق — أبقها تسخينا إن كانت تخدم ذلك الغرض، أو أحلها إلى التقاعد ليصرف التقييم وقته حيث يقع القياس فعلا.
وأخيرا، قاوم الرغبة في المبالغة برد الفعل على العينات الصغيرة. فالسؤال الموسوم بقوة حفنة من الإجابات سؤال يراقب لا يدان؛ أعطه مزيدا من المرشحين قبل أن تتصرف. جودة الأسئلة قراءة بطيئة تراكمية، والهدف بنك أسئلته الضعيفة معروفة ومدارة — لا بنك نظف من كل رقم غير مثالي.
أهم النقاط
- جودة السؤال تسكن في كيفية إجابة المرشحين عنه لا في كيفية قراءته — فسؤالان بالنظافة نفسها قد يسلكان سلوكين مختلفين تماما.
- الصعوبة زوج من الحواجز: البنود السهلة جدا (95% فأكثر إجابة صحيحة) لا تضيف إشارة؛ والبنود الصعبة جدا (20% فأقل) تشير عادة إلى سؤال بمفتاح خاطئ أو صياغة ملتبسة.
- التمييز — أن يصيب الأقوياء البند ويخطئه الضعفاء — هو أحد الإشارتين وأمضاهما؛ وما دون 0.20 تقريبا ضعيف، والقيمة السالبة تعني في الغالب مفتاح إجابة خاطئا.
- هذه الإحصاءات تكتسب من إجابات حقيقية، فالأسئلة الجديدة لا صحة لها حتى يجيب عنها ما يكفي من المرشحين؛ والوسم المسؤول ينتظر عينة دنيا.
- مرشح «يحتاج انتباها» في SkillCort يظهر البنود الموسومة وسببها في مكانه (تمييز منخفض / سهل جدا / صعب جدا) — النظام يعرض الإشارة، والإنسان يقرر العلاج.