By Daniel Whitmore, MSc in Industrial and Organizational Psychology
ひとことで言うと
設問の品質のシグナルとは、実際の候補者の回答から計算される統計で、その設問が役目を果たしているかどうかを教えてくれます。いちばん効くのは二つ。難易度 — 正解した候補者の割合 — と、識別力 — その設問が強い候補者と弱い候補者をどれだけよく分けるか、です。ほぼ全員が正解する、あるいはほぼ全員が誤る設問はほとんど情報を運びません。識別力の低い設問は、候補者をまったく並べ替えられていません。どちらも、その設問が次の決定を形づくる前に、答えの鍵を確かめ、言い回しを直すべきだという合図です。
きちんと見える設問でも、何も測っていないことがあります
アセスメントの設問はたいてい、一度書かれ、言い回しを点検され、そのあとは永遠に信頼されます。その信頼は的外れです。書き手が雑だからではなく、設問の品質はその文面には見えないからです。二つの設問が同じくらいよく読めて、候補者が答えた瞬間にまるで違う振る舞いをすることがあります。一方は内容を分かっている人と分かっていない人をきれいに分け、もう一方は部屋を無作為に二分するのです。
項目分析とは、設問を見た目ではなく振る舞いで判断する規律です。古典的テスト理論から来ていますが、ワークサンプルのバンクなら、あなたを静かに傷つけている設問を捉えるのに、その測度のうち二つで足ります。その設問がどれだけ難しいか、そしてどれだけよく識別するか。どちらも、あなたの候補者がすでに出した答えから計算されます。だからこそ信頼できます — 教科書の理想ではなく、あなたの母集団の上の、あなたのテストを言い表しているのです。
目指すのは、すべての設問で完璧な数字を追うことではありません。結果を実際にゆがめている少数の設問を浮かび上がらせ、人がそれを見て、直すか、残すか、退けるかを一つずつ決められるようにすることです。良いバンクとは、どの設問にも欠点がないバンクではありません。欠点のある設問が分かっているバンクです。
難易度 — 易しすぎても難しすぎても、情報を失います
難易度は紛らわしい名前ですが、要するに正解した候補者の割合です — 70% の人が正解した設問の難易度は 0.70 です。その役目は高いことでも低いことでもなく、情報を持つことであり、両端はほとんど情報を運びません。95% 以上の候補者が正解する設問は、もう誰も分けていません。強い候補者も弱い候補者も同じように越えるので、その設問は手がかりを足さずに長さだけを足します。準備運動としてアセスメントの冒頭に置く意味はあるかもしれませんが、測定の仕事はしていません。
反対の端はもっと危険です。正解が 20% 以下しかいないとき、まず疑うべきは候補者が弱いことではありません — 設問が壊れていることです。答えの鍵の誤り、曖昧な問い、どちらも成り立つ二つの選択肢、あるいはその職務が必要としないものを試している課題は、どれも正答率を床まで押し下げます。強い母集団の五分の一が解ける本当に難しい設問は正当で価値がありますが、ほとんど誰も解けない設問には、探しに行けば 1 分で直せる問題があるのがふつうです。
ですから難易度は、的ではなく一対のガードレールとして読むのがいちばんです。とても易しい設問は、退けるか置き場所を変える候補です。とても難しい設問は、答えの鍵と言い回しを確かめる候補です。そのあいだのすべては役目を果たしていて、あなたの手を煩わせる必要はありません。
識別力 — その設問は、強い人と弱い人を見分けているか
識別力は二つのうち強力なほうのシグナルで、チームがいちばんよく見落とすものでもあります。問うことはひとつです。この設問でうまくやった候補者は、アセスメント全体でもうまくやる傾向があるか。答えが「はい」なら、その設問はテストのほかの部分と同じ方向へ引いています — 識別しているのです。関係がないなら、その設問は、どれほど筋が通って読めても、別の何かを、あるいは何も測っていません。
具体的には、識別力とは、ある設問に正解することと、その候補者の合計スコアとの相関です。値が高ければ、強い候補者が解き、弱い候補者が外しているということで、まさに望ましい姿です。0 に近い値は、その設問が候補者をまったく並べ替えていないことを意味します。負の値は、すぐに手を打つべき警報です。強い候補者ほどその設問を間違えているという意味であり、答えの鍵の誤りか、内容をいちばん深く理解している人を罰する引っかけの、典型的な指紋です。
広く使われている目安は、識別力がおおよそ 0.20 を下回るものを不良と扱います — その設問は強い人と弱い人をかろうじてしか分けておらず、手直しの候補です。ただし識別力に意味があるのは、十分な人数が答えたあとだけです。3 件の回答では雑音にすぎません。だからこそ責任ある印付けは、数字を信じる前に最小の標本を待ちますし、新しい設問が最初の数人で断罪されることはありません。
これらのシグナルは、当て推量ではなく得るものです
項目分析の正直な限界は、設問を書いたその日には何も教えてくれないことです。難易度と識別力は回答の性質なので、まっさらな設問には、候補者が本当のことを言えるだけの回数を答えるまで、健全性というものがありません。これは欠落ではなく美点です。シグナルを意見ではなく証拠に根づかせ続け、新しい設問が公平に走る前に判断されることから守ってくれます。
同時に、設問の品質が一度きりの関門ではなく、手入れの習慣だということでもあります。1 年前はきれいだったバンクも、職務が変わり、候補者の母集団が動き、設問がアセスメントをまたいで使い回されるにつれてぶれていきます。見ておく価値があるのは、実際に使われていて、信じられるだけの回答が集まった設問です — 実務ではそれは、バンク全体ではなく、小さく移り変わる一部です。すべてを監査しているのではありません。データが印を付けた、ひと握りの設問を読んでいるのです。
SkillCort ではどう浮かび上がるか — 「要確認」の印
SkillCort は、ある設問が現れるすべてのアセスメントにわたる実際の候補者の回答から設問の健全性を計算し、二つのシグナルを、設問バンクの上の平明なひとつの絞り込みに変えます。「要確認」です。データが三つの具体的な問題のどれかを示したとき、その設問はそこへ入ります。少なくとも 5 人が答えたうえでの低い識別力、95% 以上の難易度(とても易しい)、あるいは 20% 以下の難易度(とても難しい)。勘で印が付くことはありませんし、それを裏づける回答がそろう前に印が付くこともありません。
印の付いた設問はどれも、その理由を設問の隣のチップとして携えています。識別力が低い、とても易しい、とても難しい。そして裏にある数字は、重ねると見えます。ですからバンクは、この設問は弱いと告げるだけではありません — なぜかを告げます。それが、警告を次の一手に変えるものです。設問バンクの分析の眺めは、同じシグナルをバンク全体にわたって積み上げ、判断できるだけのデータがある設問と、一度も使われていない設問を添えます。そうすれば、測定の健全性を一問ずつではなく、ひと目で見られます。
この全体の背後にある設計の規則は、このプラットフォームのほかの部分を貫くものと同じです。システムはシグナルとその理由を示し、決着は人がつけます。SkillCort は、この設問はとても難しく、正解したのは 12% だけですとお伝えします。設問を黙って削除することも、その難しさが不具合なのか狙いなのかについてのあなたの判断を覆すことも、ありません。
印が付いた設問に、何をするか
答えの鍵から始めてください。とても難しい設問と、識別力が負の設問ではとくにそうです。驚くほど多くの警報が、鍵とされた答えを読み直した瞬間に解けます。もうひとつの選択肢も正しいと気づく、あるいは意図した答えのほうが誤っていると気づくのです。この一つの確認は、どれだけ書き直すよりも多くの、印の付いた設問を直します。
鍵が正しければ、戸惑った候補者になったつもりでその設問を読んでください。とても難しい設問と識別力の低い設問は、しばしば同じ根を共有しています。曖昧な言い回し、どちらも成り立つ二つの答え、あるいは、測るつもりだったスキルの外にあるものを静かに試している問い。読み方がひとつしか残らないところまで言葉を締めれば、たいていは数字が動きます。とても易しい設問はもっと穏やかな場合です。準備運動として役立つならそのまま残し、そうでなければ退けて、アセスメントの時間が本当に測定の起きるところに使われるようにしてください。
最後に、小さな標本に過剰に反応したくなる気持ちには抗ってください。ひと握りの回答をもとに印が付いた設問は、断罪すべき設問ではなく、見ておくべき設問です。手を打つ前に、もっと候補者を通してください。設問の品質はゆっくり積み重なる読み取りであり、目指すのは、弱い設問が分かっていて手当てされているバンクです — 不完全な数字がひとつ残らず洗い流されたバンクではありません。
要点
- 設問の品質は、それがどう読めるかではなく、候補者がどう答えるかに宿ります — 同じくらいきれいな二つの設問が、まるで違う振る舞いをすることがあります。
- 難易度は的ではなく一対のガードレールです。とても易しい設問(正答率 95% 以上)は手がかりを足しません。とても難しい設問(正答率 20% 以下)は、たいてい答えの鍵の誤りか、曖昧な設問を指しています。
- 識別力 — 強い候補者が解け、弱い候補者が外すかどうか — がいちばん鋭いシグナルです。おおよそ 0.20 を下回れば弱く、負の値はほぼ必ず答えの鍵の誤りを意味します。
- これらの統計は実際の回答から得られるので、新しい設問には、十分な数の候補者が答えるまで健全性がありません。責任ある印付けは、最小の標本を待ちます。
- SkillCort の「要確認」の絞り込みは、印の付いた設問をその理由とともに並べます(識別力が低い/とても易しい/とても難しい)— システムはシグナルを示し、直し方は人が決めます。