Progettazione delle Valutazioni

Come Interpretare i Risultati dei Test di Giudizio Situazionale (SJT)

ClarityHire Team(Editorial)12 min read

Il punteggio senza contesto è rumore

Un punteggio SJT senza un ancoraggio è privo di significato. Un candidato ottiene il 72%. È buono? Medio? Debole? Non lo sai.

Il contesto dipende da:

  1. La metodologia di scoring (più efficace vs. basata sulla distanza)
  2. Il gruppo di confronto (benchmark interni vs. norme esterne)
  3. La specificità del ruolo della valutazione (generica vs. personalizzata)
  4. La classifica principale (come hai definito "giusta")

Un candidato che classifica "investigare da solo per primo" in un SJT di risposta agli incidenti potrebbe ottenere il 100% in un'azienda che valorizza l'autonomia e il 40% in un'azienda che valorizza la disciplina dell'escalation. Nessuno dei due punteggi è sbagliato. Entrambi misurano quello che l'azienda valorizza.

Questa guida ti accompagna nell'interpretazione dei risultati SJT in modo da poterli utilizzare correttamente.

Come vengono punteggiati i test di giudizio situazionale?

Praticamente ogni SJT utilizza una di due metodologie di scoring: scoring più efficace o scoring basato sulla distanza. Quale metodologia utilizza il tuo test cambia l'aspetto di un punteggio 'buono', quindi inizia da qui.

Scoring basato sul più efficace (MD)

Il candidato ottiene un punto solo se l'opzione che ha classificato al primo posto corrisponde alla prima scelta della classifica principale degli esperti.

Esempio:

  • Classifica degli esperti: E > D > A > C > B
  • Classifica del candidato: E > D > C > A > B
  • Punteggio: 1 punto (hanno abbinato l'opzione E)
  • Risultato: 1/5 su questa domanda = 20%

Vantaggi:

  • Binario e difendibile. O hanno scelto l'opzione più efficace o non l'hanno fatto.
  • Corrisponde al tuo standard di assunzione: "Prenderebbero la decisione che prenderemmo noi?"
  • Nessuna soggettività nel punteggio.
  • Facile da spiegare ai candidati e agli stakeholder.

Svantaggi:

  • Penalizza il credito parziale. Un candidato che classifica E per primo ma D per secondo (tu vuoi E > D > ...) non ottiene nessun credito.
  • Il tutto o nulla può sembrare duro nei casi limite.

Usa lo scoring MD quando: Vuoi assumere manager o leader che si allineano coerentemente ai tuoi standard di giudizio. Hai una bassa tolleranza per le deviazioni. Vuoi che la valutazione faccia una chiara differenziazione.

Scoring basato sulla distanza

La classifica completa del candidato viene confrontata con la classifica degli esperti utilizzando una metrica di distanza (ad es., somma delle differenze assolute tra le posizioni).

Esempio:

  • Classifica degli esperti: E(1) > D(2) > A(3) > C(4) > B(5)
  • Classifica del candidato: E(1) > D(2) > C(3) > A(4) > B(5)
  • Distanza: |1-1| + |2-2| + |4-3| + |3-4| + |5-5| = 0 + 0 + 1 + 1 + 0 = 2
  • Punteggio normalizzato (distanza minore = punteggio più alto): 10/10 o 5/5 a seconda della distanza massima possibile

Vantaggi:

  • Premia l'allineamento parziale. Un candidato che è "per lo più giusto ma con un'opzione invertita" ottiene credito.
  • Più granulare. Cattura la sfumatura nel ragionamento.
  • Indulgente nei casi limite dove due opzioni sono molto simili in qualità.

Svantaggi:

  • Più complesso da calcolare e spiegare.
  • Richiede una chiara definizione di "distanza" (tau di Kendall, correlazione di Spearman, altre metriche).
  • Una piccola differenza nella scelta principale può avere un grande impatto sul punteggio a seconda di come la pesi.

Usa lo scoring basato sulla distanza quando: Vuoi assumere collaboratori individuali dove il ragionevole disaccordo è prezioso. Vuoi vedere la forma del loro giudizio, non solo la scelta principale. Hai un'alta tolleranza per la diversità dell'approccio.

Qual è un buon punteggio SJT?

Non esiste un voto di passaggio universale, ma ecco il riassunto onesto:

  • Nei test SJT basati su percentili (test di vendor di tipo SHL), il 50° percentile è per definizione la media. La maggior parte dei datori di lavoro considera il 70° percentile e superiore come un buon punteggio, e le soglie di eliminazione si trovano tipicamente da qualche parte tra il 30° e il 50° percentile a seconda del volume dei candidati.
  • Con scoring più efficace, i pool di candidati tipici si attestano intorno al 55-70% corretto. Un punteggio pari o superiore al tuo benchmark interno di top performer - comunemente tra il 75-85% su un test ben calibrato - è un risultato forte.
  • Su test con bande (comuni nella selezione del settore pubblico e dei laureati), i risultati vengono riportati come bande anziché come punteggi grezzi. Conta solo la banda: una banda di "dimostrazione eccezionale" è un risultato forte indipendentemente dal numero sottostante.

Il punteggio SJT medio è un obiettivo mobile perché dipende dal metodo di scoring, dalla difficoltà degli scenari e dal gruppo di norme. Un 72% grezzo non ti dice nulla di per sé: rispetto a un gruppo di norme con media del 60% è eccellente; rispetto ai tuoi stessi top performer con media del 78% è una bandiera di attenzione. Ecco perché gli approcci di benchmarking sottostanti contano più di qualsiasi numero singolo.

Confrontare i candidati: benchmark interni vs. norme esterne

Benchmark interni (consigliato)

Somministra l'SJT ai tuoi attuali top performer nel ruolo. Documenta il loro punteggio medio. Usalo come punto di confronto per i candidati.

Esempio:

  • I tuoi cinque migliori ingegneri ottengono in media il 78% sul tuo SJT personalizzato di risposta agli incidenti di ingegneria.
  • Il candidato A ottiene l'82%.
  • Il candidato B ottiene il 71%.

Interpretazione: Il candidato A si allinea bene con i tuoi top performer. Il candidato B si discosta: o hanno modelli di giudizio diversi (che potrebbe essere buono o cattivo) o non comprendono ancora il tuo contesto.

Perché i benchmark interni funzionano:

  • Misurano l'allineamento con la tua definizione di buon giudizio, non definizioni generiche.
  • Ti permettono di dire "stiamo assumendo persone che pensano come i nostri migliori performer su queste dimensioni".
  • Emergono le sottoculture (se i tuoi top performer non sono d'accordo tra loro, anche questo è un dato interessante).

Come creare benchmark interni:

  1. Scegli 5-10 top performer che sono con te da 2+ anni (abbastanza per provare se stessi).
  2. Somministra loro l'SJT (se la tua valutazione è nuova, possono farla retrospettivamente: "Come classificheresti queste opzioni?").
  3. Calcola il loro punteggio medio.
  4. Calcola la variabilità individuale (sono d'accordo o c'è dibattito?).

Un'alta variabilità interna è un dato utile: "I nostri top performer pensano diversamente a questo." Questo potrebbe significare:

  • Lo scenario è genuinamente ambiguo (bene, dovrebbe esserlo)
  • Hai sottoculture diverse tra i top performer (non necessariamente male, ma interessante)
  • La tua classifica principale non è rappresentativa (rivisitala)

Norme esterne (usa con cautela)

Alcuni fornitori commerciali di SJT (SHL, CEB Talent, altri) hanno norme pubblicate: "Per un ruolo di ingegnere software, il punteggio del 50° percentile è del 64%". Puoi confrontare il tuo candidato con quella distribuzione.

Perché questo è complicato:

  • Le norme esterne presuppongono che la valutazione sia generica o conforme agli standard del settore.
  • Il tuo SJT personalizzato non avrà norme pubblicate.
  • Un candidato che ottiene l'80° percentile su un SJT esterno potrebbe ottenere il 40° percentile sul tuo benchmark interno se la tua definizione di "buon giudizio" è diversa.

Usa le norme esterne per:

  • Fare un controllo di sanità (se tutti ottengono più del 90° percentile, la tua valutazione è probabilmente troppo facile)
  • Rilevamento di red flag (se un candidato è al di sotto del 20° percentile, qualcosa non va)
  • Trasparenza (puoi dire ai candidati "per questo ruolo, il punteggio medio è...")

Non usare le norme esterne da sole. Accoppiale sempre con i benchmark interni se possibile.

Interpretare i modelli, non solo i punteggi

Due candidati ottengono entrambi il 76%. Ma il modello delle loro scelte è importante.

Classifiche del Candidato A per scenario:

  • Risposta agli incidenti: E per primo (corrisponde all'esperto)
  • Conflitto con il cliente: D per primo (corrisponde all'esperto)
  • Attrito nel team: A per primo (l'esperto ha classificato B per primo)
  • Delegazione: B per primo (l'esperto ha classificato B per primo)
  • Prioritizzazione: C per primo (l'esperto ha classificato D per primo)

Modello: Per lo più corrisponde ai tuoi top performer. Si discosta negli scenari focalizzati sulle persone (attrito nel team, prioritizzazione). Ipotesi: forte giudizio tecnico, più debole sul giudizio relazionale.

Classifiche del Candidato B:

  • Risposta agli incidenti: B per primo (esperto E)
  • Conflitto con il cliente: E per primo (esperto D)
  • Attrito nel team: D per primo (esperto B)
  • Delegazione: A per primo (esperto B)
  • Prioritizzazione: D per primo (esperto D)

Modello: Meno coerente complessivamente. Nessun modello chiaro. Ipotesi: o non capisce il tuo contesto, o ha una filosofia di giudizio fondamentalmente diversa.

Entrambi ottengono il 76%. Ma il Candidato A rivela una debolezza che puoi insegnare (giudizio relazionale). Il Candidato B rivela o mancanza di comprensione o un disallineamento che è più difficile da correggere.

Traccia i modelli per dominio:

  • Giudizio tecnico (risposta agli incidenti, debug, architettura)
  • Giudizio relazionale (conflitto, delegazione, feedback)
  • Giudizio esecutivo (prioritizzazione, allocazione delle risorse, trade-off)
  • Gestione del rischio (escalation, quando rallentare)

Questa granularità ti permette di dire: "Li assumerebbe per il ruolo X ma non per il ruolo Y" in base al loro modello.

Punteggio SJT + coerenza nell'intervista

Un forte punteggio SJT significa che il candidato teoricamente si allinea con i tuoi standard di giudizio. Un'intervista valida che possono eseguire su quel giudizio. Usa il tuo rubrica di assunzione per garantire coerenza tra tutti gli intervistatori.

SJT forte + intervista forte: Allineati sul giudizio e possono articolare esempi. Fiducia elevata nell'assunzione.

SJT forte + intervista debole: "Sanno" quale sia il giudizio giusto in astratto ma non riescono a supportarlo con esempi o i loro esempi sembrano provati. Red flag. Indaga: "Raccontami di una volta in cui hai scelto di escalare presto invece di investigare da solo. Qual era la situazione?"

SJT debole + intervista forte: Non ottengono un buon punteggio nel tuo test ma le loro decisioni passate si allineano con i tuoi standard di giudizio. Questo spesso significa: non hanno capito il tuo contesto nell'SJT (sono nuovi al settore) o la tua valutazione non sta misurando quello che pensi. Non filtrarli automaticamente. Capire perché il disallineamento esiste.

SJT debole + intervista debole: Segnale coerente. Il giudizio non si allinea o non è forte. Meno probabile che sia una corrispondenza.

Quando i punteggi SJT non prevedono le prestazioni

Gli SJT sono buoni per la misurazione del giudizio, ma non prevedono tutto. Prevedono:

  • Qualità della decisione in condizioni di ambiguità
  • Approccio alla risoluzione dei problemi
  • Disciplina dell'escalation
  • Giudizio relazionale (per ruoli di gestione)

Non prevedono:

  • Velocità di esecuzione (un candidato potrebbe prendere grandi decisioni ma essere lento ad agire)
  • Persistenza attraverso i contrattempi (potrebbe conoscere la giusta chiamata ma rinunciare quando è difficile)
  • Velocità di apprendimento (potrebbe comprendere i tuoi standard di giudizio ma ha bisogno di tempo per interiorizzarli)
  • Capacità comunicativa (potrebbe pensare bene ma fatica a spiegare)
  • Abilità tecnica (per ruoli dove la profondità tecnica è importante insieme al giudizio)

Se usi solo un SJT, ti stai perdendo queste dimensioni. Abbinalo a:

Red flag nell'interpretazione dell'SJT

Red flag 1: Tutti ottengono lo stesso punteggio.

Se tutti i candidati ottengono l'82%, o tutti ottengono il 45%, la tua valutazione non sta differenziando. Cause probabili:

  • La valutazione è troppo facile o troppo difficile
  • La classifica principale non è rappresentativa
  • I candidati non stanno comprendendo gli scenari

Rivedi la valutazione. Fai un test pilota con 3-5 persone e itera.

Red flag 2: La varianza dei punteggi non correla con l'anzianità.

Se un candidato junior ottiene un punteggio più alto rispetto ai tuoi nuovi assunti senior, qualcosa non va. O:

  • La valutazione misura qualcosa di diverso da quello che pensi
  • Il tuo punteggio è incoerente
  • Stai confrontando contro i benchmark sbagliati

Indaga chiedendo ai candidati che hanno ottenuto punteggi alti e bassi: "Dimmi perché hai classificato quella opzione per primo". Le loro spiegazioni corrispondono alle tue aspettative?

Red flag 3: I gruppi demografici ottengono risultati significativamente diversi.

Se le donne ottengono sistematicamente 10+ punti in meno rispetto agli uomini, o un gruppo etnico ottiene risultati sistematicamente più bassi, la tua valutazione potrebbe avere bias. Cause:

  • Gli scenari riflettono presupposti culturali
  • Il linguaggio non è ugualmente accessibile
  • Gli scenari privilegiano certi tipi di esperienza

Rivedi per bias (equità nella progettazione della valutazione) e testa con gruppi diversi.

Comunicare i punteggi ai candidati

Sii trasparente su quello che il punteggio significa. Non dire "hai ottenuto il 72%". Dì:

"Nella nostra valutazione del giudizio situazionale, hai classificato la scelta principale in modo coerente con i nostri top performer su 3 su 5 scenari. Il tuo giudizio su [dominio] era ben allineato con i nostri standard. Il tuo approccio a [dominio] differisce dalla nostra norma, il che potrebbe essere una forza (prospettiva fresca) o potrebbe richiedere un adattamento alla nostra cultura."

Questo rilancia il punteggio come modello di giudizio piuttosto che come un voto pass/fail. Segnala che:

  • Stai misurando qualcosa di specifico
  • Comprendi il contesto
  • Sei aperto a conoscere il loro ragionamento

Usare i punteggi SJT nella decisione di assunzione

I punteggi SJT sono un segnale tra tanti. Usali come:

  1. Filtro di screening: SJT forte + adattamento del curriculum procedono. SJT debole ma background interessante merita investigazione.
  2. Sonda per l'intervista: Usa la valutazione come trampolino di lancio per domande comportamentali. "Ho notato che nello scenario di escalation hai classificato X per primo. Raccontami di una volta in cui hai escalato."
  3. Pareggia: Due candidati con interviste simili? Quello con un più forte allineamento SJT probabilmente si adatterà meglio alla tua cultura.
  4. Dato di onboarding: Per i candidati assunti, traccia i loro modelli SJT nell'onboarding per identificare le aree di focus del mentoring.

Non usare l'SJT come filtro knockout per i candidati borderline. Usalo come contesto.

Per una strategia di valutazione completa, combina gli SJT con valutazioni di codifica, interviste strutturate e verifiche di riferimento. Ognuno misura diverse dimensioni di adattamento.

La piattaforma di valutazione di ClarityHire include punteggio automatizzato, benchmarking rispetto ai tuoi top performer interni e analisi dei modelli per semplificare l'interpretazione.

situational-judgmentpunteggio SJTinterpretazioneanalisi delle valutazioni

Articoli correlati