Beoordelingsvorm

Hoe Situationele Oordeel Test (SJT) scores interpreteren

ClarityHire Team(Editorial)11 min read

De score zonder context is ruis

Een SJT-score zonder referentiepunt is betekenisloos. Een kandidaat scoort 72%. Is dat sterk? Gemiddeld? Zwak? Je weet het niet.

Context hangt af van:

  1. Je scoremethodologie (meest-effectief vs. afstands-gebaseerd)
  2. Je vergelijkingsgroep (interne benchmarks vs. externe normen)
  3. De rolvereistheid van de beoordeling (generiek vs. aangepast)
  4. De expert ranking (hoe je "juist" definieerde)

Een kandidaat die "eerst alleen onderzoeken" rankt op een incidentresponse SJT scoort misschien 100% bij een bedrijf dat autonomie waardeert en 40% bij een bedrijf dat escalatiediscipline waardeert. Geen van beide scores is fout. Beide meten wat het bedrijf waardeert.

Deze gids helpt je SJT-resultaten correct te interpreteren.

Hoe worden SJT's gescoord?

Bijna elke SJT gebruikt één van twee scoremethodologieën: meest-effectief scoring of afstands-gebaseerde scoring. Welke je test gebruikt bepaalt wat een "goede" score is, dus begin hier.

Meest-effectief (MD) scoring

De kandidaat scoort alleen een punt als hun hoogst gerankte optie overeenkomt met de eerste keuze van de expert ranking.

Voorbeeld:

  • Expert ranking: E > D > A > C > B
  • Kandidaat ranking: E > D > C > A > B
  • Score: 1 punt (ze kaartte op optie E)
  • Resultaat: 1/5 op deze vraag = 20%

Voordelen:

  • Binair en verdedigbaar. Ze kiezen de meest effectieve optie of ze doen het niet.
  • Komt overeen met je aanvervingsstandaard: "Zouden ze de keuze maken die we zouden maken?"
  • Geen subjectiviteit in scoring.
  • Gemakkelijk uit te leggen aan kandidaten en stakeholders.

Nadelen:

  • Straft gedeeltelijk krediet. Een kandidaat die E eerst rankt maar D tweede (jij wilt E > D > ...) krijgt nul krediet.
  • Alles-of-niets kan hard aanvoelen bij grensgevallen.

Gebruik MD scoring wanneer: Je managers of leiders wilt aanstellen die consistent aansluiten bij je oordeel normen. Je hebt lage tolerantie voor afwijking. Je wilt dat de beoordeling duidelijk onderscheid maakt.

Afstands-gebaseerde scoring

De volledige ranking van de kandidaat wordt vergeleken met de expert ranking met behulp van een afstandsmetriek (bijv. som van absolute verschillen tussen posities).

Voorbeeld:

  • Expert ranking: E(1) > D(2) > A(3) > C(4) > B(5)
  • Kandidaat ranking: E(1) > D(2) > C(3) > A(4) > B(5)
  • Afstand: |1-1| + |2-2| + |4-3| + |3-4| + |5-5| = 0 + 0 + 1 + 1 + 0 = 2
  • Genormaliseerde score (lagere afstand = hogere score): 10/10 of 5/5 afhankelijk van maximale mogelijke afstand

Voordelen:

  • Beloont gedeeltelijke afstemming. Een kandidaat die "grotendeels goed maar met één optie omgedraaid" is, krijgt krediet.
  • Meer granuleus. Vangt nuances in redenering.
  • Tolerant voor grensgevallen waar twee opties zeer dicht in kwaliteit liggen.

Nadelen:

  • Complexer om te berekenen en uit te leggen.
  • Vereist duidelijke definitie van "afstand" (Kendall tau, Spearman correlatie, andere statistieken).
  • Een klein verschil in topkeuze kan grote scoringimpact hebben afhankelijk van hoe je het wegt.

Gebruik afstands-gebaseerde scoring wanneer: Je individuele medewerkers wilt aanstellen waar redelijke onenigheid waardevol is. Je het patroon van hun oordeel wilt zien, niet alleen de topkeuze. Je hoge tolerantie hebt voor diversiteit in aanpak.

Wat is een goede SJT-score?

Er is geen universeel slagingsnorm, maar hier is de eerlijke samenvatting:

  • Op percentiel-genormaliseerde SJT's (SHL-stijl leverancierstesten) is het 50e percentiel per definitie gemiddeld. De meeste werkgevers beschouwen het 70e percentiel en hoger als een goede score, en selectiedrempels liggen meestal ergens tussen het 30e en 50e percentiel, afhankelijk van het volume kandidaten.
  • Op meest-effectief scoring landen typische kandidaatpools rond 55-70% correct. Een score op of boven je interne top-performer benchmark - gewoonlijk 75-85% op een goed gekalibreerde test - is een sterk resultaat.
  • Op bandtesten (gebruikelijk in publieke sector en graduate werving) worden resultaten gerapporteerd als banden in plaats van ruwe scores. Alleen de band telt: een "exceptional demonstration" band is een sterk resultaat ongeacht het onderliggende getal.

De gemiddelde SJT-score is een bewegend doel omdat het afhangt van de scoremethodologie, de moeilijkheid van de scenario's en wie in de normgroep zit. Een ruwe 72% zegt jou niets op zichzelf: tegen een normgroep met gemiddelde 60% is het uitstekend; tegen je eigen top performers met gemiddelde 78% is het een waarschuwingsvlag. Daarom zijn de benchmarkingbenaderingen hieronder belangrijker dan enig enkel getal.

Kandidaten vergelijken: interne benchmarks vs. externe normen

Interne benchmarks (aanbevolen)

Geef de SJT aan je huidige topmedewerkers in de rol. Documenteer hun gemiddelde score. Gebruik dat als je vergelijkingspunt voor kandidaten.

Voorbeeld:

  • Je vijf beste engineers scoren gemiddeld 78% op je aangepaste engineering incidentresponse SJT.
  • Kandidaat A scoort 82%.
  • Kandidaat B scoort 71%.

Interpretatie: Kandidaat A sluit goed aan bij je topmedewerkers. Kandidaat B wijkt af - ze hebben ofwel verschillende oordeelpatronen (wat goed of slecht kan zijn) ofwel begrijpen ze je context nog niet.

Waarom interne benchmarks werken:

  • Ze meten afstemming met jouw definitie van goed oordeel, niet generieke definities.
  • Ze laten je zeggen "we huren mensen in die op deze dimensies zoals onze beste medewerkers denken."
  • Ze openbaren subcultuur (als je topmedewerkers het met elkaar oneens zijn, is dat ook interessante data).

Hoe je interne benchmarks creëert:

  1. Kies 5-10 topmedewerkers die 2+ jaar bij je zijn (genoeg om zichzelf te bewijzen).
  2. Geef ze de SJT (als je beoordeling nieuw is, kunnen ze het retrospectief doen: "Hoe zou je dit rangschikken?").
  3. Bereken hun gemiddelde score.
  4. Bereken individuele variabiliteit (zijn ze het eens of is er debat?).

Hoge interne variabiliteit is nuttige data: "Onze topmedewerkers denken anders over dit." Dit kan betekenen:

  • Het scenario is werkelijk ambigu (goed - het zou moeten zijn)
  • Je hebt verschillende subculturen binnen topmedewerkers (niet noodzakelijk slecht, maar interessant)
  • Je expert ranking is niet representatief (herzie het)

Externe normen (voorzichtig gebruiken)

Sommige commerciële SJT-leveranciers (SHL, CEB Talent, anderen) hebben gepubliceerde normen: "Voor een software engineer rol is de 50e percentiel score 64%." Je kunt je kandidaat tegen die verdeling vergelijken.

Waarom dit lastig is:

  • Externe normen gaan ervan uit dat de beoordeling generiek of branche-standaard is.
  • Je aangepaste SJT zal geen gepubliceerde normen hebben.
  • Een kandidaat die 80e percentiel scoort op een externe SJT kan 40e percentiel scoren op je interne benchmark als je definitie van "goed oordeel" anders is.

Gebruik externe normen voor:

  • Gezond verstand controle van je beoordelingen (als iedereen boven de 90e percentiel scoort, is je beoordeling waarschijnlijk te makkelijk)
  • Waarschuwingsvlaggen (als een kandidaat onder de 20e percentiel is, klopt er iets niet)
  • Transparantie (je kunt kandidaten zeggen "voor deze rol is de gemiddelde score...")

Gebruik externe normen niet alleen. Combineer altijd met interne benchmarks als mogelijk.

Patronen interpreteren, niet alleen scores

Twee kandidaten scoren allebei 76%. Maar het patroon van hun keuzes doet ertoe.

Kandidaat A's rankings per scenario:

  • Incidentrespons: E eerst (overeenkomstig expert)
  • Klantconflict: D eerst (overeenkomstig expert)
  • Teamwrijving: A eerst (expert rankte B eerst)
  • Delegatie: B eerst (expert rankte B eerst)
  • Prioritering: C eerst (expert rankte D eerst)

Patroon: Grotendeels overeenkomstig met je topmedewerkers. Wijkt af bij mensgericht gerichte scenario's (teamwrijving, prioritering). Hypothese: sterk technisch oordeel, zwakker op mensoordeel.

Kandidaat B's rankings:

  • Incidentrespons: B eerst (expert E)
  • Klantconflict: E eerst (expert D)
  • Teamwrijving: D eerst (expert B)
  • Delegatie: A eerst (expert B)
  • Prioritering: D eerst (expert D)

Patroon: Minder consistent over het geheel. Geen duidelijk patroon. Hypothese: begrijpt je context niet, of heeft fundamenteel ander oordeelsfilosofie.

Beide scoren 76%. Maar Kandidaat A onthult een zwakte die je kunt coachen (mensoordeel). Kandidaat B onthult ofwel gebrek aan begrip ofwel misalignment dat moeilijker te repareren is.

Track patronen per domein:

  • Technisch oordeel (incidentrespons, debugging, architectuur)
  • Mensoordeel (conflict, delegatie, feedback)
  • Uitvoering oordeel (prioritering, resource allocatie, afwegingen)
  • Risicobeheer (escalatie, wanneer vertragen)

Deze granulariteit laat je zeggen: "We zouden ze voor rol X aanstellen maar niet rol Y" op basis van hun patroon.

SJT score + interview coherentie

Een sterke SJT-score betekent dat de kandidaat theoretisch aansluit bij je oordeelsnormen. Een interview valideert dat ze dat oordeel kunnen uitvoeren. Gebruik je aanvervingsrubric om consistentie tussen alle interviewers te waarborgen.

Sterke SJT + sterk interview: Afgestemd op oordeel en kunnen voorbeelden articuleren. Hoog vertrouwen hire.

Sterke SJT + zwak interview: Ze "kennen" het juiste oordeel in abstracto maar kunnen het niet met voorbeelden ondersteunen of hun voorbeelden voelen ingestudeerd. Rood vlag. Onderzoek: "Vertel me over een moment waarop je ervoor koos om vroeg te escaleren in plaats van alleen te onderzoeken. Wat was de situatie?"

Zwakke SJT + sterk interview: Ze scoren niet goed op je test maar hun vroegere beslissingen sluiten aan bij je oordeelsnormen. Dit betekent vaak: ze begrijpen je context in de SJT niet (ze zijn nieuw in de industrie) of je beoordeling meet niet wat je denkt. Filter ze niet automatisch uit. Begrijp waarom de mismatch bestaat.

Zwakke SJT + zwak interview: Consistent signaal. Oordeel sluit niet aan of is niet sterk. Minder waarschijnlijk goed geschikt.

Wanneer SJT-scores performance niet voorspellen

SJT's zijn goed voor oordeelsmeting, maar ze voorspellen niet alles. Ze voorspellen:

  • Besliskwaliteit onder ambiguïteit
  • Probleemoplossingsaanpak
  • Escalatiediscipline
  • Mensoordeel (voor managementrollen)

Ze voorspellen niet:

  • Uitvoeringsnelheid (een kandidaat kan grote beslissingen nemen maar traag handelen)
  • Doorzettingsvermogen door tegenslag (ze kennen misschien de juiste keuze maar geven op als het moeilijk is)
  • Leersnelheid (ze begrijpen misschien je oordeelsnormen maar hebben tijd nodig om ze in te internaliseren)
  • Communicatievermogen (ze kunnen goed denken maar moeite hebben met uitleggen)
  • Technische vaardigheid (voor rollen waar technische diepte naast oordeel telt)

Als je alleen een SJT gebruikt, mis je deze dimensies. Combineer het met:

Rode vlaggen in SJT-interpretatie

Rood vlag 1: Iedereen scoort hetzelfde.

Als alle kandidaten 82% scoren, of allemaal 45%, differentieert je beoordeling niet. Waarschijnlijke oorzaken:

  • Beoordeling is te makkelijk of te moeilijk
  • Expert ranking is niet representatief
  • Kandidaten begrijpen de scenario's niet

Herzien de beoordeling. Pilot met 3-5 personen en itereer.

Rood vlag 2: Scorespreiding correleert niet met senioriteit.

Als een junior kandidaat hoger scoort dan je senior aanstellingen, klopt er iets niet. Ofwel:

  • De beoordeling meet iets anders dan je denkt
  • Je scoring is inconsistent
  • Je vergelijkt tegen de verkeerde benchmarks

Onderzoek door hoge en lage scorers te vragen: "Vertel me waarom je die optie eerst rankte." Komen hun verklaringen overeen met je verwachtingen?

Rood vlag 3: Demografische groepen scoren aanzienlijk anders.

Als vrouwen consistent 10+ punten lager scoren dan mannen, of één etnische groep scoort systematisch lager, kan je beoordeling bias hebben. Oorzaken:

  • Scenario's weerspiegelen culturele aannames
  • Taal is niet gelijk toegankelijk
  • Scenario's privileges bepaalde soorten ervaring

Beoordeel op bias (rechtvaardigheid in beoordeling design) en test met diverse groepen.

Scores communiceren naar kandidaten

Wees transparant over wat de score betekent. Zeg niet "je scoorde 72%." Zeg:

"Op onze situationele oordeel beoordeling rankte je de topkeuze consistent met onze topmedewerkers op 3 van 5 scenario's. Je oordeel op [domein] sloot goed aan bij onze normen. Je aanpak van [domein] verschilt van onze norm - dit kan een sterkte zijn (vers perspectief) of kan aanpassing aan onze cultuur vereisen."

Dit herlijnt de score als patroon van oordeel in plaats van een slaag/zak cijfer. Het geeft aan dat:

  • Je iets specifiek meet
  • Je begrijpt context
  • Je open bent voor leren van hun redenering

SJT-scores gebruiken in de aanvervingsbeslissing

SJT-scores zijn één signaal onder veel. Gebruik ze als:

  1. Screeningfilter: Sterke SJT + resume fit gaan verder. Zwakke SJT maar interessante achtergrond rechtvaardigt onderzoek.
  2. Interviewprobe: Gebruik de beoordeling als springplank voor gedragsvragen. "Ik merkde op dat je op het escalatie-scenario X eerste rankte. Vertel me over een moment dat je escaleerde."
  3. Tiebreaker: Twee kandidaten met soortgelijke interviews? Degene met sterker SJT alignment zal waarschijnlijk beter aan je cultuur aanpassen.
  4. Onboarding data: Voor aangestelde kandidaten, track hun SJT patronen bij onboarding om mentorschapfocusgebieden te identificeren.

Gebruik SJT niet als knockout filter voor grensgevallen. Gebruik het als context.

Voor uitgebreide beoordelingsstrategie, laag SJT's met coding beoordelingen, gestructureerde interviews, en referentiechecks. Elk meet andere dimensies van geschiktheid.

ClarityHire's beoordeling platform omvat geautomatiseerde scoring, benchmarking tegen je interne topmedewerkers, en patroonanalyse om interpretatie te vereenvoudigen.

situationele-oordeelSJT-scoringinterpretatiebeoordeling-analyses

Gerelateerde artikelen