Cómo Interpretar las Puntuaciones de las Pruebas de Juicio Situacional (SJT)
La puntuación sin contexto es ruido
Una puntuación de SJT sin un punto de referencia no tiene significado. Un candidato obtiene un 72%. ¿Es fuerte? ¿Medio? ¿Débil? No lo sabes.
El contexto depende de:
- Tu metodología de puntuación (más efectiva vs basada en distancia)
- Tu grupo de comparación (puntos de referencia internos vs normas externas)
- La especificidad del rol de la evaluación (genérica vs personalizada)
- La clasificación maestra (cómo definiste lo "correcto")
Un candidato que clasifica "investigar solo primero" en una prueba de respuesta a incidentes de SJT podría obtener un 100% en una empresa que valora la autonomía y un 40% en una empresa que valora la disciplina de escalada. Ninguna puntuación es incorrecta. Ambas miden lo que la empresa valora.
Esta guía te ayuda a interpretar los resultados de SJT para que puedas usarlos correctamente.
¿Cómo se puntúan los situational judgment tests?
Casi toda SJT usa una de dos metodologías de puntuación: puntuación más efectiva o puntuación basada en distancia. Cuál uses cambia lo que se ve como "buena" puntuación, así que empieza aquí.
Puntuación más efectiva (MD)
El candidato obtiene un punto solo si su opción mejor clasificada coincide con la primera opción de clasificación maestra del experto.
Ejemplo:
- Clasificación de experto: E > D > A > C > B
- Clasificación del candidato: E > D > C > A > B
- Puntuación: 1 punto (coincidió con la opción E)
- Resultado: 1/5 en esta pregunta = 20%
Ventajas:
- Binaria, defendible. O eligieron la opción más efectiva o no.
- Coincide con tu estándar de contratación: "¿Toman la decisión que nosotros tomaríamos?"
- Sin subjetividad en la puntuación.
- Fácil de explicar a candidatos e interesados.
Desventajas:
- Penaliza el crédito parcial. Un candidato que clasifica E primero pero D segundo (quieres E > D > ...) obtiene cero crédito.
- Todo o nada puede parecer duro en casos límite.
Usa puntuación MD cuando: Quieres contratar directivos o líderes que se alineen consistentemente con tus estándares de juicio. Tienes baja tolerancia a las desviaciones. Quieres que la evaluación diferencie claramente.
Puntuación basada en distancia
La clasificación completa del candidato se compara con la clasificación del experto utilizando una métrica de distancia (p. ej., suma de diferencias absolutas entre posiciones).
Ejemplo:
- Clasificación de experto: E(1) > D(2) > A(3) > C(4) > B(5)
- Clasificación del candidato: E(1) > D(2) > C(3) > A(4) > B(5)
- Distancia: |1-1| + |2-2| + |4-3| + |3-4| + |5-5| = 0 + 0 + 1 + 1 + 0 = 2
- Puntuación normalizada (menor distancia = puntuación más alta): 10/10 o 5/5 dependiendo de la distancia máxima posible
Ventajas:
- Recompensa la alineación parcial. Un candidato que es "mayormente correcto pero con una opción invertida" obtiene crédito.
- Más granular. Captura el matiz del razonamiento.
- Indulgente con casos límite donde dos opciones son muy similares en calidad.
Desventajas:
- Más compleja de calcular y explicar.
- Requiere una definición clara de "distancia" (tau de Kendall, correlación de Spearman, otras métricas).
- Una pequeña diferencia en la opción principal puede tener un gran impacto en la puntuación dependiendo de cómo la peses.
Usa puntuación basada en distancia cuando: Quieres contratar colaboradores individuales donde el desacuerdo razonable es valioso. Quieres ver la forma de su juicio, no solo la opción principal. Tienes alta tolerancia a la diversidad de enfoques.
¿Cuál es una buena puntuación de SJT?
No existe una marca de aprobado universal, pero aquí va el resumen honesto:
- En SJTs normatizadas por percentiles (pruebas de proveedores al estilo SHL), el percentil 50 es por definición el promedio. La mayoría de empleadores tratan el percentil 70 y superior como una buena puntuación, y los umbrales de criba típicamente se sitúan en algún lugar entre el percentil 30 y 50 dependiendo del volumen de candidatos.
- En puntuación más efectiva, los grupos de candidatos típicos se ubican alrededor del 55-70% correcto. Una puntuación en o por encima de tu punto de referencia interno de mejores desempeñadores - comúnmente 75-85% en una prueba bien calibrada - es un resultado fuerte.
- En pruebas con bandas (comunes en contratación del sector público y postgrado), los resultados se reportan como bandas en lugar de puntuaciones brutas. Solo la banda importa: una banda de "demostración excepcional" es un resultado fuerte independientemente del número subyacente.
La puntuación promedio de SJT es un objetivo móvil porque depende del método de puntuación, la dificultad de los escenarios, y quién está en el grupo de normas. Una puntuación bruta del 72% no te dice nada por sí sola: contra un grupo de normas que promedia el 60% es excelente; contra tus propios mejores desempeñadores que promedian el 78% es una bandera de precaución. Por eso los enfoques de comparación de puntos de referencia a continuación importan más que cualquier número individual.
Comparar candidatos: puntos de referencia internos vs normas externas
Puntos de referencia internos (recomendado)
Administra la SJT a tus mejores desempeñadores actuales en el rol. Documenta su puntuación promedio. Úsala como punto de comparación para candidatos.
Ejemplo:
- Tus cinco mejores ingenieros promedian un 78% en tu SJT personalizado de respuesta a incidentes de ingeniería.
- El candidato A obtiene un 82%.
- El candidato B obtiene un 71%.
Interpretación: El candidato A se alinea bien con tus mejores desempeñadores. El candidato B se desvía—ya sea que tengan patrones de juicio diferentes (lo cual podría ser bueno o malo) o que no entiendan tu contexto aún.
Por qué funcionan los puntos de referencia internos:
- Miden la alineación con tu definición de buen juicio, no definiciones genéricas.
- Te permiten decir "estamos contratando personas que piensan como nuestros mejores desempeñadores en estas dimensiones."
- Revelan la subcultura (si tus mejores desempeñadores están de acuerdo entre sí, eso también es un dato interesante).
Cómo crear puntos de referencia internos:
- Elige 5–10 desempeñadores de alto nivel que hayan estado contigo 2+ años (suficiente para probarse a sí mismos).
- Administra la SJT (si tu evaluación es nueva, pueden hacerla retroactivamente: "¿Cómo clasificarías esto?").
- Calcula su puntuación promedio.
- Calcula la variabilidad individual (¿están de acuerdo o hay debate?).
La alta variabilidad interna es un dato útil: "Nuestros mejores desempeñadores piensan diferente sobre esto." Esto podría significar:
- El escenario es genuinamente ambiguo (bien—debería serlo)
- Tienes diferentes subculturas dentro de los desempeñadores de alto nivel (no necesariamente malo, pero interesante)
- Tu clasificación maestra no es representativa (revisítala)
Normas externas (usa con cuidado)
Algunos proveedores comerciales de SJT (SHL, CEB Talent, otros) tienen normas publicadas: "Para un rol de ingeniero de software, la puntuación del percentil 50 es del 64%." Puedes comparar tu candidato con esa distribución.
Por qué esto es complicado:
- Las normas externas asumen que la evaluación es genérica o estándar de la industria.
- Tu SJT personalizado no tendrá normas publicadas.
- Un candidato que obtiene un percentil 80 en una SJT externa podría obtener un percentil 40 en tu punto de referencia interno si tu definición de "buen juicio" es diferente.
Usa normas externas para:
- Verificación de cordura de tus evaluaciones (si todos obtienen por encima del percentil 90, tu evaluación probablemente es demasiado fácil)
- Detección de banderas rojas (si un candidato está por debajo del percentil 20, algo no está bien)
- Transparencia (puedes decir a los candidatos "para este rol, la puntuación promedio es...")
No uses normas externas solo. Siempre empareja con puntos de referencia internos si es posible.
Interpretar patrones, no solo puntuaciones
Dos candidatos ambos obtienen un 76%. Pero el patrón de sus opciones importa.
Clasificaciones de Candidato A por escenario:
- Respuesta a incidentes: E primero (coincide con experto)
- Conflicto con cliente: D primero (coincide con experto)
- Fricción del equipo: A primero (experto clasificó B primero)
- Delegación: B primero (experto clasificó B primero)
- Priorización: C primero (experto clasificó D primero)
Patrón: Mayormente coincide con tus mejores desempeñadores. Se desvía en escenarios centrados en personas (fricción del equipo, priorización). Hipótesis: juicio técnico fuerte, juicio de personas más débil.
Clasificaciones de Candidato B:
- Respuesta a incidentes: B primero (experto E)
- Conflicto con cliente: E primero (experto D)
- Fricción del equipo: D primero (experto B)
- Delegación: A primero (experto B)
- Priorización: D primero (experto D)
Patrón: Menos consistente en general. Sin patrón claro. Hipótesis: o no entiende tu contexto, o tiene una filosofía de juicio fundamentalmente diferente.
Ambos obtienen un 76%. Pero el Candidato A revela una debilidad que puedes entrenar (juicio de personas). El Candidato B revela una falta de comprensión o desalineación que es más difícil de arreglar.
Rastrear patrones por dominio:
- Juicio técnico (respuesta a incidentes, depuración, arquitectura)
- Juicio de personas (conflicto, delegación, retroalimentación)
- Juicio de ejecución (priorización, asignación de recursos, compensaciones)
- Gestión de riesgos (escalada, cuándo desacelerarse)
Esta granularidad te permite decir: "Los contrataremos para el rol X pero no para el rol Y" basado en su patrón.
Puntuación SJT + coherencia de entrevista
Una puntuación fuerte de SJT significa que el candidato teóricamente se alinea con tus estándares de juicio. Una entrevista valida que pueden ejecutar ese juicio. Usa tu rúbrica de contratación para asegurar consistencia entre todos los entrevistadores.
SJT fuerte + entrevista fuerte: Alineados en juicio y pueden articular ejemplos. Confianza alta en contratación.
SJT fuerte + entrevista débil: "Saben" el juicio correcto en abstracto pero no pueden respaldarlo con ejemplos o sus ejemplos suenan ensayados. Bandera roja. Indaga: "Cuéntame sobre una vez que elegiste escalar temprano en lugar de investigar solo. ¿Cuál fue la situación?"
SJT débil + entrevista fuerte: No obtienen una buena puntuación en tu prueba pero sus decisiones pasadas se alinean con tus estándares de juicio. Esto a menudo significa: no entendieron tu contexto en la SJT (son nuevos en la industria) o tu evaluación no mide lo que crees. No los filtres automáticamente. Entiende por qué existe el desajuste.
SJT débil + entrevista débil: Señal consistente. El juicio no se alinea o no es fuerte. Menos probable que sea un buen ajuste.
Cuándo las puntuaciones de SJT no predicen el desempeño
Las SJT son buenas para medir juicio, pero no predicen todo. Sí predicen:
- Calidad de la decisión bajo ambigüedad
- Enfoque de resolución de problemas
- Disciplina de escalada
- Juicio de personas (para roles de gestión)
No predicen:
- Velocidad de ejecución (un candidato podría tomar grandes decisiones pero actuar lentamente)
- Persistencia a través de contratiempos (podrían saber la decisión correcta pero rendirse cuando es difícil)
- Velocidad de aprendizaje (podrían entender tus estándares de juicio pero necesitar tiempo para interiorizarlos)
- Capacidad de comunicación (podrían pensar bien pero tener dificultad para explicar)
- Habilidad técnica (para roles donde la profundidad técnica importa junto al juicio)
Si solo usas una SJT, te falta estas dimensiones. Combínala con:
- Evaluaciones de codificación o muestras de trabajo para habilidad técnica
- Entrevistas conductuales para ejecución pasada y resiliencia
- Entrevistas estructuradas con rúbricas para comunicación y profundidad
Banderas rojas en la interpretación de SJT
Bandera roja 1: Todos obtienen la misma puntuación.
Si todos los candidatos obtienen un 82%, u obtienen un 45%, tu evaluación no está diferenciando. Las causas probables son:
- La evaluación es demasiado fácil o demasiado difícil
- La clasificación maestra no es representativa
- Los candidatos no entienden los escenarios
Revisa la evaluación. Pilota con 3–5 personas e itera.
Bandera roja 2: La varianza de puntuaciones no se correlaciona con la antigüedad.
Si un candidato júnior obtiene una puntuación más alta que tus contrataciones senior, algo está mal. Cualquiera de:
- La evaluación está midiendo algo diferente a lo que crees
- Tu puntuación es inconsistente
- Estás comparando contra puntos de referencia incorrectos
Investiga preguntando a los que obtienen puntuaciones altas y bajas: "Cuéntame por qué clasificaste esa opción primero." ¿Sus explicaciones coinciden con tus expectativas?
Bandera roja 3: Los grupos demográficos obtienen puntuaciones significativamente diferentes.
Si las mujeres obtienen consistentemente 10+ puntos menos que los hombres, o un grupo étnico obtiene una puntuación sistemáticamente más baja, tu evaluación podría tener sesgo. Causas:
- Los escenarios reflejan suposiciones culturales
- El lenguaje no es igualmente accesible
- Los escenarios favorecen ciertos tipos de experiencia
Revisa por sesgo (equidad en el diseño de evaluaciones) y prueba con grupos diversos.
Comunicar puntuaciones a candidatos
Sé transparente sobre lo que la puntuación significa. No digas "obtuviste un 72%." Di:
"En nuestra evaluación de juicio situacional, clasificaste la opción superior consistentemente con nuestros mejores desempeñadores en 3 de 5 escenarios. Tu juicio en [dominio] se alineó bien con nuestros estándares. Tu enfoque a [dominio] difiere de nuestra norma—podría ser una fortaleza (perspectiva fresca) o podría requerir adaptación a nuestra cultura."
Esto reenmarca la puntuación como patrón de juicio en lugar de una calificación de aprobado/reprobado. Señala que:
- Estás midiendo algo específico
- Entiendes el contexto
- Estás abierto a aprender su razonamiento
Usar puntuaciones de SJT en la decisión de contratación
Las puntuaciones de SJT son una señal entre muchas. Úsalas como:
- Filtro de criba: SJT fuerte + ajuste de currículum avanzan. SJT débil pero antecedentes interesantes justifica investigación.
- Sonda de entrevista: Usa la evaluación como punto de partida para preguntas conductuales. "Noté que en el escenario de escalada clasificaste X primero. Cuéntame sobre una vez que escalaste."
- Desempatante: ¿Dos candidatos con entrevistas similares? El que tiene una alineación SJT más fuerte es probable que se adapte mejor a tu cultura.
- Dato de incorporación: Para candidatos contratados, rastrea sus patrones de SJT en la incorporación para identificar áreas de enfoque de mentoría.
No uses SJT como filtro de eliminación para candidatos límite. Úsalo como contexto.
Para una estrategia de evaluación integral, combina SJT con evaluaciones de codificación, entrevistas estructuradas y verificación de referencias. Cada una mide dimensiones diferentes de ajuste.
La plataforma de evaluación de ClarityHire incluye puntuación automatizada, evaluación comparativa contra tus mejores desempeñadores internos, y análisis de patrones para simplificar la interpretación.