Criteria Corp vs SHL: Investigación de validez y qué significan los números
Qué significa realmente "validado"
Cuando un proveedor de tests cognitivos dice "validado", se refiere a uno (o varios) de estos aspectos:
- Validez de constructo. El test mide lo que afirma medir (capacidad mental general, razonamiento numérico, etc.).
- Validez de criterio. Las puntuaciones del test correlacionan con medidas de desempeño laboral, generalmente calificaciones del supervisor o datos de productividad.
- Fiabilidad. Las administraciones repetidas producen puntuaciones similares; las formas alternativas son equivalentes.
- Equidad. Las distribuciones de puntuaciones y la precisión predictiva no difieren de manera injusta entre grupos demográficos protegidos.
Tanto Criteria Corp como SHL publican manuales técnicos que cubren los cuatro aspectos. Los manuales son útiles pero fáciles de malinterpretar. Este artículo recorre lo que la investigación de cada proveedor realmente muestra y cómo evaluar las afirmaciones de validez de los proveedores en general - véase también nuestro resumen más amplio sobre investigación de validez predictiva.
CCAT de Criteria Corp
La afirmación principal. CCAT correlaciona con el desempeño laboral con coeficientes de validez en el rango 0,40-0,65 en diversas familias de puestos, alineado con los tests de capacidad cognitiva general de la literatura meta-analítica más amplia.
Cómo se ve la base de investigación. Criteria publica un manual técnico que cubre varios cientos de estudios de validación, incluyendo estudios de validación locales realizados en organizaciones de clientes. La metodología es convencional: recopilar puntuaciones CCAT de una muestra de empleados actuales, recopilar calificaciones de desempeño del supervisor, calcular la correlación, corregir por restricción de rango y error de medición.
Datos de impacto adverso. CCAT muestra el patrón demográfico estándar del test de capacidad cognitiva - diferencias modestas en las puntuaciones medias entre grupos de raza/etnicidad en los EE.UU., consistentes con la literatura más amplia sobre pruebas cognitivas. Criteria publica estas diferencias abiertamente en el manual técnico. Se aplica la regla 4/5; los equipos de contratación que usan CCAT como un cutoff estricto deben ejecutar su propio análisis de impacto adverso en su relación de selección específica.
Fortalezas. Historial de publicación largo. Tamaños de muestra adecuados en la mayoría de los estudios de validación. Metodología transparente. Los números de validez son creíbles a nivel meta-analítico.
Debilidades a tener en cuenta. Muchos estudios de validación publicados usan el diseño de "empleados actuales" en lugar del diseño "predictivo" - correlacionan las puntuaciones de tests de empleados actuales con el desempeño actual, en lugar de probar a los solicitantes y hacer seguimiento a lo largo del tiempo. El diseño de empleados actuales generalmente produce coeficientes más altos de los que produciría el diseño predictivo. Lea la sección de metodología de cualquier estudio específico antes de citar su número.
SHL Verify Interactive G+
La afirmación principal. Verify Interactive G+ mide la capacidad mental general con precisión adaptativa y produce coeficientes de validez en la misma banda 0,50-0,65 contra el desempeño laboral, con la afirmación adicional de que la prueba adaptativa reduce el error de medición frente a los tests de forma fija.
Cómo se ve la base de investigación. SHL tiene una extensa base de datos de validación global - cientos de estudios, muchas muestras grandes, desplegados en docenas de países. El manual técnico es denso y cubre validez de constructo (estructura factorial de la puntuación G+), validez de criterio (muestras meta-analíticas grandes), y equidad transcultural.
Datos de impacto adverso. SHL también publica datos de diferencias de grupo. Como CCAT, Verify muestra el patrón estándar de test cognitivo. El trabajo de localización de SHL - elementos ajustados y renormalizados para diferentes países - reduce algunas fuentes de injusticia transcultural, pero las diferencias de puntuación de capacidad subyacentes permanecen consistentes con la investigación más amplia.
Fortalezas. Base de datos de validación más grande y diversa que la de Criteria, especialmente fuera de EE.UU. La metodología de prueba adaptativa es más eficiente psicométricamente. Análisis de elementos basado en TRI sólido.
Debilidades a tener en cuenta. Los estudios de validación más grandes de SHL se concentran en industrias específicas (servicios financieros, consultoría, petróleo y gas). La generalización a su familia de puestos específica merece un estudio de validación local, que SHL le venderá. Algunos de los coeficientes publicados provienen de diseños concurrentes en lugar de predictivos, la misma advertencia que para Criteria.
Cómo se comparan los dos en validez, cara a cara
Ambos proveedores se sitúan en aproximadamente la misma banda de validez - 0,50 corregido, algo en los 0,30s sin corregir - lo cual es consistente con la investigación más amplia sobre tests de capacidad cognitiva. No hay un estudio publicado directo de cara a cara que muestre que uno es significativamente más predictivo que el otro para uso general.
Donde realmente difieren:
- Error de administración del test. El diseño adaptativo de SHL Verify reduce el error de medición a nivel de test, especialmente en el extremo superior de la capacidad. La forma fija de CCAT es más sensible a los efectos de adivinanzas y presión de tiempo.
- Restricción de rango en la práctica. Si solo prueba a candidatos que ya pasaron un filtro de currículum, ambos tests mostrarán coeficientes observados más bajos que los números meta-analíticos porque el grupo de candidatos tiene rango restringido. Esta es una propiedad de cualquier test, no una diferencia de proveedor.
- Validez transcultural. SHL tiene localización más rigurosa para contratación no estadounidense. Para contratación solo en EE.UU., la brecha es menor.
La validez es necesaria pero no suficiente
Un coeficiente de validez alto le dice que el test predice el desempeño. No le dice:
- Si el test es la evaluación de mayor impacto para su rol específico
- Si el costo justifica la mejora marginal sobre una alternativa más simple
- Si los gerentes de contratación realmente usarán la puntuación, u la anularán por intuición
- Si el test crea problemas de experiencia del candidato que le cuestan buenos candidatos antes en el flujo
La investigación sobre métodos de contratación muestra consistentemente que combinar capacidad cognitiva con otro método válido (prueba de trabajo, entrevista estructurada) produce validez combinada significativamente más alta que la cognitiva sola. Los coeficientes de validez se suman aproximadamente a la R-cuadrada combinada dentro de los límites de los constructos subyacentes.
En la práctica, esto significa: no elija CCAT o SHL Verify como su único filtro de contratación. Elija uno de ellos como el componente cognitivo, luego combine con una entrevista conductual estructurada y una prueba de trabajo. Véase nuestro escrito sobre el flujo de contratación de mayor validez.
Dónde encaja ClarityHire
ClarityHire no proporciona un test de capacidad cognitiva. Nos enfocamos en el lado de la prueba de trabajo: evaluaciones de codificación, entrevistas de codificación en vivo, tarjetas de puntuación conductuales estructuradas, e verificación de integridad.
El emparejamiento de CCAT o SHL Verify (cognitivo) con ClarityHire (prueba de trabajo + entrevista estructurada + integridad) es la configuración que la base de investigación más fuertemente respalda para contratación de trabajadores del conocimiento. Los coeficientes de validez del flujo combinado alcanzan 0,60+ en la literatura meta-analítica, materialmente más alto que cualquier método individual.
Cómo evaluar las afirmaciones de validez de cualquier proveedor
Ya sea que esté mirando Criteria, SHL, u otro proveedor, pregunte:
- ¿De qué muestra viene el coeficiente? El diseño concurrente vs predictivo importa. Los datos previos al empleo son el estándar de oro.
- ¿Qué métodos de corrección se aplicaron? Los coeficientes corregidos vs sin corregir pueden diferir en 0,10-0,20. Ambos son legítimos; solo sepa cuál está leyendo.
- ¿Cuál es la relación de impacto adverso en su contexto? Los números publicados por el proveedor son agregados. Ejecute su propio análisis en su relación de selección.
- ¿Cuál es la historia de validación local? La validez general es un estándar fuerte, pero un estudio local personalizado es lo único que prueba que el test funciona en su configuración.
Tanto Criteria como SHL respaldarán un estudio de validación específico del cliente. El de SHL es más elaborado (y más caro); el de Criteria es más ligero. Cualquiera vale la pena hacer antes de escalar cualquiera de las herramientas en toda una organización.
Véase también: nuestra comparación de características y nuestro desglose de precios y ROI.