El coeficiente de correlación biserial puntual ( r pb ) es un coeficiente de correlación que se utiliza cuando una variable (por ejemplo, Y ) es dicotómica ; Y puede ser dicotómica de forma natural, como si una moneda cae cara o cruz, o una variable dicotomizada artificialmente. En la mayoría de los casos, no es recomendable dicotomizar variables artificialmente. [ 1 ] Cuando una nueva variable se dicotomiza artificialmente, la nueva variable dicotómica puede conceptualizarse como si tuviera una continuidad subyacente. En ese caso, la correlación biserial sería el cálculo más apropiado.
La correlación biserial puntual es matemáticamente equivalente al coeficiente de correlación de Pearson (momento producto) ; es decir, si tenemos una variable medida continuamente X y una variable dicotómica Y , r XY = r pb . Esto se puede demostrar asignando dos valores numéricos distintos a la variable dicotómica.
Cálculo
Para calcular r pb , supongamos que la variable dicotómica Y tiene los dos valores 0 y 1. Si dividimos el conjunto de datos en dos grupos, el grupo 1 que recibió el valor "1" en Y y el grupo 2 que recibió el valor "0" en Y , entonces el coeficiente de correlación biserial puntual se calcula de la siguiente manera:
donde s n es la desviación estándar utilizada cuando se dispone de datos para cada miembro de la población:
M 1 es el valor medio de la variable continua X para todos los puntos de datos del grupo 1, y M 0 es el valor medio de la variable continua X para todos los puntos de datos del grupo 2. Además, n 1 es el número de puntos de datos del grupo 1, n 0 es el número de puntos de datos del grupo 2 y n es el tamaño total de la muestra. Esta fórmula es una fórmula de cálculo que se ha derivado de la fórmula para r XY con el fin de reducir los pasos en el cálculo; es más fácil de calcular que r XY .
Existe una fórmula equivalente que utiliza s n −1 :
donde s n −1 es la desviación estándar utilizada cuando solo se dispone de datos para una muestra de la población:
La versión de la fórmula que utiliza s n −1 es útil si se están calculando coeficientes de correlación biserial puntual en un lenguaje de programación u otro entorno de desarrollo donde hay una función disponible para calcular s n −1 , pero no hay ninguna función disponible para calcular s n . [ 2 ]
También se puede escribir el cuadrado del coeficiente de correlación biserial puntual:
Podemos probar la hipótesis nula de que la correlación es cero en la población. Un poco de álgebra muestra que la fórmula habitual para evaluar la significancia de un coeficiente de correlación, cuando se aplica a r pb , es la misma que la fórmula para una prueba t no pareada y por lo tanto
sigue una distribución t de Student con ( n 1 + n 0 − 2) grados de libertad cuando la hipótesis nula es verdadera.
Una desventaja del coeficiente biserial puntual es que cuanto más alejada esté la distribución de Y de 50/50, más restringido será el rango de valores que puede tomar el coeficiente. Si se puede suponer que la variable dicotómica Y tiene una distribución normal, un índice descriptivo mejor viene dado por el coeficiente biserial : [ 3 ]
dóndees la densidad de la distribución normal con media cero y varianza unitaria yes su función de distribución acumulada inversa . Esto no es fácil de calcular, y el coeficiente biserial no se usa ampliamente en la práctica.
Un caso específico de correlación biserial ocurre cuando X es la suma de varias variables dicotómicas, de las cuales Y es una. Un ejemplo de esto es cuando X es la puntuación total de una persona en una prueba compuesta por n ítems con puntuación dicotómica. Una estadística de interés (que es un índice de discriminación) es la correlación entre las respuestas a un ítem dado y las puntuaciones totales de la prueba correspondientes. Hay tres cálculos ampliamente utilizados, [ 4 ] todos denominados correlación biserial puntual : (i) la correlación de Pearson entre las puntuaciones de los ítems y las puntuaciones totales de la prueba incluyendo las puntuaciones de los ítems, (ii) la correlación de Pearson entre las puntuaciones de los ítems y las puntuaciones totales de la prueba excluyendo las puntuaciones de los ítems, y (iii) una correlación ajustada para el sesgo causado por la inclusión de las puntuaciones de los ítems en las puntuaciones de la prueba. La correlación (iii) es
Una versión ligeramente diferente del coeficiente biserial puntual es el biserial de rangos, que se produce cuando la variable X consta de rangos mientras que Y es dicotómica. Podríamos calcular el coeficiente de la misma manera que cuando X es continua, pero tendría la misma desventaja de que el rango de valores que puede tomar se vuelve más restringido a medida que la distribución de Y se vuelve más desigual. Para sortear esto, observamos que el coeficiente tendrá su valor máximo donde los rangos más pequeños están todos opuestos a los 0 y los rangos más grandes están opuestos a los 1. Su valor mínimo se produce cuando ocurre lo contrario. Estos valores son respectivamente más y menos ( n1 + n0 ) /2. Por lo tanto , podemos usar el recíproco de este valor para reescalar la diferencia entre los rangos medios observados en el intervalo de más uno a menos uno. El resultado es
donde M 1 y M 0 son, respectivamente, las medias de los rangos correspondientes a las puntuaciones 1 y 0 de la variable dicotómica. Esta fórmula, que simplifica el cálculo a partir del recuento de coincidencias e inversiones, se debe a Gene V Glass (1966).
Es posible utilizar esto para probar la hipótesis nula de correlación cero en la población de la que se extrajo la muestra. Si r rb se calcula como se indicó anteriormente, entonces el menor de
y
se distribuye como U de Mann-Whitney con tamaños de muestra n 1 y n 0 cuando la hipótesis nula es verdadera.
Referencias
- ↑ MacCallum, Robert C.; et al. (2002). "Sobre la práctica de la dicotomización de variables cuantitativas". Métodos psicológicos . 7 (1): 19– 40. doi : 10.1037/1082-989X.7.1.19 . hdl : 1808/1495 .
- ↑ Una versión correcta de la fórmula biserial puntual se puede encontrar en Glass, Gene V.; Hopkins, Kenneth D. (1995). Métodos estadísticos en educación y psicología (3.ª ed.). Allyn & Bacon . ISBN 0-205-14212-5.
- ↑ Sheskin, David J. (2011). Manual de procedimientos estadísticos paramétricos y no paramétricos (Quinta ed.). Boca Raton, Londres, Nueva York: CRC Press, Taylor & Francis Group. pág. 1329. ISBN 978-1-4398-5801-1.
- ↑ Linacre, John (2008). "El valor esperado de una correlación punto-biserial (o similar)" . Rasch Measurement Transactions . 22 (1): 1154.
Enlaces externos
- Coeficiente biserial puntual (Keith Calkins, 2005)
- Indicadores de correlación