Articulo de referencia

Variación cualitativa

Un índice de variación cualitativa ( IQV ) es una medida de la dispersión estadística en distribuciones nominales . Algunos ejemplos son la razón de variación o la entropía de l...

Un índice de variación cualitativa ( IQV ) es una medida de la dispersión estadística en distribuciones nominales . Algunos ejemplos son la razón de variación o la entropía de la información .

Propiedades

Existen varios tipos de índices que se utilizan para el análisis de datos nominales. Algunos son estadísticos estándar que se utilizan en otros contextos: rango , desviación estándar , varianza , desviación media , coeficiente de variación , desviación absoluta mediana , rango intercuartil y desviación cuartílica .

Además de estas, se han desarrollado varias estadísticas teniendo en cuenta los datos nominales. Wilcox ( Wilcox 1967 ) , ( Wilcox 1973 ) resumió y diseñó varias , requiriendo que se cumplan las siguientes propiedades de estandarización:

  • La variación oscila entre 0 y 1.
  • La variación es 0 si y solo si todos los casos pertenecen a una sola categoría.
  • La variación es 1 si y solo si los casos están divididos uniformemente entre todas las categorías. [ 1 ]

En particular, el valor de estos índices estandarizados no depende del número de categorías ni del número de muestras.

Para cualquier índice, cuanto más uniforme sea la distribución, mayor será la varianza, y cuanto mayores sean las diferencias de frecuencia entre categorías, menor será la varianza.

Los índices de variación cualitativa son análogos a la entropía de la información , que se minimiza cuando todos los casos pertenecen a una sola categoría y se maximiza en una distribución uniforme. De hecho, la entropía de la información puede utilizarse como índice de variación cualitativa.

Una forma de caracterizar un índice particular de variación cualitativa (IQV) es como una relación entre las diferencias observadas y las diferencias máximas.

Índices de Wilcox

Wilcox proporciona varias fórmulas para diversos índices de QV ( Wilcox 1973 ) , la primera, que él denomina DM por "Desviación de la Moda", es una forma estandarizada de la razón de variación y es análoga a la varianza como desviación de la media.

ModVR

La fórmula para la variación alrededor de la moda (ModVR) se deriva de la siguiente manera:

METRO=i=1K(FmetroFi){\displaystyle M=\sum _{i=1}^{K}(f_{m}-f_{i})}

donde f m es la frecuencia modal, K es el número de categorías y f i es la frecuencia del i -ésimo grupo.

Esto se puede simplificar a

METRO=KFmetronorte{\displaystyle M=Kf_{m}-N}

donde N es el tamaño total de la muestra.

El índice de Freeman (o índice de variación) es [ 2 ].

v=1Fmetronorte{\displaystyle v=1-{\frac {f_{m}}{N}}}

Esto se relaciona con M de la siguiente manera:

(Fmetronorte)1KnorteK(K1)norte=METROnorte(K1){\displaystyle {\frac {({\frac {f_{m}}{N}})-{\frac {1}{K}}}{{\frac {N}{K}}{\frac {(K-1)}{N}}}}={\frac {M}{N(K-1)}}}

El ModVR se define como

ModVR=1KFmetronortenorte(K1)=K(norteFmetro)norte(K1)=KvK1{\displaystyle \operatorname {ModVR} =1-{\frac {Kf_{m}-N}{N(K-1)}}={\frac {K(N-f_{m})}{N(K-1)}}={\frac {Kv}{K-1}}}

donde v es el índice de Freeman.

Los valores bajos de ModVR corresponden a una pequeña cantidad de variación y los valores altos a cantidades mayores de variación.

Cuando K es grande, ModVR es aproximadamente igual al índice v de Freeman . 

RanVR

Esto se basa en el rango alrededor de la moda. Se define como

RanVR=1FmetroFlFmetro=FlFmetro{\displaystyle \operatorname {RanVR} =1-{\frac {f_{m}-f_{l}}{f_{m}}}={\frac {f_{l}}{f_{m}}}}

donde f m es la frecuencia modal y f l es la frecuencia más baja.

AvDev

Esto es análogo a la desviación media. Se define como la media aritmética de las diferencias absolutas de cada valor con respecto a la media.

AvDev=112norteKK1i=1K|FinorteK|{\displaystyle \operatorname {AvDev} =1-{\frac {1}{2N}}{\frac {K}{K-1}}\sum _{i=1}^{K}\left|f_{i}-{\frac {N}{K}}\right|}

MNDif

Esto es análogo a la diferencia media: el promedio de las diferencias de todos los pares posibles de valores de la variable, independientemente del signo. La diferencia media se diferencia de la media y la desviación estándar porque depende de la dispersión de los valores de la variable entre sí y no de las desviaciones respecto a un valor central. [ 3 ]

MNDif=11norte(K1)i=1K1j=i+1K|FiFj|{\displaystyle \operatorname {MNDif} =1-{\frac {1}{N(K-1)}}\sum _{i=1}^{K-1}\sum _{j=i+1}^{K}|f_{i}-f_{j}|}

donde f i y f j son las frecuencias i y j respectivamente .

El MNDif es el coeficiente de Gini aplicado a datos cualitativos.

VarNC

Esto es un análogo de la varianza.

VarNC=11norte2KK1(FinorteK)2{\displaystyle \operatorname {VarNC} =1-{\frac {1}{N^{2}}}{\frac {K}{K-1}}\sum \left(f_{i}-{\frac {N}{K}}\right)^{2}}

Es el mismo índice que el Índice de Variación Cualitativa de Mueller y Schussler [ 4 ] y el índice M2 de Gibbs .

Se distribuye como una variable chi cuadrado con K  1 grados de libertad . [ 5 ]

StDev

Wilson ha sugerido dos versiones de esta estadística.

El primero se basa en AvDev.

StDev1=1i=1K(FinorteK)2(nortenorteK)2+(K1)(norteK)2{\displaystyle \operatorname {StDev} _{1}=1-{\sqrt {\frac {\sum _{i=1}^{K}\left(f_{i}-{\frac {N}{K}}\right)^{2}}{\left(N-{\frac {N}{K}}\right)^{2}+(K-1)\left({\frac {N}{K}}\right)^{2}}}}}

El segundo se basa en MNDif.

StDev2=1i=1K1j=i+1K(FiFj)2norte2(K1){\displaystyle \operatorname {StDev} _{2}=1-{\sqrt {\frac {\sum _{i=1}^{K-1}\sum _{j=i+1}^{K}(f_{i}-f_{j})^{2}}{N^{2}(K-1)}}}}

HRel

Este índice fue desarrollado originalmente por Claude Shannon para su uso en la especificación de las propiedades de los canales de comunicación.

HRel=pagiregistro2pagiregistro2K{\displaystyle \operatorname {HRel} ={\frac {-\sum p_{i}\log _{2}p_{i}}{\log _{2}K}}}

donde p i = f i / N .

Esto es equivalente a la entropía de la información dividida por laregistro2(K){\displaystyle \log _{2}(K)}y resulta útil para comparar la variación relativa entre tablas de frecuencias de diferentes tamaños.

Índice B

Wilcox adaptó una propuesta de Kaiser [ 6 ] basada en la media geométrica y creó el índice B' . El índice B se define como

B=11[i=1kFiKnortek]2{\displaystyle B=1-{\sqrt {1-\left[{\sqrt[{k}]{\prod _{i=1}^{k}{\frac {f_{i}K}{N}}}}\,\right]^{2}}}}

paquetes R

Varios de estos índices se han implementado en el lenguaje R. [ 7 ]

Gibbs y Poston Jr. (1975) propusieron seis índices. [ 8 ]

M 1

El índice no estandarizado ( M 1) ( Gibbs & Poston Jr 1975 , p. 471) es 

METRO1=1i=1Kpagi2{\displaystyle M1=1-\sum _{i=1}^{K}p_{i}^{2}}

donde K es el número de categorías ypagi=Fi/norte{\displaystyle p_{i}=f_{i}/N}es la proporción de observaciones que caen en una categoría determinada i .

M 1 puede interpretarse como uno menos la probabilidad de que un par aleatorio de muestras pertenezca a la misma categoría, [ 9 ] por lo que esta fórmula para IQV es una probabilidad estandarizada de que un par aleatorio caiga en la misma categoría. Este índice también se ha denominado índice de diferenciación, índice de diferenciación de sustento e índice de diferenciación geográfica, según el contexto en el que se haya utilizado.

M 2

Un segundo índice es el M2 [ 10 ] ( Gibbs & Poston Jr 1975 , p. 472) es: 

METRO2=KK1(1i=1Kpagi2){\displaystyle M2={\frac {K}{K-1}}\left(1-\sum _{i=1}^{K}p_{i}^{2}\right)}

donde K es el número de categorías ypagi=Fi/norte{\displaystyle p_{i}=f_{i}/N}es la proporción de observaciones que caen en una categoría i determinada . El factor deKK1{\displaystyle {\frac {K}{K-1}}}es para estandarización.

M 1 y M 2 pueden interpretarse en términos de la varianza de una distribución multinomial ( Swanson 1976 ) (allí se denomina "modelo binomial expandido"). M 1 es la varianza de la distribución multinomial y M 2 es la razón entre la varianza de la distribución multinomial y la varianza de una distribución binomial .

M 4

El índice M 4 es

METRO4=i=1K|incógnitaimetro|2i=1Kincógnitai{\displaystyle M4={\frac {\sum _{i=1}^{K}|X_{i}-m|}{2\sum _{i=1}^{K}X_{i}}}}

donde m es la media.

M 6

La fórmula para M 6 es

METRO6=K[1i=1K|incógnitaimetro|2norte]{\displaystyle M6=K\left[1-{\frac {\sum _{i=1}^{K}|X_{i}-m|}{2N}}\right]}

· donde K es el número de categorías, X i es el número de puntos de datos en la i -ésima categoría, N es el número total de puntos de datos, || es el valor absoluto (módulo) y

metro=i=1Kincógnitainorte{\displaystyle m={\frac {\sum _{i=1}^{K}X_{i}}{N}}}

Esta fórmula se puede simplificar.

METRO6=K[1i=1K|pagi1norte|2]{\displaystyle M6=K\left[1-{\frac {\sum _{i=1}^{K}\left|p_{i}-{\frac {1}{N}}\right|}{2}}\right]}

donde p i es la proporción de la muestra en la i- ésima categoría.

En la práctica, M 1 y M 6 tienden a estar altamente correlacionados, lo que va en contra de su uso combinado.

La suma

i=1Kpagi2{\displaystyle \sum _{i=1}^{K}p_{i}^{2}}

También se ha encontrado aplicación. Esto se conoce como el índice de Simpson en ecología y como el índice de Herfindahl o el índice de Herfindahl-Hirschman (HHI) en economía. Una variante de este se conoce como el índice de Hunter-Gaston en microbiología [ 11 ].

En lingüística y criptoanálisis, esta suma se conoce como tasa de repetición. La incidencia de coincidencia ( IC ) es un estimador insesgado de esta estadística [ 12 ].

IC=Fi(Fi1)norte(norte1){\displaystyle \operatorname {IC} =\sum {\frac {f_{i}(f_{i}-1)}{n(n-1)}}}

donde f i es el recuento del i- ésimo grafema en el texto y n es el número total de grafemas en el texto.

M 1

El estadístico M 1 definido anteriormente se ha propuesto varias veces en diferentes contextos bajo diversos nombres. Estos incluyen el índice de mutabilidad de Gini, [ 13 ] la medida de diversidad de Simpson, [ 14 ] el índice de homogeneidad lingüística de Bachi, [ 15 ] el índice de variación cualitativa de Mueller y Schuessler, [ 16 ] el índice de diversificación industrial de Gibbs y Martin, [ 17 ] el índice de Lieberson. [ 18 ] y el índice de Blau en sociología, psicología y estudios de gestión. [ 19 ] La formulación de todos estos índices es idéntica.

La D de Simpson se define como

D=1i=1Knortei(nortei1)norte(norte1){\displaystyle D=1-\sum _{i=1}^{K}{\frac {n_{i}(n_{i}-1)}{n(n-1)}}}

donde n es el tamaño total de la muestra y n i es el número de elementos en la i- ésima categoría.

Para n grande tenemos

1i=1Kpagi2{\displaystyle u\sim 1-\sum _{i=1}^{K}p_{i}^{2}}

Otra estadística que se ha propuesto es el coeficiente de antipatía, que varía entre 0 y 1. [ 20 ]

=do(incógnita,y)norte2norte{\displaystyle u={\frac {c(x,y)}{n^{2}-n}}}

donde n es el tamaño de la muestra y c ( x , y ) = 1 si x e y son diferentes y 0 en caso contrario.

Para n grande tenemos

1i=1Kpagi2{\displaystyle u\sim 1-\sum _{i=1}^{K}p_{i}^{2}}

donde K es el número de categorías.

Otra estadística relacionada es la entropía cuadrática.

H2=2(1i=1Kpagi2){\displaystyle H^{2}=2\left(1-\sum _{i=1}^{K}p_{i}^{2}\right)}

lo cual está relacionado a su vez con el índice de Gini .

M 2

El índice monolingüe no ponderado de diversidad lingüística de Greenberg [ 21 ] es la estadística M 2 definida anteriormente.

M 7

Otro índice, el M 7, se creó basándose en el índice M 4 de Gibbs y Poston Jr (1975) [ 22 ].

METRO7=i=1Kj=1L|RiR|2Ri{\displaystyle M7={\frac {\sum _{i=1}^{K}\sum _{j=1}^{L}|R_{i}-R|}{2\sum R_{i}}}}

dónde

Rij=Oijmiij=Oijnorteipagj{\displaystyle R_{ij}={\frac {O_{ij}}{E_{ij}}}={\frac {O_{ij}}{n_{i}p_{j}}}}

y

R=i=1Kj=1LRiji=1Knortei{\displaystyle R={\frac {\sum _{i=1}^{K}\sum _{j=1}^{L}R_{ij}}{\sum _{i=1}^{K}n_{i}}}}

donde K es el número de categorías, L es el número de subtipos, O ij y E ij son el número observado y esperado respectivamente del subtipo j en la i- ésima categoría, n i es el número en la i- ésima categoría y p j es la proporción del subtipo j en la muestra completa.

Nota: Este índice fue diseñado para medir la participación de las mujeres en el ámbito laboral: los dos subtipos para los que fue desarrollado fueron hombres y mujeres.

Otros índices de muestra única

Estos índices son estadísticas descriptivas de la variación dentro de la muestra.

Índice de Berger-Parker

El índice Berger-Parker , que recibe su nombre de Wolfgang H. Berger y Frances Lawrence Parker , es igual al máximo.pagi{\displaystyle p_{i}}valor en el conjunto de datos, es decir, la abundancia proporcional del tipo más abundante. [ 23 ] Esto corresponde a la media generalizada ponderada de lapagi{\displaystyle p_{i}}valores cuando q se acerca al infinito, y por lo tanto es igual al inverso de la verdadera diversidad de orden infinito (1/ D ).

Índice de diversidad de Brillouin

Este índice es estrictamente aplicable solo a poblaciones completas y no a muestras finitas. Se define como

IB=registro(norte¡)i=1K(registro(nortei¡))norte{\displaystyle I_{B}={\frac {\log(N!)-\sum _{i=1}^{K}(\log(n_{i}!))}{N}}}

donde N es el número total de individuos en la población, n i es el número de individuos en la i- ésima categoría y N ! es el factorial de N . El índice de uniformidad de Brillouin se define como

miB=IB/IB(máximo){\displaystyle E_{B}=I_{B}/I_{B(\max )}}

donde I B (máx) es el valor máximo de I B .

Las cifras de diversidad de Hill

Hill sugirió una familia de números de diversidad [ 24 ]

nortea=1[i=1Kpagia]a1{\displaystyle N_{a}={\frac {1}{\left[\sum _{i=1}^{K}p_{i}^{a}\right]^{a-1}}}}

Para determinados valores de a, se pueden calcular varios de los otros índices.

  • a = 0: N a = riqueza de especies
  • a = 1: N a = índice de Shannon
  • a = 2: N a = 1/Índice de Simpson (sin la corrección para muestras pequeñas)
  • a = 3: N a = 1/índice de Berger-Parker

Hill también sugirió una familia de medidas de uniformidad.

mia,b=norteanorteb{\displaystyle E_{a,b}={\frac {N_{a}}{N_{b}}}}

donde a > b .

El E 4 de Hill es

mi4=norte2norte1{\displaystyle E_{4}={\frac {N_{2}}{N_{1}}}}

El E 5 de Hill es

mi5=norte21norte11{\displaystyle E_{5}={\frac {N_{2}-1}{N_{1}-1}}}

Índice de Margalef

IMarg=S1registrominorte{\displaystyle I_{\text{Marg}}={\frac {S-1}{\log _{e}N}}}

donde S es el número de tipos de datos en la muestra y N es el tamaño total de la muestra. [ 25 ]

Índice de Menhinick

IMETROminorte=Snorte{\displaystyle I_{\mathrm {Men} }={\frac {S}{\sqrt {N}}}}

donde S es el número de tipos de datos en la muestra y N es el tamaño total de la muestra. [ 26 ]

En lingüística, este índice es idéntico al índice de Kuraszkiewicz (índice de Guiard), donde S es el número de palabras distintas (tipos) y N es el número total de palabras (tokens) en el texto analizado. [ 27 ] [ 28 ] Este índice puede derivarse como un caso especial de la función de Torquist generalizada. [ 29 ]

Estadístico Q

Esta es una estadística inventada por Kempton y Taylor [ 30 ] e involucra los cuartiles de la muestra. Se define como

Q=12(norteR1+norteR2)+j=R1+1R21nortejregistro(R2/R1){\displaystyle Q={\frac {{\frac {1}{2}}(n_{R1}+n_{R2})+\sum _{j=R_{1}+1}^{R_{2}-1}n_{j}}{\log(R_{2}/R_{1})}}}

donde R 1 y R 2 son los cuartiles 25% y 75% respectivamente en la curva de especies acumuladas, n j es el número de especies en la j -ésima categoría, n Ri es el número de especies en la clase donde cae R i ( i = 1 o 2).

Índice de Shannon-Wiener

Esto se extrae de la teoría de la información.

H=registrominorte1nortenorteipagiregistro(pagi){\displaystyle H=\log _{e}N-{\frac {1}{N}}\sum n_{i}p_{i}\log(p_{i})}

donde N es el número total en la muestra y p i es la proporción en la i- ésima categoría.

En ecología, donde este índice se usa comúnmente, H generalmente se sitúa entre 1,5 y 3,5 y solo en raras ocasiones supera los 4,0.

Una fórmula aproximada para la desviación estándar (DE) de H es

DAKOTA DEL SUR(H)=1norte[pagi[registromi(pagi)]2H2]{\displaystyle \operatorname {SD} (H)={\frac {1}{N}}\left[\sum p_{i}[\log _{e}(p_{i})]^{2}-H^{2}\right]}

donde p i es la proporción formada por la i- ésima categoría y N es el total en la muestra.

Un valor aproximado más preciso de la varianza de H (var( H )) viene dado por [ 31 ].

var(H)=pagi[registro(pagi)]2[pagiregistro(pagi)]2norte+K12norte2+1+pagi2pagi1registro(pagi)+pagi1pagiregistro(pagi)6norte3{\displaystyle \operatorname {var} (H)={\frac {\sum p_{i}[\log(p_{i})]^{2}-\left[\sum p_{i}\log(p_{i})\right]^{2}}{N}}+{\frac {K-1}{2N^{2}}}+{\frac {-1+\sum p_{i}^{2}-\sum p_{i}^{-1}\log(p_{i})+\sum p_{i}^{-1}\sum p_{i}\log(p_{i})}{6N^{3}}}}

donde N es el tamaño de la muestra y K es el número de categorías.

Un índice relacionado es el Pielou J definido como

J=Hregistromi(S){\displaystyle J={\frac {H}{\log _{e}(S)}}}

Una dificultad de este índice es que S es desconocido para una muestra finita. En la práctica, S suele fijarse al valor máximo presente en cualquier categoría de la muestra.

entropía de Rényi

La entropía de Rényi es una generalización de la entropía de Shannon a otros valores de q distintos de la unidad. Se puede expresar de la siguiente manera:

qH=11qln(i=1Kpagiq){\displaystyle {}^{q}H={\frac {1}{1-q}}\;\ln \left(\sum _{i=1}^{K}p_{i}^{q}\right)}

lo cual es igual a

qH=ln(1i=1Kpagipagiq1q1)=ln(qD){\displaystyle {}^{q}H=\ln \left({1 \over {\sqrt[{q-1}]{\sum _{i=1}^{K}p_{i}p_{i}^{q-1}}}}\right)=\ln({}^{q}\!D)}

Esto significa que tomar el logaritmo de la diversidad verdadera basada en cualquier valor de q da la entropía de Rényi correspondiente al mismo valor de q .

El valor deqD{\displaystyle {}^{q}\!D}También se conoce como el número de Hill. [ 24 ]

D y E de McIntosh

McIntosh propuso una medida de diversidad: [ 32 ]

I=i=1Knortei2{\displaystyle I={\sqrt {\sum _{i=1}^{K}n_{i}^{2}}}}

donde n i es el número en la i- ésima categoría y K es el número de categorías.

También propuso varias versiones normalizadas de este índice. La primera es D :

D=norteInortenorte{\displaystyle D={\frac {N-I}{N-{\sqrt {N}}}}}

donde N es el tamaño total de la muestra.

Este índice tiene la ventaja de expresar la diversidad observada como una proporción de la diversidad máxima absoluta en un N dado .

Otra normalización propuesta es E — relación entre la diversidad observada y la máxima diversidad posible de un N y K dados (es decir, si todas las especies tienen el mismo número de individuos):

mi=norteInortenorteK{\displaystyle E={\frac {N-I}{N-{\frac {N}{K}}}}}

alfa de Fisher

Este fue el primer índice que se derivó para la diversidad. [ 33 ]

K=αln(1+norteα){\displaystyle K=\alpha \ln(1+{\frac {N}{\alpha }})}

donde K es el número de categorías y N es el número de puntos de datos en la muestra. El coeficiente α de Fisher debe estimarse numéricamente a partir de los datos.

El número esperado de individuos en la r -ésima categoría, donde las categorías se han ordenado en tamaño creciente, es

mi(norter)=αincógnitarr{\displaystyle \operatorname {E} (n_{r})=\alpha {\frac {X^{r}}{r}}}

donde X es un parámetro empírico que se encuentra entre 0 y 1. Si bien X se estima mejor numéricamente, se puede obtener un valor aproximado resolviendo las siguientes dos ecuaciones.

norte=αincógnita1incógnita{\displaystyle N={\frac {\alpha X}{1-X}}}
K=αln(1incógnita){\displaystyle K=-\alpha \ln(1-X)}

donde K es el número de categorías y N es el tamaño total de la muestra.

La varianza de α es aproximadamente [ 34 ]

var(α)=αln(incógnita)(1incógnita){\displaystyle \operatorname {var} (\alpha )={\frac {\alpha }{\ln(X)(1-X)}}}

Índice de Strong

Este índice ( Dw ) es la distancia entre la curva de Lorenz de distribución de especies y la línea de 45 grados. Está estrechamente relacionado con el coeficiente de Gini. [ 35 ]

En símbolos es

Dw=metroaincógnita[doiKinorte]{\displaystyle D_{w}=max[{\frac {c_{i}}{K}}-{\frac {i}{N}}]}

donde max() es el valor máximo tomado sobre los N puntos de datos, K es el número de categorías (o especies) en el conjunto de datos y c i es el total acumulado hasta la i- ésima categoría inclusive.

Simpson's E

Esto está relacionado con la D de Simpson y se define como

mi=1/DK{\displaystyle E={\frac {1/D}{K}}}

donde D es la D de Simpson y K es el número de categorías en la muestra.

Índices de Smith & Wilson

Smith y Wilson sugirieron una serie de índices basados ​​en la D de Simpson .

mi1=1D11K{\displaystyle E_{1}={\frac {1-D}{1-{\frac {1}{K}}}}}
mi2=registromi(D)registromi(K){\displaystyle E_{2}={\frac {\log _{e}(D)}{\log _{e}(K)}}}

donde D es la D de Simpson y K es el número de categorías.

Índice de Heip

mi=miH1K1{\displaystyle E={\frac {e^{H}-1}{K-1}}}

donde H es la entropía de Shannon y K es el número de categorías.

Este índice está estrechamente relacionado con el índice de Sheldon, que es

mi=miHK{\displaystyle E={\frac {e^{H}}{K}}}

donde H es la entropía de Shannon y K es el número de categorías.

Índice de Camargo

Este índice fue creado por Camargo en 1993. [ 36 ]

mi=1i=1Kj=i+1KpagipagjK{\displaystyle E=1-\sum _{i=1}^{K}\sum _{j=i+1}^{K}{\frac {p_{i}-p_{j}}{K}}}

donde K es el número de categorías y p i es la proporción en la i- ésima categoría.

B de Smith y Wilson

Este índice fue propuesto por Smith y Wilson en 1996. [ 37 ]

B=12πarctan(θ){\displaystyle B=1-{\frac {2}{\pi }}\arctan(\theta )}

donde θ es la pendiente de la curva log(abundancia)-rango.

Índice de Nee, Harvey y Cotgreave

Esta es la pendiente de la curva log(abundancia)-rango.

E de Bulla

Hay dos versiones de este índice: una para distribuciones continuas ( E c ) y otra para distribuciones discretas ( E d ). [ 38 ]

mido=O1K11K{\displaystyle E_{c}={\frac {O-{\frac {1}{K}}}{1-{\frac {1}{K}}}}}
mid=O1KK1norte11KK1norte{\displaystyle E_{d}={\frac {O-{\frac {1}{K}}-{\frac {K-1}{N}}}{1-{\frac {1}{K}}-{\frac {K-1}{N}}}}}

dónde

O=112|pagi1K|{\displaystyle O=1-{\frac {1}{2}}\left|p_{i}-{\frac {1}{K}}\right|}

es el índice de Schoener-Czekanoski, K es el número de categorías y N es el tamaño de la muestra.

Índice de la teoría de la información de Horn

Este índice ( R ik ) se basa en la entropía de Shannon. [ 39 ] Se define como

Rik=HmáximoHobsHmáximoHmin{\displaystyle R_{ik}={\frac {H_{\max }-H_{\mathrm {obs} }}{H_{\max }-H_{\min }}}}

dónde

incógnita=incógnitaij{\displaystyle X=\sum x_{ij}}
incógnita=incógnitakj{\displaystyle X=\sum x_{kj}}
H(incógnita)=incógnitaijincógnitaregistroincógnitaincógnitaij{\displaystyle H(X)=\sum {\frac {x_{ij}}{X}}\log {\frac {X}{x_{ij}}}}
H(Y)=incógnitakjYregistroYincógnitakj{\displaystyle H(Y)=\sum {\frac {x_{kj}}{Y}}\log {\frac {Y}{x_{kj}}}}
Hmin=incógnitaincógnita+YH(incógnita)+Yincógnita+YH(Y){\displaystyle H_{\min }={\frac {X}{X+Y}}H(X)+{\frac {Y}{X+Y}}H(Y)}
Hmáximo=(incógnitaijincógnita+Yregistroincógnita+Yincógnitaij+incógnitakjincógnita+Yregistroincógnita+Yincógnitakj){\displaystyle H_{\max }=\sum \left({\frac {x_{ij}}{X+Y}}\log {\frac {X+Y}{x_{ij}}}+{\frac {x_{kj}}{X+Y}}\log {\frac {X+Y}{x_{kj}}}\right)}
Hobs=incógnitaij+incógnitakjincógnita+Yregistroincógnita+Yincógnitaij+incógnitakj{\displaystyle H_{\mathrm {obs} }=\sum {\frac {x_{ij}+x_{kj}}{X+Y}}\log {\frac {X+Y}{x_{ij}+x_{kj}}}}

En estas ecuaciones, x ij y x kj son el número de veces que el j -ésimo tipo de dato aparece en la i -ésima o k- ésima muestra, respectivamente.

índice de rarefacción

En una muestra rarefacta, se elige una submuestra aleatoria n del total de N elementos. En esta muestra, algunos grupos pueden estar necesariamente ausentes de esta submuestra. Seaincógnitanorte{\displaystyle X_{n}}sea ​​el número de grupos que aún están presentes en la submuestra de n elementos.incógnitanorte{\displaystyle X_{n}}es menor que K el número de categorías siempre que falte al menos un grupo en esta submuestra.

La curva de rarefacción ,Fnorte{\displaystyle f_{n}}se define como:

Fnorte=mi[incógnitanorte]=K(nortenorte)1i=1K(nortenorteinorte){\displaystyle f_{n}=\operatorname {E} [X_{n}]=K-{\binom {N}{n}}^{-1}\sum _{i=1}^{K}{\binom {N-N_{i}}{n}}}

Nótese que 0 ≤ f ( n ) ≤ K .

Además,

F(0)=0, F(1)=1, F(norte)=K.{\displaystyle f(0)=0,\ f(1)=1,\ f(N)=K.}

A pesar de estar definidas en valores discretos de n , estas curvas se muestran con mayor frecuencia como funciones continuas. [ 40 ]

Este índice se analiza con más detalle en Rarefacción (ecología) .

V de Caswell

Esta es una estadística de tipo z basada en la entropía de Shannon. [ 41 ]

V=Hmi(H)DAKOTA DEL SUR(H){\displaystyle V={\frac {H-\operatorname {E} (H)}{\operatorname {SD} (H)}}}

donde H es la entropía de Shannon, E ( H ) es la entropía de Shannon esperada para un modelo de distribución neutral y SD ( H ) es la desviación estándar de la entropía. La desviación estándar se estima a partir de la fórmula derivada por Pielou.

SD(H)=1norte[pagi[registromi(pagi)]2H2]{\displaystyle SD(H)={\frac {1}{N}}\left[\sum p_{i}[\log _{e}(p_{i})]^{2}-H^{2}\right]}

donde p i es la proporción formada por la i- ésima categoría y N es el total en la muestra.

Índice de Lloyd & Ghelardi

Esto es

ILGRAMO=KK{\displaystyle I_{LG}={\frac {K}{K'}}}

donde K es el número de categorías y K' es el número de categorías según el modelo de palo roto de MacArthur que produce la diversidad observada.

Índice promedio de distinción taxonómica

Este índice se utiliza para comparar la relación entre los huéspedes y sus parásitos. [ 42 ] Incorpora información sobre la relación filogenética entre las especies huésped.

STD=2i<jωijs(s1){\displaystyle S_{TD}=2{\frac {\sum \sum _{i<j}\omega _{ij}}{s(s-1)}}}

donde s es el número de especies hospedadoras utilizadas por un parásito y ω ij es la distinción taxonómica entre las especies hospedadoras i y j .

Índice de variación cualitativa

Se han propuesto varios índices con este nombre.

Uno de ellos es

IQV=K(1002i=1Kpagi2)1002(K1)=KK1(1i=1K(pagi/100)2){\displaystyle IQV={\frac {K(100^{2}-\sum _{i=1}^{K}p_{i}^{2})}{100^{2}(K-1)}}={\frac {K}{K-1}}(1-\sum _{i=1}^{K}(p_{i}/100)^{2})}

donde K es el número de categorías y p i es la proporción de la muestra que se encuentra en la i- ésima categoría.

La H de Theil

Este índice también se conoce como índice de entropía multigrupo o índice de teoría de la información. Fue propuesto por Theil en 1972. [ 43 ] El índice es un promedio ponderado de la entropía de las muestras.

Dejar

mia=i=1apagilogramo(pagi){\displaystyle E_{a}=\sum _{i=1}^{a}p_{i}log(p_{i})}

y

H=i=1rnortei(mimii)nortemi{\displaystyle H=\sum _{i=1}^{r}{\frac {n_{i}(E-E_{i})}{NE}}}

donde p i es la proporción del tipo i en la a -ésima muestra, r es el número total de muestras, n i es el tamaño de la i- ésima muestra, N es el tamaño de la población de la que se obtuvieron las muestras y E es la entropía de la población.

Índices para la comparación de dos o más tipos de datos dentro de una misma muestra.

Se han desarrollado varios de estos índices para documentar el grado en que diferentes tipos de datos de interés pueden coexistir dentro de un área geográfica.

Índice de disimilitud

Sean A y B dos tipos de elementos de datos. Entonces el índice de disimilitud es

D=12i=1K|AiABiB|{\displaystyle D={\frac {1}{2}}\sum _{i=1}^{K}\left|{\frac {A_{i}}{A}}-{\frac {B_{i}}{B}}\right|}

dónde

A=i=1KAi{\displaystyle A=\sum _{i=1}^{K}A_{i}}
B=i=1KBi{\displaystyle B=\sum _{i=1}^{K}B_{i}}

A i es el número de datos de tipo A en el sitio de muestreo i , B i es el número de datos de tipo B en el sitio de muestreo i , K es el número de sitios muestreados y || es el valor absoluto.

Este índice es probablemente más conocido como el índice de disimilitud ( D ). [ 44 ] Está estrechamente relacionado con el índice de Gini.

Este índice está sesgado ya que su valor esperado bajo una distribución uniforme es > 0.

Gorard y Taylor propusieron una modificación de este índice. [ 45 ] Su índice (GT) es

GRAMOT=D(1AA+B){\displaystyle GT=D\left(1-{\frac {A}{A+B}}\right)}

Índice de segregación

El índice de segregación ( IS ) [ 46 ] es

SI=12i=1K|AiAtiAiTA|{\displaystyle SI={\frac {1}{2}}\sum _{i=1}^{K}\left|{\frac {A_{i}}{A}}-{\frac {t_{i}-A_{i}}{T-A}}\right|}

dónde

A=i=1KAi{\displaystyle A=\sum _{i=1}^{K}A_{i}}
T=i=1Kti{\displaystyle T=\sum _{i=1}^{K}t_{i}}

y K es el número de unidades, A i y t i es el número de datos de tipo A en la unidad i y el número total de todos los tipos de datos en la unidad i .

Índice de raíz cuadrada de Hutchen

Este índice ( H ) se define como [ 47 ]

H=1i=1Kj=1ipagipagj{\displaystyle H=1-\sum _{i=1}^{K}\sum _{j=1}^{i}{\sqrt {p_{i}p_{j}}}}

donde p i es la proporción de la muestra compuesta por la i- ésima variable.

Índice de aislamiento de Lieberson

Este índice ( Lxy ) fue inventado por Lieberson en 1981. [ 48 ]

Lincógnitay=1nortei=1KincógnitaiYiincógnitatot{\displaystyle L_{xy}={\frac {1}{N}}\sum _{i=1}^{K}{\frac {X_{i}Y_{i}}{X_{\mathrm {tot} }}}}

donde X i e Y i son las variables de interés en el sitio i , K es el número de sitios examinados y X tot es el número total de variables de tipo X en el estudio.

Índice de Bell

Este índice se define como [ 49 ]

IR=pagincógnitaincógnitapagincógnita1pagincógnita{\displaystyle I_{R}={\frac {p_{xx}-p_{x}}{1-p_{x}}}}

donde p x es la proporción de la muestra compuesta por variables de tipo X y

pagincógnitaincógnita=i=1Kincógnitaipaginorteincógnita{\displaystyle p_{xx}={\frac {\sum _{i=1}^{K}x_{i}p_{i}}{N_{x}}}}

donde N x es el número total de variables de tipo X en el estudio, K es el número de muestras en el estudio y x i y p i son el número de variables y la proporción de variables de tipo X respectivamente en la i -ésima muestra.

Índice de aislamiento

El índice de aislamiento es

II=i=1KAiAAiti{\displaystyle II=\sum _{i=1}^{K}{\frac {A_{i}}{A}}{\frac {A_{i}}{t_{i}}}}

donde K es el número de unidades en el estudio, A i y t i es el número de unidades de tipo A y el número de todas las unidades en la i -ésima muestra.

También se ha propuesto un índice de aislamiento modificado.

METROII=IIAT1AT{\displaystyle MII={\frac {II-{\frac {A}{T}}}{1-{\frac {A}{T}}}}}

El MII se encuentra entre 0 y 1.

Índice de segregación de Gorard

Este índice (GS) se define como

GRAMOS=12i=1K|AiAtiT|{\displaystyle GS={\frac {1}{2}}\sum _{i=1}^{K}\left|{\frac {A_{i}}{A}}-{\frac {t_{i}}{T}}\right|}

dónde

A=i=1KAi{\displaystyle A=\sum _{i=1}^{K}A_{i}}
T=i=1Kti{\displaystyle T=\sum _{i=1}^{K}t_{i}}

y A i y t i son el número de elementos de datos de tipo A y el número total de elementos en la i- ésima muestra.

Índice de exposición

Este índice se define como

Imi=i=1KAiABiti{\displaystyle IE=\sum _{i=1}^{K}{\frac {A_{i}}{A}}{\frac {B_{i}}{t_{i}}}}

dónde

A=i=1KAi{\displaystyle A=\sum _{i=1}^{K}A_{i}}

y A i y B i son el número de tipos A y B en la i- ésima categoría y t i es el número total de puntos de datos en la i- ésima categoría.

Índice de Ochiai

Esta es una forma binaria del índice coseno. [ 50 ] Se utiliza para comparar datos de presencia/ausencia de dos tipos de datos (aquí A y B ). Se define como

O=a(a+b)(a+do){\displaystyle O={\frac {a}{\sqrt {(a+b)(a+c)}}}}

donde a es el número de unidades de muestra donde se encuentran tanto A como B , b es el número de unidades de muestra donde ocurre A pero no B y c es el número de unidades de muestra donde está presente el tipo B pero no el tipo A.

Coeficiente de Kulczyński

Este coeficiente fue inventado por Stanisław Kulczyński en 1927 [ 51 ] y es un índice de asociación entre dos tipos (aquí A y B ). Su valor varía entre 0 y 1. Se define como

K=a2(1a+b+1a+do){\displaystyle K={\frac {a}{2}}\left({\frac {1}{a+b}}+{\frac {1}{a+c}}\right)}

donde a es el número de unidades de muestra donde están presentes el tipo A y el tipo B , b es el número de unidades de muestra donde está presente el tipo A pero no el tipo B y c es el número de unidades de muestra donde está presente el tipo B pero no el tipo A.

La pregunta de Navidad

Este índice fue inventado por Yule en 1900. [ 52 ] Se refiere a la asociación de dos tipos diferentes (aquí A y B ). Se define como

Q=adbdoad+bdo{\displaystyle Q={\frac {ad-bc}{ad+bc}}}

donde a es el número de muestras donde están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras donde está presente el tipo B pero no el tipo A y d es el número de muestras donde no están presentes ni el tipo A ni el tipo B. Q varía en valor entre -1 y +1. En el caso ordinal, Q se conoce como la γ de Goodman-Kruskal .

Debido a que el denominador potencialmente puede ser cero, Leinhert y Sporer han recomendado sumar +1 a a , b , c y d . [ 53 ]

Yule's Y

Este índice se define como

Y=adbdoad+bdo{\displaystyle Y={\frac {{\sqrt {ad}}-{\sqrt {bc}}}{{\sqrt {ad}}+{\sqrt {bc}}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B.

Coeficiente de Baroni-Urbani-Buser

Este índice fue inventado por Baroni-Urbani y Buser en 1976. [ 54 ] Varía entre 0 y 1 en valor. Se define como

BUB=ad+aad+a+b+do=ad+anorte+add=1norte(ad)norte+add{\displaystyle BUB={\frac {{\sqrt {ad}}+a}{{\sqrt {ad}}+a+b+c}}={\frac {{\sqrt {ad}}+a}{N+{\sqrt {ad}}-d}}=1-{\frac {N-(a-d)}{N+{\sqrt {ad}}-d}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Cuando d = 0, este índice es idéntico al índice de Jaccard.

coeficiente de Hamman

Este coeficiente se define como

H=(a+d)(b+do)a+b+do+d=(a+d)(b+do)norte{\displaystyle H={\frac {(a+d)-(b+c)}{a+b+c+d}}={\frac {(a+d)-(b+c)}{N}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Coeficiente de Rogers-Tanimoto

Este coeficiente se define como

RT=a+da+2(b+do)+d=a+dnorte+b+do{\displaystyle RT={\frac {a+d}{a+2(b+c)+d}}={\frac {a+d}{N+b+c}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra .

coeficiente de Sokal-Sneath

Este coeficiente se define como

SS=2(a+d)2(a+d)+b+do=2(a+d)norte+a+d{\displaystyle SS={\frac {2(a+d)}{2(a+d)+b+c}}={\frac {2(a+d)}{N+a+d}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

distancia binaria de Sokal

Este coeficiente se define como

SBD=b+doa+b+do+d=b+donorte{\displaystyle SBD={\sqrt {\frac {b+c}{a+b+c+d}}}={\sqrt {\frac {b+c}{N}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

coeficiente de Russell-Rao

Este coeficiente se define como

RR=aa+b+do+d=anorte{\displaystyle RR={\frac {a}{a+b+c+d}}={\frac {a}{N}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

coeficiente phi

Este coeficiente se define como

φ=adbdo(a+b)(a+do)(b+do)(do+d){\displaystyle \varphi ={\frac {ad-bc}{\sqrt {(a+b)(a+c)(b+c)(c+d)}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B.

Coeficiente de Soergel

Este coeficiente se define como

S=b+dob+do+d=b+donortea{\displaystyle S={\frac {b+c}{b+c+d}}={\frac {b+c}{N-a}}}

donde b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Coeficiente de Simpson

Este coeficiente se define como

S=aa+min(b,do){\displaystyle S={\frac {a}{a+\min(b,c)}}}

donde b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A.

Coeficiente de Dennis

Este coeficiente se define como

D=adbdo(a+b+do+d)(a+b)(a+do)=adbdonorte(a+b)(a+do){\displaystyle D={\frac {ad-bc}{\sqrt {(a+b+c+d)(a+b)(a+c)}}}={\frac {ad-bc}{\sqrt {N(a+b)(a+c)}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Coeficiente de Forbes

Este coeficiente fue propuesto por Stephen Alfred Forbes en 1907. [ 55 ] Se define como

F=anorte(a+b)(a+do){\displaystyle F={\frac {aN}{(a+b)(a+c)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra ( N = a + b + c + d ).

Alroy [ 56 ] propuso una modificación de este coeficiente que no requiere el conocimiento de d.

FA=a(norte+norte)a(norte+norte)+32bdo=13bdo2a(norte+norte)+3bdo{\displaystyle F_{A}={\frac {a(n+{\sqrt {n}})}{a(n+{\sqrt {n}})+{\frac {3}{2}}bc}}=1-{\frac {3bc}{2a(n+{\sqrt {n}})+3bc}}}

Donde n = a + b + c .

coeficiente de coincidencia simple

Este coeficiente se define como

SMETRO=a+da+b+do+d=a+dnorte{\displaystyle SM={\frac {a+d}{a+b+c+d}}={\frac {a+d}{N}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Coeficiente de Fossum

Este coeficiente se define como

F=(a+b+do+d)(a0,5)2(a+b)(a+do)=norte(a0,5)2(a+b)(a+do){\displaystyle F={\frac {(a+b+c+d)(a-0.5)^{2}}{(a+b)(a+c)}}={\frac {N(a-0.5)^{2}}{(a+b)(a+c)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Coeficiente de Stile

Este coeficiente se define como

S=registro[norte(|adbdo|norte2)2(a+b)(a+do)(b+d)(do+d)]{\displaystyle S=\log \left[{\frac {n(|ad-bc|-{\frac {n}{2}})^{2}}{(a+b)(a+c)(b+d)(c+d)}}\right]}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B , n es igual a a + b + c + d y || es el módulo (valor absoluto) de la diferencia.

Coeficiente de Michael

Este coeficiente se define como

METRO=4(adbdo)(a+d)2+(b+do)2{\displaystyle M={\frac {4(ad-bc)}{(a+d)^{2}+(b+c)^{2}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B.

Coeficiente de Peirce

En 1884, Charles Peirce sugirió [ 57 ] el siguiente coeficiente

PAG=ab+bdoab+2bdo+dod{\displaystyle P={\frac {ab+bc}{ab+2bc+cd}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B.

coeficiente de Hawkin-Dotson

En 1975, Hawkin y Dotson propusieron el siguiente coeficiente.

HD=12(aa+b+do+db+do+d)=12(anorted+dnortea){\displaystyle HD={\frac {1}{2}}\left({\frac {a}{a+b+c}}+{\frac {d}{b+c+d}}\right)={\frac {1}{2}}\left({\frac {a}{N-d}}+{\frac {d}{N-a}}\right)}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

coeficiente de Benini

En 1901, Benini propuso el siguiente coeficiente.

B=a(a+b)(a+do)a+min(b,do)(a+b)(a+do){\displaystyle B={\frac {a-(a+b)(a+c)}{a+\min(b,c)-(a+b)(a+c)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B y c es el número de muestras en las que está presente el tipo B pero no el tipo A. Min( b , c ) es el mínimo de b y c .

coeficiente de Gilbert

Gilbert propuso el siguiente coeficiente

GRAMO=a(a+b)(a+do)a+b+do(a+b)(a+do)=a(a+b)(a+do)norte(a+b)(a+do)d{\displaystyle G={\frac {a-(a+b)(a+c)}{a+b+c-(a+b)(a+c)}}={\frac {a-(a+b)(a+c)}{N-(a+b)(a+c)-d}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A , y d es el número de muestras en las que no están presentes ni el tipo A ni el tipo B. N es el tamaño de la muestra.

Índice de Gini

El índice de Gini es

GRAMO=a(a+b)(a+do)(1(a+b)2)(1(a+do)2){\displaystyle G={\frac {a-(a+b)(a+c)}{\sqrt {(1-(a+b)^{2})(1-(a+c)^{2})}}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B y c es el número de muestras en las que está presente el tipo B pero no el tipo A.

Índice de Gini modificado

El índice de Gini modificado es

GRAMOMETRO=a(a+b)(a+do)1|bdo|2(a+b)(a+do){\displaystyle G_{M}={\frac {a-(a+b)(a+c)}{1-{\frac {|b-c|}{2}}-(a+b)(a+c)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B y c es el número de muestras en las que está presente el tipo B pero no el tipo A.

Índice de Kuhn

Kuhn propuso el siguiente coeficiente en 1965.

I=2(adbdo)K(2a+b+do)=2(adbdo)K(norte+ad){\displaystyle I={\frac {2(ad-bc)}{K(2a+b+c)}}={\frac {2(ad-bc)}{K(N+a-d)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , y c es el número de muestras en las que está presente el tipo B pero no el tipo A. K es un parámetro de normalización. N es el tamaño de la muestra.

Este índice también se conoce como coeficiente de medias aritméticas.

Índice de Eyraud

Eyraud propuso el siguiente coeficiente en 1936.

I=a(a+b)(a+do)(a+do)(a+d)(b+d)(do+d){\displaystyle I={\frac {a-(a+b)(a+c)}{(a+c)(a+d)(b+d)(c+d)}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni A ni B.

distancia de Soergel

Esto se define como

DAKOTA DEL SUR=b+dob+do+d=b+donortea{\displaystyle \operatorname {SD} ={\frac {b+c}{b+c+d}}={\frac {b+c}{N-a}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni A ni B. N es el tamaño de la muestra.

Índice Tanimoto

Esto se define como

TI=1ab+do+d=1anortea=norte2anortea{\displaystyle TI=1-{\frac {a}{b+c+d}}=1-{\frac {a}{N-a}}={\frac {N-2a}{N-a}}}

donde a es el número de muestras en las que están presentes los tipos A y B , b es el número de muestras en las que está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A y d es el número de muestras en las que no están presentes ni A ni B. N es el tamaño de la muestra.

Índice de Piatetsky-Shapiro

Esto se define como

PAGSI=abdo{\displaystyle PSI=a-bc}

donde a es el número de muestras en las que están presentes los tipos A y B , b es donde está presente el tipo A pero no el tipo B , c es el número de muestras en las que está presente el tipo B pero no el tipo A.

Índices para la comparación entre dos o más muestras

Índice cuantitativo de Czekanowski

También se le conoce como índice de Bray-Curtis , índice de Schoener, índice de porcentaje mínimo común, índice de afinidad o similitud proporcional. Está relacionado con el índice de similitud de Sørensen .

doZI=min(incógnitai,incógnitaj)(incógnitai+incógnitaj){\displaystyle CZI={\frac {\sum \min(x_{i},x_{j})}{\sum (x_{i}+x_{j})}}}

donde x i y x j son el número de especies en los sitios i y j respectivamente y se toma el mínimo sobre el número de especies comunes entre los dos sitios.

Métrica de Canberra

La distancia de Canberra es una versión ponderada de la métrica L1 . Fue introducida en 1966 [ 58 ] y refinada en 1967 [ 59 ] por GN Lance y WT Williams . Se utiliza para definir la distancia entre dos vectores; en este caso , entre dos sitios con K categorías dentro de cada sitio.

La distancia de Canberra d entre los vectores p y q en un espacio vectorial real K -dimensional es

d(pag,q)=i=1norte|pagiqi||pagi|+|qi|{\displaystyle d(\mathbf {p} ,\mathbf {q} )=\sum _{i=1}^{n}{\frac {|p_{i}-q_{i}|}{|p_{i}|+|q_{i}|}}}

donde p i y q i son los valores de la i- ésima categoría de los dos vectores.

Coeficiente de comunidad de Sorensen

Esto se utiliza para medir las similitudes entre comunidades.

dodo=2dos1+s2{\displaystyle CC={\frac {2c}{s_{1}+s_{2}}}}

donde s 1 y s 2 son el número de especies en la comunidad 1 y 2 respectivamente y c es el número de especies comunes a ambas áreas.

Índice de Jaccard

Esta es una medida de la similitud entre dos muestras:

J=AA+B+do{\displaystyle J={\frac {A}{A+B+C}}}

donde A es el número de puntos de datos compartidos entre las dos muestras y B y C son los puntos de datos que se encuentran solo en la primera y la segunda muestra respectivamente.

Este índice fue inventado en 1902 por el botánico suizo Paul Jaccard . [ 60 ]

Bajo una distribución aleatoria, el valor esperado de J es [ 61 ].

J=1A(1A+B+do){\displaystyle J={\frac {1}{A}}\left({\frac {1}{A+B+C}}\right)}

El error estándar de este índice, bajo el supuesto de una distribución aleatoria, es

Smi(J)=A(B+do)norte(A+B+do)3{\displaystyle SE(J)={\sqrt {\frac {A(B+C)}{N(A+B+C)^{3}}}}}

donde N es el tamaño total de la muestra.

Índice de Dice

Esta es una medida de la similitud entre dos muestras:

D=2A2A+B+do{\displaystyle D={\frac {2A}{2A+B+C}}}

donde A es el número de puntos de datos compartidos entre las dos muestras y B y C son los puntos de datos que se encuentran solo en la primera y la segunda muestra respectivamente.

Coeficiente de coincidencia

Esta es una medida de la similitud entre dos muestras:

METRO=norteBdonorte=1B+donorte{\displaystyle M={\frac {N-B-C}{N}}=1-{\frac {B+C}{N}}}

donde N es el número de puntos de datos en las dos muestras y B y C son los puntos de datos que se encuentran solo en la primera y la segunda muestra respectivamente.

Índice de Morisita

El índice de dispersión de Masaaki Morisita ( I m ) es la probabilidad escalada de que dos puntos elegidos al azar de toda la población estén en la misma muestra. [ 62 ] Valores más altos indican una distribución más agrupada.

Imetro=incógnita(incógnita1)nortemetro(metro1){\displaystyle I_{m}={\frac {\sum x(x-1)}{nm(m-1)}}}

Una formulación alternativa es

Imetro=norteincógnita2incógnita(incógnita)2incógnita{\displaystyle I_{m}=n{\frac {\sum x^{2}-\sum x}{\left(\sum x\right)^{2}-\sum x}}}

donde n es el tamaño total de la muestra, m es la media de la muestra y x son los valores individuales cuya suma se toma sobre toda la muestra. También es igual a

Imetro=norte IMETROdonortemetro1{\displaystyle I_{m}={\frac {n\ IMC}{nm-1}}}

donde IMC es el índice de hacinamiento de Lloyd. [ 63 ]

Este índice es relativamente independiente de la densidad de población, pero se ve afectado por el tamaño de la muestra.

Morisita demostró que la estadística [ 62 ]

Imetro(incógnita1)+norteincógnita{\displaystyle I_{m}\left(\sum x-1\right)+n-\sum x}

se distribuye como una variable chi-cuadrado con n 1 grados de libertad.  

Se ha desarrollado una prueba de significancia alternativa para este índice para muestras grandes. [ 64 ]

z=Imetro12/nortemetro2{\displaystyle z={\frac {I_{m}-1}{2/nm^{2}}}}

donde m es la media general de la muestra, n es el número de unidades de la muestra y z es la abscisa de la distribución normal . La significancia se prueba comparando el valor de z con los valores de la distribución normal .

Índice de superposición de Morisita

El índice de superposición de Morisita se utiliza para comparar la superposición entre muestras. [ 65 ] El índice se basa en la suposición de que aumentar el tamaño de las muestras aumentará la diversidad porque incluirá diferentes hábitats.

doD=2i=1Sincógnitaiyi(Dincógnita+Dy)incógnitaY{\displaystyle C_{D}={\frac {2\sum _{i=1}^{S}x_{i}y_{i}}{(D_{x}+D_{y})XY}}}
x i es el número de veces que la especie i está representada en el total X de una muestra.
y i es el número de veces que la especie i está representada en el total Y de otra muestra.
D x y D y son los valores del índice de Simpson para las muestras x e y, respectivamente.
S es el número de especies únicas

CD = 0 si las dos muestras no se superponen en términos de especies, y CD = 1 si las especies aparecen en las mismas proporciones en ambas muestras.

Horn introdujo una modificación del índice [ 66 ]

doH=2i=1Sincógnitaiyi(i=1Sincógnitai2incógnita2+i=1Syi2Y2)incógnitaY{\displaystyle C_{H}={\frac {2\sum _{i=1}^{S}x_{i}y_{i}}{\left({\sum _{i=1}^{S}x_{i}^{2} \over X^{2}}+{\sum _{i=1}^{S}y_{i}^{2} \over Y^{2}}\right)XY}}}

Índice estandarizado de Morisita

Smith-Gill desarrolló una estadística basada en el índice de Morisita que es independiente tanto del tamaño de la muestra como de la densidad de población y está acotada entre −1 y +1. Esta estadística se calcula de la siguiente manera [ 67 ].

Primero, determine el índice de Morisita ( I d ) de la forma habitual. Luego, sea k el número de unidades de las que se tomó la muestra de la población. Calcule los dos valores críticos.

METRO=χ0,9752k+incógnitaincógnita1{\displaystyle M_{u}={\frac {\chi _{0.975}^{2}-k+\sum x}{\sum x-1}}}
METROdo=χ0,0252k+incógnitaincógnita1{\displaystyle M_{c}={\frac {\chi _{0.025}^{2}-k+\sum x}{\sum x-1}}}

donde χ 2 es el valor chi cuadrado para n  1 grados de libertad en los niveles de confianza del 97,5% y del 2,5%.

El índice estandarizado ( I p ) se calcula a partir de una de las fórmulas que se indican a continuación.

Cuando I dM c > 1

Ipag=0,5+0,5(IdMETROdokMETROdo){\displaystyle I_{p}=0.5+0.5\left({\frac {I_{d}-M_{c}}{k-M_{c}}}\right)}

Cuando M c > I d ≥ 1

Ipag=0,5(Id1METRO1){\displaystyle I_{p}=0.5\left({\frac {I_{d}-1}{M_{u}-1}}\right)}

Cuando 1 > I dM u

Ipag=0,5(Id1METRO1){\displaystyle I_{p}=-0.5\left({\frac {I_{d}-1}{M_{u}-1}}\right)}

Cuando 1 > M u > I d

Ipag=0,5+0,5(IdMETROMETRO){\displaystyle I_{p}=-0.5+0.5\left({\frac {I_{d}-M_{u}}{M_{u}}}\right)}

I p varía entre +1 y −1 con intervalos de confianza del 95% de ±0,5. I p tiene un valor de 0 si el patrón es aleatorio; si el patrón es uniforme, I p < 0 y si el patrón muestra agregación, I p > 0.

Índices de uniformidad de Peet

Estos índices son una medida de uniformidad entre muestras. [ 68 ]

mi1=IIminImáximoImin{\displaystyle E_{1}={\frac {I-I_{\min }}{I_{\max }-I_{\min }}}}
mi2=IImáximo{\displaystyle E_{2}={\frac {I}{I_{\max }}}}

donde I es un índice de diversidad, I max e I min son los valores máximo y mínimo de I entre las muestras que se comparan.

Coeficiente de Loevinger

Loevinger ha sugerido un coeficiente H definido de la siguiente manera:

H=pagmáximo(1pagmin)pagmin(1pagmáximo){\displaystyle H={\sqrt {\frac {p_{\max }(1-p_{\min })}{p_{\min }(1-p_{\max })}}}}

donde p max y p min son las proporciones máxima y mínima en la muestra.

Índice de Tversky

El índice de Tversky [ 69 ] es una medida asimétrica que se encuentra entre 0 y 1.

Para las muestras A y B el índice de Tversky ( S ) es

S=|AB||AB|+α|AB|+β|BA|{\displaystyle S={\frac {|A\cap B|}{|A\cap B|+\alpha |A-B|+\beta |B-A|}}}

Los valores de α y β son arbitrarios. Si se establecen ambos α y β en 0,5, se obtiene el coeficiente de Dice . Si se establecen ambos en 1, se obtiene el coeficiente de Tanimoto .

También se ha propuesto una variante simétrica de este índice. [ 70 ]

S1=|AB||AB|+β(αa+(1α)b){\displaystyle S_{1}={\frac {|A\cap B|}{|A\cap B|+\beta \left(\alpha a+(1-\alpha )b\right)}}}

dónde

a=min(|incógnitaY|,|Yincógnita|){\displaystyle a=\min \left(|X-Y|,|Y-X|\right)}
b=máximo(|incógnitaY|,|Yincógnita|){\displaystyle b=\max \left(|X-Y|,|Y-X|\right)}

Se han propuesto varios índices similares.

Monostori et al. propusieron el índice de similitud simétrica [ 71 ].

SS(A,B)=|d(A)d(B)||d(A)+d(B)|{\displaystyle SS(A,B)={\frac {|d(A)\cap d(B)|}{|d(A)+d(B)|}}}

donde d ( X ) es alguna medida derivada de X . 

Bernstein y Zobel propusieron los índices S2 y S3 [ 72 ].

S2=|d(A)d(B)|min(|d(A)|,|d(B))|{\displaystyle S2={\frac {|d(A)\cap d(B)|}{\min(|d(A)|,|d(B))|}}}
S3=2|d(A)d(B)||d(A)+d(B)|{\displaystyle S3={\frac {2|d(A)\cap d(B)|}{|d(A)+d(B)|}}}

S3 es simplemente el doble del índice de similitud simétrica. Ambos están relacionados con el coeficiente de Dice.

Métricas utilizadas

Se han propuesto varias métricas (distancias entre muestras).

distancia euclidiana

Si bien esto se suele utilizar en trabajos cuantitativos, también puede utilizarse en trabajos cualitativos. Esto se define como

djk=i=1norte(incógnitaijincógnitaik)2{\displaystyle d_{jk}={\sqrt {\sum _{i=1}^{N}(x_{ij}-x_{ik})^{2}}}}

donde d jk es la distancia entre x ij y x ik .

La distancia de Gower

Esto se define como

GRAMOD=Σi=1nortewidiΣi=1nortewi{\displaystyle GD={\frac {\Sigma _{i=1}^{n}w_{i}d_{i}}{\Sigma _{i=1}^{n}w_{i}}}}

donde d i es la distancia entre la i- ésima muestra y w i es el peso dado a la i- ésima distancia.

Distancia a Manhattan

Si bien esto se usa más comúnmente en trabajos cuantitativos, también puede usarse en trabajos cualitativos. Esto se define como

djk=i=1norte|incógnitaijincógnitaik|{\displaystyle d_{jk}=\sum _{i=1}^{N}|x_{ij}-x_{ik}|}

donde d jk es la distancia entre x ij y x ik y || es el valor absoluto de la diferencia entre x ij y x ik .

Se puede utilizar una versión modificada de la distancia de Manhattan para encontrar un cero ( raíz ) de un polinomio de cualquier grado utilizando el método de Lill .

La distancia de Prevosti

Esto está relacionado con la distancia de Manhattan. Fue descrita por Prevosti et al. y se utilizó para comparar diferencias entre cromosomas . [ 73 ] Sean P y Q dos colecciones de r distribuciones de probabilidad finitas. Supongamos que estas distribuciones tienen valores divididos en k categorías. Entonces la distancia D PQ es

DPAGQ=1rj=1ri=1k|pagjiqji|{\displaystyle D_{PQ}={\frac {1}{r}}\sum _{j=1}^{r}\sum _{i=1}^{k}|p_{ji}-q_{ji}|}

donde r es el número de distribuciones de probabilidad discretas en cada población, k j es el número de categorías en las distribuciones P j y Q j y p ji (respectivamente q ji ) es la probabilidad teórica de la categoría i en la distribución P j ( Q j ) en la población P ( Q ).

Sus propiedades estadísticas fueron examinadas por Sánchez et al. [ 74 ] , quienes recomendaron un procedimiento bootstrap para estimar intervalos de confianza al probar diferencias entre muestras.

Otras métricas

Dejar

A=incógnitaij{\displaystyle A=\sum x_{ij}}
B=incógnitaik{\displaystyle B=\sum x_{ik}}
J=min(incógnitaij,incógnitajk){\displaystyle J=\sum \min(x_{ij},x_{jk})}

donde min( x , y ) es el menor valor del par x e y .

Entonces

djk=A+B2J{\displaystyle d_{jk}=A+B-2J}

es la distancia de Manhattan,

djk=A+B2JA+B{\displaystyle d_{jk}={\frac {A+B-2J}{A+B}}}

es la distancia de Bray-Curtis,

djk=A+B2JA+BJ{\displaystyle d_{jk}={\frac {A+B-2J}{A+B-J}}}

es la distancia de Jaccard (o Ruzicka) y

djk=112(JA+JB){\displaystyle d_{jk}=1-{\frac {1}{2}}\left({\frac {J}{A}}+{\frac {J}{B}}\right)}

es la distancia de Kulczynski.

Similitudes entre textos

HaCohen-Kerner et al. han propuesto una variedad de métricas para comparar dos o más textos. [ 75 ]

Datos ordinales

Si las categorías son al menos ordinales, entonces se pueden calcular otros índices.

La D de Leik

La medida de dispersión de Leik ( D ) es uno de esos índices. [ 76 ] Supongamos que hay K categorías y que p i es f i / N, donde f i es el número en la i- ésima categoría, y que las categorías están ordenadas en orden ascendente.

doa=i=1apagi{\displaystyle c_{a}=\sum _{i=1}^{a}p_{i}}

donde aK. Sea d a = c a si c a ≤ 0,5 y 1 c a ≤ 0,5 en caso contrario. Entonces  

D=2a=1KdaK1{\displaystyle D=2\sum _{a=1}^{K}{\frac {d_{a}}{K-1}}}

Medida de Herfindahl normalizada

Este es el cuadrado del coeficiente de variación dividido por N  1, donde N es el tamaño de la muestra.

H=1norte1s2metro2{\displaystyle H={\frac {1}{N-1}}{\frac {s^{2}}{m^{2}}}}

donde m es la media y s es la desviación estándar.

Índice de potencial de conflicto

El Índice de Potencial de Conflicto (IPC) describe la proporción de puntuaciones a ambos lados del punto central de una escala de calificación. [ 77 ] Este índice requiere al menos datos ordinales. Esta proporción se suele mostrar como un gráfico de burbujas .

El PCI utiliza una escala ordinal con un número impar de puntos de calificación (− n a + n ) centrado en 0. Se calcula de la siguiente manera:

PAGdoI=incógnitatZ[1|i=1r+incógnita+incógnitati=1rincógnitaincógnitat|]{\displaystyle PCI={\frac {X_{t}}{Z}}\left[1-\left|{\frac {\sum _{i=1}^{r_{+}}X_{+}}{X_{t}}}-{\frac {\sum _{i=1}^{r_{-}}X_{-}}{X_{t}}}\right|\right]}

donde Z = 2 n , |·| es el valor absoluto (módulo), r + es el número de respuestas en el lado positivo de la escala, r es el número de respuestas en el lado negativo de la escala, X + son las respuestas en el lado positivo de la escala, X son las respuestas en el lado negativo de la escala y

incógnitat=i=1r+|incógnita+|+i=1r|incógnita|{\displaystyle X_{t}=\sum _{i=1}^{r_{+}}|X_{+}|+\sum _{i=1}^{r_{-}}|X_{-}|}

Se sabe que existen dificultades teóricas con el PCI. Este índice solo puede calcularse para escalas con un punto central neutro y un número igual de opciones de respuesta a ambos lados. Además, una distribución uniforme de las respuestas no siempre produce el punto medio del estadístico PCI, sino que este varía según el número de respuestas o valores posibles en la escala. Por ejemplo, las escalas de cinco, siete y nueve puntos con una distribución uniforme de las respuestas dan valores de PCI de 0,60, 0,57 y 0,50, respectivamente.

El primero de estos problemas es relativamente menor, ya que la mayoría de las escalas ordinales con un número par de respuestas pueden extenderse (o reducirse) en un solo valor para obtener un número impar de respuestas posibles. La escala generalmente se puede recentrar si es necesario. El segundo problema es más difícil de resolver y puede limitar la aplicabilidad del PCI.

El PCI se ha extendido [ 78 ]

PAGdoI2=i=1Kj=1ikikjdijδ{\displaystyle PCI_{2}={\frac {\sum _{i=1}^{K}\sum _{j=1}^{i}k_{i}k_{j}d_{ij}}{\delta }}}

donde K es el número de categorías, k i es el número en la i- ésima categoría, d ij es la distancia entre la i- ésima y la i- ésima categoría, y δ es la distancia máxima en la escala multiplicada por el número de veces que puede ocurrir en la muestra. Para una muestra con un número par de puntos de datos

δ=norte22dmáximo{\displaystyle \delta ={\frac {N^{2}}{2}}d_{\max }}

y para una muestra con un número impar de puntos de datos

δ=norte212dmáximo{\displaystyle \delta ={\frac {N^{2}-1}{2}}d_{\max }}

donde N es el número de puntos de datos en la muestra y d max es la distancia máxima entre puntos en la escala.

Vaske et al. sugieren varias medidas de distancia posibles para usar con este índice. [ 78 ]

D1:dij=|rirj|1{\displaystyle D_{1}:d_{ij}=|r_{i}-r_{j}|-1}

si los signos (+ o −) de r i y r j difieren. Si los signos son iguales, d ij = 0.

D2:dij=|rirj|{\displaystyle D_{2}:d_{ij}=|r_{i}-r_{j}|}
D3:dij=|rirj|pag{\displaystyle D_{3}:d_{ij}=|r_{i}-r_{j}|^{p}}

donde p es un número real arbitrario > 0.

Dpagij:dij=[|rirj|(metro1)]pag{\displaystyle Dp_{ij}:d_{ij}=[|r_{i}-r_{j}|-(m-1)]^{p}}

si sign( r i ) ≠ sign( r i ) y p es un número real > 0. Si los signos son iguales, entonces d ij = 0. m es D 1 , D 2 o D 3 .

La diferencia entre D 1 y D 2 es que la primera no incluye a los neutrales en la distancia, mientras que la segunda sí. Por ejemplo, los encuestados que puntúan −2 y +1 tendrían una distancia de 2 bajo D 1 y de 3 bajo D 2 .

El uso de una potencia ( p ) en las distancias permite reescalar las respuestas extremas. Estas diferencias pueden resaltarse con p > 1 o atenuarse con p < 1.

En simulaciones con variables extraídas de una distribución uniforme, el PCI 2 tiene una distribución unimodal simétrica. [ 78 ] Las colas de su distribución son más grandes que las de una distribución normal.

Vaske et al. sugieren el uso de una prueba t para comparar los valores del PCI entre muestras si los PCI tienen una distribución aproximadamente normal.

A de van der Eijk

Esta medida es un promedio ponderado del grado de concordancia de la distribución de frecuencias. [ 79 ] A varía de −1 ( bimodalidad perfecta ) a +1 ( unimodalidad perfecta ). Se define como

A=U(1S1K1){\displaystyle A=U\left(1-{\frac {S-1}{K-1}}\right)}

donde U es la unimodalidad de la distribución, S el número de categorías que tienen frecuencias distintas de cero y K el número total de categorías.

El valor de U es 1 si la distribución tiene alguna de las tres características siguientes:

  • Todas las respuestas pertenecen a una sola categoría.
  • Las respuestas se distribuyen uniformemente entre todas las categorías.
  • Las respuestas se distribuyen uniformemente entre dos o más categorías contiguas, mientras que las demás categorías no tienen ninguna respuesta.

Con distribuciones distintas a estas, los datos deben dividirse en «capas». Dentro de una capa, las respuestas son iguales o cero. Las categorías no tienen por qué ser contiguas. Se calcula un valor para A para cada capa ( A i ) y se determina un promedio ponderado para la distribución. Los pesos ( w i ) para cada capa son el número de respuestas en esa capa. En símbolos

Aovmirall=wiAi{\displaystyle A_{\mathrm {overall} }=\sum w_{i}A_{i}}

Una distribución uniforme tiene A = 0: cuando todas las respuestas caen en una categoría, A = +1.

Un problema teórico de este índice es que presupone que los intervalos están igualmente espaciados. Esto puede limitar su aplicabilidad.

Problema de cumpleaños

Si hay n unidades en la muestra y se distribuyen aleatoriamente en k categorías ( nk ), esto puede considerarse una variante del problema del cumpleaños . [ 80 ] La probabilidad ( p ) de que todas las categorías tengan solo una unidad es

pag=i=1norte(1ik){\displaystyle p=\prod _{i=1}^{n}\left(1-{\frac {i}{k}}\right)}

Si c es grande y n es pequeño en comparación con k 2/3, entonces, con buena aproximación,

pag=exp(norte22k){\displaystyle p=\exp \left({\frac {-n^{2}}{2k}}\right)}

Esta aproximación se deduce de la fórmula exacta de la siguiente manera:

registromi(1ik)ik{\displaystyle \log _{e}\left(1-{\frac {i}{k}}\right)\approx -{\frac {i}{k}}}
Estimaciones del tamaño de la muestra

Para p = 0,5 y p = 0,05 respectivamente, las siguientes estimaciones de n pueden ser útiles

norte=1.2k{\displaystyle n=1.2{\sqrt {k}}}
norte=2.448k2.5k{\displaystyle n=2.448{\sqrt {k}}\approx 2.5{\sqrt {k}}}

Este análisis puede extenderse a múltiples categorías. Para p = 0,5 y p 0,05 tenemos respectivamente

norte=1.21i=1k1doi{\displaystyle n=1.2{\sqrt {\frac {1}{\sum _{i=1}^{k}{\frac {1}{c_{i}}}}}}}
norte2.51i=1k1doi{\displaystyle n\approx 2.5{\sqrt {\frac {1}{\sum _{i=1}^{k}{\frac {1}{c_{i}}}}}}}

donde c i es el tamaño de la i- ésima categoría. Este análisis supone que las categorías son independientes.

Si los datos están ordenados de alguna manera, entonces para que ocurra al menos un evento en dos categorías que se encuentran dentro de j categorías entre sí, entonces una probabilidad de 0.5 o 0.05 requiere un tamaño de muestra ( n ) respectivamente de [ 81 ].

norte=1.2k2j+1{\displaystyle n=1.2{\sqrt {\frac {k}{2j+1}}}}
norte2.5k2j+1{\displaystyle n\approx 2.5{\sqrt {\frac {k}{2j+1}}}}

donde k es el número de categorías.

Problema del día del cumpleaños y del fallecimiento

Se ha investigado si existe o no una relación entre los cumpleaños y los días de muerte con la estadística [ 82 ].

registro10(1+2d365),{\displaystyle -\log _{10}\left({\frac {1+2d}{365}}\right),}

donde d es el número de días del año entre el día del cumpleaños y el día del fallecimiento.

Índice Rand

El índice de Rand se utiliza para comprobar si dos o más sistemas de clasificación coinciden en un conjunto de datos. [ 83 ]

Dado un conjunto denorte{\displaystyle n}elementosS={o1,,onorte}{\displaystyle S=\{o_{1},\ldots ,o_{n}\}}y dos particiones deS{\displaystyle S}para comparar,incógnita={incógnita1,,incógnitar}{\displaystyle X=\{X_{1},\ldots ,X_{r}\}}, una partición de S en r subconjuntos, yY={Y1,,Ys}{\displaystyle Y=\{Y_{1},\ldots ,Y_{s}\}}, una partición de S en s subconjuntos, defina lo siguiente:

  • a{\displaystyle a}, el número de pares de elementos enS{\displaystyle S}que se encuentran en el mismo subconjunto enincógnita{\displaystyle X}y en el mismo subconjunto enY{\displaystyle Y}
  • b{\displaystyle b}, el número de pares de elementos enS{\displaystyle S}que se encuentran en diferentes subconjuntos enincógnita{\displaystyle X}y en diferentes subconjuntos enY{\displaystyle Y}
  • do{\displaystyle c}, el número de pares de elementos enS{\displaystyle S}que se encuentran en el mismo subconjunto enincógnita{\displaystyle X}y en diferentes subconjuntos enY{\displaystyle Y}
  • d{\displaystyle d}, el número de pares de elementos enS{\displaystyle S}que se encuentran en diferentes subconjuntos enincógnita{\displaystyle X}y en el mismo subconjunto enY{\displaystyle Y}

El índice Rand -R{\displaystyle R}- se define como

R=a+ba+b+do+d=a+b(norte2){\displaystyle R={\frac {a+b}{a+b+c+d}}={\frac {a+b}{n \choose 2}}}

Intuitivamente,a+b{\displaystyle a+b}puede considerarse como el número de acuerdos entreincógnita{\displaystyle X}yY{\displaystyle Y}ydo+d{\displaystyle c+d}como el número de desacuerdos entreincógnita{\displaystyle X}yY{\displaystyle Y}.

Índice Rand ajustado

El índice de Rand ajustado es la versión corregida por azar del índice de Rand. [ 83 ] [ 84 ] [ 85 ] Si bien el índice de Rand solo puede arrojar un valor entre 0 y +1, el índice de Rand ajustado puede arrojar valores negativos si el índice es menor que el índice esperado. [ 86 ]

La tabla de contingencia

Dado un conjuntoS{\displaystyle S}denorte{\displaystyle n}elementos, y dos agrupaciones o particiones ( por ejemplo, agrupaciones) de estos puntos, a saber:incógnita={incógnita1,incógnita2,,incógnitar}{\displaystyle X=\{X_{1},X_{2},\ldots ,X_{r}\}}yY={Y1,Y2,,Ys}{\displaystyle Y=\{Y_{1},Y_{2},\ldots ,Y_{s}\}}, la superposición entreincógnita{\displaystyle X}yY{\displaystyle Y}se puede resumir en una tabla de contingencia[norteij]{\displaystyle \left[n_{ij}\right]}donde cada entradanorteij{\displaystyle n_{ij}}denota el número de objetos en común entreincógnitai{\displaystyle X_{i}}yYj{\displaystyle Y_{j}} :norteij=|incógnitaiYj|{\displaystyle n_{ij}=|X_{i}\cap Y_{j}|}.

Definición

La forma ajustada del Índice Rand, el Índice Rand Ajustado, es

Índice ajustado=ÍndiceÍndice esperadoÍndice máximoÍndice esperado,{\displaystyle {\text{AdjustedIndex}}={\frac {{\text{Index}}-{\text{ExpectedIndex}}}{{\text{MaxIndex}}-{\text{ExpectedIndex}}}},}

más específicamente

ARI=ij(norteij2)[i(ai2)j(bj2)]/(norte2)12[i(ai2)+j(bj2)][i(ai2)j(bj2)]/(norte2){\displaystyle {\text{ARI}}={\frac {\sum _{ij}{\binom {n_{ij}}{2}}-\left.\left[\sum _{i}{\binom {a_{i}}{2}}\sum _{j}{\binom {b_{j}}{2}}\right]\right/{\binom {n}{2}}}{{\frac {1}{2}}\left[\sum _{i}{\binom {a_{i}}{2}}+\sum _{j}{\binom {b_{j}}{2}}\right]-\left.\left[\sum _{i}{\binom {a_{i}}{2}}\sum _{j}{\binom {b_{j}}{2}}\right]\right/{\binom {n}{2}}}}}

dóndenorteij,ai,bj{\displaystyle n_{ij},a_{i},b_{j}}son valores de la tabla de contingencia.

Dado que el denominador es el número total de pares, el índice de Rand representa la frecuencia de ocurrencia de coincidencias sobre el total de pares, o la probabilidad de queincógnita{\displaystyle X}yY{\displaystyle Y}se pondrán de acuerdo en un par elegido al azar.

Evaluación de índices

Los distintos índices arrojan diferentes valores de variación y pueden utilizarse para diferentes propósitos: varios de ellos se utilizan y se critican especialmente en la literatura sociológica.

Si uno desea simplemente hacer comparaciones ordinales entre muestras (si una muestra es más o menos variada que otra), la elección del IQV es relativamente menos importante, ya que a menudo darán el mismo orden.

Cuando los datos son ordinales, un método que puede ser útil para comparar muestras es ORDANOVA .

En algunos casos es útil no estandarizar un índice para que vaya de 0 a 1, independientemente del número de categorías o muestras ( Wilcox 1973 , págs. 338) , pero generalmente se estandariza de esa manera. 

Véase también

Notas

  1. Esto solo puede ocurrir si el número de casos es un múltiplo del número de categorías.
  2. Freemen LC (1965) Estadística aplicada elemental . Nueva York: John Wiley and Sons, págs. 40-43
  3. Kendal MC, Stuart A (1958) Teoría avanzada de la estadística. Hafner Publishing Company pág. 46
  4. Mueller JE, Schuessler KP (1961) Razonamiento estadístico en sociología. Boston: Houghton Mifflin Company. págs. 177–179
  5. Wilcox (1967) , pág.. 
  6. Kaiser HF (1968) "Una medida de la calidad poblacional de la distribución legislativa". The American Political Science Review 62 (1) 208
  7. Joel Gombin (18 de agosto de 2015). "qualvar: lanzamiento inicial (versión v0.1)" . Zenodo . doi : 10.5281/zenodo.28341 .
  8. Gibbs y Poston Jr (1975) .
  9. Lieberson (1969) , pág. 851.
  10. IQV en xycoon
  11. Hunter, PR; Gaston, MA (1988). "Índice numérico de la capacidad discriminatoria de los sistemas de tipificación: una aplicación del índice de diversidad de Simpson" . J Clin Microbiol . 26 (11): 2465–2466 . doi : 10.1128/jcm.26.11.2465-2466.1988 . PMC 266921. PMID 3069867 .  
  12. Friedman WF (1925) La incidencia de la coincidencia y sus aplicaciones en criptoanálisis. Documento técnico. Oficina del Jefe de Señales. Oficina de Imprenta del Gobierno de los Estados Unidos.
  13. Gini CW (1912) Variabilidad y mutabilidad, contribución al estudio de distribuciones y relaciones estadísticas. Studi Economico-Giuricici della R. Università de Cagliari
  14. Simpson, EH (1949). "Medición de la diversidad" . Nature . 163 (4148): 688. Bibcode : 1949Natur.163..688S . doi : 10.1038/163688a0 .
  15. ^ Bachi R (1956) Un análisis estadístico del resurgimiento del hebreo en Israel. En: Bachi R (ed) Scripta Hierosolymitana, Vol III, Jerusalén: Magnus press págs. 179–247
  16. Mueller JH, Schuessler KF (1961) Razonamiento estadístico en sociología. Boston: Houghton Mifflin
  17. Gibbs, JP; Martin, WT (1962). "Urbanización, tecnología y división del trabajo: patrones internacionales". American Sociological Review . 27 (5): 667– 677. doi : 10.2307/2089624 . JSTOR 2089624 . 
  18. Lieberson (1969) , pág.. 
  19. Blau P (1977) Desigualdad y heterogeneidad. Free Press, Nueva York
  20. Perry M, Kader G (2005) La variación como antipatía. Teaching Stats 27 (2) 58–60
  21. Greenberg, JH (1956). "La medición de la diversidad lingüística". Language . 32 (1): 109– 115. doi : 10.2307/410659 . JSTOR 410659 . 
  22. Lautard EH (1978) Tesis doctoral.
  23. Berger, WH; Parker, FL (1970). "Diversidad de forameníferos planctónicos en sedimentos de aguas profundas". Science . 168 (3937): 1345– 1347. Bibcode : 1970Sci...168.1345B . doi : 10.1126/science.168.3937.1345 . PMID 17731043 . S2CID 29553922 .  
  24. 1 2 Hill, MO (1973). "Diversidad y uniformidad: una notación unificadora y sus consecuencias". Ecology . 54 (2): 427– 431. Bibcode : 1973Ecol...54..427H . doi : 10.2307/1934352 . JSTOR 1934352 . 
  25. Margalef R (1958) Sucesión temporal y heterogeneidad espacial en el fitoplancton. En: Perspectivas en biología marina. Buzzati-Traverso (ed.) Univ Calif Press, Berkeley pp 323–347
  26. Menhinick, EF (1964). "Una comparación de algunos índices de diversidad de especies e individuos aplicados a muestras de insectos de campo". Ecology . 45 (4): 859– 861. Bibcode : 1964Ecol...45..859M . doi : 10.2307/1934933 . JSTOR 1934933 . 
  27. Kuraszkiewicz W (1951) Nakladen Wroclawskiego Towarzystwa Naukowego
  28. ^ Guiraud P (1954) Les caractères statistiques du vocabulaire. Prensas Universitarias de Francia, París
  29. Panas E (2001) El Torquist generalizado: Especificación y estimación de una nueva función de tamaño de texto-vocabulario. J Quant Ling 8(3) 233–252
  30. Kempton, RA; Taylor, LR (1976). "Modelos y estadísticas para la diversidad de especies". Nature . 262 (5571): 818– 820. Bibcode : 1976Natur.262..818K . doi : 10.1038/262818a0 . PMID 958461 . S2CID 4168222 .  
  31. Hutcheson K (1970) Una prueba para comparar diversidades basada en la fórmula de Shannon. J Theo Biol 29: 151–154
  32. McIntosh RP (1967). Un índice de diversidad y la relación de ciertos conceptos con la diversidad. Ecology, 48(3), 392–404
  33. Fisher RA, Corbet A, Williams CB (1943) La relación entre el número de especies y el número de individuos en una muestra aleatoria de una población animal. Animal Ecol 12: 42–58
  34. Anscombe (1950) Teoría del muestreo de las distribuciones binomiales negativas y de series logarítmicas. Biometrika 37: 358–382
  35. Strong, WL (2002). "Evaluación de la desigualdad en la abundancia de especies dentro y entre comunidades vegetales" (PDF) . Community Ecology . 3 (2): 237– 246. doi : 10.1556/comec.3.2002.2.9 .
  36. Camargo JA (1993) ¿Debe aumentar la dominancia con el número de especies subordinadas en las interacciones competitivas? J. Theor Biol 161 537–542
  37. Smith, Wilson (1996)
  38. Bulla, L (1994). "Un índice de uniformidad y su medida de diversidad asociada". Oikos . 70 (1): 167– 171. Bibcode : 1994Oikos..70..167B . doi : 10.2307/3545713 . JSTOR 3545713 . 
  39. Horn, HS (1966). "Medición de la 'superposición' en estudios ecológicos comparativos". Am Nat . 100 (914): 419– 423. doi : 10.1086/282436 . S2CID 84469180 . 
  40. Siegel, Andrew F (2006) "Curvas de rarefacción." Enciclopedia de Ciencias Estadísticas 10.1002/0471667196.ess2195.pub2.
  41. Caswell H (1976) Estructura de la comunidad: un análisis de modelo neutral. Ecol Monogr 46: 327–354
  42. Poulin, R; Mouillot, D (2003). "Especialización de parásitos desde una perspectiva filogenética: un nuevo índice de especificidad del huésped". Parasitología . 126 ( 5): 473– 480. CiteSeerX 10.1.1.574.7432 . doi : 10.1017/s0031182003002993 . PMID 12793652. S2CID 9440341 .   
  43. Theil H (1972) Análisis de descomposición estadística. Ámsterdam: North-Holland Publishing Company>
  44. Duncan OD, Duncan B (1955) Un análisis metodológico de los índices de segregación. Am Sociol Review, 20: 210–217
  45. Gorard S, Taylor C (2002b) ¿Qué es la segregación? Una comparación de medidas en términos de invariancia composicional «fuerte» y «débil». Sociology, 36(4), 875–895
  46. Massey, DS; Denton, NA (1988). "Las dimensiones de la segregación residencial" . Social Forces . 67 (2): 281– 315. doi : 10.1093/sf/67.2.281 .
  47. Hutchens RM (2004) Una medida de segregación. International Economic Review 45: 555–578
  48. Lieberson S (1981). "Un enfoque asimétrico de la segregación". En Peach C, Robinson V, Smith S (eds.). Segregación étnica en las ciudades . Londres: Croom Helm. pp. 61–82 . 
  49. Bell, W (1954). "Un modelo de probabilidad para la medición de la segregación ecológica". Social Forces . 32 (4): 357– 364. doi : 10.2307/2574118 . JSTOR 2574118 . 
  50. Ochiai A (1957) Estudios zoogeográficos sobre los peces soléidos encontrados en Japón y sus regiones vecinas. Bull Jpn Soc Sci Fish 22: 526–530
  51. Kulczynski S (1927) Die Pflanzenassoziationen der Pieninen. Boletín Internacional de la Academia Polonesa de Ciencias y Letras, Clase de Ciencias
  52. Yule GU (1900) Sobre la asociación de atributos en estadística. Philos Trans Roy Soc
  53. Lienert GA and Sporer SL (1982) Interkorrelationen seltner Symptome mittels Nullfeldkorrigierter YuleKoeffizienten. Psychologische Beitrage 24: 411–418
  54. Baroni-Urbani, C; Buser, MW (1976). "similarity of binary Data". Systematic Biology. 25 (3): 251–259. doi:10.2307/2412493. JSTOR 2412493.
  55. Forbes SA (1907) On the local distribution of certain Illinois fishes: an essay in statistical ecology. Bulletin of the Illinois State Laboratory of Natural History 7:272–303
  56. Alroy J (2015) A new twist on a very old binary similarity coefficient. Ecology 96 (2) 575-586
  57. Carl R. Hausman and Douglas R. Anderson (2012). Conversations on Peirce: Reals and Ideals. Fordham University Press. p. 221. ISBN 9780823234677.
  58. Lance, G. N.; Williams, W. T. (1966). "Computer programs for hierarchical polythetic classification ("similarity analysis")". Computer Journal. 9 (1): 60–64. doi:10.1093/comjnl/9.1.60.
  59. Lance, G. N.; Williams, W. T. (1967). "Mixed-data classificatory programs I.) Agglomerative Systems". Australian Computer Journal: 15–20.
  60. Jaccard P (1902) Lois de distribution florale. Bulletin de la Socíeté Vaudoise des Sciences Naturelles 38:67-130
  61. Archer AW and Maples CG (1989) Response of selected binomial coefficients to varying degrees of matrix sparseness and to matrices with known data interrelationships. Mathematical Geology 21: 741–753
  62. 12Morisita M (1959) Measuring the dispersion and the analysis of distribution patterns. Memoirs of the Faculty of Science, Kyushu University Series E. Biol 2:215–235
  63. Lloyd M (1967) Mean crowding. J Anim Ecol 36: 1–30
  64. Pedigo LP & Buntin GD (1994) Handbook of sampling methods for arthropods in agriculture. CRC Boca Raton FL
  65. Morisita M (1959) Measuring of the dispersion and analysis of distribution patterns. Memoirs of the Faculty of Science, Kyushu University, Series E Biology. 2: 215–235
  66. Horn, HS (1966). "Measurement of "Overlap" in comparative ecological studies". The American Naturalist. 100 (914): 419–424. doi:10.1086/282436. S2CID 84469180.
  67. Smith-Gill SJ (1975). "Cytophysiological basis of disruptive pigmentary patterns in the leopard frog Rana pipiens. II. Wild type and mutant cell specific patterns". J Morphol. 146 (1): 35–54. doi:10.1002/jmor.1051460103. PMID 1080207. S2CID 23780609.
  68. Peet (1974) The measurements of species diversity. Annu Rev Ecol Syst 5: 285–307
  69. Tversky, Amos (1977). "Features of Similarity"(PDF). Psychological Review. 84 (4): 327–352. doi:10.1037/0033-295x.84.4.327.
  70. Jimenez S, Becerra C, Gelbukh A SOFTCARDINALITY-CORE: Improving text overlap with distributional measures for semantic textual similarity. Second Joint Conference on Lexical and Computational Semantics (*SEM), Volume 1: Proceedings of the main conference and the shared task: semantic textual similarity, p194-201. June 7–8, 2013, Atlanta, Georgia, USA
  71. Monostori K, Finkel R, Zaslavsky A, Hodasz G and Patke M (2002) Comparison of overlap detection techniques. In: Proceedings of the 2002 International Conference on Computational Science. Lecture Notes in Computer Science 2329: 51-60
  72. Bernstein Y and Zobel J (2004) A scalable system for identifying co-derivative documents. In: Proceedings of 11th International Conference on String Processing and Information Retrieval (SPIRE) 3246: 55-67
  73. Prevosti, A; Ribo, G; Serra, L; Aguade, M; Balanya, J; Monclus, M; Mestres, F (1988). "Colonization of America by Drosophila subobscura: experiment in natural populations that supports the adaptive role of chromosomal inversion polymorphism". Proc Natl Acad Sci USA. 85 (15): 5597–5600. Bibcode:1988PNAS...85.5597P. doi:10.1073/pnas.85.15.5597. PMC 281806. PMID 16593967.
  74. Sanchez, A; Ocana, J; Utzetb, F; Serrac, L (2003). "Comparison of Prevosti genetic distances". Journal of Statistical Planning and Inference. 109 (1–2): 43–65. doi:10.1016/s0378-3758(02)00297-5.
  75. HaCohen-Kerner Y, Tayeb A and Ben-Dror N (2010) Detection of simple plagiarism in computer science papers. In: Proceedings of the 23rd International Conference on Computational Linguistics pp 421-429
  76. Leik R (1966) A measure of ordinal consensus. Pacific sociological review 9 (2): 85–90
  77. Manfredo M, Vaske, JJ, Teel TL (2003) The potential for conflict index: A graphic approach tp practical significance of human dimensions research. Human Dimensions of Wildlife 8: 219–228
  78. 123Vaske JJ, Beaman J, Barreto H, Shelby LB (2010) An extension and further validation of the potential for conflict index. Leisure Sciences 32: 240–254
  79. Van der Eijk C (2001) Measuring agreement in ordered rating scales. Quality and quantity 35(3): 325–341
  80. Von Mises R (1939) Uber Aufteilungs-und Besetzungs-Wahrcheinlichkeiten. Revue de la Facultd des Sciences de de I'Universite d'lstanbul NS 4: 145−163
  81. Sevast'yanov BA (1972) Poisson limit law for a scheme of sums of dependent random variables. (trans. S. M. Rudolfer) Theory of probability and its applications, 17: 695−699
  82. Hoaglin DC, Mosteller, F and Tukey, JW (1985) Exploring data tables, trends, and shapes, New York: John Wiley
  83. 12W. M. Rand (1971). "Objective criteria for the evaluation of clustering methods". Journal of the American Statistical Association. 66 (336): 846–850. arXiv:1704.01036. doi:10.2307/2284239. JSTOR 2284239.
  84. Lawrence Hubert and Phipps Arabie (1985). "Comparing partitions". Journal of Classification. 2 (1): 193–218. doi:10.1007/BF01908075. S2CID 189915041.
  85. Nguyen Xuan Vinh, Julien Epps and James Bailey (2009). "Information Theoretic Measures for Clustering Comparison: Is a Correction for Chance Necessary?"(PDF). ICML '09: Proceedings of the 26th Annual International Conference on Machine Learning. ACM. pp. 1073–1080. Archived from the original(PDF) on 25 March 2012.PDF.
  86. Wagner, Silke; Wagner, Dorothea (12 January 2007). "Comparing Clusterings - An Overview"(PDF). Archived from the original(PDF) on 3 December 2013. Retrieved 14 February 2018.

References

  • Gibbs, Jack P.; Poston Jr, Dudley L. (marzo de 1975), "La división del trabajo: conceptualización y medidas relacionadas", Social Forces , 53 (3): 468–476 , CiteSeerX 10.1.1.1028.4969 , doi : 10.2307/2576589 , JSTOR 2576589  
  • Lieberson, Stanley (diciembre de 1969), "Medición de la diversidad poblacional", American Sociological Review , 34 (6): 850– 862, doi : 10.2307/2095977 , JSTOR 2095977 
  • Swanson, David A. (septiembre de 1976), "Una distribución muestral y una prueba de significancia para diferencias en la variación cualitativa", Social Forces , 55 (1): 182–184 , doi : 10.2307/2577102 , JSTOR 2577102 
  • Wilcox, Allen R. (octubre de 1967). Índices de variación cualitativa (PDF) (Informe). Archivado del original (PDF) el 15 de agosto de 2007.
  • Wilcox, Allen R. (junio de 1973). "Índices de variación cualitativa y medición política". The Western Political Quarterly . 26 (2): 325– 343. doi : 10.2307/446831 . JSTOR 446831 .