En estadística , una región de confianza es una generalización multidimensional de un intervalo de confianza . Para una distribución normal bivariada , es una elipse , también conocida como elipse de error . De forma más general, es un conjunto de puntos en un espacio n -dimensional, a menudo representado como un hiperelipsoide alrededor de un punto que es una solución estimada a un problema, aunque pueden presentarse otras formas.
Interpretación
La región de confianza se calcula de tal manera que, si se repitiera un conjunto de mediciones muchas veces y se calculara la región de confianza de la misma forma para cada conjunto de mediciones, entonces, en un cierto porcentaje de los casos (por ejemplo, el 95 %), la región de confianza incluiría el punto que representa los valores "verdaderos" del conjunto de variables que se están estimando. Sin embargo, a menos que se hagan ciertas suposiciones sobre probabilidades previas , el cálculo de una región de confianza no implica que exista una probabilidad del 95 % de que los valores "verdaderos" se encuentren dentro de la región, ya que no asumimos ninguna distribución de probabilidad particular de los valores "verdaderos" y podemos o no tener otra información sobre dónde es probable que se encuentren.
El caso de errores independientes e idénticamente distribuidos normalmente.
Supongamos que hemos encontrado una solución.al siguiente problema sobredeterminado:
donde Y es un vector columna n -dimensional que contiene los valores observados de la variable dependiente , X es una matriz n -por- p de valores observados de variables independientes (que pueden representar un modelo físico) que se supone que se conocen exactamente,es un vector columna que contiene los p parámetros que se van a estimar, yes un vector columna n -dimensional de errores que se supone que están distribuidos independientemente con distribuciones normales con media cero y cada uno con la misma varianza desconocida.
Una región de confianza conjunta del 100(1 − α ) % para los elementos de está representado por el conjunto de valores del vector b que satisfacen la siguiente desigualdad: [ 1 ]
donde la variable b representa cualquier punto en la región de confianza, p es el número de parámetros, es decir, el número de elementos del vectores el vector de parámetros estimados, y s 2 es el chi-cuadrado reducido , una estimación insesgada deigual a
Además, F es la función cuantil de la distribución F , con p ygrados de libertad ,es el nivel de significancia estadística y el símbolosignifica la transpuesta de.
La expresión se puede reescribir como:
dóndees la matriz de covarianza escalada de mínimos cuadrados de.
La desigualdad anterior define una región elipsoidal en el espacio de parámetros cartesianos p -dimensional R p . El centro del elipsoide se encuentra en la estimaciónSegún Press et al., es más fácil trazar el elipsoide después de realizar la descomposición en valores singulares . Las longitudes de los ejes del elipsoide son proporcionales a los recíprocos de los valores en las diagonales de la matriz diagonal , y las direcciones de estos ejes vienen dadas por las filas de la tercera matriz de la descomposición.
Mínimos cuadrados ponderados y generalizados
Ahora consideremos el caso más general donde algunos elementos distintos detienen covarianza no nula conocida (es decir, los errores en las observaciones no están distribuidos independientemente) y/o las desviaciones estándar de los errores no son todas iguales. Supongamos que la matriz de covarianza dees, donde V es una matriz no singular de n por n que era igual aen el caso más específico tratado en la sección anterior, (donde I es la matriz identidad ), pero aquí se permite tener elementos fuera de la diagonal distintos de cero que representan la covarianza de pares de observaciones individuales, así como no necesariamente tener todos los elementos diagonales iguales.
Es posible encontrar [ 2 ] una matriz simétrica no singular P tal que
En efecto, P es la raíz cuadrada de la matriz de covarianza V.
El problema de mínimos cuadrados
Luego se puede transformar multiplicando cada término por la izquierda por el inverso de P , formando la nueva formulación del problema.
dónde
- y
Una región de confianza conjunta para los parámetros, es decir, para los elementos de, entonces está delimitado por el elipsoide dado por: [ 3 ]
Aquí F representa el punto porcentual de la distribución F y las cantidades p y np son los grados de libertad que son los parámetros de esta distribución.
problemas no lineales
Se pueden definir regiones de confianza para cualquier distribución de probabilidad. El experimentador puede elegir el nivel de significancia y la forma de la región, y luego el tamaño de la región viene determinado por la distribución de probabilidad. Una elección natural es utilizar como límite un conjunto de puntos con constantevalores ( chi-cuadrado ).
Una estrategia consiste en utilizar una aproximación lineal al modelo no lineal, que puede ser una buena aproximación en las proximidades de la solución, y luego aplicar el análisis de un problema lineal para hallar una región de confianza aproximada. Este enfoque puede ser razonable si la región de confianza no es muy amplia y las segundas derivadas del modelo tampoco lo son.
También se pueden utilizar enfoques de arranque . [ 4 ]
Véase también
Notas
- ↑ Draper y Smith (1981, pág. 94)
- ↑ Draper y Smith (1981, pág. 108)
- ↑ Draper y Smith (1981, pág. 109)
- ↑ Hutton TJ, Buxton BF, Hammond P, Potts HWW (2003). Estimación de trayectorias de crecimiento promedio en el espacio de formas mediante suavizado de núcleo . IEEE Transactions on Medical Imaging , 22 (6):747-53
Referencias
- Draper, NR; H. Smith (1981) [1966]. Análisis de regresión aplicada (2.ª ed.). EE. UU.: John Wiley and Sons Ltd. ISBN 0-471-02995-5.
- Press, WH; SA Teukolsky; WT Vetterling; BP Flannery (1992) [1988]. Numerical Recipes in C: The Art of Scientific Computing (2.ª ed.). Cambridge, Reino Unido: Cambridge University Press. ISBN 978-0-521-43720-2.
- Teoría de la estimación