Articulo de referencia

Teorema de Mercer

En matemáticas , específicamente en análisis funcional , el teorema de Mercer es una representación de una función simétrica positiva definida sobre un cuadrado como una suma de...

En matemáticas , específicamente en análisis funcional , el teorema de Mercer es una representación de una función simétrica positiva definida sobre un cuadrado como una suma de una secuencia convergente de funciones producto. Este teorema, presentado en (Mercer 1909), es uno de los resultados más notables del trabajo de James Mercer (1883-1932). Es una herramienta teórica importante en la teoría de ecuaciones integrales ; se utiliza en la teoría del espacio de Hilbert de procesos estocásticos , por ejemplo el teorema de Karhunen-Loève ; y también se utiliza en la teoría del espacio de Hilbert del núcleo reproductor donde caracteriza a un núcleo simétrico positivo definido como un núcleo reproductor. [1]

Introducción

Para explicar el teorema de Mercer , primero consideramos un caso especial importante; véase más abajo una formulación más general. Un núcleo , en este contexto, es una función continua simétrica.

K : [ a , b ] × [ a , b ] R {\displaystyle K:[a,b]\times [a,b]\rightarrow \mathbb {R} }

donde simétrico significa que para todos . K ( incógnita , y ) = K ( y , incógnita ) {\displaystyle K(x,y)=K(y,x)} incógnita , y [ a , b ] {\displaystyle x,y\en [a,b]}

Se dice que K es un núcleo positivo definido si y sólo si

i = 1 norte yo = 1 norte K ( incógnita i , incógnita yo ) do i do yo 0 {\displaystyle \suma _{i=1}^{n}\suma _{j=1}^{n}K(x_{i},x_{j})c_{i}c_{j}\geq 0}

para todas las secuencias finitas de puntos x 1 , ...,  x n de [ ab ] y todas las opciones de números reales c 1 , ...,  c n . Nótese que el término "positiva-definida" está bien establecido en la literatura a pesar de la desigualdad débil en la definición. [2] [3]

Asociado a K hay un operador lineal (más específicamente un operador integral de Hilbert-Schmidt ) en funciones definidas por la integral

[ yo K φ ] ( incógnita ) = a b K ( incógnita , s ) φ ( s ) d s . {\displaystyle [T_{K}\varphi ](x)=\int _{a}^{b}K(x,s)\varphi (s)\,ds.}

Por consideraciones técnicas, suponemos que puede recorrer el espacio L 2 [ ab ] (ver espacio Lp ) de funciones de valor real integrables al cuadrado. Como T K es un operador lineal, podemos hablar de valores propios y funciones propias de T K . φ {\estilo de visualización \varphi}

Teorema . Supóngase que K es un núcleo positivo definido simétrico continuo. Entonces existe una base ortonormal { e i } i de L 2 [ ab ] que consiste en funciones propias de T K tales que la secuencia correspondiente de valores propios { λ i } i es no negativa. Las funciones propias correspondientes a valores propios distintos de cero son continuas en [ ab ] y K tiene la representación

K ( s , a ) = yo = 1 la yo mi yo ( s ) mi yo ( a ) {\displaystyle K(s,t)=\sum _{j=1}^{\infty }\lambda _{j}\,e_{j}(s)\,e_{j}(t)}

donde la convergencia es absoluta y uniforme.

Detalles

Ahora explicamos con mayor detalle la estructura de la prueba del teorema de Mercer, particularmente cómo se relaciona con la teoría espectral de operadores compactos .

  • La función KT K es inyectiva .
  • T K es un operador compacto simétrico no negativo en L 2 [ a , b ]; además K ( x , x ) ≥ 0.

Para demostrar la compacidad, demuestre que la imagen de la bola unitaria de L 2 [ a , b ] bajo T K es equicontinua y aplique el teorema de Ascoli , para demostrar que la imagen de la bola unitaria es relativamente compacta en C([ a , b ]) con la norma uniforme y a fortiori en L 2 [ a , b ].

Ahora apliquemos el teorema espectral para operadores compactos en espacios de Hilbert a T K para demostrar la existencia de la base ortonormal { e i } i de L 2 [ a , b ]

la i mi i ( a ) = [ yo K mi i ] ( a ) = a b K ( a , s ) mi i ( s ) d s . {\displaystyle \lambda _{i}e_{i}(t)=[T_{K}e_{i}](t)=\int _{a}^{b}K(t,s)e_{i}(s)\,ds.}

Si λ i ≠ 0, se observa que el vector propio ( función propia ) e i es continuo en [ a , b ]. Ahora

i = 1 la i | mi i ( a ) mi i ( s ) | sorber incógnita [ a , b ] | K ( incógnita , incógnita ) | , {\displaystyle \sum _{i=1}^{\infty }\lambda _{i}|e_{i}(t)e_{i}(s)|\leq \sup _{x\in [a,b]}|K(x,x)|,}

lo que demuestra que la secuencia

i = 1 la i mi i ( a ) mi i ( s ) {\displaystyle \sum_{i=1}^{\infty}\lambda_{i}e_{i}(t)e_{i}(s)}

converge de manera absoluta y uniforme a un núcleo K 0 que se ve fácilmente que define el mismo operador que el núcleo K . Por lo tanto K = K 0 de donde se sigue el teorema de Mercer.

Finalmente, para demostrar la no negatividad de los valores propios se puede escribir y expresar el lado derecho como una integral bien aproximada por sus sumas de Riemann, que son no negativas por la definitividad positiva de K , lo que implica , lo que implica . la F , F = F , yo K F {\displaystyle \lambda \langle f,f\rangle =\langle f,T_{K}f\rangle } la F , F 0 {\displaystyle \lambda \langle f,f\rangle \geq 0} la 0 {\displaystyle \lambda \geq 0}

Rastro

Lo siguiente es inmediato:

Teorema . Supóngase que K es un núcleo positivo definido simétrico continuo; T K tiene una secuencia de valores propios no negativos {λ i } i . Entonces

a b K ( a , a ) d a = i la i . {\displaystyle \int _{a}^{b}K(t,t)\,dt=\sum _{i}\lambda _{i}.}

Esto demuestra que el operador T K es un operador de clase de traza y

rastro ( yo K ) = a b K ( a , a ) d a . {\displaystyle \operatorname {traza} (T_{K})=\int _{a}^{b}K(t,t)\,dt.}

Generalizaciones

El teorema de Mercer en sí mismo es una generalización del resultado de que cualquier matriz semidefinida positiva simétrica es la matriz Gramiana de un conjunto de vectores.

La primera generalización [ cita requerida ] reemplaza el intervalo [ ab ] con cualquier espacio de Hausdorff compacto y la medida de Lebesgue en [ ab ] se reemplaza por una medida aditiva contable finita μ en el álgebra de Borel de X cuyo soporte es X . Esto significa que μ( U ) > 0 para cualquier subconjunto abierto no vacío U de X .

Una generalización reciente [ cita requerida ] reemplaza estas condiciones por las siguientes: el conjunto X es un espacio topológico de primer orden contable dotado de una medida de Borel (completa) μ. X es el soporte de μ y, para todo x en X , existe un conjunto abierto U que contiene a x y tiene una medida finita. Entonces, esencialmente, se cumple el mismo resultado:

Teorema . Supóngase que K es un núcleo positivo definido simétrico continuo en X . Si la función κ es L 1 μ ( X ), donde κ(x)=K(x,x), para todo x en X , entonces existe un conjunto ortonormal { e i } i de L 2 μ ( X ) que consiste en funciones propias de T K tales que la secuencia correspondiente de valores propios {λ i } i es no negativa. Las funciones propias correspondientes a valores propios distintos de cero son continuas en X y K tiene la representación

K ( s , a ) = yo = 1 la yo mi yo ( s ) mi yo ( a ) {\displaystyle K(s,t)=\sum _{j=1}^{\infty }\lambda _{j}\,e_{j}(s)\,e_{j}(t)}

donde la convergencia es absoluta y uniforme en subconjuntos compactos de X .

La siguiente generalización [ cita requerida ] trata de representaciones de núcleos mensurables .

Sea ( X , M , μ) un espacio de medida σ-finito. Un núcleo L 2 (o integrable al cuadrado) en X es una función

K yo micras micras 2 ( incógnita × incógnita ) . {\displaystyle K\en L_{\mu \otimes \mu }^{2}(X\times X).}

Los núcleos L ​​2 definen un operador acotado T K mediante la fórmula

yo K φ , ψ = incógnita × incógnita K ( y , incógnita ) φ ( y ) ψ ( incógnita ) d [ micras micras ] ( y , incógnita ) . {\displaystyle \langle T_{K}\varphi ,\psi \rangle =\int _{X\times X}K(y,x)\varphi (y)\psi (x)\,d[\mu \otimes \mu](y,x).}

T K es un operador compacto (en realidad es incluso un operador de Hilbert–Schmidt ). Si el núcleo K es simétrico, por el teorema espectral , T K tiene una base ortonormal de vectores propios. Aquellos vectores propios que corresponden a valores propios distintos de cero pueden disponerse en una secuencia { e i } i (independientemente de la separabilidad).

Teorema . Si K es un núcleo positivo definido simétrico en ( X , M , μ ), entonces

K ( y , incógnita ) = i norte la i mi i ( y ) mi i ( incógnita ) {\displaystyle K(y,x)=\sum _{i\in \mathbb {N} }\lambda _{i}e_{i}(y)e_{i}(x)}

donde la convergencia en la norma L 2. Nótese que cuando no se supone la continuidad del núcleo, la expansión ya no converge uniformemente.

La condición de Mercer

En matemáticas , se dice que una función de valor real K ( x , y ) cumple la condición de Mercer si para todas las funciones integrables al cuadrado g ( x ) se tiene

gramo ( incógnita ) K ( incógnita , y ) gramo ( y ) d incógnita d y 0. {\displaystyle \iint g(x)K(x,y)g(y)\,dx\,dy\geq 0.}

Analógico discreto

Esto es análogo a la definición de una matriz semidefinida positiva . Se trata de una matriz de dimensión , que satisface, para todos los vectores , la propiedad K {\estilo de visualización K} norte {\estilo de visualización N} gramo {\estilo de visualización g}

( gramo , K gramo ) = gramo yo K gramo = i = 1 norte yo = 1 norte gramo i K i yo gramo yo 0 {\displaystyle (g,Kg)=g^{T}{\cdot }Kg=\sum _{i=1}^{N}\sum _{j=1}^{N}\,g_{i}\,K_{ij}\,g_{j}\geq 0} .

Ejemplos

Una función constante positiva

K ( incógnita , y ) = do {\displaystyle K(x,y)=c\,}

satisface la condición de Mercer, ya que entonces la integral se convierte en por el teorema de Fubini

gramo ( incógnita ) do gramo ( y ) d incógnita d y = do gramo ( incógnita ) d incógnita gramo ( y ) d y = do ( gramo ( incógnita ) d incógnita ) 2 {\displaystyle \iint g(x)\,c\,g(y)\,dx\,dy=c\int \!g(x)\,dx\int \!g(y)\,dy=c\left(\int \!g(x)\,dx\right)^{2}}

Lo cual de hecho no es negativo .

Véase también

Notas

  1. ^ Bartlett, Peter (2008). "Reproducción de espacios de Hilbert de núcleo" (PDF) . Apuntes de la clase CS281B/Stat241B Teoría del aprendizaje estadístico . Universidad de California en Berkeley.
  2. ^ Mohri, Mehryar (2018). Fundamentos del aprendizaje automático. Afshin Rostamizadeh, Ameet Talwalkar (Segunda ed.). Cambridge, Massachusetts. ISBN 978-0-262-03940-6.OCLC 1041560990  .{{cite book}}: Mantenimiento de CS1: falta la ubicación del editor ( enlace )
  3. ^ Berlinet, A. (2004). Reproducción de espacios de Hilbert en probabilidad y estadística. Christine Thomas-Agnan. Nueva York: Springer Science+Business Media. ISBN 1-4419-9096-8.OCLC 844346520  .

Referencias

  • Adriaan Zaanen, Análisis lineal , North Holland Publishing Co., 1960,
  • Ferreira, JC, Menegatto, VA, Eigenvalues ​​of integral operatordefined by smooth positive definite kernels , Integral equation and Operator Theory, 64 (2009), no. 1, 61–81. (Proporciona la generalización del teorema de Mercer para espacios métricos. El resultado se adapta fácilmente a los primeros espacios topológicos numerables)
  • Konrad Jörgens , Operadores integrales lineales , Pitman, Boston, 1982,
  • Richard Courant y David Hilbert , Métodos de física matemática , vol. 1, Interscience 1953,
  • Robert Ash, Teoría de la información , Dover Publications, 1990,
  • Mercer, J. (1909), "Funciones de tipo positivo y negativo y su conexión con la teoría de ecuaciones integrales", Philosophical Transactions of the Royal Society A , 209 (441–458): 415–446, Bibcode :1909RSPTA.209..415M, doi : 10.1098/rsta.1909.0016,
  • "Teorema de Mercer", Enciclopedia de Matemáticas , EMS Press , 2001 [1994]
  • H. König, Distribución de valores propios de operadores compactos , Birkhäuser Verlag, 1986. (Da la generalización del teorema de Mercer para medidas finitas μ.)
Obtenido de "https://es.wikipedia.org/w/index.php?title=Teorema_de_Mercer&oldid=1222387746"