Introducción a la teoría de los espacios de Hilbert de núcleos reproductores y algunas aplicaciones
Abstract
This work explores the foundations of Reproducing Kernel Hilbert Spaces and their applications. The first part, consisting of the three initial chapters, is dedicated to the study of the fundamental properties and characterizations of these spaces, including their connection with integral operators. The second part, consisting of chapters 4 and 5, is devoted to the applications of Reproducing Kernel Hilbert Spaces (RKHS). In chapter 4, we examine how RKHS relate to Probability Theory as well as to stochastic processes. Finally, in chapter 5 we explore how RKHS are applied in statistics and machine learning, leading to the generalization of learning algorithms to nonlinear problems through the use of the kernel trick.
Full text
FACULTAD DE MATEMÁTICAS DEPARTAMENTO DE ANÁLISIS MATEMÁTICO GRADO EN MATEMÁTICAS Trabajo Fin de Grado Título Introducción a los Espacios de Hilbert de núcleos reproductores y aplicaciones Realizado por: Jesús Mesa Muñoz Supervisado por: Renato Álvarez Nodarse 4 de junio de 2025
Abstract This work explores the foundations of Reproducing Kernel Hilbert Spaces and their applications. The first part, consisting of the three initial chapters, is dedicated to the study of the fundamental properties and characterizations of these spaces, including their connection with integral operators. The second part, consisting of chapters 4 and 5, is devoted to the applications of Reproducing Kernel Hilbert Spaces (RKHS). In chapter 4, we examine how RKHS relate to Probability Theory as well as to stochastic processes. Finally, in chapter 5 we explore how RKHS are applied in statistics and machine learning, leading to the generalization of learning algorithms to nonlinear problems through the use of the kernel trick. Resumen En este trabajo estudiaremos los fundamentos de los espacios de Hilbert de núcleo de reproductor (RKHS) y sus aplicaciones. Dedicaremos la primera parte formada por los tres primeros capítulos a la discusión de las propiedades de estos espacios y su caracterización, además de su conexión con los operadores integrales. En la segunda parte formada por los capítulos 4 y 5, estudiaremos algunas aplicaciones de los espacios de Hilbert de núcleo de reproductor. En el capítulo 4, veremos la relación de los RKHS con la Teoría de la probabilidad y los procesos estocásticos. Finalmente, en el capítulo 5, veremos cómo los RKHS se aplican a la estadística y el machine learning, dando paso a la generalización de algoritmos de aprendizaje a problemas no lineales, discutiendo el kernel trick.
Índice general Introducción I Teoría 1. Resultados fundamentales 1 1.1. Definicionesbásicas............................ 1 1.2. Caracterización de los RKHS . . . . . . . . . . . . . . . . . . . . . . 11 1.3. El problema de reconstrucción . . . . . . . . . . . . . . . . . . . . . . 13 1.4. El espacio y la aplicación de características . . . . . . . . . . . . . . . 17 2. Operaciones con núcleos 20 2.1. Sumadenúcleos ............................. 20 2.2. Diferencia de núcleos e inclusión . . . . . . . . . . . . . . . . . . . . . 21 2.3. TeoríadeRetroceso............................ 24 2.4. Factorización de Cholesky . . . . . . . . . . . . . . . . . . . . . . . . 26 2.5. Productodenúcleos ........................... 27 3. Núcleos de Mercer 30 3.1. NúcleosdeMercer ............................ 30 3.2. Operadores Integrales . . . . . . . . . . . . . . . . . . . . . . . . . . . 32 3.3. TeoremadeMercer............................ 37 3.4. Operadores de Hilbert-Schmidt . . . . . . . . . . . . . . . . . . . . . 47
ÍNDICE GENERAL II Aplicaciones 4. RKHS y Procesos Estocásticos 51 4.1. Preliminares................................ 51 4.2. Integrales Estocásticas . . . . . . . . . . . . . . . . . . . . . . . . . . 53 4.3. Teorema de Karhunen-Loève . . . . . . . . . . . . . . . . . . . . . . . 54 4.4. Medidasgaussianas............................ 57 4.5. Espacio de Cameron-Martin . . . . . . . . . . . . . . . . . . . . . . . 61 4.6. Movimiento Browniano . . . . . . . . . . . . . . . . . . . . . . . . . . 61 5. RKHS en Estadística y Machine Learning 64 5.1. Kerneltrick ................................ 64 5.2. Teorema del Representante . . . . . . . . . . . . . . . . . . . . . . . . 65 5.3. Mínimoscuadrados............................ 67 5.4. Inmersiones y aplicaciones características . . . . . . . . . . . . . . . . 70 5.5. Escalado Multidimensional y Análisis de Componentes Principales . . 70 5.6. Support Vector Machines . . . . . . . . . . . . . . . . . . . . . . . . . 72 Conclusiones
Introducción El origen de los espacios de Hilbert de núcleo reproductor o Reproducing Kernel Hilbert Space (RKHS) se remonta al artículo de James Mercer [15] de 1909. En este artículo, Mercer discutió la conexión de las funciones definidas positivas con los operadores integrales y las ecuaciones integrales, demostrando el hoy día conocido Teorema de Mercer, un clásico resultado de análisis funcional que probaremos en el Capítulo 3. Sin embargo, no fue hasta 1930 que Aronszajn en [3] definió formalmente lo que era un RKHS, dando paso a las bases de la teoría de RKHS. A partir de estos trabajos, las aplicaciones de los RKHS nunca han dejado de extenderse, incluyendo aplicaciones en interpolación y teoría de la aproximación; en procesos estocásticos, cuyo origen se obtuvo al estimar la función de medias de un proceso gaussiano; en estadística, cuya aplicación se extendió gracias al Teorema del Representante que fue probado por primera vez en la interpolación de splines en [13]. Además, Vapnik en [9] introdujo los RKHS al machine learning aplicando los núcleos reproductores o funciones núcleo a la construcción de algoritmos no lineales desarrollando el kernel trick y las Máquinas de Vectores Soporte o Support Vector Machines. El uso de núcleos en este ámbito se popularizó dando lugar al término kernelized cuando se hacía uso de este tipo de funciones. En 2005 se justificó el amplio uso de las funciones núcleo, ya que en [16] se probó que en todo algoritmo que dependiera únicamente de productos escalares se podían reemplazar estos productos por funciones núcleo. En este trabajo, en la primera parte, fundamentaremos la teoría de los RKHS y, en la segunda parte, discutiremos su aplicación en diversos ámbitos. Así, seguiremos la siguiente estructura: En el Capítulo 1 definiremos los espacios de Hilbert de núcleo reproductor ilustrando un par de ejemplos de estos espacios. Además, daremos una caracterización de los RKHS y su núcleo reproductor asociado. En el Capítulo 2 estudiaremos las diversas operaciones entre núcleos y sus efectos en los correspondientes RKHS. En el Capítulo 3 discutiremos la conexión de los RKHS con los operadores integrales, estudiando los núcleos de Mercer y probando el importante Teorema de Mercer, mencionado anteriormente.
ÍNDICE GENERAL En el Capítulo 4 se verá la aplicación de la teoría de RKHS a la Teoría de la probabilidad y los procesos estocásticos. En este capítulo además veremos la relevancia de los RKHS en la generalización de la teoría de la medida a espacios de dimensión infinita. Finalmente, en el Capítulo 5 veremos la aplicación de los RKHS en estadística ymachine learning, probando el Teorema del Representate y discutiendo el kernel trick y la implementación de los métodos kernels como los Suppor Vector Machines.
Parte I Teoría
Capítulo 1 Resultados fundamentales 1.1. Definiciones básicas Sea Xun conjunto arbitrario no vacío y Fun cuerpo. Denotamos por F(X, F), al conjunto de todas las funciones definidas de XaFque es un espacio vectorial sobre el cuerpo F. Definición 1.1.1. Dado un subconjunto H ⊂ F(X, F), diremos que Hes un espacio de Hilbert de núcleo reproductor (Reproducing kernel Hilbert Space) o RKHS, sobre Xsi: 1. Hes un subespacio vectorial de F(X, F). 2. Hestá dotado de un producto escalar ⟨·,·⟩, con respecto al cual es un espacio de Hilbert. 3. Para todo x∈X, los funcionales de evaluación Ex:H → F, definidos por Ex(f) = f(x), están acotados (son continuos). A lo largo del capítulo haremos referencia a estos funcionales de evaluación Ex, ya que su estudio es esencial para determinar si un espacio de Hilbert es un RKHS. Aplicando el Teorema de representación de Riesz (ver, e.g., teorema 5.2.21 en [2]) a estos funcionales, tenemos que para cada x∈Xexiste un único elemento kx∈ H, tal que para toda f∈ H se tiene que f(x) = Ex(f) = ⟨f, kx⟩. Esta propiedad se conoce como la "propiedad reproductora". Así llegamos a la siguiente definición: 1
Definición 1.1.2. La función anterior kx, se denomina el núcleo reproductor del punto x, y la función K:X×X→F, definida por K(x, y) = ky(x), se denomina el núcleo reproductor de H. Notemos que K(x, y) = ⟨ky, kx⟩yK(x, x) = ∥kx∥2=∥Ex∥2. Ahora veremos algunos ejemplos de estos espacios. 1.1.1. Ejemplo: Espacios de Sóbolev H1 0([0,1]) Los espacios de Sóbolev en dimensión 1,H1, están formados por funciones de L2, cuyas derivadas1también pertenecen a L2. Estos espacios son ejemplos de RKHS, ya sean definidos en Ro en un intervalo acotado. Para verlo, usaremos que las funciones de H1son absolutamente continuas. Para los lectores no familiarizados con estos espacios, en [1] pueden encontrar una buena guía de referencia. Empezaremos con el ejemplo del espacio H1 0([0,1]) = {u∈L2([0,1]) : u′∈L2([0,1]), u(0) = u(1) = 0} dotado del producto escalar usual ⟨u, v⟩=ˆ1 0 u′v′dt . Estas funciones por ser absolutamente continuas admiten un representante de la forma u(x) = ˆx 0 u′(t)dt =ˆ1 0 u′(t)χ[0,x](t)dt , (1.1) donde χ[0,x]denota a la función característica de [0, x]. Luego, para cada x∈[0,1] tenemos que |u(x)| ≤ ˆ1 0|u′(t)|χ[0,x](t)dt ≤ ∥u∥ˆx 0 dt1 2 =√x∥u∥, y por tanto, los funcionales de evaluación Exestán acotados, así H1 0([0,1]) es un RKHS. Veamos cómo podemos encontrar su núcleo reproductor. Si pudiéramos resolver el problema de contorno (v′=χ[0,x], v(0) = v(1) = 0, 1Se considera la derivada débil, es decir, en el sentido distribucional. 2
Este núcleo es conocido como núcleo de Szegö. Podemos generalizar las bases ortonormales, mediante la identidad de Parseval. Así, tenemos la siguiente definición: Definición 1.1.9. Sea Hun espacio de Hilbert con producto escalar ⟨·,·⟩. Un conjunto de vectores {fs:s∈S} ⊂ Hse llama un marco de Parseval de Hsi cumple que ∥h∥2=X s∈S|⟨h, fs⟩|2, para toda h∈H. Los marcos de Parseval tienen las siguientes propiedades importantes: Proposición 1.1.10. Sea Hun espacio de Hilbert y sea {fs:s∈S} ⊂ H. Las siguientes condiciones son equivalentes: 1. El conjunto {fs:s∈S}es un marco de Parseval. 2. La función V:H→ℓ2(S), dada por (V h)(s) = ⟨h, fs⟩, es una isometría bien definida. 3. Para toda h∈Hse tiene que h=Ps∈S⟨h, fs⟩fs. Además, si {fs:s∈S}es un marco de Parseval, para cualesquiera h1, h2∈H tenemos que ⟨h1, h2⟩=Ps∈S⟨h1, fs⟩⟨fs, h2⟩. Demostración. (1) ⇒(2). Definimos V:H→ℓ2(S), por (V h)(s) = ⟨h, fs⟩. Luego, en términos de la base canónica de ℓ2(S)se tiene V h =X s∈S⟨h, fs⟩es. Como los fsforman un marco de Parseval, tenemos que ∥V h∥2 ℓ2(S)=X s∈S|⟨h, fs⟩|2=∥h∥2 H, luego Vdefine una isometría. (2) ⇒(3). Sea V∗el operador adjunto de V. Notemos que ⟨h, fs⟩=⟨V h, es⟩=⟨h, V ∗es⟩, y, por tanto, V∗es=fs. Como Ves una isometría, tenemos que V∗V=IH. De lo anterior, se sigue que h=V∗V h =V∗ X s∈S⟨h, fs⟩es!=X s∈S⟨h, fs⟩V∗(es) = X s∈S⟨h, fs⟩fs. 9
(3) ⇒(1). Se tiene que ⟨h, h⟩=X s∈S⟨h, fs⟩⟨fs, h⟩=X s∈S|⟨h, fs⟩|2. Por último, al ser Vuna isometría, para cualesquiera h1, h2∈H, se cumple que ⟨h1, h2⟩H=⟨V∗V h1, h2⟩H=⟨V h1, V h2⟩ℓ2(S) =X s∈S (V h1)(s)(V h2)(s) = X s∈S⟨h1, fs⟩⟨fs, h2⟩, de donde se sigue el resultado. Ahora podemos generalizar el teorema de las bases ortonormales a los marcos de Parseval. Teorema 1.1.11 (Papadakis).Sea Hun RKHS sobre Xcon núcleo reproductor K y sea {fs:s∈S}⊂H. Luego {fs:s∈S}es un marco de Parseval de Hsi y solo si K(x, y) = X s∈S fs(x)fs(y), donde la serie converge puntualmente. Demostración. =⇒Suponiendo que {fs:s∈S}es un marco de Parseval y aplicando la proposición anterior 1.1.10 tenemos que K(x, y) = ⟨ky, kx⟩=X s∈S⟨ky, fs⟩⟨fs, kx⟩=X s∈S fs(y)fs(x). ⇐=Al ser todo h∈ L(K)de la forma h=Pjαjkyj, tenemos que ∥h∥2=X i,j αjαikyj, kyi=X i,j αjαiK(yi, yj) =X i,j αjαiX s∈S fs(yi)fs(yj) = X i,j αjαi⟨fs, kyi⟩kyj, fs =X s∈S⟨fs,X i αikyi⟩⟨X j αjkyj, fs⟩=X s∈S|⟨h, fs⟩|2. Esto muestra que {fs:s∈S}forma un marco de Parseval de L(K). Entonces, definiendo el operador e V:L(K)→ℓ2(S)dado por (e V h)(s) = ⟨h, fs⟩, por la proposición 1.1.10 se tiene que e Ves una isometría sobre L(K). Al ser L(K)denso en H, podemos extender e Va una isometría Vsobre H, definida por (V h)(s) = ⟨h, fs⟩. Luego se tiene la condición del marco de Parseval de la proposición 1.1.10 para H, obteniendo así el resultado. 10
1.2. Caracterización de los RKHS Ahora nos centraremos en el estudio de cuándo una función es el núcleo reproductor para algún RKHS, obteniendo así las condiciones necesarias y suficientes que se acaban recogiendo en el Teorema de Moore, el resultado central de este capítulo. Para ello, primero recordemos algunas nociones de álgebra matricial. Dada una matriz A= (ai,j)de tamaño n×n, decimos que es semidefinida positiva si y sólo si para cualesquiera escalares α1, ..., αn∈Cse tiene que Pn i,j=1 αiαjai,j ≥0, ó si y sólo si, A=A∗y todo autovalor de Aes no negativo. Dichas matrices las denotaremos por A≥0. Para generalizar esta definición a funciones usaremos el término de "función núcleo"6, ya que, a continuación, veremos que hay una correspondencia uno a uno entre funciones núcleo y espacios de Hilbert de núcleo reproductor. Definición 1.2.1. Sea Xun conjunto arbitrario no vacío y sea K:X×X→C, una función de dos variables. Se dice que Kes una función núcleo si para todo n∈Ny para toda elección de npuntos distintos {x1, ..., xn} ⊆ X, la matriz (K(xi, xj))n i,j=1 es semidefinida positiva. Dichas funciones las denotaremos habitualmente por K≥0. Proposición 1.2.2. Sea Hun RKHS sobre Xcon núcleo reproductor K. Entonces Kes una función núcleo. Demostración. Fijados {x1, ..., xn} ⊆ Xyα1, ..., αn∈C, tenemos que X i,j K(xi, xj) = *X j αjkxj,X i αikxi+=X j αjkxj 2 ≥0. Lo anterior muestra que, en general, en un RKHS, la matriz K= (K(xi, xj))n i,j=1 no es definida positiva. Tomando α∈Cn,⟨Kα, α⟩= 0 , si y solo si, ∥Piαikxi∥= 0. Luego, para toda f∈ H se tiene que n X i=1 αif(xi) = ⟨f, n X i=1 αikxi⟩= 0 . Por tanto, hay una dependencia lineal entre los valores de toda función de Hen este conjunto de puntos. Teorema 1.2.3 (Teorema de Moore).Sea Xun conjunto arbitrario no vacío y sea una función K:X×X→C. Si Kes una función núcleo, entonces existe un único RKHS, H, de funciones en Xtal que Kes su núcleo reproductor. 6Esta terminología no está generalizada. Algunos autores usan los términos "funciones definidas positivas", o "funciones semidefinidas positivas". 11
Demostración. Definimos ky:X→Cdada por ky(x) = K(x, y).Para probarlo usaremos la densidad del span de estas funciones en el supuesto RKHS buscado. Intentaremos definir una forma sesquilineal en el espacio vectorial L(K), inducida por la función núcleo, para dotarlo de un producto escalar y completar el correspondiente espacio. Definimos B:L(K)×L(K)→Cde la siguiente forma: B X j αjkyj,X i βikyj!=X i,j αjβiK(yi, yj) donde αj, βison escalares. Dada una función de L(K), esta puede ser expresada de diferentes formas como suma de las funciones ky, por tanto, primero es necesario comprobar que Bestá bien definida en L(K). Para ello, es suficiente ver que si f=Pjαjkyjes idénticamente cero como función en X, entonces B(f, g) = B(g, f)=0, para toda g∈ L(K). Pero, al tratarse de un span, esto a su vez es equivalente a probar que B(f, ky) = B(ky, f) = 0, pero por definición tenemos que B(f, ky) = X j αjK(x, yj) = f(x)=0. Análogamente, B(ky, f) = X j αjK(yj, x) = X j αjK(x, yj) = f(x)=0. Recíprocamente, si B(f, g)=0para toda g∈ L(K), tomando g=ky, tenemos que f(y) = 0. Luego B(f, g) = 0, para toda g∈ L(K)si y solo si fes idénticamente nula como función en X. Luego Bestá bien definida y es fácil comprobar que es sesquilineal. Además, se tiene que B(f, kx) = f(x). Por otro lado, para cualquier f=Pn j=1 αjkyjse tiene que (K(yi, yj))n i,j=1 ≥0, luego B(f, f) = n X i,j=1 αjαiK(yi, yj)≥0. Así, Bdefine un producto escalar semidefinido sobre L(K). La forma sesquilineal Bsatisface la siguiente desigualdad, cuya prueba es análoga a la prueba de la desigualdad de Cauchy-Schwarz: |B(f, g)|2≤B(f, f)B(g, g). De esta desigualdad se sigue que B(f, f)=0⇐⇒ B(f, g) = 0,∀g∈ L(K)⇐⇒ f≡0. Por tanto Bdefine un producto escalar sobre L(K). 12
Ahora podemos completar L(K)tomando clases de equivalencia en las sucesiones de Cauchy, obteniendo así un espacio de Hilbert H. Probemos ahora que cada elemento de Hse identifica únicamente con una función sobre X(a diferencia de casos como al completar C[0,1] con la norma de L2). Para ello, notemos que cada h∈ H define puntualmente una función ˆ hde la forma ˆ h(x) = ⟨h, kx⟩. Así, definimos b H={ˆ h:h∈ H}, tal que b Hes un conjunto de funciones sobre X. Definimos L:H → F(X, C), dada por L(h) = ˆ h. Se puede ver que b Hes un espacio vectorial y que Les lineal. Además, para toda f∈ L(K)tenemos que ˆ f(x) = f(x). Para ver que Les inyectiva, es suficiente probar que ˆ h(x) = 0, para todo x∈Xsi y solo si h= 0. Supongamos que ˆ h(x)=0para todo x, lo cuál es cierto si y solo si h⊥kx, para todo x∈X. Luego h⊥ L(K), y como L(K)es denso en Hha de ser h= 0. Tenemos entonces que Les inyectiva. Luego si definimos el producto escalar en b Hdado por ⟨ˆ h1,ˆ h2⟩=⟨h1, h2⟩,b Hserá un espacio de Hilbert de funciones sobre X. Además, Ex(ˆ h) = ˆ h(x) = ⟨h, kx⟩=⟨ˆ h, ˆ hx⟩. Así, vemos que las evaluaciones puntuales Exestán acotadas y que ˆ kx=kxes el núcleo reproductor del punto x. Por tanto, b Hes un RKHS sobre Xy se tiene que ˆ ky(x) = ⟨ky, kx⟩=K(x, y), llegando así a que su núcleo reproductor es K. El Teorema de Moore 1.2.3 junto a la proposición 1.1.6, demuestran que hay una correspondencia biunívoca entre las funciones núcleo y los RKHS. Esto motiva la siguiente notación: Nota 1.2.4. Dada una función núcleo K:X×X→C. Denotamos por HKal único RKHS con núcleo reproductor K. 1.3. El problema de reconstrucción Dada una función núcleo Kdefinida sobre un conjunto X, dar una descripción concreta del espacio de Hilbert que genera es uno de los problemas de mayor dificultad de esta teoría. A este problema se le conoce como el problema de reconstrucción. Un ejemplo de la dificultad de este problema es el caso del espacio H2(D), que ya vimos en la sección 1.1.5, de funciones analíticas cuyo núcleo era K(z, w) = 1/(1−zw). El span de este núcleo está formado por funciones con polos en la frontera del disco; sin embargo, H2(D)tiene a los polinomios zncomo base ortonormal, que son funciones enteras. Veamos algunos resultados de cómo se traspasan las propiedades del núcleo reproductor al espacio generado. 13
Teorema 1.3.1. Sea Xun espacio topológico, K:X×X→Cuna función núcleo. Si Kes continua en la topología producto sobre X×X, entonces toda función de HKes continua. Demostración. Sea f∈ HKy fijamos y0∈X. Dado ε > 0, por ser Kcontinua, existe un entorno G⊆X×Xde (y0, y0), tal que para todo (x, y)∈Gse cumple que |K(x, y)−K(y0, y0)|<ε2 3(∥f∥2+ 1) . Al estar X×Xdotado de la topología producto, podemos escoger un entorno U⊆X de y0tal que U×U⊆G. Para y∈Utenemos que ∥ky−ky0∥2=⟨ky−ky0, ky−ky0⟩=⟨ky, ky⟩−⟨ky, ky0⟩−⟨ky0, ky⟩+⟨ky0, ky0⟩ =K(y, y)−K(y, y0)−K(y0, y) + K(y0, y0) = [K(y, y)−K(y0, y0)] −[K(y, y0)−K(y0, y0)] −[K(y0, y)−K(y0, y0)] <ε2 ∥f∥2+ 1, y, por tanto, aplicando Cauchy-Schwarz |f(y)−f(y0)|=|⟨f, ky−ky0⟩| ≤ ∥f∥∥ky−ky0∥<ε∥f∥ q∥f∥2+ 1 < ε . Teorema 1.3.2. Sea Kuna función núcleo sobre Xcon RKHS HK. Si Kes acotada, entonces toda función de HKtambién es acotada. Demostración. Se sigue aplicando Cauchy-Schwarz pues |f(x)|=|⟨f, K(·, x)⟩≤∥f∥HKpK(x, x)≤ ∥f∥HK∥K∥∞. Teorema 1.3.3. Sea Xun espacio medible y Kuna función núcleo sobre Xcon RKHS HK. Si K(·, x)es medible para todo x∈X, entonces toda función de HKes medible. Demostración. Si K(·, x)es medible para cada x∈X, entonces todas las funciones de L(K)son medibles, y como vimos en el Teorema de Moore, toda función de HK es el límite de una sucesión de L(K). Este límite está tomado en la norma de HK; sin embargo, esta convergencia implica la convergencia puntual, obteniendo así que toda función es medible. 14
Teorema 1.3.4. Sea Ω⊂Cnuna región, y sea K: Ω ×Ω→Cuna función núcleo continua. Si además suponemos que kzes analítica para cada z∈Ω. Entonces, toda función de HKes analítica en Ω. Demostración. Las funciones de L(K)son analíticas al ser combinaciones lineales de funciones analíticas. Dado un compacto F⊂Ωyf∈ HK, existe una sucesión {fn} ⊂ L(K)tal que fn→fen la norma de HK. Queremos ver que se tiene convergencia uniforme. Para todo x∈F, tenemos que |f(x)−fn(x)|=|⟨f−fn, kx⟩| ≤ ∥f−fn∥∥kx∥. Por otro lado, ∥kx∥2=⟨kx, kx⟩=K(x, x), y al ser Kcontinua en ambas variables, la norma ∥kx∥está uniformemente acotada en cada compacto F. Así, tenemos que sup x∈FpK(x, x) = MF⇒sup x∈F|f−fn| ≤ MF∥f−fn∥. Cómo ∥f−fn∥n→∞ −→ 0concluimos que supx∈F|f−fn|n→∞ −→ 0. Luego tenemos convergencia uniforme de {fn}en compactos de Ωy por tanto, fes analítica en Ω. En esta última prueba hemos visto cómo la continuidad de Kimplica la convergencia uniforme en compactos. Teorema 1.3.5. Sea O⊂Rnabierto y sea K:O×O→Runa función núcleo. Si K∈Ck(O×O)entonces toda función de HKes Ck(O). Demostración. Sea f∈ HK, y consideramos {en}los vectores de la base canónica de Rn. Sea αun multi-índice con |α| ≤ k. Lo probaremos por inducción. Si |α|= 1, entonces aplicando la diferenciabilidad de Ky la continuidad del producto escalar tenemos ∂f(x) ∂xi = l´ım h→0 f(x+hei)−f(x) h= l´ım h→0f, K(·, x +hei)−K(·, x) h =f, ∂K(·, x) ∂xi. La continuidad de la aplicación x→∂K(·, x)/∂xiy del producto escalar, implica que f∈C1(O). Supongamos que f∈Cm(O)para |α| ≤ m < k y probémoslo para m+ 1. Podemos expresar αcomo α=β+eidonde βes un multi-índice con |β|=m. Luego Dα(f) = ∂ ∂xi(Dβ(f)), y por tanto, aplicando la hipótesis de inducción en el cociente incremental, tenemos que Dαf(x) = l´ım h→0 Dβf(x+hei)−Dβf(x) h = l´ım h→0f, DβK(·, x +hei)−DβK(·, x) h=⟨f, DαK(·, x)⟩. 15
La continuidad se sigue de la continuidad de la aplicación x→DαK(·, x), de donde se sigue el resultado y además, que Dαf(x) = ⟨f, DαK(·, x)⟩. Teorema 1.3.6. Sea Xun espacio medible, µuna medida σ-finita sobre XyK una función núcleo medible con RKHS HK. Si existe p∈[1,∞)tal que ˆX K(x, x)p/2dµ(x)<∞, entonces, toda función de HKestá en Lp(X, µ). Demostración. Sea f∈ HK. Usando que ∥K(·, x)∥HK=pK(x, x), y aplicando Cauchy-Schwarz, tenemos que ˆX|f(x)|pdµ(x) = ˆX|⟨f, K(·, x)⟩|pdµ(x)≤ ∥f∥p HKˆX K(x, x)p/2dµ(x)<∞. 1.3.1. RKHS inducido por una función Empezaremos con el ejemplo más sencillo en el que el núcleo reproductor viene dado por una función. Sea funa función, no nula, definida sobre un conjunto X. Consideramos la función K(x, y) = f(x)f(y). Dados x1, ...xn∈X,Ktenemos que X i,j αjαiK(xi, xj) = X i,j αjαif(xi)f(xj) = X i,j f(xi) 2 ≥0, luego Kes una función núcleo. Fijando y∈X, el núcleo reproductor del punto yes ky(·) = f(y)f(·). Luego el span que generan estas funciones, L(K), es de dimensión uno. Al ser de dimensión finita, L(K)es completo en la norma de HK, es decir, la norma inducida por K, construida en el Teorema de Moore 1.2.3. Por tanto, en este caso, tenemos que L(K) = HK. Además, fijando y∈Xtal que f(y)= 0 se tiene que |f(y)|2·∥f∥2=f(y)f 2=∥ky∥2=K(y, y) = |f(y)|2, luego, ∥f∥= 1. 16
1.3.2. RKHS inducido por un producto escalar Para este ejemplo, consideraremos un espacio de Hilbert Hcon producto escalar ⟨·,·⟩. Definición 1.3.7. Dados los vectores h1, ...hn∈ H, la matriz n×n,G, definida por G= (⟨hi, hj⟩), se conoce como la matriz de Gram asociada a estos vectores. Proposición 1.3.8. Dados h1, ...hn∈ H, la matriz de Gram, G, asociada es semidefinida positiva. Además Ges definida positiva si y solo si los vectores h1, ..., hn son linealmente independientes. Demostración. Dado α∈Cn, se tiene que ⟨Gy, y⟩= n X i,j=1 ⟨hi, hj⟩αjαi= n X i=1 αihi 2 ≥0. Además, ⟨Gy, y⟩= 0 si y sólo si la combinación lineal correspondiente da el vector 0. Luego, Ges definida positiva si y sólo si la única combinación lineal de h1, ...hnque da el vector 0es la trivial, es decir, cuando todos los coeficientes αjson nulos. De la proposición anterior, se sigue que la función K:H × H → Cdada por K(x, y) = ⟨x, y⟩, es una función núcleo. Para cada y∈ H,ky(·) = ⟨·, y⟩, es un funcional lineal acotado definido por el producto escalar. Por el Teorema de representación de Riesz, todo funcional lineal acotado f:H → Cestá únicamente determinado por un elemento v. Denotando f=fv, tenemos que fv(u) = ⟨u, v⟩=kv(u). Además, es ampliamente conocido que el dual de H,H∗, es a su vez un espacio de Hilbert con producto escalar ⟨fv, gu⟩H∗=⟨u, v⟩H. Considerando los funcionales de evaluación Eu:H∗→C, notemos que fv(u) = ⟨u, v⟩=⟨fv, fu⟩=ku(v), |Eu(fv)|=|fv(u)|≤∥u∥H∥fv∥H∗. Luego, las evaluaciones puntuales Euestán acotadas y el núcleo reproductor del vector ues ku=fu. Por tanto, H∗es un RKHS con núcleo reproductor K, así H∗=HK. 1.4. El espacio y la aplicación de características En esta sección estudiaremos una definición equivalente a la definición 1.2.1 de función núcleo dada anteriormente. Esta nueva definición es ampliamente utilizada en el ámbito de la estadística y del machine learning. 17
Definición 1.4.1. Sea Xun conjunto arbitrario no vacío. Entonces una función K:X×X→Ces llamada núcleo sobre Xsi existe un espacio de Hilbert Hy una aplicación ϕ:X→ H tal que para todo x, y ∈Xse cumple que K(x, y) = ⟨ϕ(x), ϕ(y)⟩. Llamamos a ϕla aplicación de características (feature map) y a Hel espacio de características (feature space). Nota 1.4.2. Dado un núcleo según la definición anterior, ni la aplicación de características ni el espacio de características están biunívocamente determinados. Este es el caso del núcleo K(x, y) = x·ysobre R, que admite tanto a Rcomo a R2como espacios de características. El siguiente lema se sigue directamente de la definición anterior 1.4.1. Lema 1.4.3. Sea HKun RKHS sobre Xcon núcleo reproductor K. Luego Hes un espacio de características de K, donde la aplicación de características ϕ:X→ HK viene dada por ϕ(x) = K(·, x), x ∈X . Llamaremos a la aplicación ϕanterior, aplicación canónica de características. Ahora veremos la equivalencia de las definiciones 1.2.1 y 1.4.1 de funciones núcleo. Proposición 1.4.4. Una función K:X×X→Ces un núcleo según la definición 1.4.1 si y solo si Kes una función núcleo en el sentido de la definición 1.2.1. Demostración. =⇒La primera implicación se sigue de que la matriz de Gram es semidefinida positiva como vimos en la proposición 1.3.8. ⇐=Por el Teorema de Moore 1.2.3 sabemos que una función núcleo en el sentido de la definición 1.2.1, induce un RKHS y por el lema anterior vemos que K cumple la definición 1.4.1. La nueva definición de núcleo 1.4.1 no tiene un único espacio de Hilbert asociado; sin embargo, como veremos en el siguiente teorema, sí que tiene un único RKHS asociado. Teorema 1.4.5. Sea X=∅yKun núcleo sobre X, según la definición 1.4.1, con espacio de características H0y aplicación de características ϕ0:X→ H0. Entonces H={f:X→F:∃w∈ H0con f(x) = ⟨w, ϕ0(x)⟩H0,∀x∈X}, con la norma ∥f∥H:= ´ınf x∈X{∥w∥H0:w∈ H0con f(x) = ⟨w, ϕ0(x)⟩H0},(1.3) 18
Demostración. Sea f∈ HK, con ∥f∥HK=c. Por el corolario 2.2.5, se tiene la desigualdad de funciones núcleo, f(x)f(y)≤c2K(x, y). Como esta desigualdad matricial se tiene sobre cualquier conjunto finito de puntos, se tiene también que f◦φ(s)f◦φ(t)≤c2K(φ(s), φ(t)). Luego, por el mismo corolario 2.2.5, tenemos que f◦φ∈ HK◦φcon ∥f◦φ∥HK◦φ≤c, al ser esta norma la menor constante que satisface la desigualdad. Esto muestra que la aplicación Cφ:HK→ HK◦φ, dada por Cφ(f) = f◦φ, es lineal y contractiva. Denotando por ht(·) = K(φ(·), φ(t)), a los núcleos reproductores puntuales de HK◦φ, para cualquier conjunto finito de puntos t1, ..., tm∈Sy escalares α1, ..αm tenemos que m X i=1 αihti 2 HK◦φ = m X i,j=1 αiαjK(φ(ti), φ(tj)) = m X i=1 αikφ(ti) 2 HK . De lo anterior, se sigue que hay una isometría bien definida Γ : HK◦φ→ HK, cumpliendo que, Γ(ht) = kφ(t). Por tanto, Cφ◦Γ(ht) = Cφ(kφ(t)) = kφ(t)◦φ=ht, de donde se concluye que Cφ◦Γes la identidad sobre HK◦φ. Luego, dada u∈ HK◦φ, la función f= Γ(u), satisface u=f◦φcon ∥u∥HK◦φ=∥f∥HK, de donde se sigue el resultado. En el caso de tomar S⊆Xun subconjunto cualquiera, tenemos el caso concreto de la restricción. Teorema 2.3.3 (de la restricción).Sea K:X×X→Cuna función núcleo, S⊆X un subconjunto no vacío y denotemos por K|S:S×S→C, la restricción3de K aS. Entonces, K|Ses una función núcleo sobre Sy una función pertenece a HK|S si y sólo si es la restricción de una función de HKaS. Además, para u∈ HK|Sse tiene que ∥u∥HK|S= m´ın{∥f∥HK:u=f|S}. Demostración. Se sigue como corolario del Teorema de retroceso 2.3.2, tomando como función la inclusión φ:S→X,φ(s) = s. Definición 2.3.4. Dados dos conjuntos XyS, una función φ:S→X, y una función núcleo K:X×X→C, llamamos al RKHS HK◦φel retroceso de HKa lo largo de φy llamamos a la aplicación lineal Cφ:HK◦φ→ HK, definida en el teorema 2.3.2, aplicación de retroceso. 3Recordemos que dada una función f:X→C, la reestricción de fa un subconjunto S⊆X, es la función f|S:S→C, dada por f|S(x) = f(x), para cada x∈S. 25
2.4. Factorización de Cholesky En esta sección probaremos un resultado de factorización de núcleos que generaliza la factorización de Cholesky para matrices. Para ello, necesitaremos una propiedad de las proyecciones ortogonales. Proposición 2.4.1. Sea Hun espacio de Hilbert, y sea y∈ H. Si denotamos por Pa la proyección ortogonal sobre el span de y, entonces la proyección Pviene dada por P(x) = ⟨x, y⟩ ∥y∥2y . Además, la proyección sobre el complemento ortogonal del span viene dada por P⊥(x)=(I−P)(x) = x−⟨x, y⟩ ∥y∥2y . Demostración. Por el Teorema de la proyección, ha de ser ⟨x−P(x), y⟩= 0 con P(x)∈span {y}, luego P(x) = αy. Por tanto, buscamos α∈Ctal que ⟨x−αy, y⟩= 0 ⇒α=⟨x, y⟩ ∥y∥2, y aplicando la descomposición ortogonal x=P(x)+P⊥(x), se sigue el resultado. El siguiente teorema generaliza el Teorema de Factorización de Cholesky en la teoría de RKHS. De hecho, dada una matriz semidefinida positiva A∈ Mn×n(C), el Teorema de factorización de Cholesky se puede deducir tomando como función núcleo K(i, j) = ai,j sobre el conjunto de índices {1, ..., n}. Teorema 2.4.2 (Cholesky).Sea K un núcleo sobre Xyx0∈Xy supongamos que K(x0, x0)= 0. Definiendo K0(x, y) = K(x, y)−K(x, x0)K(x0, y) K(x0, x0),(2.1) entonces, K0es una función núcleo con HK0={f∈ HK:f(x0) = 0}, y para f∈ HK0tenemos que ∥f∥HK0=∥f∥HK. Demostración. Primero observemos que al ser K0(x0, x0)=0, cualquier f∈ HK0, aplicando Cauchy-Schwarz, cumplirá que |f(x0)|=|⟨f, kx0⟩HK0| ≤ ∥f∥HK0∥kx0∥HK0≤ ∥f∥HK0K0(x0, x0)1/2= 0 . 26
Denotemos por H0al subespacio de funciones de HKque se anulan en x0, este es H0={kx0}⊥, y por P0a la proyección ortogonal sobre H0. Aplicando el teorema 1.1.7, tenemos que el núcleo de H0está dado por ⟨P0(ky), kx⟩y usando la proposición anterior 2.4.1, obtenemos que ⟨P0(ky), kx⟩HK=*ky−⟨ky, kx0⟩HK ∥kx0∥2 HK kx0, kx+HK =K(x, y)−K(x, x0)K(x0, y) K(x0, x0). Esto prueba que K0es el núcleo reproductor de H0; por tanto, H0=HK0. 2.5. Producto de núcleos Ahora pasaremos a estudiar los productos de núcleos. Para ello, consideraremos un conjunto arbitrario Sque no tiene por qué estar incluido en X. Esto nos llevará a considerar productos tensoriales de espacios de Hilbert. Recordemos que, dados dos espacios de Hilbert Hi,i= 1,2, podemos construir su producto tensorial, H1⊗H2, el cual también es un espacio de Hilbert. Si ⟨·,·⟩i,i= 1,2, denotan los respectivos productos escalares, entonces para construir este espacio dotamos al producto tensorial algebraico con el producto escalar ⟨f1⊗f2, g1⊗g2⟩=⟨f1, g1⟩1⟨f2, g2⟩2, y completamos el espacio. Luego si H1yH2son dos RKHS sobre XyS, respectivamente, siguiendo el Teorema de Moore 1.2.3 es natural intentar identificar los elementos del producto tensorial algebraico h=Pn i=1 fi⊗gicon la función ˆ h(x, s) = Pn i=1 fi(x)gi(s). El siguiente teorema muestra que esta identificación está bien definida y se extiende a todo el espacio H1⊗H2. Teorema 2.5.1 (del producto tensorial de núcleos).Sean H1yH2dos RKHS sobre los conjuntos XyS, con núcleos reproductores K1yK2, respectivamente. Entonces K((x, s),(y, t)) = K1(x, y)K2(s, t)es una función núcleo sobre X×S, y la aplicación h→ˆ hdefinida en el Teorema de Moore 1.2.3 se extiende a una isometría entre H1⊗H2y el RKHS HK. Demostración. Tomemos k1 y(x) = K1(x, y)yk2 t(s) = K2(s, t). Notemos que si h= Pn i=1 fi⊗gi, entonces h, k1 y⊗k2 tH1⊗H2= n X i=1 fi, k1 yH1gi, k2 tH2=ˆ h(y, t). Luego, extenderemos la aplicación h→ˆ hdel producto tensorial de H1yH2a su completamiento de la siguiente manera. Dada h∈ H1⊗H2,hdefine una función ˆ h sobre X×Sdada por ˆ h(y, t) = h, k1 y⊗k2 tH1⊗H2. 27
Es fácil ver que b H={ˆ h:h∈ H1⊗H2}es un espacio vectorial de funciones sobre X×S. Más aún, la aplicación h→ˆ hserá inyectiva a menos que exista una función h∈ H1⊗H2no idénticamente nula tal que ˆ h(y, t)=0para todo (y, t)∈X×S. Pero esto implicaría que hes ortogonal al span de k1 y⊗k2 ty al ser el span de los núcleos puntuales k1 ydensos en H1y de los núcleos puntuales k2 ten H2, se sigue que el span de las funciones k1 y⊗k2 tes denso en H1⊗H2. Luego, si ˆ h= 0, entonces hes ortogonal a un subconjunto denso H1⊗H2y se tendría que h= 0. Por tanto, la aplicación h→ˆ hes inyectiva de H1⊗H2ab H, pudiendo usar esta identificación para dotar a b Hde la estructura de un espacio de Hilbert. De esta manera, tomamos el producto escalar ⟨ˆu, ˆv⟩b H=⟨u, v⟩H1⊗H2, y finalmente, para cualquier par (y, t)∈X×S, tenemos que ˆ h(y, t) = Dˆ h, \ k1 y⊗k2 tEb H. Así, vemos que b Hes un RKHS con núcleo reproductor K((x, s),(y, t)) = D\ k1 y⊗k2 t,\ k1 x⊗k2 sEb H=k1 y⊗k2 t, k1 x⊗k2 sH1⊗H2 =k1 y, k1 xH1k2 t, k2 sH2=K1(x, y)K2(s, t). Por tanto, Kes el núcleo reproductor de b H, luego, por la unicidad de la proposición 1.1.6, tenemos que HK=b H. De lo anterior se sigue que la aplicación h→ˆ hes una isometría entre H1⊗H2yHK. Definición 2.5.2. Se define el producto tensorial de los núcleos K1yK2como la función de cuatro variables K((x, s),(y, t)) = K1(x, y)K2(s, t), y lo denotaremos por K1⊗K2. Así, el teorema anterior2.5.1 se puede resumir en la expresión HK1⊗K2=\ H1⊗H2, donde \ H1⊗H2es la imagen de H1⊗H2por la aplicación h→ˆ h, definida anteriormente en 1.2.3 y 2.5.1. Ahora consideraremos K1yK2dos núcleos reproductores sobre el mismo conjunto X. Para estudiar su producto, primero vamos a definir el producto de Hadamard de matrices. Definición 2.5.3. Sean dos matrices A, B ∈ Mn×n. Definimos el producto de Hadamard o producto de Schur de A= (ai,j)yB= (bi,j)como la matriz A◦B= (ai,j bi,j). 28
Este producto cumple la propiedad conmutativa, distributiva y asociativa. Teorema 2.5.4 (Producto de Schur).Dadas dos matrices A, B ∈ Mn×n(C), si A yBson semidefinidas positivas, entonces su producto de Hadamard A◦Bes una matriz semidefinida positiva. Demostración. Al ser las matrices AyBsemidefinidas positivas, podemos reescribirlas como A=XX∗yB=Y Y ∗, para ciertas matrices X∈Mn×rA(C), Y∈Mn×rB(C), donde "∗", denota la conjugada traspuesta y rA, rBel rango de AyB, respectivamente. Entonces, cada elemento de AyBse puede escribir como ai,j =x∗ i·xj=⟨xi, xj⟩CrAbi,j =y∗ i·yj=⟨yi, yj⟩CrB, donde xieyidenotan las filas de XeY, respectivamente. Luego, su producto de Hadamard tiene la forma (A◦B) = (ai,j bi,j) = ((x∗ i·xj)(y∗ i·yj)) = (⟨xi, xj⟩CrA⟨yi, yj⟩CrB) = (⟨xi⊗yi, xj⊗yj⟩CrA⊗CrB). Esta matriz es exactamente la matriz de Gram de los vectores xi⊗yj, y, por la proposición 1.3.8, obtenemos el resultado. El teorema anterior implica que el producto de núcleos sigue siendo un núcleo. Además, el Teorema del retroceso 2.3.2 nos da una caracterización de su correspondiente RKHS. Definición 2.5.5. Definimos el producto de los núcleos K1yK2como el núcleo K(x, y) = K1(x, y)K2(x, y), y lo denotaremos por K=K1⊙K2. Denotando ∆ : X→X×X, a la aplicación diagonal dada por ∆(x)=(x, x), tenemos que K1⊙K2(x, y) = K1⊗K2(∆(x),∆(y)) ⇒K1⊙K2= (K1⊗K2)◦∆. Así, vemos que HK1⊙K2es el retroceso de HK1⊗K2=\ HK1⊗HK2a lo largo de ∆. El siguiente teorema resume este hecho. Teorema 2.5.6 (del producto de núcleos).Sean K1yK2dos funciones núcleo sobre Xy sea K1⊙K2(x, y) = K1(x, y)K2(x, y), su producto. Entonces, f∈ HK1⊙K2si y sólo si f(x) = ˆu(x, x)para cierta u∈ HK1⊗HK2. Además, ∥f∥HK1⊙K2= m´ın{∥u∥HK1⊗HK2:f(x) = ˆu(x, x)}. 29
Capítulo 3 Núcleos de Mercer En este capítulo estudiaremos un tipo concreto de funciones núcleo, los núcleos de Mercer, y probaremos el Teorema de Mercer, que es un resultado clásico del análisis funcional. A partir de ahora asumiremos que Xes un subconjunto compacto de Rdy que µ es una medida de Borel finita sobre X, a no ser que se especifiquen otras condiciones. 3.1. Núcleos de Mercer Ahora veremos la definición y las principales propiedades de un núcleo de Mercer. Definición 3.1.1. Sea X⊂Rnun subconjunto compacto. Se dice que una función K:X×X→C, es un núcleo de Mercer si es una función núcleo continua. Observación 3.1.2. Notemos que al ser Kcontinua, por el teorema 1.3.1, toda función de HKes continua. Proposición 3.1.3. Sea Kun núcleo de Mercer sobre un compacto X⊂Rdyµ una medida de Borel finita sobre X. Entonces, existen constantes B, C > 0tales que, para toda f∈ HKse tiene que B∥f∥L2≤ ∥f∥L∞≤C∥f∥HK. Demostración. Suponiendo que la medida de Xno es nula, tenemos que ∥f∥2 L2=ˆX|f(t)|2dµ(t)≤ ∥f∥2 L∞µ(X), y tomando B=µ(X)−1/2se sigue la primera desigualdad. Para la segunda, al ser K continua y Xun compacto, existe y se alcanza el máximo de Ken X×X. Aplicando Cauchy-Schwarz, y tomando M= m´ax{K(x, x)1/2:x∈X}, llegamos a |f(x)| ≤ |⟨f, kx⟩| ≤ ∥f∥HKK(x, x)1/2≤M∥f∥HK. 30
Proposición 3.1.4. Si Kes un núcleo de Mercer, entonces HKes separable. Demostración. Al ser X×Xun compacto, Kes uniformemente continua en X, luego, dado n∈N, existe un δn>0tal que para todo y, y0∈Xcon ∥y−y0∥< δn entonces |K(x, y)−K(x, y0)| ≤ 1/n. Usando la compacidad de X, podemos recubrirlo con un número finito de las bolas B(yi, δn). Así, para cada n∈N, construimos un conjunto finito de puntos Fn={y1, ..., ym} ⊆ X, tal que para cada y∈Xexista un iverificando que |K(x, y)−K(x, yi)| ≤ 1/n. Entonces, ∥ky−kyi∥2=K(y, y)−K(y, yi)−K(yi, y) + K(yi, yi)<2 n. Por tanto, al ser el span de las funciones kydensas en HK, y al poder aproximar estas por el span de {ky:y∈Sn∈NFn}, la familia numerable {ky:y∈Sn∈NFn}es densa en HK. Proposición 3.1.5. Sea Kun núcleo de Mercer sobre X, y sea {en(x) : n∈N} una base ortonormal de HK. Entonces, K(x, y) = ∞ X n=1 en(x)en(y) donde la suma converge absoluta y uniformemente sobre X. Demostración. Aplicando el teorema 1.1.8, sólo hace falta probar la convergencia absoluta y uniforme. Tenemos que K(x, x) = P∞ n=1 |en(x)|2, luego definiendo la sucesión gn(x) = ∞ X i=n+1 |ei(x)|2, se tiene que gn+1(x)≤gn(x)ygn(x)n→∞ −→ 0, para todo x∈X. Queremos ver la convergencia uniforme de {gn}, para ello, fijado ε > 0, al converger {gn(x)} puntualmente para cada x∈X, existe Nx∈Ntal que gn(x)< ε/2si n≥Nx. Las funciones gnson continuas al ser diferencia de dos funciones continuas, luego por la continuidad en el punto x, existirá un entorno Uxde xtal que |gn(t)|< ε, para todo t∈Uxyn≥Nx, y al ser Xcompacto, existe un número finito de puntos x1, ..., xn, tal que X=Ux1∪... ∪Uxn. Tomando N= m´ax{Nx1, ..., Nxn}, para n≥Ntenemos que |gn(x)|< ε, para todo x∈X. Por tanto, aplicando Cauchy-Schwarz, llegamos a ∞ X m=n+1 em(x)em(y)≤ ∞ X m=n+1 |em(x)em(y)| ≤ pgn(x)gn(y)< ε, para todo x, y ∈X, de donde se sigue la convergencia absoluta y uniforme. 31
3.2. Operadores Integrales Dado un espacio de medida (Y, µ)y una función S:X×Y→C, cumpliendo que para cada x∈Xla función S(x, y)es de cuadrado integrable en y, esta función induce un operador sobre L2(Y, µ)de la siguiente manera: f(x) = ˆY S(x, y)g(y)dµ(y). La función fsolo depende de la clase de equivalencia de g, ya que al escoger otro representante, la integral mantiene su valor. Por tanto, definiendo TS(g) = f, obtenemos un operador bien definido de L2(Y, µ)a un espacio de funciones sobre X. Es fácil ver que TSes lineal, y por tanto, el rango de TSes un espacio vectorial. Tal operador TSes llamado un operador integral y la función Sel núcleo integral o el símbolo del operador integral. Usaremos el término símbolo integral para no interferir con la terminología de funciones núcleo. En esta sección probaremos que el rango de un operador integral es un RKHS y daremos una descripción del núcleo reproductor en términos del símbolo integral del operador. Para ello, será necesario definir la siguiente operación de símbolos: Definición 3.2.1. Dados dos conjuntos XyZ, un espacio de medida (Y, µ)y funciones S1:X×Y→C,S2:Y×Z→C, ambas de cuadrado integrable en la variable y, para cada xyzfijas. Se define su producto de símbolos integrales como la función S1□S2:X×Z→C, dada por S1□S2(x, z) = ˆY S1(x, y)S2(y, z)dµ(y). Definición 3.2.2. Definimos el adjunto del símbolo integral S:X×Y→Ccomo la función S∗ 1:Y×X→C, dada por S∗ 1(y, x) = S1(x, y). Proposición 3.2.3. Sean un conjunto X, un espacio de medida (Y, µ)y una función S:X×Y→Cde cuadrado integrable en la variable y. Entonces, la función S□S∗:X×X→Ces una función núcleo. Demostración. Definimos K=S□S∗, y tomemos puntos x1, . . . , xn∈Xy escalares λ1, . . . , λn∈C. Escogiendo la función g(y) = Pn i=1 λiS(xi, y)∈L2(Y, µ), tenemos que n X i,j=1 K(xi, xj)λiλj=ˆY n X i,j=1 λiS(xi, y)S(xj, y)λjdµ(y) = ˆY|g(y)|2dµ(y)≥0, de donde se sigue el resultado. Antes de continuar, es necesario recordar la relación entre el espacio nulo y el rango de un operador acotado, y como podemos formar un espacio de Hilbert dotando al rango de una norma adecuada, incluso cuando el rango no es cerrado. 32
Definición 3.2.4. Sea Hun espacio de Hilbert y un operador lineal T:H → H. Se define el espacio nulo del operador Tcomo N(T) = {h∈ H :Th = 0}. Proposición 3.2.5. Si Hes un espacio de Hilbert y M⊂ H es un subespacio cerrado, entonces el espacio cociente H/M es un espacio de Hilbert. Demostración. El espacio H/M está constituido por clases de equivalencia de la forma [x] = x+M, donde x∼ysi y sólo si x−y∈M. El espacio cociente hereda una norma dada por ∥[x]∥H/M = ´ınf m∈M∥x−m∥=x⊥H, dónde la última igualdad es consecuencia del Teorema de la proyección ortogonal (ver, e.g., teorema 5.2.15 en [2]). Luego, en H/M el producto escalar compatible con la norma es ⟨[x],[y]⟩H/M =x⊥, y⊥H. Además, la aplicación Φ : H/M →M⊥dada por Φ([x]) = x⊥, es una isometría. Al ser M⊥⊂ H cerrado, es Hilbert y entonces H/M también. Definición 3.2.6. Sea Hun espacio de Hilbert y T:H → H un operador lineal y acotado. Se define el rango del operador como R(T) = {T h :h∈ H}. Lema 3.2.7. En las condiciones anteriores, si dotamos al rango de Tde la siguiente norma ∥g∥R(T)= ´ınf{∥h∥H:Th =g}, entonces, R(T)es un espacio de Hilbert, y el operador Tinduce una isometría, T:N(T)⊥→ R(T), al restringirse al espacio ortogonal de su espacio nulo. Demostración. Aplicando la proposición anterior 3.2.5 tomando M=N(T), tenemos que H/N(T)yN(T)⊥son isométricos. En N(T)⊥el operador Tes inyectivo ya que si Th =Th′, entonces T(h−h′)=0. Además, se tiene que ∥Th∥R(T)= ´ınf{∥h′∥H:Th =Th′}=∥[h]∥H/N(T)=h⊥H. Así, vemos que el operador e T:N(T)⊥→ R(T), la restricción de TaN(T), es una isometría. Finalmente, tenemos el siguiente diagrama: H R(T) H/N(T)N(T)⊥ T π Φ e T 33
Así llegamos a uno de los resultados principales de este capítulo. Teorema 3.2.8. Sea un conjunto X, un espacio de medida (Y, µ), una función S:X×Y→Cde cuadrado integrable en la segunda variable y sea K:X×X→C la función núcleo dada por K(x, z) = (S□S∗)(x, z). Entonces, HK={TSg:g∈L2(Y, µ)}=R(TS) y para cada f∈ HKtenemos que ∥f∥HK= ´ınf{∥g∥L2(Y):f=TSg}. Demostración. Queremos ver que el rango de TS,R(TS)que es un espacio concreto de funciones, es el RKHS de K. Para ver que los funcionales de evaluación Exestán acotados, dado que |f(x)|=ˆY S(x, y)g(y)dµ(y)≤ˆY|S(x, y)|2dµ(y)1/2ˆY|g(y)|2dµ(y)1/2 , para cualquier gcumpliendo f=TSg, tenemos que |f(x)|≤∥Sx∥L2(Y)∥f∥R(TS), donde Sx(y) = S(x, y). Por el lema anterior 3.2.7, TS:N(TS)⊥→ R(TS)es una isometría sobreyectiva, así, para dos funciones cualesquiera f1, f2∈ R(TS), tenemos que ⟨f1, f2⟩R(TS)=⟨g1, g2⟩L2(Y), donde g1, g2∈ N(TS)⊥son las únicas funciones que satisfacen TSgi=fi. Dado que w(y)∈ N(TS)⇐⇒ ˆY Sx(y)w(y)dµ(y)=0,∀x∈X , y esto se cumple si y solo si w⊥Sxpara todo x, tenemos que N(TS)⊥es el span cerrado de {Sx:x∈X}. En particular, tomando gt=St∈ N(TS)⊥y definiendo kt=TS(gt), se sigue para cualquier f=TSgcon g∈ N(TS)⊥, la propiedad reproductora ⟨f, kt⟩R(TS)=⟨g, gt⟩L2(Y)=ˆY gt(y)g(y)dµ(y) = ˆY S(t, y)g(y)dµ(y) = f(t). Así, R(TS)es un RKHS y ktes la función núcleo correspondiente al punto t. Finalmente, K(x, y) = kt(x) = (TSgt)(x) = ˆY S(x, y)gt(y)dµ(y) =ˆY S(x, y)S∗(t, y)dµ(y) = ˆY S(x, y)S∗(y, t)dµ(y) = (S□S∗)(x, t), y se concluye la demostración. 34
es un núcleo de Mercer y λN+1 =∥TKN∥. Este proceso o bien termina en un número finito de pasos, en tal caso K(x, y) = PN n=1 λnϕn(x)ϕn(y), o bien construimos una sucesión de autovectores y una de autovalores. En este último caso, la proposición 3.3.3 junto al Teorema de Arzelà-Ascoli 3.3.6, nos garantizan que existirá una subsucesión de autovectores, TKϕnj=λnjϕnj, que converge uniformemente y, por tanto, en norma. Esta subsucesión de vectores será de Cauchy, pero al ser los autovectores ortonormales tenemos que λnjϕnj−λnkϕnk2 L2=|λnj|2+|λnk|2n→∞ −→ 0⇒λnj n→∞ −→ 0. La subsucesión converge a 0, pero al ser la sucesión original decreciente, tenemos que ∥TKn∥=λn+1 n→∞ −→ 0. Este último hecho implica que K(x, y) = ∞ X n=1 λnϕn(x)ϕn(y), Obteniendo así las dos representaciones del teorema, donde la convergencia es uniforme. Proposición 3.3.8. En las condiciones del Teorema de Mercer 3.3.7, los autovectores {ϕn}nde TK, con autovalores asociados {λn}n, incluyendo al autovalor 0, forman una base ortonormal de L2(X, µ). Demostración. El espacio N(T)es cerrado, luego es un subespacio de L2(X, µ), que al ser µuna medida de Borel finita, es separable. Luego podemos formar una base ortonormal {ψn}nde N(T), que son autovectores asociados al autovalor 0. Por otro lado, los autovalores estrictamente positivos forman una base ortonormal del rango de TK. Es fácil ver que se tiene la descomposición L2(X, µ) = N(TK)⊕R(TK), luego uniendo ambas bases obtenemos el resultado. Ahora, dado un núcleo de Mercer Ky su operador integral asociado TK, vamos a estudiar la relación entre HKy el RKHS asociado a TK. Por el teorema 3.2.8, sabemos que K(2) =K□Kes el núcleo reproductor del RKHS del rango de TK. Proposición 3.3.9. Sea Kun núcleo de Mercer sobre Xyµuna medida de Borel finita en X. Entonces, T2 Kes un operador integral con símbolo K(2)(x, y) = ˆX K(x, t)K(t, y)dµ(y). Demostración. Calculando la imagen de T2 Kusando el Teorema de Fubini, obtenemos T2 Kg(x) = ˆX K(x, t)TKg(t)dµ(t) =ˆX K(x, t)ˆX K(t, y)f(y)dµ(y)dµ(t) =ˆX f(y)ˆX K(x, t)K(t, y)dµ(t)dµ(y), de donde se sigue el resultado. 41
Proposición 3.3.10. Sea Kun núcleo de Mercer sobre X,µuna medida de Borel finita en Xy tomemos C=´XK(t, t)dµ(t). Entonces CK −K(2) es un núcleo de Mercer sobre Xy el rango de TKestá contenido en HK. Demostración. Sabemos que K(2) es continua; luego, solo hace falta probar que CK −K(2) es una función núcleo. Notemos que por la factorización de Cholesky del teorema 2.4.2, tenemos que Lt(x, y) = K(t, t)K(x, y)−K(x, t)K(t, y) = K(t, t)K(x, y)−K(x, t)K(t, y) K(t, t) es una función núcleo para cada t∈Xfijo. En particular, es el núcleo del subespacio de funciones de HKque se anulan en t. Asumiendo que µ(X)=1, K(x, y)ˆX K(t, t)dµ(t)−ˆX K(x, t)K(t, y)dµ(t) = ˆX Lt(x, y)dµ(t), luego, dados unos vectores arbitrarios x1, .., xn∈Xy escalares α1, ..., αn, tenemos que n X i,j=1 αiαj(CK(xi, xj)−K(2)(xi, xj)) = ˆX n X i,j=1 αiαjLt(xi, xj)dµ(t)≥0, donde la desigualdad se sigue al ser la expresión del integrando no negativa, debido a que Ltes una función núcleo para cada t. Finalmente, por el Teorema de inclusión de Aronszajn 2.2.2, se sigue que R(TK) = HK(2) ⊆ HK. Observación 3.3.11. En el resultado anterior, R(TK)depende de la medida µ; sin embargo, HKes independiente de µ. Teorema 3.3.12. Sea Kun núcleo de Mercer sobre X,µuna medida de Borel finita con soporte Xy sea {ϕn}n∈Nla familia ortonormal de autovectores correspondiente a los autovalores no nulos {λn}n∈Ndel operador TKdados por el Teorema de Mercer 3.3.7. Entonces, 1. S(x, y) = ∞ X n=1 pλnϕn(x)ϕn(y), es el símbolo de un operador integral acotado en L2(X, µ). 2. TSes un operador positivo con T2 S=TK. 3. R(TS) = HK. 4. TSdefine una isometría de N(TK)⊥en HK. 5. {pλnϕn}n∈Nes una base ortonormal de HK. 42
6. HKconsiste de funciones ∞ X n=1 αnϕntales que ∞ X n=1 |αn|2 λn <∞. Demostración. Teniendo en cuenta que las funciones ϕnson ortogonales en L2(X, µ), y aplicando la descomposición del Teorema de Mercer 3.3.7, para cada x∈Xtenemos que ∥S(x, ·)∥2 L2= ∞ X n=1 λn|ϕn(x)|2=K(x, x). Luego, para cada x∈X,S(x, ·)∈L2(X, µ)y, por tanto, Sinduce un operador integral TSbien definido sobre L2(X, µ). Dada g∈L2(X, µ), tenemos que TSg(x) = ˆX S(x, y)g(y)dµ(y) = ˆX ∞ X n=1 pλnϕn(x)ϕn(y)g(y)dµ(y) = ∞ X n=1 pλn⟨g, ϕn⟩L2ϕn(x), y aplicando la proposición 3.3.8, obtenemos la acotación del operador al ser ∥TSg∥2 L2= ∞ X n=1 λn|⟨g, ϕn⟩L2|2≤C∥g∥L2donde C= sup n λn<∞. Por tanto, TSdefine un operador integral acotado sobre L2(X, µ), además, el siguiente cálculo muestra que TSes un operador positivo: ⟨TSg, g⟩L2=ˆXˆX S(x, y)g(y)g(x)dµ(y)dµ(x) =ˆXˆX ∞ X n=1 pλnϕn(x)ϕn(y)g(y)g(x)dµ(y)dµ(x) = ∞ X n=1 pλn|⟨g, ϕn⟩L2|2≥0. Por otro lado, desarrollando T2 Sse tiene que T2 Sg(x) = TS ∞ X m=1 pλm⟨g, ϕm⟩L2ϕm(y)! =ˆX ∞ X n=1 S(x, y)pλm⟨g, ϕm⟩L2ϕm(y)dµ(y) =ˆX ∞ X n=1 ∞ X m=1 pλnλm⟨g, ϕm⟩L2ϕn(x)ϕn(y)ϕm(y)dµ(y) = ∞ X n=1 λn⟨g, ϕn⟩L2ϕn(x) = TKg(x), 43
TSes la raíz cuadrada positiva del operador TK. Por el teorema 3.2.8, sabemos que el rango de TSes el RKHS con núcleo reproductor S□S∗(x, z) = ˆX S(x, y)S(y, z)dµ(y) =ˆX ∞ X n,m=1pλnλmϕn(x)ϕn(y)ϕm(y)ϕm(z)dµ(y) = ∞ X n=1 λnϕn(x)ϕn(z) = K(x, z), y además, TSdefine una isometría entre N(TS)⊥yHS□S∗=HK. Ahora observemos que N(TS)⊥=span {ϕn}=N(TK)⊥, luego, TSdefine una isometría entre span {ϕn} yN(TK)⊥. Al ser {ϕn}nuna base ortonormal para N(TK)⊥, sus imágenes por TS, {√λnϕn}nforman una base ortonormal de HK. Finalmente, el último ítem se deduce de la sobreyectividad de la isometría TSy aplicar la identidad de Parseval a la base {√λnϕn}n. Observación 3.3.13. Hemos demostrado que HKes el rango del operador T1/2 K. Esto es sorprendente, ya que R(T1/2 K)está definido a través de la medida µ; sin embargo, HKes independiente de la medida. Esto implica que el rango de los operadores integrales positivos es independiente de la medida. Ahora veremos una aplicación del Teorema de Mercer, caracterizando explícitamente el RKHS de un núcleo dado. 3.3.1. El núcleo del mínimo Consideramos el núcleo K(x, y) = m´ın{x, y}, que define un núcleo de Mercer sobre cualquier compacto X⊆[0,+∞), de hecho, se puede caracterizar directamente el RKHS sobre [0,+∞)usando los resultados de la sección 3.2. Para ello, tomando la medida de Lebesgue, consideramos el operador integral de Volterra TS:L2([0,+∞)) →L2([0,+∞)), dado por TSg(x) = ˆx 0 g(t)dt. TSes un operador integral con símbolo S: [0,+∞)×[0,+∞)→Cdefinido por S(x, t) = (1,0≤t≤x, 0, x < t. Resultados estándar de teoría de la medida (ver e.g. [25, sección 3.2]) determinan que una función fes de la forma TSg=fsi y solo si fes absolutamente continua, es decir, f′=gcasi por todo con f′∈L2([0,+∞)) yf(0) = 0. 44
Por otro lado, calculando el producto de símbolos de SyS∗tenemos que K(x, t) = S□S∗(x, t) = ˆ+∞ 0 S(x, y)S(t, y)dy = m´ın{x, t}, En el teorema 3.2.8, vimos que el RKHS de K=S□S∗viene dado por el rango del operador integral TS, así tenemos que el RKHS del núcleo del mínimo viene dado por el rango del operador integral de Volterra. En resumen, HK=R(TS) = {f: [0,+∞)→C|f(0) = 0, f absolutamente continua, f′∈L2} con ∥f∥HK=∥f′∥L2([0,+∞]). Si consideramos el caso en el que Xsea compacto,X= [0, b]⊂[0,+∞), aplicando el Teorema de la restricción, el RKHS sobre [0, b]sería simplemente la restricción de las funciones anteriores a este intervalo. Además, si tomamos cualquier medida de Borel µcon soporte [0, b]y consideramos el operador integral TKg(x) = ˆ[0,b] m´ın{x, t}g(t)dµ(t), TKserá un operador positivo con una base de autofunciones {ϕn}nortogonales en L2([0, b], µ)y en HK. Además, a priori sabemos que las ϕnserán absolutamente continuas con ϕn(0) = 0 y cuya derivada ϕ′ nes de cuadrado integrable respecto a la medida de Lebesgue en [0, b]. Se cumplirá entonces que ˆ[0,b] ϕn(t)ϕm(t)dµ(t) = 0 yˆb 0 ϕ′ n(t)ϕ′ m(t)dt = 0 ∀n=m . Ahora veremos un ejemplo de caracterización usando el Teorema de Mercer 3.3.7 y calculando las autofunciones asociadas. Consideramos el núcleo K(x, t) = m´ın{x, t}−xt, con x, t ∈[0,1], cuyo operador integral asociado, tomando la medida de Lebesgue, viene dado por TKg(x) = ˆ1 0 [m´ın{x, t}−xt]g(t)dt . Desarrollando la integral, tenemos que TKg(x) =ˆx 0 (t−xt)g(t)dt+ˆ1 x (x−xt)g(t)dt = (1−x)ˆx 0 t g(t)dt+xˆ1 x (1−t)g(t)dt, de donde se deduce la siguiente ecuación integral para los autovalores de TK: λ ϕ(x) = (1 −x)ˆx 0 t ϕ(t)dt +xˆ1 x (1 −t)ϕ(t)dt . 45
Ahora buscaremos la ecuación diferencial que tienen que satisfacer las autofunciones ϕ. Derivando la expresión anterior aplicando la regla de Leibniz o simplemente aplicando el Teorema fundamental del cálculo, obtenemos λ ϕ′(x) = −ˆx 0 t ϕ(t)dt + (1 −x)xϕ(x)+ˆ1 x (1 −t)ϕ(t)dt −x(1 −x)ϕ(x) ⇒λ ϕ′(x) = −ˆx 0 t ϕ(t)dt +ˆ1 x (1 −t)ϕ(t)dt . Derivando una segunda vez, llegamos a la ecuación λ ϕ′′(x) = −xϕ(x)−(1 −x)ϕ(x) = −ϕ(x). Encontremos unas condiciones de contorno que nos permitan resolver la ecuación diferencial anterior. Observemos que K(x, t) = m´ın{x, t} − xt es 0cuando x= 0 óx= 1, luego una elección adecuada debe ser ϕ(0) = ϕ(1) = 0. Así, tenemos el problema de contorno (ϕ′′ +rϕ = 0, ϕ(0) = ϕ(1) = 0 , donde r= 1/λ. Este es un problema de Sturm-Liouville clásico, cuyas autofunciones y autovalores vienen dados por ϕn(x) = √2 sin(nπx)yrn= (nπ)2⇒λn=1 (nπ)2. Por el Teorema de Mercer 3.3.7, tenemos, por tanto, la descomposición K(x, t) = ∞ X n=1 2 (nπ)2sin(nπx) sin(nπt) y el RKHS correspondiente esta constituido por funciones de la forma f(x) = ∞ X n=1 an√2 sin(nπx)con ∥f∥2 HK= ∞ X n=1 a2 n λn = ∞ X n=1 a2 n(nπ)2<∞. Las autofunciones {√2 sin(nπx)}nforman una base ortonormal de L2([0,1]), luego los anson los coeficientes de Fourier de fen la base {√2 sin(nπx)}n. Ahora, considerando la derivada débil de f, definida en el sentido de las distribuciones, que coincide con la derivada formal, f′(x) = ∞ X n=1 annπ√2 cos(nπx), y dado que las funciones {√2 cos(nπx)}ntambién forman una base ortonormal de L2([0,1]), tenemos que ∥f′∥2 L2([0,1]) = ∞ X n=1 n2π2a2 n<∞ ⇒ f′∈L2([0,1]) y∥f∥HK=∥f′∥L2([0,1]) . 46
Además, para toda f∈ HKse tiene que f(0) = f(1) = 0, luego, HK⊆H1 0([0,1]). Pero además, las funciones de H1 0([0,1]) se pueden desarrollar en la base anterior {√2 sin(nπx)}ny verifican las mismas propiedades que las funciones de HK. Al coincidir en norma, concluimos la igualdad HK=H1 0([0,1]). Este núcleo coincide con el ejemplo del capítulo 1, ejemplo 1.1.1. Otra manera de probar que HK=H1 0([0,1]), es usando el Teorema de factorización de Cholesky 2.4.2, a partir de la expresión (2.1), obtenemos la descomposición de núcleos K(x, t) = m´ın{x, t}−xt = m´ın{x, t}− m´ın{1, x}m´ın{1, t} m´ın{1,1}. Por tanto, las funciones de HKson las mismas funciones que las del RKHS anterior que además se anulan en x= 1. 3.4. Operadores de Hilbert-Schmidt Como aplicación de la teoría de RKHS de este capítulo, vamos a considerar brevemente los operadores integrales con símbolo de cuadrado integrable con respecto a la medida producto2. Así, en esta sección probaremos que este tipo de operadores se corresponden con los operadores de tipo Hilbert-Schmidt. Asumiremos que µes una medida σ-finita sobre X, así la medida µ×µestá bien definida sobre X×X. Si S:X×X→Ces de cuadrado integrable respecto a µ×µ, entonces ˆX×X|S(x, y)|2d(µ×µ) = ˆXˆX|S(x, y)|2dµ(y)dµ(x) =ˆXˆX|S(x, y)|2dµ(x)dµ(y), y, por tanto, ˆX|S(x, y)|2dµ(y)<∞,c.p.t. x∈XyˆX|S(x, y)|2dµ(x)<∞c.p.t y∈X . Si tomamos Xcomo el soporte de µ, las integrales anteriores son finitas para todo x, y ∈Y. Dado que en la teoría de RKHS, estamos interesados en funciones que existen en todos los puntos, asumiremos que µtiene soporte X. Así, una función S:X×X→Cde cuadrado integrable respecto a µ×µ, siendo Xel soporte de µ, se denomina una función de cuadrado integrable estándar en el dominio producto. En este caso, para cada x∈X, tenemos que Sx(·) = S(x, ·)∈L2(X), y por tanto, para todo x∈Xyg∈L2(X), el valor (TSg)(x) = ´XS(x, y)g(y)dµ(y)está bien definido. Más aún, al tener que |(TSg)(x)|2≤ˆX|S(x, y)|2dµ(y)ˆX|g(y)|2dµ(y), 2Dada una medida µsobre X, la medida producto µ×µes una medida sobre X×X, dada por µ×µ(B×B) = µ(B)µ(B). 47
entonces, ∥TSg∥2 L2≤ ∥g∥2 L2ˆXˆX|S(x, y)|2dµ(y)dµ(y) = ∥g∥2 L2∥S∥2 L2. por tanto, el operador integral TS:L2(X)→L2(X)está bien definido y es acotado con ∥TS∥≤∥S∥L2(X×X). Y lo que es más importante: el rango de este operador no es solo un subespacio de L2(X)sino un espacio vectorial de funciones definidas en X. En el teorema 3.2.8, hemos visto que existe una forma natural de dotar a este espacio de una norma y convertirlo en un RKHS sobre Xcon núcleo reproductor K(x, z) = S□S∗(X, z) = ˆX S(x, y)S(y, z)dµ(y). Definición 3.4.1. Sea Hun espacio de Hilbert y un operador T:H → H. Si para toda base ortonormal {en}n, se tiene que ∞ X n=1 ∥Ten∥2<∞, entonces, se dice que Tes un operador de Hilbert-Schmidt. Además, la suma anterior es independiente de la base ortonormal elegida, por ello, dicha suma se define como la norma de Hilbert-Schmidt del operador y se denota por ∥T∥HS Proposición 3.4.2. Sea µuna medida σ-finita sobre XyS:X×X→Cuna función de cuadrado integrable estándar. Entonces, el operador integral asociado TS es Hilbert-Schmidt y ∥TS∥2 HS =ˆˆX×X|S(x, y)|2dµ(x)dµ(y). Demostración. Sea {en}nuna base ortonormal de L2(X). Tenemos que ˆX|S(x, y)|2dµ(y) = ∞ X n=1 |⟨S(x, ·), en⟩L2|2 = ∞ X n=1 ˆX S(x, t)en(t)dµ(t) 2 = ∞ X n=1 |TSen(x)|2, e integrando sobre xy aplicando el Teorema de Tonelli, obtenemos ˆXˆX|S(x, y)|2dµ(y)dµ(x) = ∞ X n=1 ∥TSen∥2 L2. 48
En el siguiente teorema probaremos que efectivamente los operadores de HilbertSchmidt se corresponden con los operadores integrales de símbolo de cuadrado integrable sobre el dominio producto. Teorema 3.4.3. Sea T:L2(X, µ)→L2(X, µ)un operador de Hilbert-Schmidt y supongamos que L2(X, µ)es separable. Entonces, Tes un operador integral con símbolo de cuadrado integrable sobre X×X S(x, y) = ∞ X n=1 fn(x)en(y), donde {en}nes una base ortonormal cualquiera de L2(X, µ)yfn=T enpara cada n∈N. Además, Sno depende de la base elegida. Demostración. Dada g∈L2(X, µ), la expresamos en términos de la base como g=Pnαnendonde αn=⟨g, en⟩L2. Luego, tenemos que Tg =Pnαnfny al ser T Hilbert-Schmidt, es decir, Pn∥fn∥2 L2<∞, nos lleva a definir el símbolo integral S(x, y) = ∞ X n=1 fn(x)en(y). Veamos que es de cuadrado integrable sobre X×X. En efecto, aplicando la identidad de Parseval y el Teorema de Tonelli, tenemos que ∥S∥2 L2(X×X)=ˆXˆX ∞ X n=1 fn(x)en(y) 2 dµ(y)dµ(x) =ˆX ∞ X n=1 |fn(x)|2dµ(x) = ∞ X n=1 ∥fn∥2 L2<∞. Además, esta suma es independiente de la base elegida. Al tomar otra base ortonormal, el símbolo obtenido es igual a Ssalvo en conjuntos de medida nula. Por otro lado, hemos visto en la página 48 que el operador integral TSestá bien definido y es acotado. Así finalmente, tenemos que TSg(x) = ˆX S(x, y)g(y)dµ(y) = ˆX ∞ X n=1 fn(x)en(y)! ∞ X m=1 αmem(y)!dµ(y) =ˆX ∞ X n=1 ∞ X m=1 αmfn(x)em(y)en(y)dµ(y) = ∞ X n=1 ∞ X m=1 αm⟨em, en⟩L2fn(x) = ∞ X n=1 αnfn(x) = Tg(x), de donde se obtiene que TS=T 49
Observación 3.4.4. Generalizando el resultado anterior, dado un espacio de Hilbert separable cualquiera, este es unitariamente equivalente a un espacio L2separable, y como la propiedad de ser Hilbert-Schmidt de operadores se conserva bajo equivalencias unitarias, concluimos que el estudio de los operadores de Hilbert-Schmidt es equivalente al estudio de los operadores integrales con símbolo de cuadrado integrable. Nota 3.4.5. El rango de todo operador Hilbert-Schmidt en L2es un RKHS con núcleo reproductor K=S□S∗, donde Ses el símbolo integral dado por el teorema anterior 3.4.3. El rango de un operador Hilbert-Schmidt en cualquier espacio de Hilbert separable es unitariamente equivalente a un RKHS. 50
Considerando la función t→Xt, tenemos que ∥Xt−Xs∥2 L2(Ω) =K(s, s) + K(t, t)−2K(s, t)s→t −→0, y, por tanto, la aplicación t→Xtes continua de TaL2(Ω). Al ser ϕncontinua, la aplicación t→ϕn(t)Xttambién es continua y por tanto, uniformemente continua del compacto Tal espacio de Banach L2(Ω), así, la integral de Bochner Zn=1 √λnˆT Xtϕn(t)dt ∈L2(Ω) está bien definida. Cuando Tes un intervalo o un rectángulo, esta integral es simplemente un límite de sumas de Riemann. Ahora vemos que la sucesión {Zn}nes incorrelada calculando las covarianzas ⟨Zn, Zm⟩L2(Ω) =1 √λnλmˆT Xtϕn(t)dt, ˆT Xsϕm(s)dsL2(Ω) =1 √λnλmˆ ˆT×T⟨Xt, Xs⟩L2(Ω) ϕn(t)ϕm(s)ds dt =1 √λnλmˆ ˆT×T K(s, t)ϕn(t)ϕm(s)ds dt =1 √λnλm⟨TKϕn, ϕm⟩L2(T)=1 √λnλm (λn⟨ϕn, ϕm⟩L2(T)) = δn,m . Además, asumiendo que E[Xt] = 0 tenemos que ˆΩ ZndP =1 λnˆΩˆT Xtϕn(t) = ˆT ϕn(t)ˆΩ XtdP = 0 . Para probar la convergencia de la serie al proceso, notemos que ⟨Xt, Zn⟩L2(Ω) =1 √λnXt,ˆT Xsϕn(s)dsL2(Ω) =1 √λnˆT⟨Xt, Xs⟩L2(Ω) ϕn(s)ds =1 √λnˆT K(s, t)ϕn(s)ds =pλnϕn(t). 56
Luego, Xt− N X n=1 pλnZnϕn(t) 2 L2(Ω) =∥Xt∥2 L2(Ω) −2 N X n=1 pλn⟨Xt, Zn⟩L2(Ω) ϕn(t) + N X n,m=1 pλnλm⟨Zn, Zm⟩L2(Ω) ϕn(t)ϕm(t) =K(t, t)−2 N X n=1 λnϕn(t)2+ N X n=1 λnϕn(t)2 =K(t, t)− N X n=1 λnϕn(t)2n→∞ −→ 0. En particular, por la proposición 3.1.5 la convergencia es uniforme en T. En el caso de que Xtsea un proceso gaussiano, notemos que por la definición de integral de Bochner, Znse aproxima por sumas de la forma PN i=1 µ(Ei)Xtiϕn(ti). Como la suma de variables normales es normal, y el límite de normales también es normal, Znes normal. Usando el hecho de que las variables normales incorreladas son independientes, tenemos que {Zn}nes una sucesión de variables normales independientes. 4.4. Medidas gaussianas En esta sección, discutiremos brevemente la teoría de la medida en espacios de dimensión infinita, viendo algunas propiedades de las medidas gaussianas y su relación con los RKHS. Se demuestra (ver e.g. [17]) que no se puede generalizar la medida de Lebesgue a espacios de dimensión infinita; al ser la medida trivial µ≡0, la única medida localmente finita e invariante por traslaciones. Este hecho nos lleva a considerar otros tipos de medidas, como las medidas gaussianas. Las medidas gaussianas son una generalización de la medida inducida por una distribución normal. Una consecuencia de la continuidad de los funcionales de evaluación Exen un RKHS es la equivalencia de los procesos gaussianos con las medidas gaussianas, como veremos en el teorema 4.4.9. Estas, además, son equivalentes en espacios como L2, espacios de funciones continuas, etc. Primero recordaremos algunas nociones fundamentales de teoría de la medida que podemos consultar en [7] o en [4]. Definición 4.4.1. Sea (X, A)un espacio medible y µyνdos medidas sobre A. La medida νes absolutamente continua con respecto a µsi para todo A∈A,µ(A) = 0 implica ν(A)=0. Así decimos que νestá dominada por µy lo denotamos por ν≪µ. Si νes finita, esta propiedad es equivalente a que para todo ε > 0exista un δ > 0 tal que ν(A)< ε para todo A∈Acon µ(A)< δ. 57
Teorema 4.4.2 (de Radon-Nikodym).Sea (X, A)un espacio medible y dos medidas σ-finitas µyνsobre Atales que νes absolutamente continua con respecto a µ. Entonces existe una función medible no negativa ftal que ν(A) = ˆA f dµ , ∀A∈A. Además, la función festá únicamente determinada salvo a lo sumo en los conjuntos de µ-medida nula. Es decir, si ges otra función medible cumpliendo la condición anterior se tiene que f=gc.p.t. µ. Definición 4.4.3. En las condiciones del teorema anterior, a la función fse le denomina derivada de Radon-Nykodim de νcon respecto a µ, y suele denotarse por dν/dµ. Definición 4.4.4. Dados dos espacios medibles (X, A)y(Y, B), una aplicación medible f:X→Yy una medida µsobre A. Se define la medida imagen o “pushforward"de µpor fcomo la medida f∗µsobre Bdada por f∗µ(B) = µ(f−1(B)) para cada B∈B. A partir de ahora consideraremos que Tes un espacio medible, que las funciones núcleo estarán definidas de la forma K:T×T→C, y que Hes un RKHS separable. La generalización de la medida a dimensión infinita nos llevará a considerar funciones medibles que toman valores en espacios de Hilbert, por ello, a continuación daremos una descripción del σ-álgebra de Borel de un RKHS. Teorema 4.4.5. El σ-álgebra de Borel de un RKHS separable H,B(H)es el σálgebra generado por los funcionales de evaluación Ex, es decir, σ({Ex}x∈X). Demostración. Sea B=σ({Ex}x∈X) = {E−1 x(B) : x∈X, B ∈B(R)}, el σálgebra generado por los funcionales de evaluación {Ex}x∈X. Por la continuidad de los funcionales Ex, tenemos que B⊆B(H), ya que todos los funcionales continuos son medibles respecto al σ−álgebra de Borel. Luego, para toda f∈ H tenemos que ∥f∥= sup ∥g∥≤1|⟨f, g⟩| = sup ∥g∥≤1, g∈L0(K)|⟨f, g⟩|, donde L0(K)es un subconjunto numerable3de L(K)denso en H. Si g∈ L0(K), tenemos que el funcional L=⟨·, g⟩, al poderse reescribir como una combinación lineal de funcionales de evaluación Ex, es B−B(R)medible, es decir, se tiene que L−1(B)∈Bpara todo B∈B(R). Sea r > 0yf0∈ H, entonces {f:∥f−f0∥ ≤ r}=\ ∥g∥≤1, g∈L0(K){f:|⟨f−f0, g⟩| ≤ r}, 3En la proposición 3.1.4, vimos como construir un subconjunto de L(K)numerable y denso en HK. 58
donde la parte derecha de la igualdad es una intersección numerable de elementos de B, luego, pertenece a B, y, por tanto, tenemos que toda bola cerrada pertenece aB. Al ser Hseparable se tiene que todo abierto es unión numerable de bolas cerradas lo que implica que B(H)⊆B, de donde se sigue el resultado. Nótese que la prueba anterior es válida para todo subconjunto denso y numerable en un espacio de Hilbert separable cualquiera. Por el teorema anterior 4.4.5, se sigue que B(H)es el conjunto de intersecciones H∩B, para cada Bperteneciente al σ-álgebra producto4de F(X, C), y de aquí se siguen los siguientes corolarios: Corolario 4.4.6. Sea (Ω,A)un espacio medible. Una aplicación X: (Ω,A)→(H,B(H)) ω7→ X(ω, ·) es medible si y solo si para todo t∈Tla función X(·, t) = ⟨X, K(·, t)⟩ es una variable aleatoria. Corolario 4.4.7. Una variable aleatoria en un espacio medible (Ω,A)que toma valores en (H,B(H)), es equivalente a un proceso estocástico Xt∈Ten (Ω,A)cuyas trayectorias pertenecen a H. Definición 4.4.8. Una medida de probabilidad µsobre (H,B(H)) se denomina una medida gaussiana si para toda g∈ H, el funcional ⟨·, g⟩es una variable aleatoria real gaussiana en (H,B(H), µ). El siguiente teorema muestra la equivalencia de las medidas gaussianas con los procesos gaussianos: Teorema 4.4.9. Las siguientes afirmaciones son equivalentes: 1. Si X:T×Ω→Res un proceso gaussiano definido en (Ω,A, P)con trayectorias T→R t7→Xt(ω), ω ∈Ω, en H. Entonces, la medida imagen de Ppor X, es decir, la medida PX−1 inducida en (H,B(H)) por la variable aleatoria X: (Ω,A, P)→(H,B(H)) ω7→X(ω, ·), es una medida gaussiana. 4El σ-álgebra producto de F(X, C)es el menor σ-álgebra para el cual los funcionales de evaluación Exson medibles sobre F(X, C), y viene dado por σ({E−1 x(B) : B∈B(C)}), donde B(C) denota el σ-álgebra de Borel de C. 59
2. Recíprocramente, si µes una medida gaussiana sobre (H,B(H)), entonces existe un espacio de probabilidad (Ω,A, P), en el cual se puede definir un proceso gaussiano Xcon trayectorias en H, tal que PX−1=µ. Demostración. 1. Tenemos que probar que para toda g∈ H, la variable aleatoria real ⟨·, g⟩: (H,B(H), PX−1)→(R,B(R)) f7→ ⟨f, g⟩ es gaussiana. Dado B∈B(R)), se tiene que PX−1(⟨·, g⟩ ∈ B) = P(⟨X, g⟩ ∈ B), luego, es suficiente probar que ⟨X, g⟩es gaussiana. Al ser H=L(K), la función ges el límite de una sucesión de L(K), es decir, g= l´ım n→∞ jn X i=1 αn iK(·, tn i), αn i∈R, tn i∈T, ∀i, ∀n=⇒ ⟨X, g⟩= jn X i=1 αn iXtn i. Al ser Xun proceso gaussiano, las variables Xtn ison gaussianas entonces, ⟨X, g⟩es gaussiana por ser el límite de variables gaussianas. 2. Sea t∈Tyf∈ H, definimos Xt(f) = f(t). Sea n∈N,(t1, ..., tn)∈Tn,α∈Rn. La aplicación n X i=1 αiXti: (H,B(H), µ)→(R,B(R)), es el funcional lineal continuo sobre Hcuyo representante de Riesz viene dado por n X i=1 αiK(·, ti). Por definición de medida gaussiana, el funcional que representa es una variable aleatoria gaussiana, luego, Xtes un proceso gaussiano con trayectorias X(f, ·) = f∈ H. Si Xes la variable aleatoria asociada al proceso Xt, dada por el corolario 4.4.7, tenemos que µ(X−1(B)) = µ({g:X(g, ·)∈B}) = µ(B),∀B∈B(H) =⇒µX−1=µ, así, hemos construido un proceso Xten (H,B(H), µ)que cumple µX−1=µ, como buscábamos. Nota 4.4.10. Dado un proceso gaussiano X, se llama la ley del proceso Xa la medida inducida por el proceso, PX−1, es decir, la medida imagen de Ppor X. 60
4.5. Espacio de Cameron-Martin Continuando con la discusión iniciada en la sección anterior 4.4, en dimensión infinita las medidas no serán invariantes por traslaciones; luego, será necesario caracterizar cómo afectan las traslaciones a la medida. Curiosamente, es un RKHS el que caracteriza las traslaciones por las cuales la medida se mantiene absolutamente continua; este espacio se conoce como el espacio de Cameron-Martin. Este espacio fue inicialmente introducido por Cameron y Martin al estudiar las traslaciones del movimiento Browniano. En [12] y [8], se pueden consultar las pruebas y detalles de esta sección. Definición 4.5.1. Sea µuna medida gaussiana sobre (H,B(H)) y su asociado proceso gaussiano X. Se define el espacio de Cameron-Martin, Hµ, de µóXcomo el RKHS inducido por la función de covarianzas Kdel proceso X, es decir, Hµ=HK. Teorema 4.5.2 (Cameron-Martin).Sea µuna medida gaussiana sobre (H,B(H)) con proceso gaussiano asociado Xt∈T, con función de medias m(t)≡0, y función de covarianzas Ky sea Hµel espacio de Cameron-Martin de µ. Dada una dirección h, la traslación de µpor h,µh(A) = µ(A−h), es absolutamente continua respecto aµsi y solo si h∈ Hµ. Además, se tiene que la derivada de Radon-Nikodym es dµh dµ (x) = exp U(h)−1 2∥h∥Hµ= exp ˆT h dXt−1 2∥h∥Hµ, donde Ues la isometría dada en 4.2.1, que define la integral de Wiener de la segunda igualdad. El teorema anterior caracteriza por completo las traslaciones por las que una medida gaussiana o la ley de un proceso gaussiano se mantienen absolutamente continuas. 4.6. Movimiento Browniano En esta sección veremos brevemente las aplicaciones de los resultados principales de este capítulo al movimiento Browniano. Primero definiremos el movimiento Browniano con valores en R. Definición 4.6.1. Un movimiento Browniano o proceso de Wiener es un proceso gaussiano {Wt}t≥0, tal que 1. W0= 0, casi seguro5. 2. Las trayectorias t→Wtson continuas casi seguro. 5En teoría de la probabilidad, el término casi seguro, quiere decir con probabilidad 1. 61
3. Para cualquier sucesión finita de tiempo 0≤t0< t1<··· < tn, los incrementos Wt1−Wt0, ..., Wtn−Wtn−1, son mutuamente independientes (incrementos independientes). 4. Para cualesquiera 0≤s<t, la variable Wt−Wssigue una distribución normal N(0, t −s). Tomando el incremento Wt−W0, tenemos que Wt−W0=Wt∼N(0, t), luego la función de medias de Wtes mW(t)≡0. Tomando 0≤s<t, E[WsWt] = E[Ws(Ws+ (Wt−Ws))] = E[W2 s] + E[Ws(Wt−Ws)] =E[W2 s] = Var(Ws) = s, donde hemos aplicado que el incremento Ws−W0=Wses independiente del incremento Wt−Ws. Por tanto, la función de covarianzas del proceso viene dada por K(s, t) = m´ın{s, t}. Esta función es el núcleo estudiado en la sección 3.3.1, que al haber tomado índice t∈[0,+∞], tiene como RKHS al espacio HK={f: [0,+∞)→C|f(0) = 0, f absolutamente continua, f′∈L2([0,+∞])}. Restringiendo los índices ta[0,1], y calculando los autovalores del operador integral asociado a Kde manera análoga a la sección 3.3.1, si aplicamos el Teorema de Karhunen-Loève, obtenemos la representación de Wiener del movimiento Browniano en [0,1], Wt=√2 ∞ X n=1 Zn sin(n−1 2)πt (n−1 2)π, con Zn∼N(0,1) independientes e idénticamente distribuidas. Por otro lado, por el Teorema de Cameron-Martin 4.5.2, el espacio HKconstituye las traslaciones por las que la ley del movimiento browniano se mantiene absolutamente continua. Si h∈ HK, la ley del proceso Wt+hes absolutamente continua respecto a la ley de Wt. En la figura 4.1, mostramos un ejemplo de cómo las traslaciones de Cameron-Martin mantienen la distribución del movimiento Browniano absolutamente continua y cómo cambia la media de las trayectorias. 62
Figura 4.1: En esta figura, vemos las traslaciones de Cameron-Martin de una trayectoria muestral de un movimiento Browniano. De esta forma, las trayectorias resultantes de una traslación por htienen funcion de medias h(t), por lo que el proceso gaussiano resultante se centra en torno a la curva h,pero mantiendo la distribución absolutamente continua con respecto a la original. 63
Capítulo 5 RKHS en Estadística y Machine Learning Si recordamos la definición de núcleo 1.4.1, la aplicación de características ϕes una inmersión del conjunto Xen un espacio de Hilbert. Este procedimiento es habitual en estadística y machine learning, donde se suele sumergir un conjunto de datos Xen un espacio de dimensión mayor o infinita con el objetivo de estudiar sus relaciones o de linealizar algunos problemas de predicción. Así, las funciones del espacio de características de ϕse convierten en los posibles predictores de nuestro problema. Este procedimiento es la base de los ampliamente denominados métodos kernels. En este capítulo discutiremos la base teórica de los métodos kernels y mostraremos algunos ejemplos. 5.1. Kernel trick Un gran beneficio de los núcleos reproductores es que no hace falta calcular explícitamente las imágenes de los datos por la aplicación característica ϕpara obtener sus respectivos productos escalares, ya que estos vienen directamente dados por el núcleo K. Así, podemos construir algoritmos que únicamente estén formulados en términos de productos escalares, haciéndolos computacionalmente mucho más eficientes. Además, dado un algoritmo de este tipo, podemos intercambiar el núcleo por cualquier otro resolviendo el mismo problema, pero en otro espacio distinto. Esta metodología es lo que se conoce como el kernel trick. El caso más común en el que se aplica el kernel trick es cuando tenemos un algoritmo que depende únicamente de productos escalares. Por otra parte, al no haber puesto ninguna restricción sobre el conjunto X, podemos aplicar estos procedimientos a conjuntos de textos u otro tipo de datos no estructurados. 64
5.2. Teorema del Representante El siguiente teorema es simple y aún así destacable y celebrado. Muestra cómo un problema inicial de optimización en un espacio de dimensión infinita en un RKHS se convierte en un problema de optimización en dimensión finita, concretamente en un subespacio generado por núcleos reproductores puntuales. Teorema 5.2.1 (del Representante).Sea Hun RKHS sobre X con núcleo K, sea una función monótonamente creciente W:R→Ry sea L: (X×Y×R)n→Runa función de error arbitraria. Considerando la función de coste J(f) = W(∥f∥2 H) + L((x1, y1, f(x1)), ..., (xn, yn, f(xn))) , donde xi∈X,yi∈Ypara todo i= 1, ..., n, entonces, cualquier minimizador f∗tal que J(f∗) = ´ınff∈H J(f), pertenece al span de los núcleos reproductores puntuales kx1, ..., kxn. Es decir, f∗admite una representación de la forma f∗= n X i=1 αikxi, donde αi∈Rpara todo i= 1, ..., n. Demostración. Sea S= span {kxi, i = 1, ..., n}. Por el Teorema de la proyección ortogonal, tomando la descomposición f∗=g+h, donde g∈Syh∈S⊥, la prueba se reduce a probar que h= 0. Dado que h∈S⊥se tiene que h(xi) = 0 para todo i= 1, ..., n, y dado que la función Ldepende de los valores de la función en los puntos xi, vemos que J(f∗) = W(∥f∗∥2 H) + L((x1, y1, g(x1)), ..., (xn, yn, g(xn))) . Más aún, por el Teorema de Pitágoras ∥f∗∥2=∥g∥2+∥h∥2≥ ∥g∥2y al ser W monótonamente creciente tenemos que J(f∗)> W(∥g∥2 H) + L((x1, y1, g(x1)), ..., (xn, yn, g(xn))) . Por tanto, se sigue que f∗∈S. Si además pedimos que Lsea convexo1, entonces podemos garantizar la existencia y unicidad de la solución. Así llegamos a la versión del teorema del representante para el problema de regularización de Tikhonov, donde el error es convexo. 1Recordemos que una función L:C→Res convexa si para todo x, y ∈Cy0<t<1se tiene que L(tx + (1 −t)y)≤tL(x) + (1 −t)L(y). 65
5.6. Support Vector Machines Muchos problemas de reconocimiento de patrones o figuras se reducen a un problema de clasificación binaria; en esta sección, nos centraremos en la clasificación supervisada, en la que partimos de unos datos clasificados (x1, λ1), ..., (xn, λn), donde λies la etiqueta de la clase de xi∈X, que asumiremos que toma los valores ±1. La simple idea de asociar un nuevo patrón xa la clase cuya media es más cercana según un producto escalar induce una frontera de decisión que tiene la forma de un hiperplano, lo que nos lleva a la siguiente definición según la existencia de estos tipos de hiperplanos: Definición 5.6.1. Sea X={xi:i∈I}⊂Hun conjunto de datos con Hun espacio prehilbertiano y λi∈ {±1}las etiquetas de clasificación asociadas. Definiendo las particiones X+={xi∈X:λi= +1}yX−={xi∈X:λi=−1}, el conjunto de datos Xse dice linealmente separable si existe un hiperplano V={h∈ H :⟨h, v⟩= c}⊂Htal que X+⊆V+={h∈ H :⟨h, v⟩> c}, X−⊆V−={h∈ H :⟨h, v⟩< c}, de lo contrario, se dirá que el conjunto de datos es no separable. Dado un hiperplano de esta clase, podemos tomar como función de predicción para el problema de clasificación binaria a la función f(x) = sign(⟨x, v⟩−c). Dado un problema linealmente separable, una cuestión a determinar es cuál es el hiperplano óptimo como hiperplano de decisión. Este hiperplano existe, y es único, y está determinado por tener el máximo margen de separación entre cualesquiera 2 puntos de los datos. El hiperplano de máximo margen de separación se puede obtener resolviendo el siguiente problema: m´ın v∈H, c∈R∥v∥2 2, con las siguientes restricciones2λi(⟨v, xi⟩−c)≥1, para todos i= 1, ..., n . Por las condiciones de Karush-Kuhn-Tucker (KKT) de optimalidad, el vector normal del hiperplano vtiene una expansión única en términos de un subconjunto de puntos de los datos. Estos puntos se encuentran justo en el margen del hiperplano al satisfacer la igualdad de la restricción, y los demás puntos son irrelevantes para su determinación; por ello, estos puntos se denominan vectores de soporte o support 72
Figura 5.1: Ejemplo del hiperplano de máximo margen de separación de un conjunto de datos linealmente separable; donde además, destacamos los vectores de soporte que determinan el hiperplano. vectors. En [24], se puede encontrar el desarrollo y la derivación de la formulación del problema. En la figura 5.1 tenemos un ejemplo del hiperplano discutido. Este procedimiento depende únicamente de los productos escalares entre los xi, luego estamos en las condiciones de aplicar el kernel trick. Generalizando así este problema para construir fronteras de decisión no lineales, sin necesitar que el conjunto de datos Xesté equipado con un producto escalar. Esta generalización constituye el modelo de clasificación conocido como Support Vector Machines (SVM) o Máquina de Vectores de Soporte, el nombre se debe a los vectores de soporte que determinan la frontera de decisión. Consideramos entonces un núcleo Ky la aplicación de características canónica 1.4.3, ϕ:X→ HK, transformando nuestros datos de entrada en un espacio de dimensión alta o posiblemente infinita, donde separaremos linealmente los datos. Además, no necesitaremos calcular la transformación explícita de los datos por ϕya que solo necesitaremos sus productos escalares que vienen dados por K, reduciendo significativamente todo el coste computacional. Podemos aplicar el mismo método que en 5.3.2 para que el problema de encontrar el hiperplano de margen máximo de separación en HK, sea equivalente a resolver el siguiente: m´ın f∈HK∥f∥2 HK con restricciones λi⟨f, kxi⟩HK=λif(xi)≥1, para todo i= 1, ..., n . En la práctica, los datos no tienen por qué ser linealmente separables; más aún, un outlier como un dato mal clasificado puede afectar crucialmente al hiperplano. Lo que lleva a generalizar el método, consintiendo que algunos puntos sobrepasen una distancia fija del margen del hiperplano. Relajando así las restricciones del problema 2A la hora de escribir las restricciones, hemos utilizado ≥1en vez de >0, pues podemos reescalar vyb. 73
de optimización, pero manteniendo aún así las propiedades anteriores. Este nuevo hiperplano se denomina hiperplano de margen blando o soft margin. Un método heurístico para hallar tal fen ambos casos es minimizar el funcional que penaliza las funciones que no satisfacen la restricción, esta función de error se conoce como el error de hinge, y viene dada por L(xi, λi, f(xi)) = n X i=1 m´ax{0,1−λif(xi)}, que es una función convexa en f. Luego, el Teorema del representante 5.2.1 establece que existe una única solución de ∥f∥2 HK+ n X i=1 m´ax{0,1−λif(xi)}, y además, la solución pertenece al span de los núcleos puntuales kx1, ..., kxn, garantizando así la convergencia del método, y reduciendo nuestro problema de optimización en dimensión infinita a uno de dimensión finita. En la figura 5.2, tenemos un ejemplo del algoritmo construido, Support Vector Machines. (a) Espacio de entrada. (b) Transformación (x, y, x2+y2). Figura 5.2: En esta figura mostramos un ejemplo de SVM usando el Radial Basis Function Kernel, núcleo dado por la función K(x, y) = exp−∥x−y∥2/2σ2definida en Rn. En este caso, los datos de entrada son puntos en R2, en los que cada clase tiene una relación radial. Así, sumergimos los datos en R3con la inmersión ϕ(x, y) = (x, y, x2+y2), y tras esta transformación, los separamos linealmente. Notemos que los vectores de soporte son los puntos más cercanos no sólo en el espacio de características sino en el espacio de entrada. 74
Conclusiones En este trabajo hemos estudiado los fundamentos de la teoría de los espacios de Hilbert de núcleo reproductor y sus aplicaciones en la teoría de la probabilidad y los procesos estocásticos y en la estadística y el machine learning. En el Capítulo 1 definimos los RKHS mostrando ejemplos como H1,PWσo H2(D). Además, caracterizamos estos espacios mediante el Teorema de Moore 1.2.3, estableciendo una correspondencia uno a uno entre los RKHS y las funciones núcleo. En el Capítulo 2 estudiamos las operaciones algebraicas de núcleos y sus efectos en el RKHS asociado, demostrando que la diferencia de núcleos implicaba la inclusión de los espacios y que la teoría de retrocesos era de gran utilidad para describir los RKHS. En el Capítulo 3 discutimos la conexión de los RKHS y las funciones núcleo con los operadores integrales. Además, demostramos el Teorema de Mercer 3.3.7 que proporciona una descomposición espectral del núcleo reproductor a partir de los autovalores del operador integral asociado al mismo. El Teorema de Mercer también da una descripción de todas las funciones que constituyen el RKHS. Por otro lado, respecto a las aplicaciones, en el Capítulo 4 vimos cómo los RKHS y la Teoría de la probabilidad se relacionaban a través de la covarianza. Esta relación dio paso a la generalización de las integrales estocásticas deterministas a través de la isometría que inducía el operador integral asociado a un proceso estocástico. También vimos cómo la aplicación del Teorema de Mercer 3.3.7 a los procesos estocásticos condujo a la descomposición de Karhunen-Loève de un proceso estocástico. Como última aplicación en este ámbito, estudiamos el espacio de Cameron-Martin; este espacio constituye un RKHS que caracteriza las traslaciones por las que una medida gaussiana o la ley de un proceso gaussiano se mantiene absolutamente continua. Finalmente, en el Capítulo 5 vimos la conexión de los RKHS y la Estadística a través de la aplicación de características y el espacio de características. De esta conexión surgió el kernel trick y los métodos kernels, métodos estadísticos que son ampliamente utilizados en la actualidad. También vimos cómo el celebrado Teorema del Representante 5.2.1 reducía los problemas de optimización en un RKHS a un problema de optimización en dimensión finita, lo que justifica aún más el uso de los núcleos gracias a su alta eficiencia computacional. Así, aplicamos los métodos kernels en problemas como los mínimos cuadrados en la Sección 5.3, la reducción
de la dimensionalidad en la Sección 5.5 y la clasificación desarrollando el algoritmo de Support Vector Machines en la Sección 5.6. Todo lo anterior muestra cómo una teoría bien fundamentada en el análisis funcional, con origen en 1909, lleva extendiendo sus aplicaciones a infinidad de ámbitos a lo largo de más de cien años. Para terminar este apartado nos gustaría mencionar algunas posibles aplicaciones y problemas abiertos relacionados con este trabajo, como por ejemplo: la aplicación de los RKHS a las redes neuronales, la generalización de la integral estocástica introducida en la Sección 4.2 a funciones no deterministas, un estudio más detallado del espacio de Cameron-Martin, etc. Finalmente, queremos hacer notar que los ejemplos de la Subsección 1.1.2 y Subsección 3.3.1, las secciones Sección 5.4 y Sección 4.2, y las pruebas de los resultados 1.3.4, 1.3.5, 2.2.1, 2.2.5, 2.4.1, 2.5.4, 3.2.5, 3.2.7, 3.3.8, 3.3.12, 5.3.1, no están tomados de ninguna de las referencias mencionadas en la bibliografía, siendo estos, en principio, originales de esta memoria. También hemos de mencionar que los códigos para la realización de las figuras Figura 4.1, Figura 5.1 y Figura 5.2, han sido realizados por el autor de esta memoria.
Bibliografía [1] Robert A. Adams and John J.F. Fournier. Sobolev Spaces. Pure and Applied Mathematics. Academic Press, 2nd edition, 2003. ISBN 9780120441433. [2] R. Alvarez-Nodarse. Introducción al Análisis Funcional. Facultad de Matemáticas US, 2025. URL https://renato.ryn-fismat.es/. [3] N. Aronszajn. Theory of reproducing kernels. Transactions of the American Mathematical Society, 68:337–404, 1950. [4] Krishna B. Athreya and Soumendra N. Lahiri. Measure Theory and Probability Theory. Springer, New York, 2006. ISBN 9780387329031. doi: 10.1007/978-0-387-32904-8. [5] Alain Berlinet and Christine Thomas-Agnan. Reproducing Kernel Hilbert Spaces in Probability and Statistics. Springer US, 2004. [6] Rabi Bhattacharya and Edward C. Waymire. Random Walk, Brownian Motion, and Martingales, volume 19 of Cambridge Series in Statistical and Probabilistic Mathematics. Springer, Cambridge, 2009. ISBN 9780521873865. [7] Patrick Billingsley. Probability and Measure. Wiley Series in Probability and Mathematical Statistics. John Wiley & Sons, 3rd edition, 1995. ISBN 9780471007104. [8] Vladimir I. Bogachev. Gaussian Measures, volume 62 of Mathematical Surveys and Monographs. American Mathematical Society, 1998. ISBN 978-0-82180866-9. [9] Corinna Cortes and Vladimir Vapnik. Support-vector networks. Machine Learning, 20(3):273–297, 1995. doi: 10.1007/BF00994018. [10] Giuseppe Da Prato and Jerzy Zabczyk. Stochastic Equations in Infinite Dimensions, volume 44 of Encyclopedia of Mathematics and its Applications. Cambridge University Press, Cambridge, 1992. ISBN 9780521446205. [11] Ivar Ekeland and Roger Temam. Convex Analysis and Variational Problems, volume 28 of Classics in Applied Mathematics. Society for Industrial and Applied Mathematics, Philadelphia, 1999. ISBN 978-0-89871-450-4. doi: 10.1137/1.9781611971088.
[12] Svante Janson. Gaussian Hilbert Spaces, volume 129 of Cambridge Tracts in Mathematics. Cambridge University Press, 1997. ISBN 978-0-521-59047-3. doi: 10.1017/CBO9780511526169. [13] George Kimeldorf and Grace Wahba. Some results on tchebycheffian spline functions. Journal of Mathematical Analysis and Applications, 33(1):82–95, 1971. doi: 10.1016/0022-247X(71)90155-2. [14] T. W. Körner. Fourier Analysis. Cambridge Mathematical Library. Cambridge University Press, 2022. [15] James Mercer. Functions of positive and negative type, and their connection with the theory of integral equations. Philosophical Transactions of the Royal Society of London. Series A, Containing Papers of a Mathematical or Physical Character, 209(441–458):415–446, 1909. doi: 10.1098/rsta.1909.0016. [16] Charles A Micchelli and Massimiliano Pontil. On learning vector-valued functions. Neural computation, 17(1):177–204, 2005. doi: 10.1162/ 0899766052530807. [17] John C. Oxtoby. Invariant measures in groups which are not locally compact. Transactions of the American Mathematical Society, 49(2):363–380, 1946. doi: 10.2307/1990121. [18] Vern I. Paulsen and Mrinal Raghupathi. An Introduction to the Theory of Reproducing Kernel Hilbert Spaces, volume 152 of Cambridge Studies in Advanced Mathematics. Cambridge University Press, 2016. [19] Carl Edward Rasmussen and Christopher K. I. Williams. Gaussian Processes for Machine Learning. MIT Press, 2006. [20] Frigyes Riesz and Béla Sz.-Nagy. Functional Analysis. Dover Publications, New York, 1st edition, 1990. Originally published in 1955 by Frederick Ungar Publishing Co. [21] Walter Rudin. Principles of Mathematical Analysis. McGraw-Hill, New York, 3rd edition, 1976. ISBN 9780070542358. [22] Saburou Saitoh. Theory of Reproducing Kernels and Applications. Longman Scientific & Technical, 1988. [23] Robert Schaback. Kernel-based meshless methods. Technical Report KBMM2007, Universität Göttingen, 2007. [24] Bernhard Schölkopf and Alexander J. Smola. Learning with Kernels: Support Vector Machines, Regularization, Optimization, and Beyond. MIT Press, 2002.
[25] Elias M. Stein and Rami Shakarchi. Real Analysis: Measure Theory, Integration, and Hilbert Spaces, volume 3 of Princeton Lectures in Analysis. Princeton University Press, Princeton, NJ, 2005. ISBN 9780691113869. [26] Ingo Steinwart and Andreas Christmann. Support Vector Machines. Springer, 2008. [27] Grace Wahba and Yuedong Wang. Representer theorems for learning theory. Neural Computation, 13(3):619–627, 2001. [28] Norbert Wiener. Differential-space. Journal of Mathematical Physics (MIT), 2:131–174, 1923. [29] Bernt Øksendal. Stochastic Differential Equations: An Introduction with Applications. Springer, 6 edition, 2003. ISBN 9783540047582.
