Articulo de referencia

Aprendizaje multitarea

El aprendizaje multitarea (MTL) es un subcampo del aprendizaje automático en el que se resuelven múltiples tareas de aprendizaje simultáneamente, aprovechando las similitudes y ...

El aprendizaje multitarea (MTL) es un subcampo del aprendizaje automático en el que se resuelven múltiples tareas de aprendizaje simultáneamente, aprovechando las similitudes y diferencias entre ellas. Esto puede resultar en una mayor eficiencia de aprendizaje y precisión de predicción para los modelos específicos de cada tarea, en comparación con el entrenamiento de los modelos por separado. [ 1 ] [ 2 ] [ 3 ] Intrínsecamente, el aprendizaje multitarea es un problema de optimización multiobjetivo con compensaciones entre diferentes tareas. [ 4 ] Las primeras versiones de MTL se denominaban "pistas". [ 5 ] [ 6 ]

En un artículo de 1997 ampliamente citado, Rich Caruana ofreció la siguiente caracterización:

El aprendizaje multitarea es un enfoque de transferencia inductiva que mejora la generalización al utilizar la información del dominio contenida en las señales de entrenamiento de tareas relacionadas como un sesgo inductivo . Esto se logra aprendiendo tareas en paralelo mientras se utiliza una representación compartida ; lo que se aprende para cada tarea puede ayudar a que otras tareas se aprendan mejor. [ 3 ]

En el contexto de la clasificación, el aprendizaje multitarea (MTL) busca mejorar el rendimiento de múltiples tareas de clasificación mediante su aprendizaje conjunto. Un ejemplo es un filtro de spam, que puede tratarse como tareas de clasificación distintas pero relacionadas entre diferentes usuarios. Para ilustrarlo mejor, consideremos que diferentes personas tienen distintas distribuciones de características que distinguen los correos electrónicos no deseados de los legítimos; por ejemplo, un hablante de inglés puede considerar que todos los correos electrónicos en ruso son spam, mientras que los hablantes de ruso no. Sin embargo, existe una característica común en esta tarea de clasificación entre los usuarios; por ejemplo, un texto relacionado con transferencias de dinero podría ser la presencia de textos comunes. Resolver el problema de clasificación de spam de cada usuario de forma conjunta mediante MTL permite que las soluciones se retroalimenten y mejoren el rendimiento. Otros ejemplos de configuraciones para MTL incluyen la clasificación multiclase y la clasificación multietiqueta . [ 7 ]

El aprendizaje multitarea funciona porque la regularización inducida al exigir que un algoritmo tenga un buen desempeño en una tarea relacionada puede ser superior a la regularización que previene el sobreajuste penalizando uniformemente toda la complejidad. Una situación en la que el aprendizaje multitarea puede ser particularmente útil es cuando las tareas comparten similitudes significativas y, en general, están ligeramente submuestreadas. [ 8 ] Sin embargo, como se analiza más adelante, también se ha demostrado que el aprendizaje multitarea es beneficioso para aprender tareas no relacionadas. [ 8 ] [ 9 ]

Métodos

El principal desafío en el aprendizaje multitarea radica en cómo combinar las señales de aprendizaje de múltiples tareas en un único modelo. Esto puede depender en gran medida de la concordancia o contradicción entre las diferentes tareas. Existen diversas maneras de abordar este desafío:

Agrupación de tareas y superposición

Dentro del paradigma MTL, la información puede compartirse entre algunas o todas las tareas. Dependiendo de la estructura de la relación entre tareas, se puede compartir información selectivamente entre ellas. Por ejemplo, las tareas pueden agruparse o existir en una jerarquía, o estar relacionadas según alguna métrica general. Supongamos, como se desarrolla más formalmente a continuación, que el vector de parámetros que modela cada tarea es una combinación lineal de alguna base subyacente. La similitud en términos de esta base puede indicar la relación entre las tareas. Por ejemplo, con escasez , la superposición de coeficientes distintos de cero entre tareas indica similitud. Una agrupación de tareas corresponde entonces a aquellas tareas que se encuentran en un subespacio generado por algún subconjunto de elementos de la base, donde las tareas en diferentes grupos pueden ser disjuntas o superponerse arbitrariamente en términos de sus bases. [ 10 ] La relación entre tareas puede imponerse a priori o aprenderse a partir de los datos. [ 7 ] [ 11 ] La relación jerárquica entre tareas también puede explotarse implícitamente sin asumir conocimiento a priori ni aprender relaciones explícitamente. [ 8 ] [ 12 ] Por ejemplo, el aprendizaje explícito de la relevancia de las muestras en diferentes tareas puede realizarse para garantizar la efectividad del aprendizaje conjunto en múltiples dominios. [ 8 ]

Aprovechamiento de tareas no relacionadas: Aprendizaje auxiliar

En el aprendizaje auxiliar , se intenta aprender un grupo de tareas principales utilizando un grupo de tareas auxiliares, no relacionadas con las principales. Con las tareas no relacionadas adecuadas, se ha demostrado que el aprendizaje conjunto de tareas no relacionadas que utilizan los mismos datos de entrada es beneficioso y proporciona una mejora significativa con respecto al MTL estándar. [ 9 ] La razón es que el conocimiento previo sobre la relación de las tareas puede conducir a representaciones más dispersas y más informativas para cada grupo de tareas, esencialmente al filtrar las idiosincrasias de la distribución de datos. Se ha propuesto construir sobre una metodología multitarea previa favoreciendo una representación compartida de baja dimensión dentro de cada grupo de tareas, e imponiendo una penalización a las tareas de diferentes grupos que fomenta que las dos representaciones sean ortogonales .

El aprendizaje con tareas auxiliares no relacionadas plantea dos desafíos principales: encontrar tareas auxiliares útiles y combinar las pérdidas de todas las tareas de manera útil. Algunos métodos pueden aprenderlas a partir de los datos junto con el proceso de entrenamiento, [ 13 ] y combinar las tareas de manera eficiente. [ 14 ]

Transferencia de conocimientos

Relacionado con el aprendizaje multitarea se encuentra el concepto de transferencia de conocimiento. Mientras que el aprendizaje multitarea tradicional implica que se desarrolla una representación compartida simultáneamente entre tareas, la transferencia de conocimiento implica una representación compartida secuencialmente. Proyectos de aprendizaje automático a gran escala, como la red neuronal convolucional profunda GoogLeNet [ 15 ] , un clasificador de objetos basado en imágenes, pueden desarrollar representaciones robustas que pueden ser útiles para algoritmos posteriores que aprenden tareas relacionadas. Por ejemplo, el modelo preentrenado puede usarse como extractor de características para realizar el preprocesamiento para otro algoritmo de aprendizaje. O bien, el modelo preentrenado puede usarse para inicializar un modelo con una arquitectura similar que luego se ajusta para aprender una tarea de clasificación diferente [ 16 ] .

Múltiples tareas no estacionarias

Tradicionalmente, el aprendizaje multitarea y la transferencia de conocimiento se aplican a entornos de aprendizaje estáticos. Su extensión a entornos no estáticos se denomina aprendizaje adaptativo grupal en línea (GOAL). [ 17 ] Compartir información puede ser particularmente útil si los estudiantes operan en entornos en constante cambio, ya que un estudiante puede beneficiarse de la experiencia previa de otro para adaptarse rápidamente a su nuevo entorno. Este aprendizaje adaptativo grupal tiene numerosas aplicaciones, desde la predicción de series temporales financieras , pasando por sistemas de recomendación de contenido, hasta la comprensión visual para agentes autónomos adaptativos.

Optimización multitarea

La optimización multitarea se centra en resolver y optimizar todo el proceso. [ 18 ] [ 19 ] El paradigma se ha inspirado en los conceptos bien establecidos de aprendizaje por transferencia [ 20 ] y aprendizaje multitarea en análisis predictivo . [ 21 ]

La motivación clave detrás de la optimización multitarea es que si las tareas de optimización están relacionadas entre sí en términos de sus soluciones óptimas o las características generales de sus paisajes funcionales, [ 22 ] el progreso de la búsqueda se puede transferir para acelerar sustancialmente la búsqueda en la otra.

El éxito del paradigma no se limita necesariamente a la transferencia unidireccional de conocimientos de tareas más simples a tareas más complejas. En la práctica, se intenta resolver intencionadamente una tarea más difícil que, de forma no intencionada, puede resolver varios problemas menores. [ 23 ]

Existe una relación directa entre la optimización multitarea y la optimización multiobjetivo . [ 24 ]

En algunos casos, el entrenamiento simultáneo de tareas aparentemente relacionadas puede perjudicar el rendimiento en comparación con los modelos de una sola tarea. [ 25 ] Comúnmente, los modelos MTL emplean módulos específicos de tarea sobre una representación de características conjunta obtenida mediante un módulo compartido. Dado que esta representación conjunta debe capturar características útiles en todas las tareas, MTL puede perjudicar el rendimiento de tareas individuales si las diferentes tareas buscan una representación conflictiva, es decir, los gradientes de diferentes tareas apuntan en direcciones opuestas o difieren significativamente en magnitud. Este fenómeno se conoce comúnmente como transferencia negativa. Para mitigar este problema, se han propuesto varios métodos de optimización de MTL. Se ha informado que la transferencia de metaconocimiento podría ayudar a evitar la transferencia negativa [ 26 ] . Además, los gradientes por tarea se combinan en una dirección de actualización conjunta a través de varios algoritmos de agregación o heurísticas.

Existen varios enfoques comunes para la optimización de tareas múltiples: optimización bayesiana , computación evolutiva y enfoques basados ​​en la teoría de juegos . [ 18 ]

Optimización bayesiana multitarea

La optimización bayesiana multitarea es un enfoque moderno basado en modelos que aprovecha el concepto de transferencia de conocimiento para acelerar el proceso de optimización automática de hiperparámetros de los algoritmos de aprendizaje automático. [ 27 ] El método construye un modelo de proceso gaussiano multitarea sobre los datos provenientes de diferentes búsquedas que progresan en paralelo. [ 28 ] Las dependencias entre tareas capturadas se utilizan posteriormente para informar mejor el muestreo subsiguiente de soluciones candidatas en los espacios de búsqueda respectivos.

Multitarea evolutiva

La multitarea evolutiva se ha explorado como un medio para explotar el paralelismo implícito de los algoritmos de búsqueda basados ​​en poblaciones para avanzar simultáneamente en múltiples tareas de optimización distintas. Al mapear todas las tareas a un espacio de búsqueda unificado, la población evolutiva de soluciones candidatas puede aprovechar las relaciones ocultas entre ellas a través de la transferencia genética continua. Esto se induce cuando las soluciones asociadas con diferentes tareas se cruzan. [ 19 ] [ 29 ] Recientemente, se han explorado modos de transferencia de conocimiento que son diferentes del cruce directo de soluciones . [ 30 ] [ 31 ]

Optimización basada en la teoría de juegos

Los enfoques de la teoría de juegos para la optimización multitarea proponen ver el problema de optimización como un juego, donde cada tarea es un jugador. Todos los jugadores compiten a través de la matriz de recompensas del juego, y tratan de alcanzar una solución que satisfaga a todos los jugadores (todas las tareas). Esta visión proporciona información sobre cómo construir algoritmos eficientes basados ​​en la optimización por descenso de gradiente (GD), que es particularmente importante para el entrenamiento de redes neuronales profundas . [ 32 ] En GD para MTL, el problema es que cada tarea proporciona su propia pérdida, y no está claro cómo combinar todas las pérdidas y crear un único gradiente unificado, lo que lleva a varias estrategias de agregación diferentes. [ 33 ] [ 34 ] [ 35 ] Este problema de agregación se puede resolver definiendo una matriz de juego donde la recompensa de cada jugador es la concordancia de su propio gradiente con el gradiente común, y luego estableciendo el gradiente común como la negociación cooperativa de Nash [ 36 ] de ese sistema.

Aplicaciones

Los algoritmos para la optimización multitarea abarcan una amplia gama de aplicaciones del mundo real. Estudios recientes destacan el potencial de aceleración en la optimización de parámetros de diseño de ingeniería mediante la realización conjunta de diseños relacionados de manera multitarea. [ 29 ] En el aprendizaje automático , la transferencia de características optimizadas entre conjuntos de datos relacionados puede mejorar la eficiencia del proceso de entrenamiento, así como la capacidad de generalización de los modelos aprendidos. [ 37 ] [ 38 ] Además, el concepto de multitarea ha llevado a avances en la optimización automática de hiperparámetros de modelos de aprendizaje automático y aprendizaje de conjuntos . [ 39 ] [ 40 ]

También se han reportado aplicaciones en computación en la nube, [ 41 ] con desarrollos futuros orientados a servicios de optimización bajo demanda basados ​​en la nube que pueden atender a múltiples clientes simultáneamente. [ 19 ] [ 42 ] Trabajos recientes han mostrado además aplicaciones en química. [ 43 ] Además, algunos trabajos recientes han aplicado algoritmos de optimización multitarea en la fabricación industrial. [ 44 ] [ 45 ]

Matemáticas

Espacio de Hilbert reproductor de funciones con valores vectoriales (RKHSvv)

El problema MTL puede plantearse en el contexto de RKHSvv (un espacio de producto interno completo de funciones con valores vectoriales equipado con un núcleo reproductor ). En particular, recientemente se ha prestado especial atención a los casos en los que la estructura de la tarea puede identificarse mediante un núcleo separable, descrito a continuación. La presentación aquí se basa en Ciliberto et al., 2015. [ 7 ]

conceptos RKHSvv

Supongamos que el conjunto de datos de entrenamiento esSt={(incógnitait,yit)}i=1nortet{\displaystyle {\mathcal {S}}_{t}=\{(x_{i}^{t},y_{i}^{t})\}_{i=1}^{n_{t}}}, conincógnitaitincógnita{\displaystyle x_{i}^{t}\in {\mathcal {X}}},yitY{\displaystyle y_{i}^{t}\in {\mathcal {Y}}}, donde t indexa la tarea yt1,...,T{\displaystyle t\in 1,...,T}. Dejarnorte=t=1Tnortet{\displaystyle n=\sum _{t=1}^{T}n_{t}}En este entorno, existe un espacio de entrada y salida consistente y la misma función de pérdida .L:R×RR+{\displaystyle {\mathcal {L}}:\mathbb {R} \times \mathbb {R} \rightarrow \mathbb {R} _{+}}Para cada tarea: . Esto da como resultado el problema de aprendizaje automático regularizado:

dóndeH{\displaystyle {\mathcal {H}}}es un espacio de Hilbert con núcleo reproductor de valores vectoriales con funcionesF:incógnitaYT{\displaystyle f:{\mathcal {X}}\rightarrow {\mathcal {Y}}^{T}}que tienen componentesFt:incógnitaY{\displaystyle f_{t}:{\mathcal {X}}\rightarrow {\mathcal {Y}}}.

El núcleo reproductor para el espacioH{\displaystyle {\mathcal {H}}}de funciones F:incógnitaRT{\displaystyle f:{\mathcal {X}}\rightarrow \mathbb {R} ^{T}}es una función matricial simétricaΓ:incógnita×incógnitaRT×T{\displaystyle \Gamma :{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} ^{T\times T}} , tal queΓ(,incógnita)doH{\displaystyle \Gamma (\cdot ,x)c\in {\mathcal {H}}}y se cumple la siguiente propiedad de reproducción:

El núcleo reproductor da lugar a un teorema de representación que muestra que cualquier solución a la ecuación 1 tiene la forma:

Núcleos separables

La forma del núcleo Γ induce tanto la representación del espacio de características como la estructura de la salida en todas las tareas. Una simplificación natural es elegir un núcleo separable, que se factoriza en núcleos separados en el espacio de entrada X y en las tareas.{1,...,T}{\displaystyle \{1,...,T\}}En este caso, el núcleo relaciona los componentes escalares.Ft{\displaystyle f_{t}}yFs{\displaystyle f_{s}}es dado porγ((incógnitai,t),(incógnitaj,s))=k(incógnitai,incógnitaj)kT(s,t)=k(incógnitai,incógnitaj)As,t{\textstyle \gamma ((x_{i},t),(x_{j},s))=k(x_{i},x_{j})k_{T}(s,t)=k(x_{i},x_{j})A_{s,t}}Para funciones con valores vectoriales FH{\displaystyle f\in {\mathcal {H}}} podemos escribirΓ(incógnitai,incógnitaj)=k(incógnitai,incógnitaj)A{\displaystyle \Gamma (x_{i},x_{j})=k(x_{i},x_{j})A}, donde k es un núcleo reproductor escalar y A es una semidefinida positiva simétricaT×T{\displaystyle T\times T}matriz. De ahora en adelante denotaremosS+T={Matrices PSD}RT×T{\displaystyle S_{+}^{T}=\{{\text{matrices PSD}}\}\subset \mathbb {R} ^{T\times T}}.

Esta propiedad de factorización, la separabilidad, implica que la representación del espacio de características de entrada no varía según la tarea. Es decir, no hay interacción entre el núcleo de entrada y el núcleo de la tarea. La estructura en las tareas está representada únicamente por A. Los métodos para núcleos no separables Γ constituyen un campo de investigación actual.

Para el caso separable, el teorema de representación se reduce aF(incógnita)=i=1nortek(incógnita,incógnitai)Adoi{\textstyle f(x)=\sum _{i=1}^{N}k(x,x_{i})Ac_{i}}. La salida del modelo en los datos de entrenamiento es entonces KCA , donde K es elnorte×norte{\displaystyle n\times n}matriz de núcleo empírica con entradasKi,j=k(incógnitai,incógnitaj){\textstyle K_{i,j}=k(x_{i},x_{j})}y C es elnorte×T{\displaystyle n\times T}matriz de filasdoi{\displaystyle c_{i}}.

Con el núcleo separable, la ecuación 1 se puede reescribir como

donde V es un promedio (ponderado) de L aplicado entrada por entrada a Y y KCA . (El peso es cero siYit{\displaystyle Y_{i}^{t}}es una observación faltante).

Nótese que el segundo término de P se puede derivar de la siguiente manera:

FH2=i=1nortek(,incógnitai)Adoi,j=1nortek(,incógnitaj)AdojH=i,j=1nortek(,incógnitai)Adoi,k(,incógnitaj)AdojH(bilinealidad)=i,j=1nortek(incógnitai,incógnitaj)Adoi,dojRT(propiedad reproductora)=i,j=1nortek(incógnitai,incógnitaj)doiAdoj=tr(KdoAdo){\displaystyle {\begin{aligned}\|f\|_{\mathcal {H}}^{2}&=\left\langle \sum _{i=1}^{n}k(\cdot ,x_{i})Ac_{i},\sum _{j=1}^{n}k(\cdot ,x_{j})Ac_{j}\right\rangle _{\mathcal {H}}\\&=\sum _{i,j=1}^{n}\langle k(\cdot ,x_{i})Ac_{i},k(\cdot ,x_{j})Ac_{j}\rangle _{\mathcal {H}}&{\text{(bilinearity)}}\\&=\sum _{i,j=1}^{n}\langle k(x_{i},x_{j})Ac_{i},c_{j}\rangle _{\mathbb {R} ^{T}}&{\text{(reproducing property)}}\\&=\sum _{i,j=1}^{n}k(x_{i},x_{j})c_{i}^{\top }Ac_{j}=tr(KCAC^{\top })\end{aligned}}}

Estructura de tarea conocida

Representaciones de la estructura de tareas

Existen tres formas prácticamente equivalentes de representar la estructura de una tarea: mediante un regularizador, mediante una métrica de salida y mediante una asignación de salida.

Regularizador Con el núcleo separable, se puede demostrar (a continuación) que||F||H2=s,t=1TAt,sFs,FtHk{\textstyle ||f||_{\mathcal {H}}^{2}=\sum _{s,t=1}^{T}A_{t,s}^{\dagger }\langle f_{s},f_{t}\rangle _{{\mathcal {H}}_{k}}}, dóndeAt,s{\displaystyle A_{t,s}^{\dagger }}es el t,s{\displaystyle t,s}elemento de la pseudoinversa deA{\displaystyle A}, yHk{\displaystyle {\mathcal {H}}_{k}}es el RKHS basado en el núcleo escalark{\displaystyle k}, yFt(incógnita)=i=1nortek(incógnita,incógnitai)Atdoi{\textstyle f_{t}(x)=\sum _{i=1}^{n}k(x,x_{i})A_{t}^{\top }c_{i}}Esta formulación muestra queAt,s{\displaystyle A_{t,s}^{\dagger }}controla el peso de la penalización asociada conFs,FtHk{\textstyle \langle f_{s},f_{t}\rangle _{{\mathcal {H}}_{k}}}. (Tenga en cuenta queFs,FtHk{\textstyle \langle f_{s},f_{t}\rangle _{{\mathcal {H}}_{k}}}surge de||Ft||Hk=Ft,FtHk{\textstyle ||f_{t}||_{{\mathcal {H}}_{k}}=\langle f_{t},f_{t}\rangle _{{\mathcal {H}}_{k}}}.)

Prueba

FH2=i=1norteγ((incógnitai,ti),)doiti,j=1norteγ((incógnitaj,tj),)dojtjH=i,j=1nortedoitidojtjγ((incógnitai,ti),(incógnitaj,tj))=i,j=1nortes,t=1Tdoitdojsk(incógnitai,incógnitaj)As,t=i,j=1nortek(incógnitai,incógnitaj)doi,AdojRT=i,j=1nortek(incógnitai,incógnitaj)doi,AAAdojRT=i,j=1nortek(incógnitai,incógnitaj)Adoi,AAdojRT=i,j=1nortes,t=1T(Adoi)t(Adoj)sk(incógnitai,incógnitaj)As,t=s,t=1TAs,ti=1nortek(incógnitai,)(Adoi)t,j=1nortek(incógnitaj,)(Adoj)sHk=s,t=1TAs,tFt,FsHk{\displaystyle {\begin{aligned}\|f\|_{\mathcal {H}}^{2}&=\left\langle \sum _{i=1}^{n}\gamma ((x_{i},t_{i}),\cdot )c_{i}^{t_{i}},\sum _{j=1}^{n}\gamma ((x_{j},t_{j}),\cdot )c_{j}^{t_{j}}\right\rangle _{\mathcal {H}}\\&=\sum _{i,j=1}^{n}c_{i}^{t_{i}}c_{j}^{t_{j}}\gamma ((x_{i},t_{i}),(x_{j},t_{j}))\\&=\sum _{i,j=1}^{n}\sum _{s,t=1}^{T}c_{i}^{t}c_{j}^{s}k(x_{i},x_{j})A_{s,t}\\&=\sum _{i,j=1}^{n}k(x_{i},x_{j})\langle c_{i},Ac_{j}\rangle _{\mathbb {R} ^{T}}\\&=\sum _{i,j=1}^{n}k(x_{i},x_{j})\langle c_{i},AA^{\dagger }Ac_{j}\rangle _{\mathbb {R} ^{T}}\\&=\sum _{i,j=1}^{n}k(x_{i},x_{j})\langle Ac_{i},A^{\dagger }Ac_{j}\rangle _{\mathbb {R} ^{T}}\\&=\sum _{i,j=1}^{n}\sum _{s,t=1}^{T}(Ac_{i})^{t}(Ac_{j})^{s}k(x_{i},x_{j})A_{s,t}^{\dagger }\\&=\sum _{s,t=1}^{T}A_{s,t}^{\dagger }\langle \sum _{i=1}^{n}k(x_{i},\cdot )(Ac_{i})^{t},\sum _{j=1}^{n}k(x_{j},\cdot )(Ac_{j})^{s}\rangle _{{\mathcal {H}}_{k}}\\&=\sum _{s,t=1}^{T}A_{s,t}^{\dagger }\langle f_{t},f_{s}\rangle _{{\mathcal {H}}_{k}}\end{aligned}}}

Métrica de salida : una métrica de salida alternativa enYT{\displaystyle {\mathcal {Y}}^{T}}puede ser inducido por el producto internoy1,y2Θ=y1,Θy2RT{\displaystyle \langle y_{1},y_{2}\rangle _{\Theta }=\langle y_{1},\Theta y_{2}\rangle _{\mathbb {R} ^{T}}}. Con la pérdida cuadrática existe una equivalencia entre los núcleos separablesk(,)IT{\displaystyle k(\cdot ,\cdot )I_{T}}bajo la métrica alternativa, yk(,)Θ{\displaystyle k(\cdot ,\cdot )\Theta }, bajo la métrica canónica.

Mapeo de salida : las salidas se pueden mapear como L:YTY~{\displaystyle L:{\mathcal {Y}}^{T}\rightarrow {\mathcal {\tilde {Y}}}} a un espacio de mayor dimensión para codificar estructuras complejas como árboles, grafos y cadenas. Para mapas lineales L , con una elección apropiada del núcleo separable, se puede demostrar que A=LL{\displaystyle A=L^{\top }L}.

Ejemplos de estructura de tareas

Mediante la formulación del regularizador, se pueden representar fácilmente diversas estructuras de tareas.

  • AlquilerA=γIT+(γλ)1T11{\textstyle A^{\dagger }=\gamma I_{T}+(\gamma -\lambda ){\frac {1}{T}}\mathbf {1} \mathbf {1} ^{\top }}(dóndeIT{\displaystyle I_{T}}es la matriz identidad T x T , y11{\textstyle \mathbf {1} \mathbf {1} ^{\top }}es la matriz T x T de unos) es equivalente a dejar que Γ controle la varianzat||FtF¯||Hk{\textstyle \sum _{t}||f_{t}-{\bar {f}}||_{{\mathcal {H}}_{k}}} de tareas de su media1TtFt{\textstyle {\frac {1}{T}}\sum _{t}f_{t}}Por ejemplo, se pueden tomar niveles sanguíneos de algún biomarcador en pacientes con T ennortet{\displaystyle n_{t}}puntos temporales durante el transcurso de un día y el interés puede radicar en regularizar la varianza de las predicciones entre pacientes.
  • AlquilerA=αIT+(αλ)METRO{\displaystyle A^{\dagger }=\alpha I_{T}+(\alpha -\lambda )M}, dóndeMETROt,s=1|GRAMOr|I(t,sGRAMOr){\displaystyle M_{t,s}={\frac {1}{|G_{r}|}}\mathbb {I} (t,s\in G_{r})}es equivalente a dejarα{\displaystyle \alpha }controlar la varianza medida con respecto a la media de un grupo:rtGRAMOr||Ft1|GRAMOr|sGRAMOr)Fs||{\displaystyle \sum _{r}\sum _{t\in G_{r}}||f_{t}-{\frac {1}{|G_{r}|}}\sum _{s\in G_{r})}f_{s}||}. (Aquí|GRAMOr|{\displaystyle |G_{r}|}la cardinalidad del grupo r, yI{\displaystyle \mathbb {I} }es la función indicadora). Por ejemplo, las personas de diferentes partidos políticos (grupos) podrían regularizarse conjuntamente con respecto a la predicción del índice de popularidad de un político. Nótese que esta penalización se reduce a la primera cuando todas las tareas pertenecen al mismo grupo.
  • AlquilerA=δIT+(δλ)L{\displaystyle A^{\dagger }=\delta I_{T}+(\delta -\lambda )L}, dóndeL=DMETRO{\displaystyle L=D-M}es el laplaciano para el grafo con matriz de adyacencia M que da similitudes por pares de tareas. Esto es equivalente a dar una penalización mayor a la distancia que separa las tareas t y s cuando son más similares (según el pesoMETROt,s{\displaystyle M_{t,s}},) es decirδ{\displaystyle \delta }regularizat,s||FtFs||Hk2METROt,s{\displaystyle \sum _{t,s}||f_{t}-f_{s}||_{{\mathcal {H}}_{k}}^{2}M_{t,s}}.
  • Todas las opciones anteriores de A también inducen el término de regularización adicional. λt||F||Hk2{\textstyle \lambda \sum _{t}||f||_{{\mathcal {H}}_{k}}^{2}}lo cual penaliza la complejidad en f de forma más amplia.

Tareas de aprendizaje junto con su estructura

El problema de aprendizaje P puede generalizarse para admitir la matriz de tareas de aprendizaje A de la siguiente manera:

Elección deF:S+TR+{\displaystyle F:S_{+}^{T}\rightarrow \mathbb {R} _{+}}Debe diseñarse para aprender matrices A de un tipo determinado. Véase "Casos especiales" más abajo.

Optimización de Q

Limitándose al caso de pérdidas convexas y penalizaciones coercitivas , Ciliberto et al. han demostrado que, si bien Q no es convexa conjuntamente en C y A, un problema relacionado sí lo es.

Específicamente en el conjunto convexodo={(do,A)Rnorte×T×S+T|Ranortegramomi(doKdo)Ranortegramomi(A)}{\displaystyle {\mathcal {C}}=\{(C,A)\in \mathbb {R} ^{n\times T}\times S_{+}^{T}|Range(C^{\top }KC)\subseteq Range(A)\}}, el problema equivalente

es convexa con el mismo valor mínimo. Y si(doR,AR){\displaystyle (C_{R},A_{R})}es un minimizador para R entonces(doRAR,AR){\displaystyle (C_{R}A_{R}^{\dagger },A_{R})}es un minimizador para Q.

R puede resolverse mediante un método de barrera en un conjunto cerrado introduciendo la siguiente perturbación:

La perturbación a través de la barreraδ2tr(A){\displaystyle \delta ^{2}tr(A^{\dagger })}obliga a que las funciones objetivo sean iguales a+{\displaystyle +\infty }en el límite deRnorte×T×S+T{\displaystyle R^{n\times T}\times S_{+}^{T}}.

S se puede resolver con un método de descenso de coordenadas por bloques, alternando en C y A. Esto da como resultado una secuencia de minimizadores.(dometro,Ametro){\displaystyle (C_{m},A_{m})}en S que converge a la solución en R comoδmetro0{\displaystyle \delta _{m}\rightarrow 0}y por lo tanto da la solución a Q.

Casos especiales

Penalizaciones espectrales - Dinnuzo et al [ 46 ] sugirieron establecer F como la norma de Frobeniustr(AA){\displaystyle {\sqrt {tr(A^{\top }A)}}}. Optimizaron Q directamente usando descenso de coordenadas por bloques, sin tener en cuenta las dificultades en el límite deRnorte×T×S+T{\displaystyle \mathbb {R} ^{n\times T}\times S_{+}^{T}}.

Aprendizaje de tareas agrupadas : Jacob et al. [ 47 ] sugirieron aprender A en el entorno donde T tareas están organizadas en R grupos disjuntos. En este caso, seami{0,1}T×R{\displaystyle E\in \{0,1\}^{T\times R}}ser la matriz conmit,r=I(tarea tgrupo r){\displaystyle E_{t,r}=\mathbb {I} ({\text{task }}t\in {\text{group }}r)}. ConfiguraciónMETRO=ImimiT{\displaystyle M=I-E^{\dagger }E^{T}}, y U=1T11{\displaystyle U={\frac {1}{T}}\mathbf {11} ^{\top }}, la matriz de tareasA{\displaystyle A^{\dagger }} puede parametrizarse como una función deMETRO{\displaystyle M}:A(METRO)=ϵMETROU+ϵB(METROU)+ϵ(IMETRO){\displaystyle A^{\dagger }(M)=\epsilon _{M}U+\epsilon _{B}(M-U)+\epsilon (I-M)}, con términos que penalizan la varianza promedio, entre clústeres y dentro de los clústeres, respectivamente, de las predicciones de la tarea. M no es convexa, pero hay una relajación convexa.Sdo={METROS+T:IMETROS+Ttr(METRO)=r}{\displaystyle {\mathcal {S}}_{c}=\{M\in S_{+}^{T}:I-M\in S_{+}^{T}\land tr(M)=r\}}. En esta formulación, F(A)=I(A(METRO){A:METROSdo}){\displaystyle F(A)=\mathbb {I} (A(M)\in \{A:M\in {\mathcal {S}}_{C}\})}.

Generalizaciones

Penalizaciones no convexas : Se pueden construir penalizaciones de tal manera que A esté restringido a ser un laplaciano de grafos, o que A tenga una factorización de rango bajo. Sin embargo, estas penalizaciones no son convexas, y el análisis del método de barrera propuesto por Ciliberto et al. no se aplica en estos casos.

Núcleos no separables : Los núcleos separables tienen limitaciones, en particular, no consideran conjuntamente las estructuras en el espacio de interacción entre los dominios de entrada y salida. Es necesario seguir investigando para desarrollar modelos que permitan el uso de estos núcleos.

Paquete de software

Un paquete de Matlab llamado Multi-Task Learning via StructurAl Regularization (MALSAR) [ 48 ] implementa los siguientes algoritmos de aprendizaje multitarea: Aprendizaje multitarea regularizado por media, [ 49 ] [ 50 ] Aprendizaje multitarea con selección conjunta de características, [ 51 ] Aprendizaje robusto de características multitarea, [ 52 ] Aprendizaje multitarea regularizado por norma de traza, [ 53 ] Optimización estructural alternada, [ 54 ] [ 55 ] Aprendizaje incoherente de bajo rango y disperso, [ 56 ] Aprendizaje multitarea robusto de bajo rango, Aprendizaje multitarea agrupado, [ 57 ] [ 58 ] Aprendizaje multitarea con estructuras de grafos.

Literatura

  • Predicción multiobjetivo: una visión unificadora de los problemas y los métodos Willem Waegeman, Krzysztof Dembczynski, Eyke Huellermeier https://arxiv.org/abs/1809.02352v1

Véase también

Referencias

  1. Baxter, J. (2000). Un modelo de aprendizaje de sesgo inductivo. Journal of Artificial Intelligence Research 12:149-198, Artículo en línea.
  2. Thrun, S. (1996). ¿Es más fácil aprender la enésima cosa que aprender la primera? En Advances in Neural Information Processing Systems 8, pp. 640-646. MIT Press. Artículo en Citeseer
  3. 1 2 Caruana, R. (1997). "Aprendizaje multitarea" (PDF) . Machine Learning . 28 : 41–75 . doi : 10.1023/A:1007379606734 .
  4. Aprendizaje multitarea como optimización multiobjetivo. Parte de Advances in Neural Information Processing Systems 31 (NeurIPS 2018), https://proceedings.neurips.cc/paper/2018/hash/432aca3a1e345e339f35a30c8f65edce-Abstract.html
  5. Suddarth, S., Kergosien, Y. (1990). Sugerencias de inyección de reglas como medio para mejorar el rendimiento y el tiempo de aprendizaje de la red neuronal. Taller EURASIP. Redes neuronales, págs. 120-129. Notas de clase en informática. Springer.
  6. Abu-Mostafa, YS (1990). "Aprendizaje a partir de indicios en redes neuronales" . Journal of Complexity . 6 (2): 192– 198. doi : 10.1016/0885-064x(90)90006-y .
  7. 1 2 3 Ciliberto, C. (2015). "Aprendizaje convexo de tareas múltiples y su estructura". arXiv : 1504.03101 [ cs.LG ].
  8. 1 2 3 4 Hajiramezanali, E. & Dadaneh, SZ & Karbalayghareh, A. & Zhou, Z. & Qian, X. Aprendizaje bayesiano multidominio para el descubrimiento de subtipos de cáncer a partir de datos de recuento de secuenciación de próxima generación. 32.ª Conferencia sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2018), Montreal, Canadá. arXiv : 1810.09433
  9. 1 2 Romera-Paredes, B., Argyriou, A., Bianchi-Berthouze, N., & Pontil, M., (2012) Explotación de tareas no relacionadas en el aprendizaje multitarea. http://jmlr.csail.mit.edu/proceedings/papers/v22/romera12/romera12.pdf
  10. Kumar, A., & Daume III, H., (2012) Aprendizaje de agrupamiento y superposición de tareas en el aprendizaje multitarea. http://icml.cc/2012/papers/690.pdf
  11. Jawanpuria, P., & Saketha Nath, J., (2012) Una formulación de aprendizaje de características convexas para el descubrimiento de la estructura latente de tareas. http://icml.cc/2012/papers/90.pdf
  12. Zweig, A. y Weinshall, D. Cascada de regularización jerárquica para el aprendizaje conjunto. Actas de la 30.ª Conferencia Internacional sobre Aprendizaje Automático, Atlanta, GA, junio de 2013. http://www.cs.huji.ac.il/~daphna/papers/Zweig_ICML2013.pdf
  13. Navon, Aviv; Achituve, Idan; Maron, Haggai; Chechik, Gal; Fetaya, Ethan (2020-10-02). "Aprendizaje auxiliar mediante diferenciación implícita" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 2007.02693 .
  14. Shamsian, Aviv; Navon, Aviv; Glazer, Neta; Kawaguchi, Kenji; Chechik, Gal; Fetaya, Ethan (2023-06-15). "Aprendizaje auxiliar como un juego de negociación asimétrico" . Conferencia Internacional sobre Aprendizaje Automático (ICML) . arXiv : 2301.13501 .
  15. Szegedy, Christian; Wei Liu, Youssef; Yangqing Jia, Tomaso; Sermanet, Pierre; Reed, Scott; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (2015). "Going deeper with convolutions". 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . pp. 1–9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0. S2CID 206592484 . 
  16. Roig, Gemma. "Deep Learning Overview" (PDF) . Archivado del original (PDF) el 6 de marzo de 2016. Consultado el 26 de agosto de 2019 .
  17. Zweig, A. y Chechik, G. Aprendizaje adaptativo en línea en grupo. Machine Learning, DOI 10.1007/s10994-017-5661-5, agosto de 2017. http://rdcu.be/uFSv
  18. 1 2 Gupta, Abhishek; Ong, Yew-Soon; Feng, Liang (2018). "Insights on Transfer Optimization: Because Experience is the Best Teacher". IEEE Transactions on Emerging Topics in Computational Intelligence . 2 (1): 51– 64. Bibcode : 2018ITECI...2...51G . doi : 10.1109/TETCI.2017.2769104 . hdl : 10356/147980 . S2CID 11510470 . 
  19. 1 2 3 Gupta, Abhishek; Ong, Yew-Soon; Feng, Liang (2016). "Evolución multifactorial: hacia la multitarea evolutiva". IEEE Transactions on Evolutionary Computation . 20 (3): 343– 357. Bibcode : 2016ITEC...20..343G . doi : 10.1109/TEVC.2015.2458037 . hdl : 10356/148174 . S2CID 13767012 . 
  20. Pan, Sinno Jialin; Yang, Qiang (2010). "Una revisión sobre el aprendizaje por transferencia". IEEE Transactions on Knowledge and Data Engineering . 22 (10): 1345– 1359. Bibcode : 2010ITKDE..22.1345P . doi : 10.1109/TKDE.2009.191 . S2CID 740063 . 
  21. Caruana, R., "Aprendizaje multitarea", págs. 95-134 en Sebastian Thrun, Lorien Pratt (eds.) Aprender a aprender , (1998) Springer ISBN 9780792380474
  22. Cheng, Mei-Ying; Gupta, Abhishek; Ong, Yew-Soon; Ni, Zhi-Wei (2017). "Multitarea coevolutiva para la optimización global concurrente: con estudios de caso en diseño de ingeniería complejo" . Aplicaciones de ingeniería de la inteligencia artificial . 64 : 13–24 . doi : 10.1016/j.engappai.2017.05.008 . S2CID 13767210 . 
  23. Cabi, Serkan; Sergio Gómez Colmenarejo; Hoffman, Matthew W.; Denil, Misha; Wang, Ziyu; Nando de Freitas (2017). "El agente intencional no intencional: aprender a resolver muchas tareas de control continuo simultáneamente". arXiv : 1707.03300 [ cs.AI ].
  24. J.-Y. Li, Z.-H. Zhan, Y. Li y J. Zhang, Tareas múltiples para objetivos múltiples: Un nuevo método de optimización multiobjetivo mediante optimización multitarea en IEEE Transactions on Evolutionary Computation, doi : 10.1109/TEVC.2023.3294307
  25. Standley, Trevor; Zamir, Amir R.; Chen, Dawn; Guibas, Leonidas; Malik, Jitendra; Savarese, Silvio (2020-07-13). "Aprendizaje del frente de Pareto con hiperredes" . Conferencia internacional sobre aprendizaje automático : 9120–9132 . arXiv : 1905.07553 .
  26. Li JY, Zhan ZH, Tan KC, et al. Una evolución diferencial basada en la transferencia de metaconocimiento para la optimización de tareas múltiples. IEEE Transactions on Evolutionary Computation, 2021, 26(4): 719-734 .
  27. Swersky, K., Snoek, J., & Adams, RP (2013). Optimización bayesiana multitarea . Avances en sistemas de procesamiento de información neuronal (pp. 2004-2012).
  28. Bonilla, EV, Chai, KM y Williams, C. (2008). Predicción de procesos gaussianos multitarea . Avances en sistemas de procesamiento de información neuronal (págs. 153-160).
  29. 1 2 Ong, YS, & Gupta, A. (2016). Multitarea evolutiva: una visión de la informática sobre la multitarea cognitiva . Cognitive Computation, 8(2), 125-142.
  30. Feng, Liang; Zhou, Lei; Zhong, Jinghui; Gupta, Abhishek; Ong, Yew-Soon; Tan, Kay-Chen; Qin, AK (2019). "Multitarea evolutiva mediante autoencoders explícitos". IEEE Transactions on Cybernetics . 49 (9): 3457– 3470. Bibcode : 2019ITCyb..49.3457F . doi : 10.1109/TCYB.2018.2845361 . PMID 29994415 . S2CID 51613697 .  
  31. Jiang, Yi; Zhan, Zhi-Hui; Tan, Kay Chen; Zhang, Jun (enero de 2024). "Transferencia de conocimiento a nivel de bloque para la optimización multitarea evolutiva". IEEE Transactions on Cybernetics . 54 (1): 558– 571. Bibcode : 2024ITCyb..54..558J . doi : 10.1109/TCYB.2023.3273625 . ISSN 2168-2267 . PMID 37216256 .  
  32. Goodfellow, Ian; Bengio, Yoshua; Courville, Aaron (2016). Aprendizaje profundo . MIT Press. ISBN 978-0-262-03561-3.
  33. ^ Liu, L.; Li, Y.; Kuang, Z.; Xue, J.; Chen, Y.; Yang, W.; Liao, Q.; Zhang, W. (4 de mayo de 2021). "Hacia un aprendizaje imparcial multitarea" . En: Actas de la Conferencia Internacional sobre Representaciones del Aprendizaje (ICLR 2021). ICLR: Evento virtual. (2021) . Consultado el 20 de noviembre de 2022 .
  34. Tianhe, Yu; Saurabh, Kumar; Abhishek, Gupta; Sergey, Levine; Karol, Hausman; Chelsea, Finn (2020). " Cirugía de gradiente para el aprendizaje multitarea" . Avances en sistemas de procesamiento de información neuronal . 33. arXiv : 2001.06782 .
  35. Liu, Bo; Liu, Xingchao; Jin, Xiaojie; Stone, Peter; Liu, Qiang (2021-10-26). "Descenso de gradiente con aversión al conflicto para el aprendizaje multitarea". arXiv : 2110.14048 [ cs.LG ].
  36. ^ Aviv Navon, Aviv Shamsian, Idan Achituve, Haggai Maron, Kenji Kawaguchi, Gal Chechik, Ethan Fetaya, (2022). El aprendizaje multitarea como juego de negociación . Congreso internacional sobre aprendizaje automático.
  37. Chandra, R., Gupta, A., Ong, YS, & Goh, CK (2016, octubre). Aprendizaje evolutivo multitarea para el entrenamiento modular de redes neuronales de alimentación directa . En Conferencia internacional sobre procesamiento de información neuronal (págs. 37-46). Springer, Cham.
  38. Yosinski, J., Clune, J., Bengio, Y., & Lipson, H. (2014). ¿Qué tan transferibles son las características en las redes neuronales profundas? En Avances en sistemas de procesamiento de información neuronal (pp. 3320-3328).
  39. Wen, Yu-Wei; Ting, Chuan-Kang (2016). "Aprendizaje de conjuntos de árboles de decisión mediante programación genética multifactorial". Congreso IEEE de Computación Evolutiva (CEC) de 2016. págs. 5293–5300 . doi : 10.1109/CEC.2016.7748363 . ISBN  978-1-5090-0623-6. S2CID 2617811 . 
  40. Zhang, Boyu; Qin, AK; Sellis, Timos (2018). «Generación de subespacios de características evolutivas para la clasificación de conjuntos». Actas de la Conferencia de Computación Genética y Evolutiva . págs. 577–584 . doi : 10.1145/3205455.3205638 . ISBN  978-1-4503-5618-3. S2CID 49564862 . 
  41. ^ Bao, Liang; Qi, Yutao; Shen, Mengqing; Bu, Xiaoxuan; Yu, Jusheng; Li, Qian; Chen, Ping (2018). "Un algoritmo evolutivo multitarea para la composición de servicios de computación en la nube". Servicios – SERVICIOS 2018 . Apuntes de conferencias sobre informática. vol. 10975. págs. 130–144 . doi : 10.1007/978-3-319-94472-2_10 . ISBN   978-3-319-94471-5.
  42. Tang, J., Chen, Y., Deng, Z., Xiang, Y., & Joy, CP (2018). Un enfoque basado en grupos para mejorar el algoritmo evolutivo multifactorial . En IJCAI (pp. 3870-3876).
  43. Felton, Kobi; Wigh, Daniel; Lapkin, Alexei (2021). "Optimización bayesiana multitarea de reacciones químicas". chemRxiv . doi : 10.26434/chemrxiv.13250216.v2 .
  44. Jiang, Yi; Zhan, Zhi-Hui; Tan, Kay Chen; Zhang, Jun (octubre de 2023). "Un marco de transferencia de conocimiento bi-objetivo para la optimización evolutiva de múltiples tareas" . IEEE Transactions on Evolutionary Computation . 27 (5): 1514– 1528. Bibcode : 2023ITEC...27.1514J . doi : 10.1109/TEVC.2022.3210783 . ISSN 1089-778X . 
  45. Jiang, Yi; Zhan, Zhi-Hui; Tan, Kay Chen; Kwong, Sam; Zhang, Jun (2024). "Optimización evolutiva de múltiples tareas basada en la preservación de la estructura del conocimiento" . IEEE Transactions on Evolutionary Computation . 29 (2): 287– 301. doi : 10.1109/TEVC.2024.3355781 . ISSN 1089-778X . 
  46. Dinuzzo, Francesco (2011). "Learning output kernels with block coordinate descent" (PDF) . Actas de la 28.ª Conferencia Internacional sobre Aprendizaje Automático (ICML-11) . Archivado del original (PDF) el 8 de agosto de 2017.
  47. Jacob, Laurent (2009). "Aprendizaje multitarea agrupado: una formulación convexa". Advances in Neural Information Processing Systems . arXiv : 0809.2085 . Bibcode : 2008arXiv0809.2085J .
  48. Zhou, J., Chen, J. y Ye, J. MALSAR: Aprendizaje multitarea mediante regularización estructural. Universidad Estatal de Arizona, 2012. http://www.public.asu.edu/~jye02/Software/MALSAR . Manual en línea .
  49. Evgeniou, T., & Pontil, M. (2004). Aprendizaje multitarea regularizado . Actas de la décima conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos (págs. 109-117).
  50. Evgeniou, T.; Micchelli, C.; Pontil, M. (2005). "Aprendizaje de múltiples tareas con métodos de kernel" (PDF) . Journal of Machine Learning Research . 6 : 615.
  51. Argyriou, A.; Evgeniou, T.; Pontil, M. (2008a). "Aprendizaje de características multitarea convexas" . Machine Learning . 73 (3): 243– 272. Bibcode : 2008MLear..73..243A . doi : 10.1007/s10994-007-5040-8 .
  52. Chen, J., Zhou, J., & Ye, J. (2011). Integración de estructuras de bajo rango y dispersas en grupos para un aprendizaje robusto de múltiples tareas.Actas de la décima conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos.
  53. Ji, S., & Ye, J. (2009). Un método de gradiente acelerado para la minimización de la norma de traza . Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático (págs. 457–464).
  54. Ando, ​​R.; Zhang, T. (2005). "Un marco para aprender estructuras predictivas a partir de múltiples tareas y datos sin etiquetar" (PDF) . The Journal of Machine Learning Research . 6 : 1817–1853 .
  55. Chen, J., Tang, L., Liu, J., & Ye, J. (2009). Una formulación convexa para aprender estructuras compartidas a partir de múltiples tareas . Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático (págs. 137–144).
  56. Chen, J., Liu, J., & Ye, J. (2010). Aprendizaje de patrones dispersos y de bajo rango incoherentes a partir de múltiples tareas . Actas de la 16.ª conferencia internacional ACM SIGKDD sobre descubrimiento de conocimiento y minería de datos (págs. 1179–1188).
  57. Jacob, L., Bach, F., & Vert, J. (2008). Aprendizaje multitarea agrupado: una formulación convexa . Advances in Neural Information Processing Systems, 2008
  58. Zhou, J., Chen, J., & Ye, J. (2011). Aprendizaje multitarea agrupado mediante optimización de estructura alternante . Avances en sistemas de procesamiento de información neuronal.
  • El Grupo de Inteligencia de Bioseñales de la UIUC
  • Departamento de Ciencias de la Computación de la Universidad de Washington en San Luis

Software