Articulo de referencia

Métodos de gradiente proximal para el aprendizaje

Los métodos de gradiente proximal (división hacia adelante y hacia atrás) para el aprendizaje son un área de investigación en la teoría de la optimización y el aprendizaje estad...

Los métodos de gradiente proximal (división hacia adelante y hacia atrás) para el aprendizaje son un área de investigación en la teoría de la optimización y el aprendizaje estadístico que estudia algoritmos para una clase general de problemas de regularización convexa donde la penalización de regularización puede no ser diferenciable . Un ejemplo de ello es1{\displaystyle \ell _{1}}regularización (también conocida como Lasso) de la forma

minwRd1nortei=1norte(yiw,incógnitai)2+λw1, dónde incógnitaiRd y yiR.{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}+\lambda \|w\|_{1},\quad {\text{ donde }}x_{i}\in \mathbb {R} ^{d}{\text{ y }}y_{i}\in \mathbb {R} .}

Los métodos de gradiente proximal ofrecen un marco general para resolver problemas de regularización de la teoría del aprendizaje estadístico con penalizaciones adaptadas a una aplicación específica del problema. [ 1 ] [ 2 ] Estas penalizaciones personalizadas pueden ayudar a inducir cierta estructura en las soluciones del problema, como la escasez (en el caso de lasso ) o la estructura de grupo (en el caso de group lasso ).

Antecedentes relevantes

Los métodos de gradiente proximal son aplicables en una amplia variedad de escenarios para resolver problemas de optimización convexa de la forma

minincógnitaHF(incógnita)+R(incógnita),{\displaystyle \min _{x\in {\mathcal {H}}}F(x)+R(x),}

dóndeF{\displaystyle F}es convexa y diferenciable con gradiente continuo de Lipschitz ,R{\displaystyle R}es una función convexa , semicontinua inferiormente , que posiblemente no sea diferenciable, yH{\displaystyle {\mathcal {H}}}es algún conjunto, típicamente un espacio de Hilbert . El criterio habitual deincógnita{\displaystyle x}minimizaF(incógnita)+R(incógnita){\displaystyle F(x)+R(x)}si y solo si(F+R)(incógnita)=0{\displaystyle \nabla (F+R)(x)=0}en el entorno convexo y diferenciable ahora se reemplaza por

0(F+R)(incógnita),{\displaystyle 0\in \partial (F+R)(x),}

dóndeφ{\displaystyle \partial \varphi}denota el subgradiente de una función convexa de valor real.φ{\displaystyle \varphi }.

Dada una función convexaφ:HR{\displaystyle \varphi :{\mathcal {H}}\to \mathbb {R} } un operador importante a considerar es su operador proximalproximidadφ:HH{\displaystyle \operatorname {prox} _{\varphi }:{\mathcal {H}}\to {\mathcal {H}}}definido por

proximidadφ()=argminincógnitaHφ(incógnita)+12incógnita22,{\displaystyle \operatorname {prox} _{\varphi }(u)=\operatorname {arg} \min _{x\in {\mathcal {H}}}\varphi (x)+{\frac {1}{2}}\|ux\|_{2}^{2},}

que está bien definida debido a la estricta convexidad de la2{\displaystyle \ell _{2}}norma. El operador proximal puede verse como una generalización de una proyección . [ 1 ] [ 3 ] [ 4 ] Vemos que el operador de proximidad es importante porqueincógnita{\displaystyle x^{*}}es un minimizador del problemaminincógnitaHF(incógnita)+R(incógnita){\displaystyle \min _{x\in {\mathcal {H}}}F(x)+R(x)}si y solo si

incógnita=proximidadγR(incógnitaγF(incógnita)),{\displaystyle x^{*}=\operatorname {prox} _{\gamma R}\left(x^{*}-\gamma \nabla F(x^{*})\right),}dóndeγ>0{\displaystyle \gamma >0}es cualquier número real positivo. [ 1 ]

descomposición de Moreau

Una técnica importante relacionada con los métodos de gradiente proximal es la descomposición de Moreau, que descompone el operador identidad como la suma de dos operadores de proximidad. [ 1 ] Es decir, seaφ:incógnitaR{\displaystyle \varphi Sea {\mathcal {X}}\to \mathbb {R} } unafunción semicontinua inferior y convexa en un espacio vectorial.incógnita{\displaystyle {\mathcal {X}}}. Definimos su conjugado de Fenchelφ:incógnitaR{\displaystyle \varphi ^{*}:{\mathcal {X}}\to \mathbb {R} }ser la función

φ():=sorberincógnitaincógnitaincógnita,φ(incógnita).{\displaystyle \varphi ^{*}(u):=\sup _{x\in {\mathcal {X}}}\langle x,u\rangle -\varphi (x).}

La forma general de la descomposición de Moreau establece que para cualquierincógnitaincógnita{\displaystyle x\in {\mathcal {X}}}y cualquierγ>0{\displaystyle \gamma >0}eso

incógnita=proximidadγφ(incógnita)+γproximidadφ/γ(incógnita/γ),{\displaystyle x=\operatorname {prox} _{\gamma \varphi }(x)+\gamma \operatorname {prox} _{\varphi ^{*}/\gamma }(x/\gamma ),}

que paraγ=1{\displaystyle \gamma =1}implica queincógnita=proximidadφ(incógnita)+proximidadφ(incógnita){\displaystyle x=\operatorname {prox} _{\varphi }(x)+\operatorname {prox} _{\varphi ^{*}}(x)}. [ 1 ] [ 3 ] La descomposición de Moreau puede considerarse una generalización de la descomposición ortogonal usual de un espacio vectorial , análoga al hecho de que los operadores de proximidad son generalizaciones de proyecciones. [ 1 ]

En ciertas situaciones puede ser más fácil calcular el operador de proximidad para el conjugado.φ{\displaystyle \varphi ^{*}}en lugar de la funciónφ{\displaystyle \varphi }y por lo tanto se puede aplicar la descomposición de Moreau. Este es el caso para group lasso .

Regularización Lasso

Consideremos el problema de minimización del riesgo empírico regularizado con pérdida cuadrática y con la1{\displaystyle \ell _{1}}norma como penalización de regularización:

minwRd1nortei=1norte(yiw,incógnitai)2+λw1,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}+\lambda \|w\|_{1},}

dóndeincógnitaiRd y yiR.{\displaystyle x_{i}\in \mathbb {R} ^{d}{\text{ and }}y_{i}\in \mathbb {R} .}El1{\displaystyle \ell _{1}}El problema de regularización a veces se denomina lasso ( operador de selección y contracción de mínimos absolutos ). [ 5 ] Tal1{\displaystyle \ell _{1}}Los problemas de regularización son interesantes porque inducen soluciones dispersas , es decir, solucionesw{\displaystyle w}El problema de minimización tiene relativamente pocos componentes distintos de cero. Se puede ver que Lasso es una relajación convexa del problema no convexo.

minwRd1nortei=1norte(yiw,incógnitai)2+λw0,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}+\lambda \|w\|_{0},}

dóndew0{\displaystyle \|w\|_{0}}denota el0{\displaystyle \ell _{0}}"norma", que es el número de entradas no nulas del vectorw{\displaystyle w}Las soluciones dispersas son de particular interés en la teoría del aprendizaje para la interpretabilidad de los resultados: una solución dispersa puede identificar un pequeño número de factores importantes. [ 5 ]

Resolviendo para el operador de proximidad L1

Para simplificar, restringimos nuestra atención al problema dondeλ=1{\displaystyle \lambda =1}Para resolver el problema

minwRd1nortei=1norte(yiw,incógnitai)2+w1,{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}+\|w\|_{1},}

Consideramos nuestra función objetivo en dos partes: un término convexo y diferenciable.F(w)=1nortei=1norte(yiw,incógnitai)2{\displaystyle F(w)={\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}}y una función convexaR(w)=w1{\displaystyle R(w)=\|w\|_{1}}. Tenga en cuenta queR{\displaystyle R}no es estrictamente convexa.

Calculemos el operador de proximidad paraR(w){\displaystyle R(w)}Primero encontramos una caracterización alternativa del operador de proximidad.proximidadR(incógnita){\displaystyle \operatorname {prox} _{R}(x)}como sigue:

=proximidadR(incógnita)0(R()+12incógnita22)0R()+incógnitaincógnitaR().{\displaystyle {\begin{aligned}u=\operatorname {prox} _{R}(x)\iff &0\in \partial \left(R(u)+{\frac {1}{2}}\|u-x\|_{2}^{2}\right)\\\iff &0\in \partial R(u)+u-x\\\iff &x-u\in \partial R(u).\end{aligned}}}

ParaR(w)=w1{\displaystyle R(w)=\|w\|_{1}}es fácil de calcularR(w){\displaystyle \partial R(w)}: eli{\displaystyle i}entrada deR(w){\displaystyle \partial R(w)}es precisamente

|wi|={1,wi>01,wi<0[1,1],wi=0.{\displaystyle \partial |w_{i}|={\begin{cases}1,&w_{i}>0\\-1,&w_{i}<0\\\left[-1,1\right],&w_{i}=0.\end{cases}}}

Utilizando la recaracterización del operador de proximidad dada anteriormente, para la elección deR(w)=w1{\displaystyle R(w)=\|w\|_{1}}yγ>0{\displaystyle \gamma >0}tenemos esoproximidadγR(incógnita){\displaystyle \operatorname {prox} _{\gamma R}(x)}se define entrada por entrada

(proximidadγR(incógnita))i={incógnitaiγ,incógnitai>γ0,|incógnitai|γincógnitai+γ,incógnitai<γ,{\displaystyle \left(\operatorname {prox} _{\gamma R}(x)\right)_{i}={\begin{cases}x_{i}-\gamma ,&x_{i}>\gamma \\0,&|x_{i}|\leq \gamma \\x_{i}+\gamma ,&x_{i}<-\gamma ,\end{cases}}}

que se conoce como operador de umbralización suaveSγ(incógnita)=proximidadγ1(incógnita){\displaystyle S_{\gamma }(x)=\operatorname {prox} _{\gamma \|\cdot \|_{1}}(x)}. [ 1 ] [ 6 ]

Esquemas iterativos de punto fijo

Para resolver finalmente el problema del lazo, consideramos la ecuación del punto fijo mostrada anteriormente:

incógnita=proximidadγR(incógnitaγF(incógnita)).{\displaystyle x^{*}=\operatorname {prox} _{\gamma R}\left(x^{*}-\gamma \nabla F(x^{*})\right).}

Dado que hemos calculado explícitamente la forma del operador de proximidad, podemos definir un procedimiento iterativo estándar de punto fijo. Es decir, fijamos un punto inicial.w0Rd{\displaystyle w^{0}\in \mathbb {R} ^{d}}y parak=1,2,{\displaystyle k=1,2,\ldots }definir

wk+1=Sγ(wkγF(wk)).{\displaystyle w^{k+1}=S_{\gamma }\left(w^{k}-\gamma \nabla F\left(w^{k}\right)\right).}

Nótese aquí la compensación efectiva entre el término de error empírico.F(w){\displaystyle F(w)}y la penalización por regularizaciónR(w){\displaystyle R(w)}. Este método de punto fijo ha desacoplado el efecto de las dos funciones convexas diferentes que componen la función objetivo en un paso de descenso de gradiente (wkγF(wk){\displaystyle w^{k}-\gamma \nabla F\left(w^{k}\right)}) y un paso de umbralización suave (a través deSγ{\displaystyle S_{\gamma }}).

La convergencia de este esquema de punto fijo está bien estudiada en la literatura [ 1 ] [ 6 ] y está garantizada bajo una elección apropiada del tamaño del paso.γ{\displaystyle \gamma }y función de pérdida (como la pérdida cuadrática tomada aquí). Nesterov introdujo métodos acelerados en 1983 que mejoran la tasa de convergencia bajo ciertas suposiciones de regularidad enF{\displaystyle F}[ 7 ] Estos métodos se han estudiado ampliamente en años anteriores. [ 8 ] Para problemas de aprendizaje más generales donde el operador de proximidad no se puede calcular explícitamente para algún término de regularizaciónR{\displaystyle R}, tales esquemas de punto fijo aún pueden llevarse a cabo utilizando aproximaciones tanto al gradiente como al operador de proximidad. [ 4 ] [ 9 ]

Consideraciones prácticas

En la última década se han producido numerosos avances en las técnicas de optimización convexa que han influido en la aplicación de los métodos de gradiente proximal en la teoría del aprendizaje estadístico. Aquí analizamos algunos temas importantes que pueden mejorar significativamente el rendimiento algorítmico práctico de estos métodos. [ 2 ] [ 10 ]

Tamaño de paso adaptativo

En el esquema de iteración de punto fijo

wk+1=proximidadγR(wkγF(wk)),{\displaystyle w^{k+1}=\operatorname {prox} _{\gamma R}\left(w^{k}-\gamma \nabla F\left(w^{k}\right)\right),}

uno puede permitir un tamaño de paso variableγk{\displaystyle \gamma _{k}}en lugar de una constanteγ{\displaystyle \gamma }Se han propuesto numerosos esquemas de tamaño de paso adaptativo a lo largo de la literatura. [ 1 ] [ 4 ] [ 11 ] [ 12 ] Las aplicaciones de estos esquemas [ 2 ] [ 13 ] sugieren que pueden ofrecer una mejora sustancial en el número de iteraciones necesarias para la convergencia de punto fijo.

Red elástica (regularización de norma mixta)

La regularización de red elástica ofrece una alternativa a la pura1{\displaystyle \ell _{1}}regularización. El problema de lasso (1{\displaystyle \ell _{1}}La regularización implica el término de penalización.R(w)=w1{\displaystyle R(w)=\|w\|_{1}}, que no es estrictamente convexa. Por lo tanto, las soluciones aminwF(w)+R(w),{\displaystyle \min _{w}F(w)+R(w),}dóndeF{\displaystyle F}es alguna función de pérdida empírica, no tiene por qué ser única. Esto a menudo se evita mediante la inclusión de un término estrictamente convexo adicional, como un2{\displaystyle \ell _{2}}penalización de regularización de norma. Por ejemplo, se puede considerar el problema

minwRd1nortei=1norte(yiw,incógnitai)2+λ((1μ)w1+μw22),{\displaystyle \min _{w\in \mathbb {R} ^{d}}{\frac {1}{n}}\sum _{i=1}^{n}(y_{i}-\langle w,x_{i}\rangle )^{2}+\lambda \left((1-\mu )\|w\|_{1}+\mu \|w\|_{2}^{2}\right),}

dóndeincógnitaiRd y yiR.{\displaystyle x_{i}\in \mathbb {R} ^{d}{\text{ and }}y_{i}\in \mathbb {R} .} Para0<μ1{\displaystyle 0<\mu \leq 1}el término de penalizaciónλ((1μ)w1+μw22){\displaystyle \lambda \left((1-\mu )\|w\|_{1}+\mu \|w\|_{2}^{2}\right)}Ahora es estrictamente convexa y, por lo tanto, el problema de minimización ahora admite una solución única. Se ha observado que para suficientemente pequeñoμ>0{\displaystyle \mu >0}, el término de penalización adicionalμw22{\displaystyle \mu \|w\|_{2}^{2}}actúa como un precondicionador y puede mejorar sustancialmente la convergencia sin afectar negativamente la escasez de soluciones. [ 2 ] [ 14 ]

Explotación de la estructura grupal

Los métodos de gradiente proximal proporcionan un marco general aplicable a una amplia variedad de problemas en la teoría del aprendizaje estadístico . Algunos problemas de aprendizaje suelen involucrar datos con una estructura adicional conocida a priori . En los últimos años, se han producido nuevos avances que incorporan información sobre la estructura de grupos para ofrecer métodos adaptados a diferentes aplicaciones. Aquí presentamos un resumen de algunos de estos métodos.

Lazo de grupo

El lasso grupal es una generalización del método lasso cuando las características se agrupan en bloques disjuntos. [ 15 ] Supongamos que las características se agrupan en bloques{w1,,wGRAMO}{\displaystyle \{w_{1},\ldots ,w_{G}\}}Aquí tomamos como penalización de regularización

R(w)=gramo=1GRAMOwgramo2,{\displaystyle R(w)=\sum _{g=1}^{G}\|w_{g}\|_{2},}

que es la suma de la2{\displaystyle \ell _{2}}norma en los vectores de características correspondientes para los diferentes grupos. Se puede utilizar un análisis de operador de proximidad similar al anterior para calcular el operador de proximidad para esta penalización. Donde la penalización lasso tiene un operador de proximidad que es un umbral suave en cada componente individual, el operador de proximidad para el lasso de grupo es un umbral suave en cada grupo. Para el grupowgramo{\displaystyle w_{g}}tenemos ese operador de proximidad deλγ(gramo=1GRAMOwgramo2){\displaystyle \lambda \gamma \left(\sum _{g=1}^{G}\|w_{g}\|_{2}\right)}es dado por

S~λγ(wgramo)={wgramoλγwgramowgramo2,wgramo2>λγ0,wgramo2λγ{\displaystyle {\widetilde {S}}_{\lambda \gamma }(w_{g})={\begin{cases}w_{g}-\lambda \gamma {\frac {w_{g}}{\|w_{g}\|_{2}}},&\|w_{g}\|_{2}>\lambda \gamma \\0,&\|w_{g}\|_{2}\leq \lambda \gamma \end{cases}}}

dóndewgramo{\displaystyle w_{g}}es elgramo{\displaystyle g}el grupo.

A diferencia de lasso, la derivación del operador de proximidad para lasso grupal se basa en la descomposición de Moreau . Aquí, el operador de proximidad del conjugado de la penalización de lasso grupal se convierte en una proyección sobre la bola de una norma dual . [ 2 ]

Otras estructuras de grupo

A diferencia del problema de group lasso, donde las características se agrupan en bloques disjuntos, puede darse el caso de que las características agrupadas se superpongan o tengan una estructura anidada. Tales generalizaciones de group lasso se han considerado en diversos contextos. [ 16 ] [ 17 ] [ 18 ] [ 19 ] Para grupos superpuestos, un enfoque común es el conocido como latent group lasso , que introduce variables latentes para tener en cuenta la superposición. [ 20 ] [ 21 ] Las estructuras de grupos anidados se estudian en la predicción de estructuras jerárquicas y con grafos acíclicos dirigidos . [ 18 ]

Véase también

Referencias

  1. 1 2 3 4 5 6 7 8 9 Combettes, Patrick L.; Wajs, Valérie R. (2005). "Recuperación de señales mediante división proximal hacia adelante y hacia atrás". Multiscale Model. Simul . 4 (4): 1168– 1200. doi : 10.1137/050626090 . S2CID 15064954 . 
  2. 1 2 3 4 5 Mosci, S.; Rosasco, L.; Matteo, S.; Verri, A.; Villa, S. (2010). "Resolución de la regularización de la escasez estructurada con métodos proximales". Aprendizaje automático y descubrimiento de conocimiento en bases de datos . Notas de clase en ciencias de la computación. Vol. 6322. págs. 418–433 . doi : 10.1007/978-3-642-15883-4_27 . ISBN   978-3-642-15882-7.
  3. ^ Moreau , J.-J. (1962). "Funciones convexas duales y puntos próximos en un espacio hilbertien". Cuentas Rendus de la Academia de Ciencias, Serie A. 255 : 2897– 2899. SEÑOR 0144188 . Zbl 0118.10502 .  
  4. 1 2 3 Bauschke, HH y Combettes, PL (2011). Análisis convexo y teoría de operadores monótonos en espacios de Hilbert . Springer.{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
  5. 1 2 Tibshirani, R. (1996). "Regresión, contracción y selección mediante el método lasso". JR Stat. Soc. Ser. B . 1. 58 (1): 267– 288. doi : 10.1111/j.2517-6161.1996.tb02080.x .
  6. 1 2 Daubechies, I.; Defrise, M.; De Mol, C. (2004). "Un algoritmo iterativo de umbralización para el problema inverso lineal con una restricción de escasez". Comm. Pure Appl. Math . 57 (11): 1413– 1457. arXiv : math/0307152 . doi : 10.1002/cpa.20042 . S2CID 1438417 . 
  7. Nesterov, Yurii (1983). "Un método para resolver un problema de programación convexa con tasa de convergenciaO(1/k2){\displaystyle O(1/k^{2})}". Matemáticas soviéticas - Doklady . 27 (2): 372– 376.
  8. Nesterov, Yurii (2004). Lecciones introductorias sobre optimización convexa . Kluwer Academic Publisher.
  9. Villa, S.; Salzo, S.; Baldassarre, L.; Verri, A. (2013). "Algoritmos de avance-retroceso acelerados e inexactos". SIAM J. Optim . 23 (3): 1607–1633 . CiteSeerX 10.1.1.416.3633 . doi : 10.1137/110844805 . S2CID 11379846 .  
  10. Bach, F.; Jenatton, R.; Mairal, J.; Obozinski, Gl. (2011). "Optimización con penalizaciones que inducen escasez". Foundations and Trends in Machine Learning . 4 (1): 1– 106. arXiv : 1108.0775 . Bibcode : 2011arXiv1108.0775B . doi : 10.1561/2200000015 . S2CID 56356708 . 
  11. ^ Loris, yo; Bertero, M.; De Mol, C.; Zanella, R.; Zanni, L. (2009). "Acelerar los métodos de proyección de gradiente para1{\displaystyle \ell _{1}}-recuperación de señal restringida por reglas de selección de longitud de paso". Applied & Comp. Harmonic Analysis . 27 (2): 247– 254. arXiv : 0902.4424 . doi : 10.1016/j.acha.2009.02.003 . S2CID 18093882 . 
  12. Wright, SJ; Nowak, RD; Figueiredo, MAT (2009). "Reconstrucción dispersa mediante aproximación separable". IEEE Trans. Image Process . 57 (7): 2479– 2493. Bibcode : 2009ITSP...57.2479W . CiteSeerX 10.1.1.115.9334 . doi : 10.1109/TSP.2009.2016892 . S2CID 7399917 .  
  13. Loris, Ignace (2009). "Sobre el rendimiento de los algoritmos para la minimización de1{\displaystyle \ell _{1}}-funcionales penalizados". Problemas inversos . 25 (3) 035008. arXiv : 0710.4082 . Bibcode : 2009InvPr..25c5008L . doi : 10.1088/0266-5611/25/3/035008 . S2CID 14213443 . 
  14. De Mol, C.; De Vito, E.; Rosasco, L. (2009). "Regularización de red elástica en la teoría del aprendizaje". J. Complejidad . 25 (2): 201–230 . arXiv : 0807.3423 . doi : 10.1016/j.jco.2009.01.002 . S2CID 7167292 . 
  15. Yuan, M.; Lin, Y. (2006). "Selección y estimación de modelos en regresión con variables agrupadas" . JR Stat. Soc. B. 68 ( 1): 49– 67. doi : 10.1111/j.1467-9868.2005.00532.x . S2CID 6162124 . 
  16. Chen, X.; Lin, Q.; Kim, S.; Carbonell, JG; Xing, EP (2012). "Método de gradiente proximal suavizado para regresión dispersa estructurada general". Ann. Appl. Stat . 6 (2): 719– 752. arXiv : 1005.4717 . doi : 10.1214/11-AOAS514 . S2CID 870800 . 
  17. Mosci, S.; Villa, S.; Verri, A.; Rosasco, L. (2010). "Un algoritmo primal-dual para la regularización dispersa de grupos con grupos superpuestos". NIPS . 23 : 2604–2612 .
  18. 1 2 Jenatton, R.; Audibert, J.-Y.; Bach, F. (2011). "Selección de variables estructuradas con normas que inducen escasez". J. Mach. Learn. Res . 12 : 2777–2824 . arXiv : 0904.3523 . Bibcode : 2009arXiv0904.3523J .
  19. Zhao, P.; Rocha, G.; Yu, B. (2009). "La familia de penalizaciones absolutas compuestas para la selección de variables agrupadas y jerárquicas". Ann. Stat . 37 (6A): 3468– 3497. arXiv : 0909.0411 . Bibcode : 2009arXiv0909.0411Z . doi : 10.1214/07-AOS584 . S2CID 9319285 . 
  20. Obozinski, Guillaume; Jacob, Laurent; Vert, Jean-Philippe (2011). "Group Lasso with Overlaps: The Latent Group Lasso approach". arXiv : 1110.0413 [ stat.ML ].
  21. Villa, Silvia; Rosasco, Lorenzo; Mosci, Sofia; Verri, Alessandro (2012). "Métodos proximales para la penalización lasso de grupo latente". arXiv : 1209.0368 [ math.OC ].