Articulo de referencia

Equidad (aprendizaje automático)

La equidad en el aprendizaje automático (ML) se refiere a los diversos intentos de corregir el sesgo algorítmico en los procesos de toma de decisiones automatizados basados ​​en...

La equidad en el aprendizaje automático (ML) se refiere a los diversos intentos de corregir el sesgo algorítmico en los procesos de toma de decisiones automatizados basados ​​en modelos de ML. Las decisiones tomadas por dichos modelos después de un proceso de aprendizaje pueden considerarse injustas si se basaron en variables consideradas sensibles (por ejemplo, género, etnia, orientación sexual o discapacidad).

Como ocurre con muchos conceptos éticos , las definiciones de imparcialidad y parcialidad pueden ser controvertidas. En general, la imparcialidad y la parcialidad se consideran relevantes cuando el proceso de toma de decisiones afecta la vida de las personas.

Dado que las decisiones tomadas por máquinas pueden verse sesgadas por diversos factores, podrían considerarse injustas para ciertos grupos o individuos. Un ejemplo de ello es la forma en que las redes sociales ofrecen noticias personalizadas a los consumidores.

Contexto

El debate sobre la equidad en el aprendizaje automático es un tema relativamente reciente. Desde 2016, se ha producido un marcado aumento en la investigación sobre este tema. [ 1 ] Este aumento podría atribuirse en parte a un influyente informe de ProPublica que afirmaba que el software COMPAS , ampliamente utilizado en los tribunales estadounidenses para predecir la reincidencia , presentaba sesgos raciales. [ 2 ] Un tema de investigación y debate es la definición de equidad, ya que no existe una definición universal y las diferentes definiciones pueden ser contradictorias entre sí, lo que dificulta la evaluación de los modelos de aprendizaje automático. [ 3 ] Otros temas de investigación incluyen los orígenes del sesgo, los tipos de sesgo y los métodos para reducirlo. [ 4 ]

En los últimos años, las empresas tecnológicas han creado herramientas y manuales sobre cómo detectar y reducir el sesgo en el aprendizaje automático. IBM cuenta con herramientas para Python y R con varios algoritmos para reducir el sesgo del software y aumentar su equidad. [ 5 ] [ 6 ] Google ha publicado directrices y herramientas para estudiar y combatir el sesgo en el aprendizaje automático. [ 7 ] [ 8 ] Facebook ha informado sobre el uso de una herramienta, Fairness Flow, para detectar el sesgo en su IA . [ 9 ] Sin embargo, los críticos han argumentado que los esfuerzos de la empresa son insuficientes, informando sobre un escaso uso de la herramienta por parte de los empleados, ya que no se puede utilizar para todos sus programas e incluso cuando se puede, su uso es opcional. [ 10 ]

Es importante señalar que la discusión sobre métodos cuantitativos para evaluar la equidad y la discriminación injusta en la toma de decisiones precede en varias décadas al debate relativamente reciente sobre la equidad en el aprendizaje automático. [ 11 ] De hecho, un debate animado sobre este tema por parte de la comunidad científica floreció a mediados de la década de 1960 y en la de 1970, principalmente como resultado del movimiento por los derechos civiles en Estados Unidos y, en particular, de la aprobación de la Ley de Derechos Civiles de Estados Unidos de 1964. Sin embargo, a finales de la década de 1970, el debate prácticamente desapareció, ya que las diferentes y a veces contrapuestas nociones de equidad dejaban poco margen para aclarar cuándo una noción de equidad puede ser preferible a otra.

Sesgo lingüístico

El sesgo lingüístico se refiere a un tipo de sesgo de muestreo estadístico vinculado al idioma de una consulta que conduce a "una desviación sistemática en la información de muestreo que impide que represente con precisión la cobertura real de los temas y puntos de vista disponibles en su repositorio". [ 12 ] Luo et al. [ 12 ] muestran que los modelos de lenguaje grandes actuales, dado que están entrenados predominantemente con datos en inglés, a menudo presentan los puntos de vista angloamericanos como la verdad, mientras que minimizan sistemáticamente las perspectivas no inglesas como irrelevantes, erróneas o ruido. Cuando se consulta con ideologías políticas como "¿Qué es el liberalismo?", ChatGPT , dado que fue entrenado con datos centrados en el inglés, describe el liberalismo desde la perspectiva angloamericana, enfatizando aspectos de derechos humanos e igualdad, mientras que aspectos igualmente válidos como "se opone a la intervención estatal en la vida personal y económica" de la perspectiva vietnamita dominante y "limitación del poder gubernamental" de la perspectiva china predominante están ausentes. De manera similar, otras perspectivas políticas integradas en corpus japoneses, coreanos, franceses y alemanes están ausentes en las respuestas de ChatGPT. ChatGPT, que se presenta como un chatbot multilingüe, en realidad es mayormente "ciego" a las perspectivas que no son en inglés. [ 12 ]

sesgo de género

El sesgo de género se refiere a la tendencia de estos modelos a producir resultados que muestran un sesgo injusto hacia un género sobre otro. Este sesgo suele surgir de los datos con los que se entrenan estos modelos. Por ejemplo, los grandes modelos de lenguaje a menudo asignan roles y características basándose en normas de género tradicionales; podrían asociar enfermeras o secretarias predominantemente con mujeres e ingenieros o directores ejecutivos con hombres. [ 13 ] Otro ejemplo utiliza métodos basados ​​en datos para identificar el sesgo de género en los perfiles de LinkedIn . El creciente uso de sistemas habilitados para aprendizaje automático se ha convertido en un componente importante de la captación de talento moderna, particularmente a través de redes sociales como LinkedIn y Facebook. Sin embargo, se ha demostrado que el exceso de datos integrado en los sistemas de reclutamiento, basados ​​en métodos de procesamiento del lenguaje natural (PLN), produce sesgo de género. [ 14 ]

Sesgo político

El sesgo político se refiere a la tendencia de los algoritmos a favorecer sistemáticamente ciertos puntos de vista, ideologías o resultados políticos sobre otros. Los modelos de lenguaje también pueden presentar sesgos políticos. Dado que los datos de entrenamiento incluyen una amplia gama de opiniones y cobertura política, los modelos podrían generar respuestas que se inclinen hacia ideologías o puntos de vista políticos particulares, dependiendo de la prevalencia de esas opiniones en los datos. [ 15 ]

Controversias

El uso de la toma de decisiones algorítmicas en el sistema legal ha sido un área de uso notable bajo escrutinio. En 2014, el entonces Fiscal General de los Estados Unidos, Eric Holder, expresó su preocupación de que los métodos de "evaluación de riesgos" pudieran estar haciendo un énfasis indebido en factores que no están bajo el control del acusado, como su nivel educativo o su origen socioeconómico. [ 16 ] El informe de 2016 de ProPublica sobre COMPAS afirmaba que los acusados ​​negros tenían casi el doble de probabilidades de ser etiquetados incorrectamente como de mayor riesgo que los acusados ​​blancos, mientras que se cometía el error opuesto con los acusados ​​blancos. [ 2 ] El creador de COMPAS, Northepointe Inc., impugnó el informe, alegando que su herramienta es justa y que ProPublica cometió errores estadísticos, [ 17 ] lo cual fue posteriormente refutado nuevamente por ProPublica. [ 18 ]

También se ha observado sesgo racial y de género en los algoritmos de reconocimiento de imágenes. Se ha descubierto que la detección facial y de movimiento en las cámaras ignora o etiqueta erróneamente las expresiones faciales de sujetos no blancos. [ 19 ] En 2015, Google se disculpó después de que Google Fotos etiquetara erróneamente a una pareja negra como gorilas. De manera similar, se descubrió que la función de etiquetado automático de Flickr había etiquetado a algunas personas negras como "simios" y "animales". [ 20 ] Se descubrió que un concurso internacional de belleza de 2016 juzgado por un algoritmo de IA estaba sesgado hacia individuos con piel más clara, probablemente debido a un sesgo en los datos de entrenamiento. [ 21 ] Un estudio de tres algoritmos comerciales de clasificación de género en 2018 encontró que los tres algoritmos eran generalmente más precisos al clasificar a hombres de piel clara y peores al clasificar a mujeres de piel oscura. [ 22 ] En 2020, se demostró que una herramienta de recorte de imágenes de Twitter prefería rostros de piel más clara. [ 23 ] En 2022, los creadores del modelo de texto a imagen DALL-E 2 explicaron que las imágenes generadas estaban significativamente estereotipadas, basadas en rasgos como el género o la raza. [ 24 ] [ 25 ]

Otras áreas donde se utilizan algoritmos de aprendizaje automático que han demostrado ser sesgados incluyen las solicitudes de empleo y préstamos. Amazon ha utilizado software para revisar solicitudes de empleo que era sexista, por ejemplo, penalizando los currículos que incluían la palabra "mujeres". [ 26 ] En 2019, el algoritmo de Apple para determinar los límites de las tarjetas de crédito para su nueva Apple Card otorgó límites significativamente más altos a los hombres que a las mujeres, incluso para parejas que compartían sus finanzas. [ 27 ] Un informe de The Markup de 2021 demostró que los algoritmos de aprobación de hipotecas utilizados en EE. UU. tenían más probabilidades de rechazar a los solicitantes no blancos. [ 28 ]

Limitaciones

Trabajos recientes subrayan la presencia de varias limitaciones en el panorama actual de la equidad en el aprendizaje automático, particularmente en lo que respecta a lo que es realistamente alcanzable en este sentido en las aplicaciones cada vez más numerosas de la IA en el mundo real. [ 29 ] [ 30 ] [ 31 ] Por ejemplo, el enfoque matemático y cuantitativo para formalizar la equidad, y los enfoques relacionados de "eliminación de sesgos", pueden basarse en supuestos demasiado simplistas y fácilmente pasados ​​por alto, como la categorización de individuos en grupos sociales predefinidos. Otros aspectos delicados son, por ejemplo, la interacción entre varias características sensibles, [ 22 ] y la falta de una noción filosófica y/o legal clara y compartida de no discriminación.

Finalmente, si bien los modelos de aprendizaje automático pueden diseñarse para cumplir con criterios de equidad, las decisiones finales tomadas por los operadores humanos aún pueden verse influenciadas por sus propios sesgos. Este fenómeno ocurre cuando quienes toman las decisiones aceptan las recomendaciones de la IA solo cuando coinciden con sus prejuicios preexistentes, lo que socava la equidad prevista del sistema. [ 32 ]

Criterios de equidad grupal

En los problemas de clasificación , un algoritmo aprende una función para predecir una característica discreta.Y{\textstyle Y}, la variable objetivo, a partir de características conocidasincógnita{\textstyle X}Modelamos.A{\textstyle A}como una variable aleatoria discreta que codifica algunas características contenidas o implícitamente codificadas enincógnita{\textstyle X}que consideramos características sensibles (género, etnia, orientación sexual, etc.). Finalmente, denotamos porR{\textstyle R}la predicción del clasificador . Ahora definamos tres criterios principales para evaluar si un clasificador dado es justo, es decir, si sus predicciones no están influenciadas por algunas de estas variables sensibles. [ 33 ]

Independencia

Decimos que las variables aleatorias(R,A){\textstyle (R,A)}Satisfacer la independencia si las características sensiblesA{\textstyle A}son estadísticamente independientes de la predicciónR{\textstyle R}y escribimos RA.{\displaystyle R\bot A.} También podemos expresar esta noción con la siguiente fórmula: PAG(R=r | A=a)=PAG(R=r | A=b)rRa,bA{\displaystyle P(R=r\ |\ A=a)=P(R=r\ |\ A=b)\quad \forall r\in R\quad \forall a,b\in A} Esto significa que la tasa de clasificación para cada clase objetivo es igual para las personas que pertenecen a diferentes grupos con respecto a las características sensibles.A{\displaystyle A}.

Otra expresión equivalente para la independencia puede darse utilizando el concepto de información mutua entre variables aleatorias , definida como I(incógnita,Y)=H(incógnita)+H(Y)H(incógnita,Y){\displaystyle I(X,Y)=H(X)+H(Y)-H(X,Y)} En esta fórmula,H(incógnita){\textstyle H(X)}es la entropía de la variable aleatoriaincógnita{\displaystyle X}. Entonces(R,A){\textstyle (R,A)}satisfacen la independencia siI(R,A)=0{\textstyle I(R,A)=0}.

Una posible relajación de la definición de independencia incluye la introducción de una holgura positiva.ϵ>0{\textstyle \epsilon >0}y viene dada por la fórmula: PAG(R=r | A=a)PAG(R=r | A=b)ϵrRa,bA{\displaystyle P(R=r\ |\ A=a)\geq P(R=r\ |\ A=b)-\epsilon \quad \forall r\in R\quad \forall a,b\in A}

Finalmente, otra posible relajación es exigirI(R,A)ϵ{\textstyle I(R,A)\leq \epsilon }.

Separación

Decimos que las variables aleatorias(R,A,Y){\textstyle (R,A,Y)}Satisfacer la separación si las características sensiblesA{\textstyle A}son estadísticamente independientes de la predicciónR{\textstyle R}dado el valor objetivoY{\textstyle Y}y escribimos RA | Y.{\displaystyle R\bot A\ |\ Y.} También podemos expresar esta noción con la siguiente fórmula: PAG(R=r | Y=q,A=a)=PAG(R=r | Y=q,A=b)rRqYa,bA{\displaystyle P(R=r\ |\ Y=q,A=a)=P(R=r\ |\ Y=q,A=b)\quad \forall r\in R\quad q\in Y\quad \forall a,b\in A} Esto significa que toda la dependencia de la decisiónR{\displaystyle R}sobre el atributo sensibleA{\displaystyle A}debe justificarse por la dependencia real de la verdadera variable objetivo.Y{\displaystyle Y}.

Otra expresión equivalente, en el caso de una tasa objetivo binaria, es que la tasa de verdaderos positivos y la tasa de falsos positivos son iguales (y por lo tanto la tasa de falsos negativos y la tasa de verdaderos negativos son iguales) para cada valor de las características sensibles: PAG(R=1 | Y=1,A=a)=PAG(R=1 | Y=1,A=b)a,bA{\displaystyle P(R=1\ |\ Y=1,A=a)=P(R=1\ |\ Y=1,A=b)\quad \forall a,b\in A}PAG(R=1 | Y=0,A=a)=PAG(R=1 | Y=0,A=b)a,bA{\displaystyle P(R=1\ |\ Y=0,A=a)=P(R=1\ |\ Y=0,A=b)\quad \forall a,b\in A}

Una posible flexibilización de las definiciones dadas consiste en permitir que el valor de la diferencia entre las tasas sea un número positivo inferior a una holgura determinada.ϵ>0{\textstyle \epsilon >0}, en lugar de ser igual a cero.

En algunos campos, la separación (coeficiente de separación) en una matriz de confusión es una medida de la distancia (en un nivel dado de la puntuación de probabilidad) entre el porcentaje acumulado negativo previsto y el porcentaje acumulado positivo previsto .

Cuanto mayor sea este coeficiente de separación para un valor de puntuación dado, más eficaz será el modelo para diferenciar entre el conjunto de positivos y negativos en un umbral de probabilidad determinado. Según Mayes: [ 34 ] "En el sector crediticio se observa a menudo que la selección de medidas de validación depende del enfoque de modelado. Por ejemplo, si el procedimiento de modelado es paramétrico o semiparamétrico, se suele utilizar la prueba KS de dos muestras . Si el modelo se deriva mediante métodos de búsqueda heurísticos o iterativos, la medida del rendimiento del modelo suele ser la divergencia . Una tercera opción es el coeficiente de separación... El coeficiente de separación, comparado con los otros dos métodos, parece ser la medida más razonable para evaluar el rendimiento del modelo, ya que refleja el patrón de separación del mismo."

Suficiencia

Decimos que las variables aleatorias(R,A,Y){\textstyle (R,A,Y)}Satisfacer la suficiencia si las características sensiblesA{\textstyle A}son estadísticamente independientes del valor objetivoY{\textstyle Y}dada la predicciónR{\textstyle R}y escribimos YA | R.{\displaystyle Y\bot A\ |\ R.} También podemos expresar esta noción con la siguiente fórmula: PAG(Y=q | R=r,A=a)=PAG(Y=q | R=r,A=b)qYrRa,bA{\displaystyle P(Y=q\ |\ R=r,A=a)=P(Y=q\ |\ R=r,A=b)\quad \forall q\in Y\quad r\in R\quad \forall a,b\in A} Esto significa que la probabilidad de pertenecer realmente a cada uno de los grupos es la misma para dos individuos con características sensibles diferentes, dado que se predijo que pertenecerían al mismo grupo.

Relaciones entre definiciones

Finalmente, resumimos algunos de los principales resultados que relacionan las tres definiciones dadas anteriormente:

  • ArroganteY{\textstyle Y}es binario, siA{\textstyle A}yY{\textstyle Y}no son estadísticamente independientes yR{\textstyle R}yY{\textstyle Y}Si tampoco son estadísticamente independientes, entonces la independencia y la separación no pueden darse simultáneamente, excepto en casos retóricos.
  • Si(R,A,Y){\textstyle (R,A,Y)}como una distribución conjunta tiene probabilidad positiva para todos sus posibles valores yA{\textstyle A}yY{\textstyle Y}Si no son estadísticamente independientes, entonces la separación y la suficiencia no pueden cumplirse simultáneamente, excepto en casos retóricos.

Se habla de equidad total cuando la independencia, la separación y la suficiencia se satisfacen simultáneamente. [ 35 ] Sin embargo, la equidad total no es posible alcanzarla salvo en casos retóricos específicos. [ 36 ]

Formulación matemática de las definiciones de equidad grupal

Definiciones preliminares

La mayoría de las medidas estadísticas de equidad se basan en diferentes métricas, por lo que comenzaremos definiéndolas. Al trabajar con un clasificador binario , tanto la clase predicha como la real pueden tomar dos valores: positivo y negativo. Ahora comencemos a explicar las diferentes relaciones posibles entre el resultado predicho y el real: [ 37 ]

Matriz de confusión
  • Verdadero positivo (VP): El caso en el que tanto el resultado previsto como el resultado real pertenecen a la clase positiva.
  • Verdadero negativo (VN): El caso en el que tanto el resultado previsto como el resultado real se asignan a la clase negativa.
  • Falso positivo (FP): Un caso que se predijo que pertenecería a una clase positiva, pero que en el resultado real se asigna a una clase negativa.
  • Falso negativo (FN): Un caso que se predijo que pertenecería a la clase negativa, pero cuyo resultado real es positivo.

Estas relaciones se pueden representar fácilmente con una matriz de confusión , una tabla que describe la precisión de un modelo de clasificación. En esta matriz, las columnas y las filas representan las instancias de los casos predichos y reales, respectivamente.

Mediante el uso de estas relaciones, podemos definir múltiples métricas que posteriormente se pueden utilizar para medir la imparcialidad de un algoritmo:

  • Valor predictivo positivo (VPP): la fracción de casos positivos que se predijeron correctamente de entre todas las predicciones positivas. Generalmente se le denomina precisión y representa la probabilidad de una predicción positiva correcta. Se calcula mediante la siguiente fórmula:PAGPAGV=PAG(adotal=+ | pagrmididotionorte=+)=TPAGTPAG+FPAG{\displaystyle PPV=P(actual=+\ |\ predicción=+)={\frac {TP}{TP+FP}}}
  • Tasa de falsos descubrimientos (FDR): la fracción de predicciones positivas que en realidad fueron negativas con respecto al total de predicciones positivas. Representa la probabilidad de una predicción positiva errónea y se calcula mediante la siguiente fórmula:FDR=PAG(adotal= | pagrmididotionorte=+)=FPAGTPAG+FPAG{\displaystyle FDR=P(actual=-\ |\ predicción=+)={\frac {FP}{TP+FP}}}
  • Valor predictivo negativo (VPN): la fracción de casos negativos que se predijeron correctamente de entre todas las predicciones negativas. Representa la probabilidad de una predicción negativa correcta y se calcula mediante la siguiente fórmula:nortePAGV=PAG(adotal= | pagrmididotionorte=)=TnorteTnorte+Fnorte{\displaystyle NPV=P(actual=-\ |\ predicción=-)={\frac {TN}{TN+FN}}}
  • Tasa de falsa omisión (FOR): la fracción de predicciones negativas que en realidad fueron positivas con respecto al total de predicciones negativas. Representa la probabilidad de una predicción negativa errónea y se calcula mediante la siguiente fórmula:FOR=PAG(adotal=+ | pagrmididotionorte=)=FnorteTnorte+Fnorte{\displaystyle FOR=P(actual=+\ |\ predicción=-)={\frac {FN}{TN+FN}}}
  • Tasa de verdaderos positivos (TPR): la fracción de casos positivos que se predijeron correctamente de entre todos los casos positivos. Generalmente se la denomina sensibilidad o exhaustividad, y representa la probabilidad de que los sujetos positivos se clasifiquen correctamente como tales. Se calcula mediante la siguiente fórmula:TPAGR=PAG(pagrmididotionorte=+ | adotal=+)=TPAGTPAG+Fnorte{\displaystyle TPR=P(predicción=+\ |\ real=+)={\frac {TP}{TP+FN}}}
  • Tasa de falsos negativos (TFN): la fracción de casos positivos que fueron predichos incorrectamente como negativos con respecto al total de casos positivos. Representa la probabilidad de que los sujetos positivos sean clasificados incorrectamente como negativos, y se calcula mediante la siguiente fórmula:FnorteR=PAG(pagrmididotionorte= | adotal=+)=FnorteTPAG+Fnorte{\displaystyle FNR=P(predicción=-\ |\ real=+)={\frac {FN}{TP+FN}}}
  • Tasa de verdaderos negativos (TNR): la fracción de casos negativos que se predijeron correctamente de entre todos los casos negativos. Representa la probabilidad de que los sujetos negativos se clasifiquen correctamente como tales, y se calcula mediante la fórmula:TnorteR=PAG(pagrmididotionorte= | adotal=)=TnorteTnorte+FPAG{\displaystyle TNR=P(predicción=-\ |\ real=-)={\frac {TN}{TN+FP}}}
  • Tasa de falsos positivos (TFP): la fracción de casos negativos que fueron predichos incorrectamente como positivos de entre todos los casos negativos. Representa la probabilidad de que los sujetos negativos sean clasificados incorrectamente como positivos, y se calcula mediante la siguiente fórmula:FPAGR=PAG(pagrmididotionorte=+ | adotal=)=FPAGTnorte+FPAG{\displaystyle FPR=P(predicción=+\ |\ real=-)={\frac {FP}{TN+FP}}}
Relación entre los criterios de equidad como se muestra en Barocas et al. [ 33 ]

Los siguientes criterios pueden entenderse como medidas de las tres definiciones generales presentadas al inicio de esta sección: Independencia, Separación y Suficiencia. En la tabla [ 33 ] de la derecha, podemos observar las relaciones entre ellas.

Para definir estas medidas específicamente, las dividiremos en tres grandes grupos como lo hicieron Verma et al.: [ 37 ] definiciones basadas en un resultado previsto, en resultados previstos y reales, y definiciones basadas en probabilidades previstas y el resultado real.

Trabajaremos con un clasificador binario y la siguiente notación:S{\textstyle S}Se refiere a la puntuación otorgada por el clasificador, que es la probabilidad de que un determinado sujeto pertenezca a la clase positiva o negativa.R{\textstyle R}representa la clasificación final predicha por el algoritmo, y su valor generalmente se deriva deS{\textstyle S}, por ejemplo será positivo cuandoS{\textstyle S}está por encima de cierto umbral.Y{\textstyle Y}representa el resultado real, es decir, la clasificación real del individuo y, finalmente,A{\textstyle A}denota los atributos sensibles de los sujetos.

Definiciones basadas en el resultado previsto

Las definiciones de esta sección se centran en un resultado previsto.R{\textstyle R}para diversas distribuciones de sujetos. Son las nociones de equidad más simples e intuitivas.

  • Paridad demográfica , también conocida como paridad estadística , paridad de tasa de aceptación y evaluación comparativa . Un clasificador cumple esta definición si los sujetos de los grupos protegido y no protegido tienen la misma probabilidad de ser asignados a la clase predicha positiva. Esto se cumple si se satisface la siguiente fórmula:PAG(R=+ | A=a)=PAG(R=+ | A=b)a,bA{\displaystyle P(R=+\ |\ A=a)=P(R=+\ |\ A=b)\quad \forall a,b\in A}
  • Paridad estadística condicional . Básicamente consiste en la definición anterior, pero restringida solo a un subconjunto de las instancias. En notación matemática, esto sería:PAG(R=+ | L=l,A=a)=PAG(R=+ | L=l,A=b)a,bAlL{\displaystyle P(R=+\ |\ L=l,A=a)=P(R=+\ |\ L=l,A=b)\quad \forall a,b\in A\quad \forall l\in L}

Definiciones basadas en resultados previstos y reales

Estas definiciones no solo consideran el resultado previsto.R{\textstyle R}pero también compárelo con el resultado real.Y{\textstyle Y}.

  • Paridad predictiva , también conocida como prueba de resultados . Un clasificador cumple esta definición si los sujetos de los grupos protegido y no protegido tienen el mismo valor predictivo positivo (VPP). Esto se cumple si se satisface la siguiente fórmula:PAG(Y=+ | R=+,A=a)=PAG(Y=+ | R=+,A=b)a,bA{\displaystyle P(Y=+\ |\ R=+,A=a)=P(Y=+\ |\ R=+,A=b)\quad \forall a,b\in A}
Matemáticamente, si un clasificador tiene el mismo PPV para ambos grupos, también tendrá el mismo FDR, satisfaciendo la fórmula:PAG(Y= | R=+,A=a)=PAG(Y= | R=+,A=b)a,bA{\displaystyle P(Y=-\ |\ R=+,A=a)=P(Y=-\ |\ R=+,A=b)\quad \forall a,b\in A}
  • Equilibrio de la tasa de error de falsos positivos , también conocido como igualdad predictiva . Un clasificador cumple esta definición si los sujetos de los grupos protegido y no protegido tienen la misma tasa de falsos positivos. Esto se cumple si se satisface la siguiente fórmula:PAG(R=+ | Y=,A=a)=PAG(R=+ | Y=,A=b)a,bA{\displaystyle P(R=+\ |\ Y=-,A=a)=P(R=+\ |\ Y=-,A=b)\quad \forall a,b\in A}
Matemáticamente, si un clasificador tiene la misma tasa de falsos positivos (FPR) para ambos grupos, también tendrá la misma tasa de verdaderos negativos (TNR), satisfaciendo la fórmula:PAG(R= | Y=,A=a)=PAG(R= | Y=,A=b)a,bA{\displaystyle P(R=-\ |\ Y=-,A=a)=P(R=-\ |\ Y=-,A=b)\quad \forall a,b\in A}
  • Equilibrio de la tasa de error de falsos negativos , también conocido como igualdad de oportunidades . Un clasificador cumple con esta definición si los sujetos de los grupos protegidos y no protegidos tienen la misma tasa de falsos negativos. Esto se cumple si se satisface la siguiente fórmula:PAG(R= | Y=+,A=a)=PAG(R= | Y=+,A=b)a,bA{\displaystyle P(R=-\ |\ Y=+,A=a)=P(R=-\ |\ Y=+,A=b)\quad \forall a,b\in A}
Matemáticamente, si un clasificador tiene la misma tasa de falsos negativos (FNR) para ambos grupos, también tendrá la misma tasa de verdaderos positivos (TPR), satisfaciendo la fórmula:PAG(R=+ | Y=+,A=a)=PAG(R=+ | Y=+,A=b)a,bA{\displaystyle P(R=+\ |\ Y=+,A=a)=P(R=+\ |\ Y=+,A=b)\quad \forall a,b\in A}
  • Probabilidades igualadas , también conocidas como igualdad de precisión del procedimiento condicional y trato discriminatorio . Un clasificador cumple esta definición si los sujetos de los grupos protegidos y no protegidos tienen la misma TPR y la misma FPR, cumpliendo la fórmula:PAG(R=+ | Y=y,A=a)=PAG(R=+ | Y=y,A=b)y{+,}a,bA{\displaystyle P(R=+\ |\ Y=y,A=a)=P(R=+\ |\ Y=y,A=b)\quad y\in \{+,-\}\quad \forall a,b\in A}
  • Igualdad de precisión de uso condicional . Un clasificador satisface esta definición si los sujetos en los grupos protegidos y no protegidos tienen el mismo VPP y el mismo VPN, satisfaciendo la fórmula:PAG(Y=y | R=y,A=a)=PAG(Y=y | R=y,A=b)y{+,}a,bA{\displaystyle P(Y=y\ |\ R=y,A=a)=P(Y=y\ |\ R=y,A=b)\quad y\in \{+,-\}\quad \forall a,b\in A}
  • Igualdad de precisión general . Un clasificador cumple esta definición si los sujetos de los grupos protegido y no protegido tienen la misma precisión de predicción, es decir, la probabilidad de que un sujeto de una clase sea asignado a ella. Esto se cumple si satisface la siguiente fórmula:PAG(R=Y | A=a)=PAG(R=Y | A=b)a,bA{\displaystyle P(R=Y\ |\ A=a)=P(R=Y\ |\ A=b)\quad \forall a,b\in A}
  • Igualdad de trato . Un clasificador cumple esta definición si los sujetos de los grupos protegidos y no protegidos tienen una proporción igual de falsos negativos (FN) y falsos positivos (FP), que satisface la fórmula:FnorteA=aFPAGA=a=FnorteA=bFPAGA=b{\displaystyle {\frac {FN_{A=a}}{FP_{A=a}}}={\frac {FN_{A=b}}{FP_{A=b}}}}

Definiciones basadas en probabilidades previstas y resultados reales.

Estas definiciones se basan en el resultado real.Y{\textstyle Y}y la puntuación de probabilidad previstaS{\textstyle S}.

  • Equidad en las pruebas , también conocida como calibración o coincidencia de frecuencias condicionales . Un clasificador satisface esta definición si los individuos con la misma puntuación de probabilidad predichaS{\textstyle S}tienen la misma probabilidad de ser clasificados en la clase positiva, ya sea que pertenezcan al grupo protegido o al no protegido:PAG(Y=+ | S=s,A=a)=PAG(Y=+ | S=s,A=b)sSa,bA{\displaystyle P(Y=+\ |\ S=s,A=a)=P(Y=+\ |\ S=s,A=b)\quad \forall s\in S\quad \forall a,b\in A}
  • La calibración del pozo es una extensión de la definición anterior. Establece que cuando los individuos dentro o fuera del grupo protegido tienen la misma puntuación de probabilidad previstaS{\textstyle S}deben tener la misma probabilidad de ser clasificados en la clase positiva, y esta probabilidad debe ser igual aS{\textstyle S}:PAG(Y=+ | S=s,A=a)=PAG(Y=+ | S=s,A=b)=ssSa,bA{\displaystyle P(Y=+\ |\ S=s,A=a)=P(Y=+\ |\ S=s,A=b)=s\quad \forall s\in S\quad \forall a,b\in A}
  • Equilibrio para la clase positiva . Un clasificador satisface esta definición si los sujetos que constituyen la clase positiva de los grupos protegidos y no protegidos tienen la misma puntuación de probabilidad predicha promedio.S{\textstyle S}Esto significa que el valor esperado de la puntuación de probabilidad para los grupos protegidos y no protegidos con un resultado real positivoY{\textstyle Y}es lo mismo, satisfaciendo la fórmula:mi(S | Y=+,A=a)=mi(S | Y=+,A=b)a,bA{\displaystyle E(S\ |\ Y=+,A=a)=E(S\ |\ Y=+,A=b)\quad \forall a,b\in A}
  • Equilibrio para la clase negativa . Un clasificador satisface esta definición si los sujetos que constituyen la clase negativa de los grupos protegidos y no protegidos tienen la misma puntuación de probabilidad predicha promedio.S{\textstyle S}Esto significa que el valor esperado de la puntuación de probabilidad para los grupos protegidos y no protegidos con un resultado real negativoY{\textstyle Y}es lo mismo, satisfaciendo la fórmula:mi(S | Y=,A=a)=mi(S | Y=,A=b)a,bA{\displaystyle E(S\ |\ Y=-,A=a)=E(S\ |\ Y=-,A=b)\quad \forall a,b\in A}

Equidad de confusión igualitaria

Con respecto a las matrices de confusión , la independencia, la separación y la suficiencia requieren que las cantidades respectivas que se enumeran a continuación no tengan una diferencia estadísticamente significativa entre las características sensibles. [ 36 ]

  • Independencia: (TP + FP) / (TP + FP + FN + TN) (es decir,PAG(Y^=1){\displaystyle P({\hat {Y}}=1)}).
  • Separación: TN / (TN + FP) y TP / (TP + FN) (es decir, especificidad)PAG(Y^=0Y=0){\displaystyle P({\hat {Y}}=0\mid Y=0)}y recuerdoPAG(Y^=1Y=1){\displaystyle P({\hat {Y}}=1\mid Y=1)}).
  • Suficiencia: TP / (TP + FP) y TN / (TN + FN) (es decir, precisión)PAG(Y=1Y^=1){\displaystyle P(Y=1\mid {\hat {Y}}=1)}y valor predictivo negativoPAG(Y=0Y^=0){\displaystyle P(Y=0\mid {\hat {Y}}=0)}).

La noción de equidad de confusión igual [ 38 ] requiere que la matriz de confusión de un sistema de decisión dado tenga la misma distribución cuando se calcula estratificada sobre todas las características sensibles.

función de bienestar social

Algunos académicos han propuesto definir la equidad algorítmica en términos de una función de bienestar social . Argumentan que el uso de una función de bienestar social permite al diseñador de algoritmos considerar la equidad y la precisión predictiva en función de sus beneficios para las personas afectadas por el algoritmo. También permite al diseñador equilibrar la eficiencia y la equidad de manera fundamentada. [ 39 ] Sendhil Mullainathan ha afirmado que los diseñadores de algoritmos deberían utilizar funciones de bienestar social para reconocer los beneficios absolutos para los grupos desfavorecidos. Por ejemplo, un estudio encontró que el uso de un algoritmo de toma de decisiones en la detención preventiva, en lugar del juicio puramente humano, redujo las tasas de detención para personas negras, hispanas y minorías raciales en general, incluso manteniendo constante la tasa de criminalidad. [ 40 ]

Criterios de equidad individual

Una distinción importante entre las definiciones de equidad es la que existe entre las nociones de grupo e individual. [ 41 ] [ 42 ] [ 37 ] [ 43 ] En términos generales, mientras que los criterios de equidad grupal comparan cantidades a nivel de grupo, generalmente identificadas por atributos sensibles (por ejemplo, género, etnia, edad, etc.), los criterios individuales comparan individuos. En otras palabras, la equidad individual sigue el principio de que "los individuos similares deben recibir tratos similares".

Existe un enfoque muy intuitivo de la equidad, generalmente conocido como equidad por desconocimiento ( EDC ) o ceguera , que prescribe no emplear explícitamente características sensibles al tomar decisiones (automatizadas). En esencia, se trata de una noción de equidad individual, ya que dos individuos que solo difieren en el valor de sus atributos sensibles obtendrían el mismo resultado.

Sin embargo, en general, el FTU presenta varias desventajas, la principal de las cuales es que no considera las posibles correlaciones entre los atributos sensibles y los no sensibles empleados en el proceso de toma de decisiones. Por ejemplo, un agente con la intención (maliciosa) de discriminar por razón de género podría introducir en el modelo una variable sustituta para el género (es decir, una variable altamente correlacionada con el género) y, de hecho, utilizar información sobre el género, al tiempo que cumple con la prescripción del FTU.

El problema de qué variables correlacionadas con variables sensibles pueden ser utilizadas de manera razonable por un modelo en el proceso de toma de decisiones es crucial, y también es relevante para los conceptos de grupo : las métricas de independencia requieren una eliminación completa de la información sensible, mientras que las métricas basadas en la separación permiten la correlación, pero solo en la medida en que la variable objetivo etiquetada las "justifique".

El concepto más general de equidad individual fue introducido en el trabajo pionero de Cynthia Dwork y colaboradores en 2012 [ 44 ] y puede entenderse como una traducción matemática del principio de que el mapa de decisiones que toma características como entrada debe construirse de manera que pueda "mapear individuos similares de manera similar", lo cual se expresa como una condición de Lipschitz en el mapa del modelo. Ellos llaman a este enfoque equidad a través de la conciencia ( FTA ), precisamente como contrapunto a FTU, ya que subrayan la importancia de elegir la métrica de distancia apropiada relacionada con el objetivo para evaluar qué individuos son similares en situaciones específicas. Nuevamente, este problema está muy relacionado con el punto planteado anteriormente sobre qué variables pueden considerarse "legítimas" en contextos particulares.

Otro enfoque de la equidad individual es el de la equidad contrafactual. [ 4 ] La intuición detrás de la equidad contrafactual es que una decisión es justa para un individuo si es la misma tanto en el mundo real como en un mundo contrafactual donde el individuo perteneciera a un grupo demográfico diferente. [ 45 ]

Métricas basadas en la causalidad

La equidad causal mide la frecuencia con la que dos usuarios o aplicaciones casi idénticos que difieren solo en un conjunto de características con respecto a las cuales la asignación de recursos debe ser justa reciben un trato idéntico. [ 46 ]

Toda una rama de la investigación académica sobre métricas de equidad se dedica a aprovechar los modelos causales para evaluar el sesgo en los modelos de aprendizaje automático . Este enfoque se justifica generalmente por el hecho de que la misma distribución observacional de datos puede ocultar diferentes relaciones causales entre las variables involucradas, posiblemente con diferentes interpretaciones sobre si el resultado se ve afectado por algún tipo de sesgo o no. [ 33 ]

Kusner et al. [ 45 ] proponen emplear contrafactuales y definen un proceso de toma de decisiones como contrafactualmente justo si, para cualquier individuo, el resultado no cambia en el escenario contrafactual donde se modifican los atributos sensibles. Cabe señalar que esto también se clasifica como una medida de equidad individual. La formulación matemática es la siguiente:

PAG(RAa=1A=a,incógnita=incógnita)=PAG(RAb=1A=a,incógnita=incógnita),a,b;{\displaystyle P(R_{A\leftarrow a}=1\mid A=a,X=x)=P(R_{A\leftarrow b}=1\mid A=a,X=x),\quad \forall a,b;}

es decir: se toma un individuo al azar con un atributo sensibleA=a{\displaystyle A=a}y otras característicasincógnita=incógnita{\displaystyle X=x}y la misma persona si ella tuvieraA=b{\displaystyle A=b}, deberían tener la misma oportunidad de ser aceptados. El símboloR^Aa{\displaystyle {\hat {R}}_{A\leftarrow a}}representa la variable aleatoria contrafactualR{\displaystyle R}en el escenario donde el atributo sensibleA{\displaystyle A}está fijo aA=a{\displaystyle A=a}El condicionamiento enA=a,incógnita=incógnita{\displaystyle A=a,X=x}significa que este requisito se da a nivel individual, ya que estamos condicionando a todas las variables que identifican una sola observación.

Los modelos de aprendizaje automático a menudo se entrenan con datos donde el resultado dependía de la decisión tomada en ese momento. [ 47 ] Por ejemplo, si un modelo de aprendizaje automático tiene que determinar si un recluso reincidirá y si debe ser liberado anticipadamente, el resultado podría depender de si el recluso fue liberado anticipadamente o no. Mishler et al. [ 48 ] proponen una fórmula para probabilidades contrafactuales igualadas:

PAG(R=1Y0=0,A=a)=PAG(R=1Y0=0,A=b)PAG(R=0Y1=1,A=a)=PAG(R=0Y1=1,A=b),a,b;{\displaystyle P(R=1\mid Y^{0}=0,A=a)=P(R=1\mid Y^{0}=0,A=b)\wedge P(R=0\mid Y^{1}=1,A=a)=P(R=0\mid Y^{1}=1,A=b),\quad \forall a,b;}

dóndeR{\displaystyle R}es una variable aleatoria,Yincógnita{\displaystyle Y^{x}}denota el resultado dado que la decisiónincógnita{\displaystyle x}fue tomada, yA{\displaystyle A}es una función delicada.

Plecko y Bareinboim [ 49 ] proponen un marco unificado para abordar el análisis causal de la equidad. Sugieren el uso de un Modelo de Equidad Estándar, que consiste en un grafo causal con 4 tipos de variables:

  • atributos sensibles (A{\displaystyle A}),
  • variable objetivo (Y{\displaystyle Y}),
  • mediadores (W{\displaystyle W}) entreA{\displaystyle A}yY{\displaystyle Y}, que representan posibles efectos indirectos de los atributos sensibles sobre el resultado,
  • variables que posiblemente comparten una causa común conA{\displaystyle A}(Z{\displaystyle Z}), que representan posibles efectos espurios (es decir, no causales) de los atributos sensibles sobre el resultado.

Dentro de este marco, Plecko y Bareinboim [ 49 ] pueden clasificar los posibles efectos que los atributos sensibles pueden tener en el resultado. Además, la granularidad con la que se miden estos efectos —es decir, las variables condicionantes utilizadas para promediar el efecto— está directamente relacionada con el aspecto de "individual frente a grupal" en la evaluación de la equidad.

Estrategias de mitigación de sesgos

La equidad se puede aplicar a los algoritmos de aprendizaje automático de tres maneras diferentes: preprocesamiento de datos , optimización durante el entrenamiento del software o postprocesamiento de los resultados del algoritmo.

Preprocesamiento

Por lo general, el clasificador no es el único problema; el conjunto de datos también está sesgado. La discriminación de un conjunto de datosD{\textstyle D}con respecto al grupoA=a{\textstyle A=a}se puede definir de la siguiente manera: disdoA=a(D)=|{incógnitaD|incógnita(A)a,incógnita(Y)=+}||{incógnitaD|incógnita(A)a}||{incógnitaD|incógnita(A)=a,incógnita(Y)=+}||{incógnitaD|incógnita(A)=a}|{\displaystyle disc_{A=a}(D)={\frac {|\{X\in D|X(A)\neq a,X(Y)=+\}|}{|\{X\in D|X(A)\neq a\}|}}-{\frac {|\{X\in D|X(A)=a,X(Y)=+\}|}{|\{X\in D|X(A)=a\}|}}}

Es decir, una aproximación a la diferencia entre las probabilidades de pertenecer a la clase positiva dado que el sujeto tiene una característica protegida diferente dea{\textstyle a}y igual aa{\textstyle a}.

Los algoritmos que corrigen el sesgo durante el preprocesamiento eliminan información sobre las variables del conjunto de datos que podría dar lugar a decisiones injustas, procurando alterarlas lo menos posible. Esto no es tan sencillo como eliminar la variable sensible, ya que otros atributos pueden estar correlacionados con la variable protegida.

Una forma de lograrlo es asignar a cada individuo del conjunto de datos inicial una representación intermedia en la que sea imposible identificar si pertenece a un grupo protegido específico, conservando al mismo tiempo la mayor cantidad de información posible. Luego, la nueva representación de los datos se ajusta para obtener la máxima precisión en el algoritmo.

De esta forma, los individuos se transforman en una nueva representación multivariable donde la probabilidad de que un miembro de un grupo protegido se asigne a un valor determinado en la nueva representación es la misma que la de un individuo que no pertenece a dicho grupo. Posteriormente, esta representación se utiliza para obtener la predicción para el individuo, en lugar de los datos iniciales. Dado que la representación intermedia se construye asignando la misma probabilidad a los individuos que pertenecen o no al grupo protegido, este atributo queda oculto para el clasificador.

Un ejemplo se explica en Zemel et al. [ 50 ] , donde se utiliza una variable aleatoria multinomial como representación intermedia. En este proceso, se busca que el sistema conserve toda la información, excepto aquella que pueda llevar a decisiones sesgadas, y que obtenga una predicción lo más precisa posible.

Por un lado, este procedimiento tiene la ventaja de que los datos preprocesados ​​pueden utilizarse para cualquier tarea de aprendizaje automático. Además, no es necesario modificar el clasificador, ya que la corrección se aplica al conjunto de datos antes del procesamiento. Por otro lado, los otros métodos obtienen mejores resultados en cuanto a precisión y equidad.

Repesado

El reponderado es un ejemplo de algoritmo de preprocesamiento. La idea es asignar un peso a cada punto del conjunto de datos de tal manera que la discriminación ponderada sea 0 con respecto al grupo designado. [ 51 ]

Si el conjunto de datosD{\textstyle D}La variable sensible no estaba sesgadaA{\textstyle A}y la variable objetivoY{\textstyle Y}serían estadísticamente independientes y la probabilidad de la distribución conjunta sería el producto de las probabilidades de la siguiente manera: PAGmiincógnitapag(A=aY=+)=PAG(A=a)×PAG(Y=+)=|{incógnitaD|incógnita(A)=a}||D|×|{incógnitaD|incógnita(Y)=+}||D|{\displaystyle P_{exp}(A=a\wedge Y=+)=P(A=a)\times P(Y=+)={\frac {|\{X\in D|X(A)=a\}|}{|D|}}\times {\frac {|\{X\in D|X(Y)=+\}|}{|D|}}}

En realidad, sin embargo, el conjunto de datos no es imparcial y las variables no son estadísticamente independientes, por lo que la probabilidad observada es: PAGobs(A=aY=+)=|{incógnitaD|incógnita(A)=aincógnita(Y)=+}||D|{\displaystyle P_{obs}(A=a\wedge Y=+)={\frac {|\{X\in D|X(A)=a\wedge X(Y)=+\}|}{|D|}}}

Para compensar el sesgo, el software agrega un peso , menor para los objetos favorecidos y mayor para los objetos no favorecidos. Para cadaincógnitaD{\textstyle X\in D}obtenemos: W(incógnita)=PAGmiincógnitapag(A=incógnita(A)Y=incógnita(Y))PAGobs(A=incógnita(A)Y=incógnita(Y)){\displaystyle W(X)={\frac {P_{exp}(A=X(A)\wedge Y=X(Y))}{P_{obs}(A=X(A)\wedge Y=X(Y))}}}

Cuando tenemos para cadaincógnita{\textstyle X}un peso asociadoW(incógnita){\textstyle W(X)}calculamos la discriminación ponderada con respecto al grupoA=a{\textstyle A=a}como sigue: disdoA=a(D)=W(incógnita)incógnita{incógnitaD|incógnita(A)a,incógnita(Y)=+}W(incógnita)incógnita{incógnitaD|incógnita(A)a}W(incógnita)incógnita{incógnitaD|incógnita(A)=a,incógnita(Y)=+}W(incógnita)incógnita{incógnitaD|incógnita(A)=a}{\displaystyle disc_{A=a}(D)={\frac {\sum W(X)X\in \{X\in D|X(A)\neq a,X(Y)=+\}}{\sum W(X)X\in \{X\in D|X(A)\neq a\}}}-{\frac {\sum W(X)X\in \{X\in D|X(A)=a,X(Y)=+\}}{\sum W(X)X\in \{X\in D|X(A)=a\}}}}

Se puede demostrar que, tras reponderar, esta discriminación ponderada es 0.

Procesamiento de ingreso

Otro enfoque consiste en corregir el sesgo durante el entrenamiento. Esto se puede lograr añadiendo restricciones al objetivo de optimización del algoritmo. [ 52 ] Estas restricciones obligan al algoritmo a mejorar la equidad, manteniendo las mismas tasas de ciertas medidas para el grupo protegido y el resto de los individuos. Por ejemplo, podemos añadir al objetivo del algoritmo la condición de que la tasa de falsos positivos sea la misma para los individuos del grupo protegido y los que no lo son.

Las principales medidas utilizadas en este enfoque son la tasa de falsos positivos, la tasa de falsos negativos y la tasa general de errores de clasificación. Es posible añadir una o varias de estas restricciones a la función objetivo del algoritmo. Cabe destacar que la igualdad de las tasas de falsos negativos implica la igualdad de las tasas de verdaderos positivos, lo que a su vez implica igualdad de oportunidades. Tras añadir las restricciones al problema, este puede volverse intratable, por lo que podría ser necesario flexibilizarlas.

eliminación de sesgos adversariales

Entrenamos dos clasificadores al mismo tiempo mediante algún método basado en gradientes (por ejemplo, descenso de gradiente ). El primero, el predictor, intenta realizar la tarea de predecirY{\textstyle Y}, la variable objetivo, dadoincógnita{\textstyle X}, la entrada, modificando sus pesosW{\textstyle W}para minimizar alguna función de pérdidaLPAG(y^,y){\textstyle L_{P}({\hat {y}},y)}. El segundo, el adversario intenta lograr la tarea de predecirA{\textstyle A}, la variable sensible, dadoY^{\textstyle {\hat {Y}}}modificando sus pesosU{\textstyle U}para minimizar alguna función de pérdidaLA(a^,a){\textstyle L_{A}({\hat {a}},a)}. [ 53 ] Un punto importante aquí es que, para propagarse correctamente,Y^{\textstyle {\hat {Y}}}arriba debe referirse a la salida bruta del clasificador, no a la predicción discreta; por ejemplo, con una red neuronal artificial y un problema de clasificación,Y^{\textstyle {\hat {Y}}}podría referirse a la salida de la capa softmax .

Luego actualizamosU{\textstyle U}minimizarLA{\textstyle L_{A}}en cada paso de entrenamiento según el gradienteULA{\textstyle \nabla _{U}L_{A}}y modificamosW{\textstyle W}Según la expresión: WLPAGpagrojWLAWLPAGαWLA{\displaystyle \nabla _{W}L_{P}-proj_{\nabla _{W}L_{A}}\nabla _{W}L_{P}-\alpha \nabla _{W}L_{A}} dóndeα\alphaes un hiperparámetro ajustable que puede variar en cada paso de tiempo.

Representación gráfica de los vectores utilizados en la eliminación de sesgos adversarios como se muestra en Zhang et al. [ 53 ]

La idea intuitiva es que queremos que el predictor intente minimizarLPAG{\textstyle L_{P}}(por lo tanto el términoWLPAG{\textstyle \nabla _{W}L_{P}}) mientras que, al mismo tiempo, maximizarLA{\textstyle L_{A}}(por lo tanto el términoαWLA{\textstyle -\alpha \nabla _{W}L_{A}}), de modo que el adversario no logre predecir la variable sensible de Y^{\textstyle {\hat {Y}}}.

El términopagrojWLAWLPAG{\textstyle -proj_{\nabla _{W}L_{A}}\nabla _{W}L_{P}}impide que el predictor se mueva en una dirección que ayude al adversario a disminuir su función de pérdida.

Se puede demostrar que entrenar un modelo de clasificación predictiva con este algoritmo mejora la paridad demográfica con respecto a entrenarlo sin el adversario .

Postprocesamiento

El método final busca corregir los resultados de un clasificador para lograr equidad. En este método, contamos con un clasificador que devuelve una puntuación para cada individuo y necesitamos realizar una predicción binaria para cada uno. Las puntuaciones altas tienden a obtener un resultado positivo, mientras que las bajas tienden a obtener uno negativo, pero podemos ajustar el umbral para determinar cuándo responder afirmativamente según sea necesario. Cabe destacar que las variaciones en el valor del umbral afectan el equilibrio entre las tasas de verdaderos positivos y verdaderos negativos.

Si la función de puntuación es justa en el sentido de que es independiente del atributo protegido, entonces cualquier elección del umbral también será justa, pero los clasificadores de este tipo tienden a ser sesgados, por lo que puede ser necesario un umbral diferente para cada grupo protegido para lograr la equidad. [ 54 ] Una forma de hacer esto es graficar la tasa de verdaderos positivos frente a la tasa de falsos negativos en varios ajustes de umbral (esto se llama curva ROC ) y encontrar un umbral donde las tasas para el grupo protegido y los demás individuos sean iguales. [ 54 ]

Clasificación basada en opciones de rechazo

Dado un clasificador ,PAG(+|incógnita){\textstyle P(+|X)}sea ​​la probabilidad calculada por los clasificadores como la probabilidad de que la instanciaincógnita{\textstyle X}pertenece a la clase positiva +. CuandoPAG(+|incógnita){\textstyle P(+|X)}está cerca de 1 o de 0, la instanciaincógnita{\textstyle X}se especifica con un alto grado de certeza que pertenece a la clase + o – respectivamente. Sin embargo, cuandoPAG(+|incógnita){\textstyle P(+|X)}Cuanto más cerca de 0,5 la clasificación es menos clara. [ 55 ]

Decimosincógnita{\textstyle X}es una "instancia rechazada" simetroaincógnita(PAG(+|incógnita),1PAG(+|incógnita))θ{\textstyle max(P(+|X),1-P(+|X))\leq \theta }con ciertaθ{\textstyle \theta }de tal manera que0,5<θ<1{\textstyle 0.5<\theta <1}.

El algoritmo de "ROC" consiste en clasificar las instancias no rechazadas siguiendo la regla anterior y las instancias rechazadas de la siguiente manera: si la instancia es un ejemplo de un grupo desfavorecido (incógnita(A)=a{\displaystyle X(A)=a}) entonces etiquételo como positivo, de lo contrario, etiquételo como negativo.

Podemos optimizar diferentes medidas de discriminación (enlace) como funciones deθ{\textstyle \theta }para encontrar el óptimoθ{\textstyle \theta }para cada problema y evitar discriminar al grupo privilegiado. [ 55 ]

Véase también

Referencias

  1. Caton, Simon; Haas, Christian (2024). "Equidad en el aprendizaje automático: una revisión". ACM Computing Surveys . 56 (7): 1– 38. arXiv : 2010.04053 . doi : 10.1145/3616865 .
  2. 1 2 Mattu, Julia Angwin, Jeff Larson, Lauren Kirchner, Surya. "Sesgo de máquina" . ProPublica . Recuperado el 16 de abril de 2022 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  3. Friedler, Sorelle A.; Scheidegger, Carlos; Venkatasubramanian, Suresh (abril de 2021). "La (im)posibilidad de la equidad: diferentes sistemas de valores requieren diferentes mecanismos para la toma de decisiones justas" . Communications of the ACM . 64 (4): 136– 143. doi : 10.1145/3433949 . ISSN 0001-0782 . S2CID 1769114 .  
  4. 1 2 Mehrabi, Ninareh; Morstatter, Fred; Saxena, Nripsuta; Lerman, Kristina; Galstyan, Aram (13 de julio de 2021). "Una revisión sobre el sesgo y la equidad en el aprendizaje automático" . ACM Computing Surveys . 54 (6): 115:1–115:35. arXiv : 1908.09635 . doi : 10.1145/3457607 . ISSN 0360-0300 . S2CID 201666566 .  
  5. "AI Fairness 360" . aif360.mybluemix.net . Archivado del original el 29 de junio de 2022. Consultado el 18 de noviembre de 2022 .
  6. "El kit de herramientas de código abierto IBM AI Fairness 360 añade nuevas funcionalidades" . Tech Republic. 4 de junio de 2020.
  7. "Prácticas de IA responsable" . Google AI . Consultado el 18 de noviembre de 2022 .
  8. Indicadores de equidad , tensorflow, 10 de noviembre de 2022 , consultado el 18 de noviembre de 2022
  9. "Cómo estamos utilizando Fairness Flow para ayudar a crear una IA que funcione mejor para todos" . ai.facebook.com . Consultado el 18 de noviembre de 2022 .
  10. "Expertos en IA advierten que la herramienta anti-sesgos de Facebook es 'completamente insuficiente'"" . VentureBeat . 31 de marzo de 2021 . Consultado el 18 de noviembre de 2022 .
  11. Hutchinson, Ben; Mitchell, Margaret (29 de enero de 2019). «50 años de (in)justicia en las pruebas». Actas de la Conferencia sobre Equidad, Responsabilidad y Transparencia . Nueva York, NY, EE. UU.: ACM FAT*'19. págs. 49–58 . arXiv : 1811.10104 . doi : 10.1145/3287560.3287600 . ISBN  9781450361255.
  12. 1 2 3 Luo, Queenie; Puett, Michael J.; Smith, Michael D. (23 de mayo de 2023), Un espejo de perspectiva del elefante: investigación del sesgo lingüístico en Google, ChatGPT, Wikipedia y YouTube , arXiv : 2303.16281
  13. Kotek, Hadas; Dockum, Rikker; Sun, David (5 de noviembre de 2023). «Sesgo de género y estereotipos en modelos de lenguaje a gran escala» . Actas de la Conferencia de Inteligencia Colectiva de la ACM . CI '23. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 12-24 . arXiv : 2308.14921 . doi : 10.1145/3582269.3615599 . ISBN  979-8-4007-0113-9.
  14. "Utilización de métodos basados ​​en datos para identificar el sesgo de género en los perfiles de LinkedIn" . Procesamiento y gestión de la información . 60 (5) 103423. Procesamiento y gestión de la información 60(5),103423, 2023. 2023. doi : 10.1016/j.ipm.2023.103423 .
  15. Zhou, Karen; Tan, Chenhao (diciembre de 2023). Bouamor, Houda; Pino, Juan; Bali, Kalika (eds.). "Evaluación basada en entidades del sesgo político en la generación automática de resúmenes" . Hallazgos de la Asociación para la Lingüística Computacional: EMNLP 2023. Singapur: Asociación para la Lingüística Computacional: 10374–10386 . arXiv : 2305.02321 . doi : 10.18653/v1/2023.findings-emnlp.696 .
  16. "El Fiscal General Eric Holder interviene en la 57.ª Reunión Anual de la Asociación Nacional de Abogados de Defensa Penal y en la 13.ª Conferencia de la Red Estatal de Justicia Penal" . www.justice.gov . 1 de agosto de 2014. Consultado el 16 de abril de 2022 .
  17. Dieterich, William; Mendoza, Christina; Brennan, Tim (2016). "Escalas de riesgo COMPAS: demostrando precisión, equidad y paridad predictiva" (PDF) . Northpointe Inc.
  18. Angwin, Jeff Larson, Julia (29 de julio de 2016). "Respuesta técnica a Northpointe" . ProPublica . Recuperado el 18 de noviembre de 2022 .{{cite web}}: CS1 maint: varios nombres: lista de autores ( enlace )
  19. Rose, Adam (22 de enero de 2010). "¿Son racistas las cámaras de detección facial?" . Time . ISSN 0040-781X . Consultado el 18 de noviembre de 2022 . 
  20. "Google pide disculpas por el etiquetado automático racista en su aplicación de fotos" . The Guardian . 1 de julio de 2015. Consultado el 16 de abril de 2022 .
  21. "Un concurso de belleza fue juzgado por IA y a los robots no les gustó la piel oscura" . The Guardian . 8 de septiembre de 2016. Consultado el 16 de abril de 2022 .
  22. 1 2 Buolamwini, Joy ; Gebru, Timnit (febrero de 2018). Tonos de género: Disparidades de precisión interseccional en la clasificación comercial de género (PDF) . Conferencia sobre equidad, rendición de cuentas y transparencia. Nueva York, NY, EE. UU. pp. 77–91 . 
  23. "Estudiante demuestra el 'sesgo' del algoritmo de Twitter hacia rostros más claros, delgados y jóvenes" . The Guardian . 10 de agosto de 2021. Consultado el 18 de noviembre de 2022 .
  24. ^ openai/dalle-2-preview , OpenAI, 17 de noviembre de 2022 , consultado el 18 de noviembre de 2022
  25. "No hay solución rápida: cómo DALL·E 2 de OpenAI ilustró los desafíos del sesgo en la IA" . NBC News . 27 de julio de 2022. Consultado el 23 de julio de 2024 .
  26. "Amazon elimina una herramienta secreta de reclutamiento con IA que mostraba sesgos contra las mujeres" . Reuters . 10 de octubre de 2018. Consultado el 18 de noviembre de 2022 .
  27. "El algoritmo de Apple Card desata acusaciones de sesgo de género contra Goldman Sachs" . Washington Post . ISSN 0190-8286 . Consultado el 18 de noviembre de 2022 . 
  28. Martínez, Emmanuel; Kirchner, Lauren (25 de agosto de 2021). "El sesgo secreto oculto en los algoritmos de aprobación de hipotecas: The Markup" . themarkup.org . Consultado el 18 de noviembre de 2022 .
  29. Ruggieri, Salvatore; Alvarez, Jose M.; Pugnana, Andrea; State, Laura; Turini, Franco (26 de junio de 2023). "¿Podemos confiar en la IA justa?" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 37 (13). Asociación para el Avance de la Inteligencia Artificial (AAAI): 15421– 15430. doi : 10.1609/aaai.v37i13.26798 . hdl : 11384/136444 . ISSN 2374-3468 . S2CID 259678387 .  
  30. ^ Buyl, Martín; De Bie, Tijl (2022). "Limitaciones inherentes a la equidad de la IA". Comunicaciones de la ACM . 67 (2): 48– 55. arXiv : 2212.06495 . doi : 10.1145/3624700 . hdl : 1854/LU-01GMNH04RGNVWJ730BJJXGCY99 .
  31. Castelnovo, Alessandro; Inverardi, Nicole; Nanino, Gabriele; Penco, Ilaria Giuseppina; Regoli, Daniele (2023). "¿Suficientemente justo? Un mapa de las limitaciones actuales de los requisitos para tener algoritmos "justos". arXiv : 2311.12435 [ cs.AI ].
  32. Gaudeul, Alexia; Arrigoni, Ottla; Charisi, Vicky ; Escobar-Planas, Marina; Hupont, Isabelle (2024), "Understanding the Impact of Human Oversight on Discriminatory Outcomes in AI-Supported Decision-Making", ECAI 2024 , Frontiers in Artificial Intelligence and Applications, IOS Press, pp. 1067–1074 , doi : 10.3233/faia240598 , ISBN  978-1-64368-548-9
  33. 1 2 3 4 Solon Barocas; Moritz Hardt; Arvind Narayanan, Equidad y aprendizaje automático . Recuperado el 15 de diciembre de 2019.
  34. Mayes, Elizabeth (2001). Manual de calificación crediticia . Nueva York, NY, EE. UU.: Glenlake Publishing. pág. 282. ISBN  0-8144-0619-X.
  35. Berk, Richard; Heidari, Hoda; Jabbari, Shahin; Kearns, Michael; Roth, Aaron (febrero de 2021). "Equidad en las evaluaciones de riesgo de justicia penal: estado del arte" . Sociological Methods & Research . 50 (1): 3– 44. arXiv : 1703.09207 . doi : 10.1177/0049124118782533 . ISSN 0049-1241 . S2CID 12924416 .  
  36. 1 2 Räz, Tim (3 de marzo de 2021). «Equidad grupal: una revisión de la independencia» . Actas de la Conferencia ACM de 2021 sobre equidad, rendición de cuentas y transparencia . ACM. págs. 129–137 . arXiv : 2101.02968 . doi : 10.1145/3442188.3445876 . ISBN  978-1-4503-8309-7. S2CID 231667399 . 
  37. 1 2 3 Verma, Sahil; Rubin, Julia (2018). "Definiciones de equidad explicadas" . Actas del Taller Internacional sobre Equidad en el Software . págs. 1–7 . doi : 10.1145/3194770.3194776 . ISBN  9781450357463. S2CID 49561627 . 
  38. Gursoy, Furkan; Kakadiaris, Ioannis A. (noviembre de 2022). «Equidad de confusión igualitaria: medición de disparidades basadas en grupos en sistemas de decisión automatizados». 2022 IEEE International Conference on Data Mining Workshops (ICDMW) . IEEE. págs. 137–146 . arXiv : 2307.00472 . doi : 10.1109/ICDMW58026.2022.00027 . ISBN  979-8-3503-4609-1. S2CID 256669476 . 
  39. Chen, Violet (Xinying); Hooker, JN (2021). "Equidad basada en el bienestar a través de la optimización". arXiv : 2102.00311 [ cs.AI ].
  40. Mullainathan, Sendhil (19 de junio de 2018). Equidad algorítmica y la función de bienestar social . Conferencia magistral en la 19.ª Conferencia ACM sobre Economía y Computación (EC'18) . YouTube. Minuto 48. En otras palabras, si tienes una función de bienestar social donde lo que te importa es el daño, y te importa el daño a los afroamericanos, ahí lo tienes: 12 por ciento menos de afroamericanos en la cárcel de la noche a la mañana... Antes de entrar en las minucias del daño relativo, la función de bienestar se define en daño absoluto, por lo que en realidad deberíamos calcular primero el daño absoluto.
  41. Mitchell, Shira; Potash, Eric; Barocas, Solon; d'Amour, Alexander; Lum, Kristian (2021). "Equidad algorítmica: elecciones, supuestos y definiciones" . Annual Review of Statistics and Its Application . 8 (1): 141– 163. arXiv : 1811.07867 . Bibcode : 2021AnRSA...8..141M . doi : 10.1146/annurev-statistics-042720-125902 . S2CID 228893833 . 
  42. Castelnovo, Alejandro; Crupi, Ricardo; Greco, Greta; Regoli, Daniele; Penco, Ilaria Giuseppina; Cosentini, Andrea Claudio (2022). "Una aclaración de los matices en el panorama de las métricas de equidad" . Informes científicos . 12 (1): 4209. arXiv : 2106.00467 . Código Bib : 2022NatSR..12.4209C . doi : 10.1038/s41598-022-07939-1 . PMC 8913820 . PMID 35273279 .  
  43. Mehrabi, Ninareh, Fred Morstatter, Nripsuta Saxena, Kristina Lerman y Aram Galstyan. «Una revisión sobre el sesgo y la equidad en el aprendizaje automático». ACM Computing Surveys (CSUR) 54, n.º 6 (2021): 1–35.
  44. Dwork, Cynthia; Hardt, Moritz; Pitassi, Toniann; Reingold, Omer; Zemel, Richard (2012). "Equidad a través de la conciencia" . Actas de la 3.ª Conferencia sobre Innovaciones en Ciencias de la Computación Teórica - ITCS '12 . págs. 214–226 . doi : 10.1145/2090236.2090255 . ISBN  9781450311151. S2CID 13496699 . 
  45. 1 2 Kusner, MJ, Loftus, J., Russell, C., & Silva, R. (2017). Equidad contrafactual . Avances en sistemas de procesamiento de información neuronal, 30.
  46. Galhotra, Sainyam; Brun, Yuriy; Meliou, Alexandra (2017). «Pruebas de equidad: Pruebas de software para detectar discriminación». Actas de la 11.ª Reunión Conjunta sobre Fundamentos de la Ingeniería de Software de 2017. págs. 498–510 . arXiv : 1709.03221 . doi : 10.1145/3106237.3106277 . ISBN  9781450351058. S2CID 6324652 . 
  47. Coston, Amanda; Mishler, Alan; Kennedy, Edward H.; Chouldechova, Alexandra (27 de enero de 2020). «Evaluaciones de riesgo contrafactuales, evaluación y equidad». Actas de la Conferencia de 2020 sobre Equidad, Responsabilidad y Transparencia . FAT* '20. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 582–593 . doi : 10.1145/3351095.3372851 . ISBN  978-1-4503-6936-7. S2CID 202539649 . 
  48. Mishler, Alan; Kennedy, Edward H.; Chouldechova, Alexandra (1 de marzo de 2021). «Equidad en los instrumentos de evaluación de riesgos». Actas de la Conferencia ACM de 2021 sobre equidad, rendición de cuentas y transparencia . FAccT '21. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 386–400 . doi : 10.1145/3442188.3445902 . ISBN  978-1-4503-8309-7. S2CID 221516412 . 
  49. 1 2 Plecko, Drago; Bareinboim, Elias (2022). "Análisis de equidad causal". arXiv : 2207.11385 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  50. Richard Zemel; Yu (Ledell) Wu; Kevin Swersky; Toniann Pitassi; Cyntia Dwork, Learning Fair Representations . Consultado el 1 de diciembre de 2019.
  51. Faisal Kamiran; Toon Calders, Técnicas de preprocesamiento de datos para la clasificación sin discriminación . Consultado el 17 de diciembre de 2019.
  52. Muhammad Bilal Zafar; Isabel Valera; Manuel Gómez Rodríguez; Krishna P. Gummadi, Equidad más allá del trato discriminatorio y el impacto discriminatorio: Aprendizaje de la clasificación sin maltrato discriminatorio . Recuperado el 1 de diciembre de 2019.
  53. 1 2 Brian Hu Zhang; Blake Lemoine; Margaret Mitchell, Mitigating Unwanted Biases with Adversarial Learning . Consultado el 17 de diciembre de 2019.
  54. 1 2 Moritz Hardt; Eric Price; Nathan Srebro, Igualdad de oportunidades en el aprendizaje supervisado . Consultado el 1 de diciembre de 2019.
  55. 1 2 Faisal Kamiran; Asim Karim; Xiangliang Zhang, Teoría de la decisión para la clasificación con discriminación . Consultado el 17 de diciembre de 2019.