Articulo de referencia

Privacidad diferencial

Una definición informal de privacidad diferencial La privacidad diferencial ( PD ) es un marco matemáticamente riguroso para divulgar información estadística sobre conjuntos de ...

Una definición informal de privacidad diferencial

La privacidad diferencial ( PD ) es un marco matemáticamente riguroso para divulgar información estadística sobre conjuntos de datos, protegiendo al mismo tiempo la privacidad de los sujetos de datos individuales. Permite al poseedor de datos compartir patrones agregados del grupo, limitando la información que se filtra sobre individuos específicos. [ 1 ] [ 2 ] Esto se logra inyectando ruido cuidadosamente calibrado en los cálculos estadísticos, de manera que se preserve la utilidad de la estadística, limitando de forma demostrable lo que se puede inferir sobre cualquier individuo en el conjunto de datos.

Otra forma de describir la privacidad diferencial es como una restricción en los algoritmos utilizados para publicar información agregada sobre una base de datos estadística, que limita la divulgación de información privada de los registros en dicha base de datos. Por ejemplo, algunas agencias gubernamentales utilizan algoritmos de privacidad diferencial para publicar información demográfica u otros datos estadísticos agregados, garantizando al mismo tiempo la confidencialidad de las respuestas a las encuestas; y las empresas los utilizan para recopilar información sobre el comportamiento de los usuarios, controlando lo que es visible incluso para los analistas internos.

En términos generales, un algoritmo es diferencialmente privado si un observador que ve su resultado no puede determinar si la información de un individuo en particular se utilizó en el cálculo. La privacidad diferencial se suele abordar en el contexto de la identificación de individuos cuya información puede estar en una base de datos. Si bien no se refiere directamente a los ataques de identificación y reidentificación, los algoritmos diferencialmente privados resisten de manera demostrable dichos ataques. [ 3 ]

privacidad diferencial ε

Una definición formal de privacidad diferencial ε.D1{\displaystyle D_{1}}es un conjunto de datos sin los datos privados yD2{\displaystyle D_{2}}es uno con ello. Esto es "privacidad diferencial ε pura", lo que significa δ=0.

El artículo de Cynthia Dwork , Frank McSherry , Kobbi Nissim y Adam D. Smith de 2006 [ 3 ] introdujo el concepto de privacidad diferencial ε, una definición matemática de la pérdida de privacidad asociada con cualquier divulgación de datos extraídos de una base de datos estadística . [ 4 ] (Aquí, el término base de datos estadística se refiere a un conjunto de datos que se recopilan bajo el compromiso de confidencialidad con el propósito de producir estadísticas que, al producirse, no comprometan la privacidad de las personas que proporcionaron los datos).

La definición de privacidad diferencial ε requiere que un cambio en una entrada de una base de datos solo genere un pequeño cambio en la distribución de probabilidad de los resultados de las mediciones, tal como lo percibe el atacante. [ 3 ] La intuición detrás de la definición de privacidad diferencial ε es que la privacidad de una persona no puede verse comprometida por una divulgación estadística si sus datos no se encuentran en la base de datos. [ 5 ] En la privacidad diferencial, a cada individuo se le otorga aproximadamente la misma privacidad que resultaría de la eliminación de sus datos. [ 5 ] Es decir, las funciones estadísticas ejecutadas en la base de datos no deberían verse afectadas sustancialmente por la eliminación, adición o cambio de ningún individuo en los datos. [ 5 ]

La contribución de cada individuo al resultado de una consulta a una base de datos depende, en parte, de la cantidad de datos de personas involucradas en la consulta. Si la base de datos contiene datos de una sola persona, los datos de esa persona contribuyen al 100%. Si la base de datos contiene datos de cien personas, los datos de cada persona contribuyen solo al 1%. La idea clave de la privacidad diferencial es que, a medida que la consulta se realiza sobre los datos de menos personas, se necesita agregar más ruido al resultado de la consulta para producir el mismo nivel de privacidad. De ahí el nombre del artículo de 2006, "Calibrating Noise to Sensitivity in Private Data Analysis " ( Calibrando el ruido a la sensibilidad en el análisis de datos privados). [ 3 ]

Definición

Sea ε un número real positivo yA{\displaystyle {\mathcal {A}}}Sea un algoritmo aleatorio que toma un conjunto de datos como entrada (que representa las acciones de la parte de confianza que posee los datos).soy A{\displaystyle {\textrm {im}}\ {\mathcal {A}}}denota la imagen deA{\displaystyle {\mathcal {A}}}.

El algoritmoA{\displaystyle {\mathcal {A}}}Se dice que proporciona privacidad diferencial (ε, δ) si, para todos los conjuntos de datosD1{\displaystyle D_{1}}yD2{\displaystyle D_{2}}que difieren en un solo elemento (es decir, los datos de una persona) y todos los subconjuntosS{\displaystyle S}desoy A{\displaystyle {\textrm {im}}\ {\mathcal {A}}}:

Pr[A(D1)S]miεPr[A(D2)S]+δ.{\displaystyle \Pr[{\mathcal {A}}(D_{1})\in S]\leq e^{\varepsilon }\Pr[{\mathcal {A}}(D_{2})\in S]+\delta .}

donde la probabilidad se toma sobre la aleatoriedad utilizada por el algoritmo. [ 6 ] Esta definición a veces se denomina "privacidad diferencial aproximada", siendo la "privacidad diferencial pura" un caso especial cuandoδ=0{\displaystyle \delta =0}En este último caso, se suele decir que el algoritmo satisface la privacidad diferencial ε (es decir, omiteδ=0{\displaystyle \delta =0}).

La privacidad diferencial ofrece garantías sólidas y robustas que facilitan el diseño modular y el análisis de mecanismos de privacidad diferencial debido a su capacidad de composición , su robustez ante el posprocesamiento y su degradación gradual en presencia de datos correlacionados .

Ejemplo

Según esta definición, la privacidad diferencial es una condición del mecanismo de divulgación (es decir, la entidad de confianza que divulga la información sobre el conjunto de datos) y no del conjunto de datos en sí. Intuitivamente, esto significa que, para dos conjuntos de datos similares, un algoritmo con privacidad diferencial se comportará de forma prácticamente idéntica en ambos. Esta definición ofrece una sólida garantía de que la presencia o ausencia de un individuo no afectará significativamente el resultado final del algoritmo.

Por ejemplo, supongamos que tenemos una base de datos de registros médicos.D1{\displaystyle D_{1}}donde cada registro es un par ( Nombre , X ), dondeincógnita{\displaystyle X}es un valor booleano que indica si una persona tiene diabetes o no. Por ejemplo:

Ahora supongamos que un usuario malicioso (a menudo denominado adversario ) quiere averiguar si Chandler tiene diabetes o no. Supongamos también que sabe en qué fila de la base de datos reside Chandler. Ahora supongamos que al adversario solo se le permite usar una forma particular de consulta.Qi{\displaystyle Q_{i}}que devuelve la suma parcial de la primerai{\displaystyle i}filas de columnaincógnita{\displaystyle X}en la base de datos. Para averiguar el estado de diabetes de Chandler, el adversario ejecutaQ5(D1){\displaystyle Q_{5}(D_{1})}yQ4(D1){\displaystyle Q_{4}(D_{1})}, luego calcula su diferencia. En este ejemplo,Q5(D1)=3{\displaystyle Q_{5}(D_{1})=3}yQ4(D1)=2{\displaystyle Q_{4}(D_{1})=2}Por lo tanto, su diferencia es 1. Esto indica que el campo "Tiene diabetes" en la fila de Chandler debe ser 1. Este ejemplo resalta cómo la información individual puede verse comprometida incluso sin consultar explícitamente la información de una persona específica.

Continuando con este ejemplo, si construimosD2{\displaystyle D_{2}}Al reemplazar (Chandler, 1) con (Chandler, 0), este adversario malicioso podrá distinguirD2{\displaystyle D_{2}}deD1{\displaystyle D_{1}}mediante computaciónQ5Q4{\displaystyle Q_{5}-Q_{4}}para cada conjunto de datos. Si el adversario estuviera obligado a recibir los valoresQi{\displaystyle Q_{i}}a través de unε{\displaystyle \varepsilon }-algoritmo de privacidad diferencial, para un suficientemente pequeñoε{\displaystyle \varepsilon }, entonces no podría distinguir entre los dos conjuntos de datos.

Componibilidad y robustez ante el procesamiento posterior

La componibilidad se refiere al hecho de que la distribución conjunta de las salidas de mecanismos diferencialmente privados (posiblemente elegidos de forma adaptativa) satisface la privacidad diferencial. [ 3 ]

  • Composición secuencial. Si consultamos un mecanismo de privacidad diferencial εt{\displaystyle t}veces, y la aleatorización del mecanismo es independiente para cada consulta, entonces el resultado seríaεt{\displaystyle \varepsilon t}-privacidad diferencial. En el caso más general, si haynorte{\displaystyle n}mecanismos independientes:METRO1,,METROnorte{\displaystyle {\mathcal {M}}_{1},\dots ,{\mathcal {M}}_{n}}, cuyas garantías de privacidad sonε1,,εnorte{\displaystyle \varepsilon _ {1},\dots,\varepsilon _ {n}}privacidad diferencial, respectivamente, entonces cualquier funcióngramo{\displaystyle g}de ellos:gramo(METRO1,,METROnorte){\displaystyle g({\mathcal {M}}_{1},\dots ,{\mathcal {M}}_{n})}es(i=1norteεi){\displaystyle \left(\sum \limits _{i=1}^{n}\varepsilon _{i}\right)}-privacidad diferencial. [ 7 ]
  • Composición paralela. Si los mecanismos anteriores se calculan en subconjuntos disjuntos de la base de datos privada, entonces la funcióngramo{\displaystyle g}sería(máximoiεi){\displaystyle (\max _ {i}\varepsilon _ {i})}-privacidad diferencial en su lugar. [ 7 ]

La otra propiedad importante para el uso modular de la privacidad diferencial es la robustez al posprocesamiento. Esto se define como que para cualquier función determinista o aleatoriaF{\displaystyle F}definido sobre la imagen del mecanismoA{\displaystyle {\mathcal {A}}}, siA{\displaystyle {\mathcal {A}}}satisface la privacidad diferencial ε, al igual queF(A){\displaystyle F({\mathcal {A}})}. [ 3 ]

La propiedad de composición permite la construcción modular y el análisis de mecanismos con privacidad diferencial [ 3 ] y motiva el concepto de presupuesto de pérdida de privacidad . Si todos los elementos que acceden a datos sensibles de un mecanismo complejo son individualmente con privacidad diferencial, también lo será su combinación, seguida de un posprocesamiento arbitrario. [ 3 ]

Privacidad del grupo

En general, la privacidad diferencial ε está diseñada para proteger la privacidad entre bases de datos vecinas que difieren solo en una fila. Esto significa que ningún adversario con información auxiliar arbitraria puede saber si un participante en particular envió su información. Sin embargo, esto también es extensible. [ 3 ] Es posible que queramos proteger bases de datos que difieren endo{\displaystyle c}filas, lo que equivale a que un adversario con información auxiliar arbitraria sepa sido{\displaystyle c}Particulares participantes enviaron su información. Esto se puede lograr porque sido{\displaystyle c}Los elementos cambian, la dilatación de probabilidad está limitada porexp(εdo){\displaystyle \exp(\varepsilon c)}en lugar deexp(ε){\displaystyle \exp(\varepsilon )}, [ 8 ] es decir, para D 1 y D 2 que difieren endo{\displaystyle c}elementos:Pr[A(D1)S]exp(εdo)Pr[A(D2)S]{\displaystyle \Pr[{\mathcal {A}}(D_{1})\in S]\leq \exp(\varepsilon c)\cdot \Pr[{\mathcal {A}}(D_{2})\in S]\,\!}Por lo tanto, estableciendo ε en su lugar aε/do{\displaystyle \varepsilon /c}logra el resultado deseado (protección dedo{\displaystyle c}elementos). [ 3 ] En otras palabras, en lugar de tener cada elemento ε-diferencialmente privado protegido, ahora cada grupo dedo{\displaystyle c}Los elementos están protegidos de forma ε-diferencialmente privada (y cada elemento es(ε/do){\displaystyle (\varepsilon /c)}-privacidad diferencial protegida). [ 3 ]

Interpretación de las pruebas de hipótesis

Se puede pensar en la privacidad diferencial como la limitación de las tasas de error en una prueba de hipótesis. Consideremos dos hipótesis:

  • H0{\displaystyle H_{0}}Los datos de este individuo no se encuentran en el conjunto de datos.
  • H1{\displaystyle H_{1}}: Los datos del individuo están en el conjunto de datos.

Entonces, hay dos tasas de error:

  • Tasa de falsos positivos (FPR): PAGFP=Pr[Adivinanzas del adversario H1H0 es verdad].{\displaystyle P_{\text{FP}}=\Pr[{\text{El adversario adivina }}H_{1}\mid H_{0}{\text{ es verdadero}}].}
  • Tasa de falsos negativos (FNR): PAGFN=Pr[Adivinanzas del adversario H0H1 es verdad].{\displaystyle P_{\text{FN}}=\Pr[{\text{El adversario supone que }}H_{0}\mid H_{1}{\text{ es verdadero}}].}

La protección ideal implicaría que ambas tasas de error son iguales, pero para una configuración fija (ε, δ), un atacante puede lograr las siguientes tasas: [ 9 ]

  • {(PAGFP,PAGFN)PAGFP+miεPAGFN1δ, miεPAGFP+PAGFN1δ}{\displaystyle \{(P_{\text{FP}},P_{\text{FN}})\mid P_{\text{FP}}+e^{\varepsilon }P_{\text{FN}}\geq 1-\delta ,\ e^{\varepsilon }P_{\text{FP}}+P_{\text{FN}}\geq 1-\delta \}}

Mecanismos ε-diferencialmente privados

Dado que la privacidad diferencial es un concepto probabilístico, cualquier mecanismo de privacidad diferencial es necesariamente aleatorio. Algunos de estos, como el mecanismo de Laplace, descrito más adelante, se basan en añadir ruido controlado a la función que queremos calcular. Otros, como el mecanismo exponencial [ 10 ] y el muestreo posterior [ 11 ], muestrean a partir de una familia de distribuciones que depende del problema.

Una definición importante con respecto a los mecanismos ε-diferencialmente privados es la sensibilidad. [ 3 ] Sead{\displaystyle d}sea ​​un número entero positivo,D{\displaystyle {\mathcal {D}}}ser una colección de conjuntos de datos, yF:DRd{\displaystyle f\colon {\mathcal {D}}\rightarrow \mathbb {R} ^{d}}ser una función. Una definición de la sensibilidad de una función, denotadaΔF{\displaystyle \Delta f}, puede definirse mediante: [ 3 ]ΔF=máximoF(D1)F(D2)1,{\displaystyle \Delta f=\max \lVert f(D_{1})-f(D_{2})\rVert _{1},}donde el máximo se calcula sobre todos los pares de conjuntos de datos.D1{\displaystyle D_{1}}yD2{\displaystyle D_{2}}enD{\displaystyle {\mathcal {D}}}difiriendo en como máximo un elemento y1{\displaystyle \lVert \cdot \rVert _{1}}denota la norma L1 . [ 3 ] En el ejemplo de la base de datos médica que se muestra a continuación, si consideramosF{\displaystyle f}ser la funciónQi{\displaystyle Q_{i}}Entonces, la sensibilidad de la función es uno, ya que cambiar cualquiera de las entradas en la base de datos hace que la salida de la función cambie en cero o en uno. Esto se puede generalizar a otros espacios métricos (medidas de distancia) y debe ser así para que ciertos algoritmos de privacidad diferencial funcionen, incluyendo la adición de ruido de la distribución gaussiana (que requiere la norma L2 ) en lugar de la distribución de Laplace . [ 3 ]

Existen técnicas (que se describen a continuación) mediante las cuales podemos crear un algoritmo de privacidad diferencial para funciones, con parámetros que varían según su sensibilidad. [ 3 ]

mecanismo de Laplace

Mecanismo de Laplace que ofrece privacidad diferencial de 0,5 para una función con sensibilidad 1.

El mecanismo de Laplace añade ruido de Laplace (es decir, ruido de la distribución de Laplace , que puede expresarse mediante una función de densidad de probabilidad).ruido(y)exp(|y|/λ){\displaystyle {\text{ruido}}(y)\propto \exp(-|y|/\lambda )\,\!}, que tiene media cero y desviación estándar2λ{\displaystyle {\sqrt {2}}\lambda \,\!}). Ahora, en nuestro caso, definimos la función de salida deA{\displaystyle {\mathcal {A}}\,\!}como una función de valor real (llamada como la salida de la transcripción porA{\displaystyle {\mathcal {A}}\,\!}) comoTA(incógnita)=F(incógnita)+Y{\displaystyle {\mathcal {T}}_{\mathcal {A}}(x)=f(x)+Y\,\!}dóndeYRegazo(λ){\displaystyle Y\sim {\text{Lap}}(\lambda )\,\!\,\!}yF{\displaystyle f\,\!}es la consulta/función original de valor real que planeábamos ejecutar en la base de datos. Ahora claramenteTA(incógnita){\displaystyle {\mathcal {T}}_{\mathcal {A}}(x)\,\!}puede considerarse una variable aleatoria continua, donde

pagdF(TA,D1(incógnita)=t)pagdF(TA,D2(incógnita)=t)=ruido(tF(D1))ruido(tF(D2)){\displaystyle {\frac {\mathrm {pdf} ({\mathcal {T}}_{{\mathcal {A}},D_{1}}(x)=t)}{\mathrm {pdf} ({\mathcal {T}}_{{\mathcal {A}},D_{2}}(x)=t)}}={\frac {{\text{noise}}(t-f(D_{1}))}{{\text{noise}}(t-f(D_{2}))}}\,\!}

que es como máximomi|F(D1)F(D2)|λmiΔ(F)λ{\displaystyle e^{\frac {|f(D_{1})-f(D_{2})|}{\lambda }}\leq e^{\frac {\Delta (f)}{\lambda }}\,\!}Podemos considerarΔ(F)λ{\displaystyle {\frac {\Delta (f)}{\lambda }}\,\!}ser el factor de privacidadε{\displaystyle \varepsilon \,\!}. De este modoT{\displaystyle {\mathcal {T}}\,\!}sigue un mecanismo de privacidad diferencial (como se puede ver en la definición anterior). Si intentamos usar este concepto en nuestro ejemplo de diabetes, entonces se deduce del hecho derivado anteriormente que para tenerA{\displaystyle {\mathcal {A}}\,\!}como elε{\displaystyle \varepsilon \,\!}-algoritmo de privacidad diferencial que necesitamos tenerλ=1/ε{\displaystyle \lambda =1/\varepsilon \,\!}Aunque aquí hemos utilizado el ruido de Laplace, se pueden emplear otras formas de ruido, como el ruido gaussiano, pero estas podrían requerir una ligera relajación de la definición de privacidad diferencial. [ 8 ]

Respuesta aleatoria

Un ejemplo sencillo, especialmente desarrollado en las ciencias sociales , [ 12 ] consiste en pedirle a una persona que responda a la pregunta "¿Posee usted el atributo A ?", según el siguiente procedimiento:

  1. Lanza una moneda .
  2. Si sale cara, vuelve a lanzar la moneda (ignorando el resultado) y responde a la pregunta con sinceridad.
  3. Si sale cruz, vuelve a lanzar la moneda y responde "Sí" si sale cara, "No" si sale cruz.

(El lanzamiento adicional, aparentemente redundante, del primer caso es necesario en situaciones donde el simple acto de lanzar una moneda puede ser observado por otros, aunque el resultado real permanezca oculto). La confidencialidad surge entonces de la posibilidad de refutar las respuestas individuales.

Pero, en general, estos datos con muchas respuestas son significativos, ya que las respuestas positivas son dadas a una cuarta parte de las personas que no tienen el atributo A y a tres cuartas partes de las personas que realmente lo poseen. Por lo tanto, si p es la proporción real de personas con A , entonces esperamos obtener (1/4)(1- p ) + (3/4) p = (1/4) + p /2 respuestas positivas. Por lo tanto, es posible estimar p .

En particular, si el atributo A es sinónimo de comportamiento ilegal, entonces responder "Sí" no es incriminatorio, siempre que la persona tenga una probabilidad de dar una respuesta "Sí", sea cual sea.

Aunque este ejemplo, inspirado en la respuesta aleatoria , podría aplicarse a los microdatos (es decir, publicar conjuntos de datos con cada respuesta individual), por definición la privacidad diferencial excluye las publicaciones de microdatos y solo es aplicable a las consultas (es decir, agregar respuestas individuales en un solo resultado), ya que esto violaría los requisitos, más específicamente la negación plausible de que un sujeto participó o no. [ 13 ] [ 14 ]

Transformaciones estables

Una transformaciónT{\displaystyle T}esdo{\displaystyle c}-estable si la distancia de Hamming entreT(A){\displaystyle T(A)}yT(B){\displaystyle T(B)}es como máximodo{\displaystyle c}-veces la distancia de Hamming entreA{\displaystyle A}yB{\displaystyle B}para cualesquiera dos bases de datosA,B{\displaystyle A,B}Si existe un mecanismoMETRO{\displaystyle M}eso esε{\displaystyle \varepsilon }-privacidad diferencial, entonces el mecanismo compuestoMETROT{\displaystyle M\circ T}es(ε×do){\displaystyle (\varepsilon \times c)}-privacidad diferencial. [ 7 ]

Esto podría generalizarse a la privacidad de grupo, ya que el tamaño del grupo podría considerarse como la distancia de Hamming.h{\displaystyle h}entre A{\displaystyle A}yB{\displaystyle B}(dóndeA{\displaystyle A}contiene el grupo yB{\displaystyle B}no). En este casoMETROT{\displaystyle M\circ T}es(ε×do×h){\displaystyle (\varepsilon \times c\times h)}-privacidad diferencial.

Investigación

Las primeras investigaciones que condujeron a la privacidad diferencial

En 1977, Tore Dalenius formalizó las matemáticas de la supresión celular . [ 15 ] Tore Dalenius fue un estadístico sueco que contribuyó a la privacidad estadística a través de su artículo de 1977 que reveló un punto clave sobre las bases de datos estadísticas: que estas no deberían revelar información sobre un individuo que no sea accesible de otra manera. [ 16 ] También definió una tipología para las divulgaciones estadísticas. [ 4 ]

En 1979, Dorothy Denning , Peter J. Denning y Mayer D. Schwartz formalizaron el concepto de Rastreador, un adversario que podía aprender el contenido confidencial de una base de datos estadística mediante la creación de una serie de consultas dirigidas y el registro de los resultados. [ 17 ] Esta y futuras investigaciones demostraron que las propiedades de privacidad en una base de datos solo podían preservarse considerando cada nueva consulta a la luz de (posiblemente todas) las consultas anteriores. Esta línea de trabajo se denomina a veces privacidad de consultas, y el resultado final es que rastrear el impacto de una consulta en la privacidad de los individuos en la base de datos era NP-difícil .

siglo XXI

En 2003, Kobbi Nissim e Irit Dinur demostraron que es imposible publicar consultas arbitrarias en una base de datos estadística privada sin revelar cierta cantidad de información privada, y que todo el contenido informativo de la base de datos puede revelarse publicando los resultados de un número sorprendentemente pequeño de consultas aleatorias, mucho menor de lo que sugerían trabajos anteriores. [ 18 ] Este fenómeno general se conoce como la Ley Fundamental de Recuperación de la Información , y su idea clave, a saber, que en el caso más general, la privacidad no puede protegerse sin inyectar cierta cantidad de ruido, condujo al desarrollo de la privacidad diferencial.

En 2006, Cynthia Dwork , Frank McSherry , Kobbi Nissim y Adam D. Smith publicaron un artículo [ 3 ] que formalizaba la cantidad de ruido que debía añadirse y proponía un mecanismo generalizado para ello. Este artículo también creó la primera definición formal de privacidad diferencial. [ 4 ] Su trabajo fue co-receptor del premio TCC Test-of-Time de 2016 [ 19 ] y del premio Gödel de 2017. [ 20 ]

Desde entonces, investigaciones posteriores han demostrado que existen muchas maneras de producir estadísticas muy precisas a partir de la base de datos, al tiempo que se garantizan altos niveles de privacidad . [ 1 ]

Adopción en aplicaciones del mundo real

Hasta la fecha existen más de 12 implementaciones reales de privacidad diferencial , siendo las más destacadas las siguientes:

  • 2008: Oficina del Censo de EE. UU. , para mostrar patrones de desplazamiento diario. [ 21 ]
  • 2014: RAPPOR de Google , para telemetría, como el aprendizaje de estadísticas sobre software no deseado que secuestra la configuración de los usuarios. [ 22 ] [ 23 ]
  • 2015: Google, por compartir estadísticas históricas de tráfico. [ 24 ]
  • 2016: Apple iOS 10 , para su uso en tecnología de asistente personal inteligente . [ 25 ]
  • 2017: Microsoft, para telemetría en Windows. [ 26 ]
  • 2020: Social Science One y Facebook , un conjunto de datos de 55 billones de células para que los investigadores aprendan sobre elecciones y democracia. [ 27 ] [ 28 ]
  • 2021: La Oficina del Censo de EE. UU. utiliza privacidad diferencial para publicar datos de redistribución de distritos del Censo de 2020. [ 29 ]

Consideraciones de interés público

Hay varias consideraciones de interés público con respecto a la privacidad diferencial que es importante tener en cuenta, especialmente para los responsables políticos y las audiencias centradas en las políticas interesadas en las oportunidades y los riesgos sociales de la tecnología: [ 30 ]

  • Utilidad y precisión de los datos. La principal preocupación con la privacidad diferencial radica en el equilibrio entre la utilidad de los datos y la privacidad individual. Si el parámetro de pérdida de privacidad se ajusta para favorecer la utilidad, los beneficios de privacidad disminuyen (se introduce menos "ruido" en el sistema); si se ajusta para favorecer una privacidad estricta, la precisión y la utilidad del conjunto de datos disminuyen (se introduce más "ruido" en el sistema). Es importante que los responsables políticos consideren las ventajas y desventajas de la privacidad diferencial para establecer las mejores prácticas y estándares adecuados en torno al uso de esta práctica de preservación de la privacidad, especialmente dada la diversidad de casos de uso en las organizaciones. Cabe destacar, sin embargo, que la disminución de la precisión y la utilidad es un problema común en todos los métodos de limitación de la divulgación estadística y no es exclusivo de la privacidad diferencial. Lo que sí es único, en cambio, es cómo los responsables políticos, los investigadores y los implementadores pueden considerar la mitigación de los riesgos que presenta este equilibrio.
  • Privacidad y seguridad de los datos. La privacidad diferencial proporciona una medida cuantificada de la pérdida de privacidad y un límite superior, y permite a los administradores elegir el equilibrio explícito entre privacidad y precisión. Es robusta frente a ataques a la privacidad aún desconocidos. Sin embargo, fomenta un mayor intercambio de datos , lo que, si se realiza incorrectamente, aumenta el riesgo para la privacidad. La privacidad diferencial implica que la privacidad está protegida, pero esto depende en gran medida del parámetro de pérdida de privacidad elegido y puede generar una falsa sensación de seguridad. Finalmente, aunque es robusta frente a futuros ataques a la privacidad imprevistos, podría idearse una contramedida que no podemos predecir.

Ataques en la práctica

Debido a que las técnicas de privacidad diferencial se implementan en computadoras reales, son vulnerables a diversos ataques que no se pueden contrarrestar únicamente con las matemáticas de las propias técnicas. Además de los defectos estándar de los artefactos de software que se pueden identificar mediante pruebas o fuzzing , las implementaciones de mecanismos de privacidad diferencial pueden sufrir las siguientes vulnerabilidades:

  • Errores sutiles de algoritmo o análisis. [ 31 ] [ 32 ]
  • Ataques de canal lateral de temporización. [ 33 ] A diferencia de los ataques de temporización contra implementaciones de algoritmos criptográficos que normalmente tienen una baja tasa de fuga y deben ir seguidos de un criptoanálisis no trivial , un canal de temporización puede conducir a una vulneración catastrófica de un sistema de privacidad diferencial, ya que un ataque dirigido puede utilizarse para exfiltrar el bit mismo que el sistema está diseñado para ocultar.
  • Fugas a través de la aritmética de punto flotante . [ 34 ] Los algoritmos de privacidad diferencial se presentan típicamente en el lenguaje de las distribuciones de probabilidad, lo que conduce naturalmente a implementaciones que utilizan aritmética de punto flotante. La abstracción de la aritmética de punto flotante es una fuga , y sin una atención cuidadosa a los detalles, una implementación ingenua puede no proporcionar privacidad diferencial. (Este es particularmente el caso para la privacidad diferencial ε, que no permite ninguna probabilidad de fallo, incluso en el peor de los casos). Por ejemplo, el soporte de un muestreador de texto de la distribución de Laplace (necesario, por ejemplo, para el mecanismo de Laplace ) es menos del 80% de todos los números de punto flotante de doble precisión ; además, el soporte para distribuciones con diferentes medias no es idéntico. Una sola muestra de una implementación ingenua del mecanismo de Laplace permite distinguir entre dos conjuntos de datos adyacentes con una probabilidad superior al 35%.
  • Canal de temporización a través de aritmética de punto flotante. [ 35 ] A diferencia de las operaciones sobre enteros que suelen ser de tiempo constante en las CPU modernas, la aritmética de punto flotante presenta una variabilidad de temporización significativa dependiente de la entrada. [ 36 ] El manejo de números subnormales puede ser particularmente lento, hasta 100 veces más lento que en el caso típico. [ 37 ]

Véase también

Referencias

  1. 1 2 Hilton, M; Cal (2012). "Privacidad diferencial: un estudio histórico" . Semantic Scholar . S2CID 16861132. Recuperado el 31 de diciembre de 2023 . 
  2. Dwork, Cynthia (25 de abril de 2008). «Privacidad diferencial: una revisión de resultados» . En Agrawal, Manindra; Du, Dingzhu; Duan, Zhenhua; Li, Angsheng (eds.). Teoría y aplicaciones de modelos de computación . Lecture Notes in Computer Science. Vol. 4978. Springer Berlin Heidelberg. pp. 1–19 . doi : 10.1007/978-3-540-79228-4_1 . ISBN   978-3-540-79227-7. S2CID 2887752 . 
  3. 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 Calibración del ruido a la sensibilidad en el análisis de datos privados por Cynthia Dwork, Frank McSherry, Kobbi Nissim, Adam Smith. En Theory of Cryptography Conference (TCC), Springer, 2006. doi : 10.1007/11681878_14 . La versión completa aparece en Journal of Privacy and Confidentiality, 7 (3), 17-51. doi : 10.29012/jpc.v7i3.405
  4. 1 2 3 Hilton, Michael. Privacidad diferencial: un estudio histórico (PDF) . S2CID 16861132. Archivado del original (PDF) el 1 de marzo de 2017. 
  5. 1 2 3 Dwork, Cynthia (2008). "Privacidad diferencial: una revisión de resultados" . En Agrawal, Manindra; Du, Dingzhu; Duan, Zhenhua; Li, Angsheng (eds.). Teoría y aplicaciones de modelos de computación . Lecture Notes in Computer Science. Vol. 4978. Berlín, Heidelberg: Springer. pp. 1–19 . doi : 10.1007/978-3-540-79228-4_1 . ISBN   978-3-540-79228-4.
  6. Los fundamentos algorítmicos de la privacidad diferencial, por Cynthia Dwork y Aaron Roth. Foundations and Trends in Theoretical Computer Science. Vol. 9, n.º 3–4, págs. 211‐407, agosto de 2014. doi : 10.1561/0400000042
  7. 1 2 3 Consultas integradas de privacidad: una plataforma extensible para el análisis de datos que preserva la privacidad, por Frank D. McSherry. En Actas de la 35.ª Conferencia Internacional SIGMOD sobre Gestión de Datos (SIGMOD), 2009. doi : 10.1145/1559845.1559850
  8. 1 2 Privacidad diferencial por Cynthia Dwork, Coloquio Internacional sobre Autómatas, Lenguajes y Programación (ICALP) 2006, págs. 1–12. doi : 10.1007/11787006_1
  9. Kairouz, Peter, Sewoong Oh y Pramod Viswanath. «El teorema de composición para la privacidad diferencial». Conferencia internacional sobre aprendizaje automático. PMLR, 2015. Enlace
  10. "Microsoft Research – Investigación sobre tecnologías emergentes, informática y software" . Microsoft Research .
  11. Dimitrakakis, Christos; Nelson, Blaine; Zhang y Zuhe; Mitrokotsa, Aikaterini; Rubinstein, Benjamin (23 de diciembre de 2016). "Privacidad diferencial bayesiana mediante muestreo posterior". arXiv : 1306.1066 [ stat.ML ].
  12. Warner, SL (marzo de 1965). "Respuesta aleatoria: una técnica de encuesta para eliminar el sesgo de respuesta evasiva". Journal of the American Statistical Association . 60 (309). Taylor & Francis : 63–69 . doi : 10.1080/01621459.1965.10480775 . JSTOR 2283137. PMID 12261830. S2CID 35435339 .   
  13. Dwork, Cynthia. "Una base sólida para el análisis de datos privados." Communications of the ACM 54.1 (2011): 86–95, supra nota 19, página 91.
  14. Bambauer, Jane, Krishnamurty Muralidhar y Rathindra Sarathy. "Oro de tontos: una crítica ilustrada de la privacidad diferencial". Vand. J. Ent. & Tech. L. 16 (2013): 701.
  15. Tore Dalenius (1977). "Hacia una metodología para el control de la divulgación estadística" . Statistik Tidskrift . 15. hdl : 1813/111303 .
  16. Dwork, Cynthia (2006). "Privacidad diferencial" . En Bugliesi, Michele; Preneel, Bart; Sassone, Vladimiro; Wegener, Ingo (eds.). Autómatas, lenguajes y programación . Lecture Notes in Computer Science. Vol. 4052. Berlín, Heidelberg: Springer. pp. 1–12 . doi : 10.1007/11787006_1 . ISBN   978-3-540-35908-1.
  17. Dorothy E. Denning; Peter J. Denning; Mayer D. Schwartz (marzo de 1979). "The Tracker: A Threat to Statistical Database Security" . ACM Transactions on Database Systems . 4 (1): 76–96 . doi : 10.1145/320064.320069 . S2CID 207655625 . 
  18. Irit Dinur y Kobbi Nissim. 2003. Revelar información preservando la privacidad. En Actas del vigésimo segundo simposio ACM SIGMOD-SIGACT-SIGART sobre Principios de los sistemas de bases de datos (PODS '03). ACM, Nueva York, NY, EE. UU., 202–210. doi : 10.1145/773153.773173
  19. "Premio TCC a la trayectoria" . www.iacr.org .
  20. "Premio Gödel 2017" . EATCS .
  21. Ashwin Machanavajjhala, Daniel Kifer, John M. Abowd, Johannes Gehrke y Lars Vilhuber. «Privacidad: la teoría se encuentra con la práctica en el mapa». En Actas de la 24.ª Conferencia Internacional sobre Ingeniería de Datos (ICDE) 2008.
  22. Erlingsson, Úlfar; Pihur, Vasyl; Korolova, Aleksandra (2014). "RAPPOR: Respuesta ordinal agregable aleatoria que preserva la privacidad" . Actas de la Conferencia ACM SIGSAC de 2014 sobre seguridad informática y de comunicaciones . págs. 1054–1067 . arXiv : 1407.6981 . doi : 10.1145/2660267.2660348 . ISBN  978-1-4503-2957-6.
  23. ^ google/rappor , GitHub, 15 de julio de 2021
  24. Abordar la movilidad urbana con tecnología, por Andrew Eland. Blog de Google Policy Europe, 18 de noviembre de 2015.
  25. "Apple – Información de prensa – Apple presenta iOS 10, el lanzamiento más importante de iOS hasta la fecha" . Apple . Consultado el 20 de junio de 2023 .
  26. Recopilación privada de datos de telemetría por Bolin Ding, Jana Kulkarni, Sergey Yekhanin. NIPS 2017.
  27. Messing, Solomon; DeGregorio, Christina; Hillenbrand, Bennett; King, Gary; Mahanti, Saurav; Mukerjee, Zagreb; Nayak, Chaya; Persily, Nate; State, Bogdan (2020), "Ciencias Sociales", Conjunto de datos de URL completas protegidas por privacidad de Facebook , Zagreb Mukerjee, Harvard Dataverse, doi : 10.7910/dvn/tdoapg , consultado el 8 de febrero de 2023
  28. Evans, Georgina; King, Gary (enero de 2023). "Inferencias estadísticamente válidas a partir de divulgaciones de datos con privacidad diferencial, con aplicación al conjunto de datos de URL de Facebook" . Análisis político . 31 (1): 1– 21. doi : 10.1017/pan.2022.1 . ISSN 1047-1987 . S2CID 211137209 .  
  29. "Evitar la divulgación de información para el Censo de 2020: Una introducción" . 2 de noviembre de 2021.
  30. "Hoja informativa sobre tecnología: privacidad diferencial" . Centro Belfer para la Ciencia y los Asuntos Internacionales . Consultado el 12 de abril de 2021 .
  31. McSherry, Frank (25 de febrero de 2018). "La privacidad diferencial de Uber... probablemente no existe" . GitHub .
  32. Lyu, Min; Su, Dong; Li, Ninghui (1 de febrero de 2017). "Comprensión de la técnica de vectores dispersos para la privacidad diferencial". Actas de la Fundación VLDB . 10 (6): 637– 648. arXiv : 1603.01699 . doi : 10.14778/3055330.3055331 . S2CID 5449336 . 
  33. Haeberlen, Andreas; Pierce, Benjamin C.; Narayan, Arjun (2011). "Privacidad diferencial bajo fuego". 20º Simposio de Seguridad de USENIX .
  34. Mironov, Ilya (octubre de 2012). «Sobre la importancia de los bits menos significativos para la privacidad diferencial». Actas de la conferencia ACM de 2012 sobre seguridad informática y de comunicaciones (PDF) . ACM. págs. 650–661 . doi : 10.1145/2382196.2382264 . ISBN  9781450316514. S2CID 3421585 . 
  35. Andrysco, Marc; Kohlbrenner, David; Mowery, Keaton; Jhala, Ranjit; Lerner, Sorin; Shacham, Hovav (mayo de 2015). «Sobre punto flotante subnormal y sincronización anormal». Simposio IEEE de 2015 sobre seguridad y privacidad . págs. 623–639 . doi : 10.1109/SP.2015.44 . ISBN  978-1-4673-6949-7. S2CID 1903469 . 
  36. Kohlbrenner, David; Shacham, Hovav (agosto de 2017). "Sobre la efectividad de las medidas de mitigación contra los canales de temporización de punto flotante". Actas del 26.º Simposio de la Conferencia USENIX sobre Seguridad . Asociación USENIX: 69–81 .
  37. Dooley, Isaac; Kale, Laxmikant (septiembre de 2006). "Cuantificación de la interferencia causada por valores de punto flotante subnormales" (PDF) . Actas del Taller sobre Interferencia del Sistema Operativo en Aplicaciones de Alto Rendimiento .

Lecturas adicionales

Publicaciones

  • Calibración del ruido a la sensibilidad en el análisis de datos privados , Cynthia Dwork , Frank McSherry , Kobbi Nissim y Adam Smith. 2006. En Actas de la Tercera Conferencia sobre Teoría de la Criptografía (TCC'06). Springer-Verlag, Berlín, Heidelberg, 265-284. Calibración del ruido a la sensibilidad en el análisis de datos privados (Esta es la publicación original de Privacidad diferencial, y no el artículo homónimo de Dwork publicado el mismo año).
  • Privacidad diferencial: Un estudio de los resultados, por Cynthia Dwork, Microsoft Research, abril de 2008 (Presenta los hallazgos de los dos primeros años de investigación sobre privacidad diferencial).
  • Privacidad diferencial: una introducción para un público no técnico , Alexandra Wood, Micah Altman , Aaron Bembenek, Mark Bun, Marco Gaboardi, et al., Vanderbilt Journal of Entertainment & Technology Law, Volumen 21, Número 1, Otoño de 2018. (Un buen documento introductorio, pero definitivamente *no* para un público no técnico).
  • Ficha informativa sobre tecnología: Privacidad diferencial por Raina Gandhi y Amritha Jayanti, Centro Belfer para la Ciencia y Asuntos Internacionales, otoño de 2020
  • Privacidad diferencial y el censo estadounidense de 2020 , Estudios de caso del MIT sobre responsabilidades sociales y éticas de la informática, n.º Invierno 2022 (enero). Privacidad diferencial y el censo estadounidense de 2020 .
  • Garfinkel, Simson (2025). Privacidad diferencial . Conocimiento esencial de MIT Press. Prensa del MIT. doi : 10.7551/mitpress/15354.001.0001 . ISBN 9780262551656.Icono de acceso abierto
  • Bowen, Claire McKay y Simson Garfinkel, La filosofía de la privacidad diferencial , AMS Notices, noviembre de 2021.

Tutoriales

  • Guía práctica para principiantes sobre privacidad diferencial, por Christine Task, Universidad de Purdue, abril de 2012.