El filtrado colaborativo robusto , o filtrado colaborativo resistente a ataques , se refiere a algoritmos o técnicas que buscan hacer que el filtrado colaborativo sea más resistente a los intentos de manipulación, manteniendo la calidad de las recomendaciones. En general, estos intentos de manipulación suelen referirse a ataques de manipulación, también llamados ataques de inyección de perfiles. El filtrado colaborativo predice la calificación de un usuario para los artículos al encontrar usuarios similares y analizar sus calificaciones. Dado que es posible crear copias casi ilimitadas de perfiles de usuario en un sistema en línea, el filtrado colaborativo se vuelve vulnerable cuando se introducen múltiples copias de perfiles falsos en el sistema. Se han sugerido varios enfoques diferentes para mejorar la robustez del filtrado colaborativo, tanto basado en modelos como en memoria. Sin embargo, las técnicas de filtrado colaborativo robusto siguen siendo un campo de investigación activo, y sus principales aplicaciones aún están por llegar.
Introducción
Uno de los mayores desafíos para el filtrado colaborativo son los ataques de manipulación de perfiles. Es decir, usuarios malintencionados o un competidor pueden introducir deliberadamente una cierta cantidad de perfiles falsos en el sistema (normalmente entre el 1 % y el 5 %) para afectar la calidad de las recomendaciones o incluso sesgar las calificaciones previstas en su propio beneficio. Algunas de las principales estrategias de manipulación de perfiles son los ataques aleatorios, los ataques de promedio, los ataques de arrastre y los ataques centrados en segmentos.
Los ataques aleatorios insertan perfiles que dan calificaciones aleatorias a un subconjunto de elementos; los ataques promedio dan la calificación promedio de cada elemento. [ 1 ] Los ataques de efecto banda y los ataques centrados en segmentos son modelos de ataque más nuevos y sofisticados. Los perfiles de ataque de efecto banda dan calificaciones aleatorias a un subconjunto de elementos y la calificación máxima a los elementos muy populares, en un esfuerzo por aumentar las posibilidades de que estos perfiles falsos tengan muchos vecinos. El ataque centrado en segmentos es similar al modelo de ataque de efecto banda, pero da la calificación máxima a los elementos que se espera que sean calificados positivamente por el grupo de usuarios objetivo, en lugar de los calificados frecuentemente. [ 2 ]
En general, se sabe que el filtrado colaborativo basado en elementos es más robusto que el filtrado colaborativo basado en usuarios. Sin embargo, el filtrado colaborativo basado en elementos aún no es completamente inmune a los ataques de efecto banda y de segmentación.
El filtrado colaborativo robusto suele funcionar de la siguiente manera:
- Construir un modelo de detección de usuarios que envían spam
- Siga el flujo de trabajo del sistema de filtrado colaborativo habitual , pero utilizando únicamente los datos de valoración de los usuarios que no envían spam.
Relaciones de usuario
Este es un método de detección sugerido por Gao et al. para hacer que el filtrado colaborativo basado en memoria sea más robusto. [ 3 ] Algunas métricas populares utilizadas en el filtrado colaborativo para medir la similitud de usuarios son el coeficiente de correlación de Pearson, la similitud de intereses y la distancia coseno. (consulte CF basado en memoria para obtener definiciones) Un sistema de recomendación puede detectar ataques explotando el hecho de que las distribuciones de estas métricas difieren cuando hay usuarios de spam en el sistema. Debido a que los ataques de shilling inyectan no solo un perfil falso sino una gran cantidad de perfiles falsos similares, estos usuarios de spam tendrán una similitud inusualmente alta que la de los usuarios normales.
El sistema funciona de la siguiente manera: a partir de una matriz de calificaciones, aplica un algoritmo de agrupamiento basado en densidad a las métricas de relación entre usuarios para detectar usuarios que envían spam, asignando un peso de 0 a estos usuarios y un peso de 1 a los usuarios normales. Es decir, el sistema solo considera las calificaciones de los usuarios normales al realizar predicciones. El resto del algoritmo funciona exactamente igual que el filtrado colaborativo basado en ítems convencional.
Según los resultados experimentales obtenidos con datos de MovieLens, este método robusto de filtrado colaborativo (CF) mantiene la precisión en comparación con el filtrado colaborativo basado en ítems convencional, pero es más estable. El resultado de la predicción para el filtrado colaborativo convencional varía entre un 30 % y un 40 % cuando se inyectan perfiles de usuarios de spam, mientras que este método robusto solo varía entre un 5 % y un 10 %.
Referencias
- ↑ Bhaskar Mehta, Thomas Hofmann y Wolfgang Nejdl, Filtrado colaborativo robusto , Actas de RecSys '07 de la Conferencia ACM de 2007 sobre sistemas de recomendación, 49-56
- ↑ Bamshad Mobasher, Robin Burke, Chad Williams y Runa Bhaumik, Análisis y detección de ataques centrados en segmentos contra la recomendación colaborativa , Avances en minería web y análisis de uso web, 2005, 96-118
- ↑ Min Gao, Bin Ling, Quan Yuan, Qingyu Xiong y Linda Yang, Un enfoque de filtrado colaborativo robusto basado en relaciones de usuario para sistemas de recomendación , Problemas matemáticos en ingeniería, vol. 2014, artículo ID 162521
- Sistemas de recomendación