Articulo de referencia

Sistema de filtrado de información

Un sistema de filtrado de información elimina la información redundante o no deseada de un flujo de información mediante métodos (semi)automatizados o computarizados antes de pr...

Un sistema de filtrado de información elimina la información redundante o no deseada de un flujo de información mediante métodos (semi)automatizados o computarizados antes de presentarla a un usuario humano. Su objetivo principal es gestionar la sobrecarga de información e incrementar la relación señal-ruido semántica . Para ello, se compara el perfil del usuario con ciertas características de referencia. Estas características pueden provenir del propio elemento de información (enfoque basado en el contenido) o del entorno social del usuario ( enfoque de filtrado colaborativo ).

Mientras que en el procesamiento de señales de transmisión de información se utilizan filtros contra el ruido que altera la sintaxis a nivel de bits, los métodos empleados en el filtrado de información actúan a nivel semántico.

La variedad de métodos de aprendizaje automático empleados se basa en los mismos principios que los utilizados para la extracción de información . Un ejemplo notable se encuentra en el campo de los filtros de correo electrónico no deseado . Por lo tanto, no solo la explosión de información requiere algún tipo de filtro, sino también la pseudoinformación introducida de forma inadvertida o maliciosa .

A nivel de presentación, el filtrado de información adopta la forma de fuentes de noticias basadas en las preferencias del usuario , etc.

Los sistemas de recomendación y las plataformas de descubrimiento de contenido son sistemas activos de filtrado de información que intentan presentar al usuario elementos informativos ( películas , televisión , música , libros , noticias , páginas web ) de su interés. Estos sistemas añaden elementos informativos al flujo de información dirigido al usuario, en lugar de eliminarlos. Los sistemas de recomendación suelen utilizar enfoques de filtrado colaborativo o una combinación de ambos, aunque también existen sistemas de recomendación basados ​​en contenido.

Historia

Antes de la llegada de Internet , ya existían varios métodos para filtrar la información ; por ejemplo, los gobiernos podían controlar y restringir el flujo de información en un país determinado mediante la censura formal o informal.

Otro ejemplo de filtrado de información es el trabajo de editores y periodistas que ofrecen un servicio de selección de la información más valiosa para sus clientes: lectores de libros, revistas y periódicos, oyentes de radio y telespectadores . Este filtrado también se da en escuelas y universidades, donde se selecciona información para brindar apoyo académico a los estudiantes. Con la llegada de internet, cualquiera puede publicar lo que desee a bajo costo. Esto ha provocado un aumento considerable de la cantidad de información de baja calidad y, en consecuencia, una disminución en la calidad de la información. Ante este problema, se inició el desarrollo de sistemas de filtrado de información para obtener de forma fácil y eficiente la información necesaria para cada tema específico.

Operación

Un sistema de filtrado de este tipo consta de varias herramientas que ayudan a encontrar la información más valiosa, de modo que el tiempo limitado que se puede dedicar a leer, escuchar o ver se dirija correctamente hacia los documentos más interesantes y útiles. Estos filtros también se utilizan para organizar y estructurar la información de forma correcta y comprensible, además de agrupar mensajes en el correo electrónico. Son esenciales para los resultados que obtienen los motores de búsqueda en internet. Las funciones de filtrado mejoran día a día para facilitar la descarga de documentos web y la gestión de mensajes más eficiente.

Criterio

Uno de los criterios utilizados en este paso es determinar si el conocimiento es perjudicial o no, es decir, si permite una mejor comprensión con o sin el concepto. En este caso, la tarea consiste en filtrar la información para reducir o eliminar la información perjudicial que contiene conocimiento.

Sistema de aprendizaje

Un sistema de aprendizaje de contenidos consta, por regla general, principalmente de tres etapas básicas:

  1. En primer lugar, un sistema que proporcione soluciones a un conjunto definido de tareas.
  2. Posteriormente, se somete a criterios de evaluación que medirán el desempeño de la etapa anterior en relación con la solución de problemas.
  3. Módulo de adquisición cuyo resultado genera conocimientos que se utilizan en el solucionador del sistema de la primera etapa.

Futuro

Actualmente, el problema no radica en encontrar la mejor manera de filtrar la información , sino en cómo estos sistemas deben aprender de forma independiente las necesidades de información de los usuarios. Esto se debe no solo a que automatizan el proceso de filtrado , sino también a la construcción y adaptación del filtro. Algunas ramas, como la estadística, el aprendizaje automático, el reconocimiento de patrones y la minería de datos, constituyen la base para el desarrollo de filtros de información que aparecen y se adaptan en función de la experiencia. Para llevar a cabo el proceso de aprendizaje, es necesario prefiltrar parte de la información, lo que implica contar con ejemplos positivos y negativos, denominados datos de entrenamiento, que pueden ser generados por expertos o mediante la retroalimentación de usuarios comunes.

Error

A medida que se ingresan datos, el sistema incorpora nuevas reglas; si consideramos que estos datos pueden generalizar la información de los datos de entrenamiento, entonces debemos evaluar el desarrollo del sistema y medir su capacidad para predecir correctamente las categorías de nueva información . Este paso se simplifica separando los datos de entrenamiento en una nueva serie llamada "datos de prueba", que utilizaremos para medir la tasa de error. Como regla general, es importante distinguir entre tipos de errores (falsos positivos y falsos negativos). Por ejemplo, en el caso de un agregador de contenido para niños, no tiene la misma gravedad permitir el paso de información inapropiada para ellos, que muestre violencia o pornografía, que el error de descartar información apropiada. Para mejorar el sistema, reducir las tasas de error y lograr que estos sistemas tengan capacidades de aprendizaje similares a las humanas, se requiere el desarrollo de sistemas que simulen las capacidades cognitivas humanas, como la comprensión del lenguaje natural , la captura de significado común y otras formas de procesamiento avanzado para lograr la semántica de la información.

Campos de uso

Actualmente, existen numerosas técnicas para desarrollar filtros de información, algunas de las cuales alcanzan tasas de error inferiores al 10% en diversos experimentos. Entre estas técnicas se encuentran los árboles de decisión, las máquinas de vectores de soporte, las redes neuronales, las redes bayesianas, los discriminantes lineales, la regresión logística, etc. En la actualidad, estas técnicas se utilizan en diversas aplicaciones, no solo en el ámbito web, sino también en temas tan variados como el reconocimiento de voz, la clasificación de datos astronómicos telescópicos o la evaluación del riesgo financiero.

Véase también

Referencias

    • Hanani, U., Shapira, B., Shoval, P. (2001) Filtrado de información: Panorama general de problemas, investigación y sistemas. User Modeling and User-Adapted Interaction, 11, pp.  203–259.
    • http://www.infoworld.com/d/developer-world/human-information-filter-813
    • Infoworld
    • IEEXplore