Articulo de referencia

Múltiples métodos electromagnéticos para la obtención de motivos.

El algoritmo de maximización de expectativas múltiples para la obtención de motivos (MEME) es una herramienta para descubrir motivos en un grupo de secuencias de ADN o proteínas...

El algoritmo de maximización de expectativas múltiples para la obtención de motivos (MEME) es una herramienta para descubrir motivos en un grupo de secuencias de ADN o proteínas relacionadas. [ 1 ]

Un motivo es un patrón de secuencia que se repite en un grupo de secuencias de proteínas o ADN relacionadas y que suele estar asociado a alguna función biológica. MEME representa los motivos como matrices de probabilidad de letras dependientes de la posición , que describen la probabilidad de cada letra posible en cada posición del patrón. Los motivos individuales de MEME no contienen huecos. Los patrones con huecos de longitud variable se dividen en dos o más motivos separados.

MEME toma como entrada un grupo de secuencias de ADN o proteínas (el conjunto de entrenamiento) y genera tantos motivos como se soliciten. Utiliza técnicas de modelado estadístico para seleccionar automáticamente el ancho, el número de ocurrencias y la descripción óptimos para cada motivo.

MEME es la primera de una colección de herramientas para analizar motivos denominada suite MEME .

Definición

El algoritmo MEME puede entenderse desde dos perspectivas diferentes. Desde un punto de vista biológico, MEME identifica y caracteriza motivos compartidos en un conjunto de secuencias no alineadas. Desde el punto de vista informático , MEME encuentra un conjunto de subcadenas que no se solapan y que coinciden aproximadamente, a partir de un conjunto inicial de cadenas.

Usar

MEME permite identificar funciones y estructuras biológicas similares en distintas secuencias. Es necesario tener en cuenta que la variación entre secuencias puede ser significativa y que, en ocasiones, los motivos son muy pequeños. Asimismo, resulta útil considerar la especificidad de los sitios de unión de las proteínas. Esto facilita la reducción de los experimentos de laboratorio (ahorrando tiempo y dinero). De hecho, para descubrir mejor los motivos relevantes desde un punto de vista biológico, es preciso seleccionar cuidadosamente el ancho óptimo de los motivos, el número de ocurrencias en cada secuencia y la composición de cada motivo.

Componentes del algoritmo

El algoritmo utiliza varios tipos de funciones bien conocidas:

Sin embargo, a menudo se desconoce el punto de partida. Existen varias posibilidades: exactamente un motivo por secuencia, uno o ningún motivo por secuencia, o cualquier número de motivos por secuencia.

Véase también

Referencias

  1. Bailey TL, Elkan C. Aprendizaje no supervisado de múltiples motivos en biopolímeros mediante EM. Mach. Learn. 1995;21:51–80.
  • MEME Suite : herramientas de análisis de secuencias basadas en motivos.
  • Versión acelerada por GPU de MEME
  • EXTREME : una implementación EM en línea del modelo MEME para el descubrimiento rápido de motivos en grandes conjuntos de datos de huella genética ChIP-Seq y DNase-Seq.