Articulo de referencia

Motivo de secuencia

Un motivo de secuencia de ADN representado como un logotipo de secuencia para el motivo de unión a LexA. En biología, un motivo de secuencia es un patrón de secuencia de nucleót...

Un motivo de secuencia de ADN representado como un logotipo de secuencia para el motivo de unión a LexA.

En biología, un motivo de secuencia es un patrón de secuencia de nucleótidos o aminoácidos que está muy extendido y que generalmente se asume que está relacionado con la función biológica de la macromolécula. Por ejemplo, un motivo de sitio de N -glicosilación se puede definir como Asn, seguido de cualquier residuo excepto Pro, seguido de Ser o Thr, seguido de cualquier residuo excepto Pro .

Descripción general

Cuando un motivo de secuencia aparece en el exón de un gen , puede codificar el " motivo estructural " de una proteína ; es decir, un elemento estereotípico de la estructura general de la proteína. Sin embargo, los motivos no necesariamente están asociados con una estructura secundaria distintiva . Las secuencias " no codificantes " no se traducen en proteínas, y los ácidos nucleicos con dichos motivos no tienen por qué desviarse de la forma típica (por ejemplo, la doble hélice de ADN en "forma B" ).

Fuera de los exones genéticos, existen motivos de secuencias reguladoras y motivos dentro del " ADN basura ", como el ADN satélite . Se cree que algunos de estos afectan la forma de los ácidos nucleicos [ 1 ] (véase, por ejemplo, el autoempalme del ARN ), pero esto solo ocurre en algunos casos. Por ejemplo, muchas proteínas de unión al ADN que tienen afinidad por sitios de unión específicos se unen al ADN solo en su forma de doble hélice. Son capaces de reconocer motivos mediante el contacto con el surco mayor o menor de la doble hélice.

Los motivos de codificación cortos, que aparentemente carecen de estructura secundaria, incluyen aquellos que etiquetan las proteínas para su entrega a partes específicas de una célula o las marcan para su fosforilación .

Dentro de una secuencia o base de datos de secuencias, los investigadores buscan y encuentran motivos utilizando técnicas informáticas de análisis de secuencias , como BLAST . Estas técnicas pertenecen a la disciplina de la bioinformática . Véase también secuencia consenso .

Representación de motivos

Considere el motivo del sitio de N -glicosilación mencionado anteriormente:

Asn, seguido de cualquier cosa menos Pro, seguido de Ser o Thr, seguido de cualquier cosa menos Pro

Este patrón se puede escribir como N{P}[ST]{P}donde N= Asn, P= Pro, S= Ser, T= Thr; {X}significa cualquier aminoácido excepto X; y [XY]significa Xo Y.

La notación [XY]no indica la probabilidad de que el patrón se presente Xo Yocurra. Las probabilidades observadas pueden representarse gráficamente mediante logotipos de secuencia . En ocasiones, los patrones se definen en términos de un modelo probabilístico, como un modelo oculto de Markov .

Motivos y secuencias consenso

La notación [XYZ]significa Xo Yo Z, pero no indica la probabilidad de una coincidencia en particular. Por esta razón, dos o más patrones suelen asociarse a un mismo motivo: el patrón definitorio y varios patrones típicos.

Por ejemplo, la secuencia definitoria para el motivo IQ puede considerarse como:

[FILV]Qxxx[RK]Gxxx[RK]xx[FILVWY]

donde xsignifica cualquier aminoácido, y los corchetes indican una alternativa (véase más abajo para obtener más detalles sobre la notación).

Por lo general, sin embargo, la primera letra es I, y ambas [RK]opciones se resuelven en R. Dado que la última opción es tan amplia, el patrón IQxxxRGxxxRa veces se equipara con el motivo IQ en sí, pero una descripción más precisa sería una secuencia de consenso para el motivo IQ .

Notaciones de descripción de patrones

Se utilizan varias notaciones para describir motivos, pero la mayoría de ellas son variantes de las notaciones estándar para expresiones regulares y utilizan estas convenciones:

  • Existe un alfabeto de caracteres individuales, cada uno de los cuales representa un aminoácido específico o un conjunto de aminoácidos;
  • Una cadena de caracteres extraídos del alfabeto denota una secuencia de los aminoácidos correspondientes;
  • cualquier cadena de caracteres extraída del alfabeto encerrada entre corchetes coincide con cualquiera de los aminoácidos correspondientes; por ejemplo, [abc]coincide con cualquiera de los aminoácidos representados por ao bo c.

La idea fundamental que subyace a todas estas notaciones es el principio de correspondencia, que asigna un significado a una secuencia de elementos de la notación del patrón:

Una secuencia de elementos de la notación de patrones coincide con una secuencia de aminoácidos si y solo si esta última secuencia se puede dividir en subsecuencias de tal manera que cada elemento del patrón coincida a su vez con la subsecuencia correspondiente.

Por lo tanto, el patrón [AB] [CDE] Fcoincide con las seis secuencias de aminoácidos correspondientes a ACF, ADF, AEF, BCF, BDF, y BEF.

Las distintas notaciones de descripción de patrones tienen diferentes maneras de formar los elementos del patrón. Una de estas notaciones es la notación PROSITE, que se describe en la siguiente subsección.

Notación de patrones PROSITE

La notación PROSITE utiliza los códigos de una letra de la IUPAC y se ajusta a la descripción anterior con la excepción de que se utiliza un símbolo de concatenación, ' -', entre los elementos del patrón, pero a menudo se omite entre las letras del alfabeto del patrón.

PROSITE permite los siguientes elementos de patrón, además de los descritos anteriormente:

  • La letra minúscula ' x' se puede utilizar como elemento de patrón para denotar cualquier aminoácido.
  • Una cadena de caracteres extraídos del alfabeto y encerrados entre llaves (corchetes) denota cualquier aminoácido excepto los que aparecen en la cadena. Por ejemplo, {ST}denota cualquier aminoácido distinto de So T.
  • Si un patrón está restringido al extremo N-terminal de una secuencia, el patrón se antepone con ' <'.
  • Si un patrón se restringe al extremo C-terminal de una secuencia, el patrón se sufija con ' >'.
  • El carácter ' >' también puede aparecer dentro de un patrón de corchetes de terminación, de modo que coincide tanto con " " como con " ".S[T>]STS>
  • Si ees un elemento de patrón, y my nson dos enteros decimales con m<= n, entonces:
    • e(m)es equivalente a la repetición eexactamente mveces;
    • e(m,n)es equivalente a la repetición eexactamente kveces para cualquier entero kque satisfaga: m<= k<= n.

Algunos ejemplos:

  • x(3)es equivalente a x-x-x.
  • x(2,4)coincide con cualquier secuencia que coincida con x-xo x-x-xo x-x-x-x.

La firma del dominio de dedo de zinc de tipo C2H2 es:

  • C-x(2,4)-C-x(3)-[LIVMFYWC]-x(8)-H-x(3,5)-H

Matrices

Una matriz de números que contiene puntuaciones para cada residuo o nucleótido en cada posición de un motivo de longitud fija. Hay dos tipos de matrices de ponderación.

  • Una matriz de frecuencia de posición (PFM) registra la frecuencia de cada residuo o nucleótido en función de su posición. Las PFM pueden determinarse experimentalmente mediante experimentos SELEX o descubiertas computacionalmente con herramientas como MEME, que utilizan modelos ocultos de Markov.
  • Una matriz de ponderación de posición (PWM) contiene ponderaciones de probabilidad logarítmica para calcular una puntuación de coincidencia. Se requiere un umbral para especificar si una secuencia de entrada coincide o no con el motivo. Las PWM se calculan a partir de las PFM. Las PWM también se conocen como PSSM.

Un ejemplo de PFM de la base de datos TRANSFAC para el factor de transcripción AP-1:

La primera columna especifica la posición, la segunda columna contiene el número de ocurrencias de A en esa posición, la tercera columna contiene el número de ocurrencias de C en esa posición, la cuarta columna contiene el número de ocurrencias de G en esa posición, la quinta columna contiene el número de ocurrencias de T en esa posición, y la última columna contiene la notación IUPAC para esa posición. Tenga en cuenta que las sumas de ocurrencias de A, C, G y T para cada fila deben ser iguales, ya que el PFM se deriva de la agregación de varias secuencias consenso.

Descubrimiento de motivos

Descripción general

El proceso de descubrimiento de motivos de secuencia se ha desarrollado considerablemente desde la década de 1990. En particular, la mayor parte de la investigación existente en este campo se centra en motivos de ADN. Con los avances en la secuenciación de alto rendimiento, estos problemas de descubrimiento de motivos se ven dificultados tanto por la degeneración de los patrones de secuencia como por la escalabilidad computacional, que requiere un gran volumen de datos.

Proceso de descubrimiento

Diagrama de flujo que representa el proceso de descubrimiento de motivos.

El descubrimiento de motivos se produce en tres fases principales. Una etapa de preprocesamiento donde las secuencias se preparan meticulosamente mediante pasos de ensamblaje y limpieza. El ensamblaje implica la selección de secuencias que contienen el motivo deseado en grandes cantidades y la extracción de secuencias no deseadas mediante agrupamiento. La limpieza garantiza la eliminación de cualquier elemento que pueda generar confusión. A continuación, se produce la etapa de descubrimiento. En esta fase, las secuencias se representan mediante cadenas de consenso o matrices de peso específicas de posición (PWM) . Tras la representación del motivo, se elige una función objetivo y se aplica un algoritmo de búsqueda adecuado para descubrir los motivos. Finalmente, la etapa de postprocesamiento implica la evaluación de los motivos descubiertos. [ 2 ]

Descubrimiento de motivos de novo

Hay programas informáticos que, a partir de múltiples secuencias de entrada, intentan identificar uno o más motivos candidatos. Un ejemplo es el algoritmo Multiple EM for Motif Elicitation (MEME), que genera información estadística para cada candidato. [ 3 ] Hay más de 100 publicaciones que detallan algoritmos de descubrimiento de motivos; Weirauch et al . evaluaron muchos algoritmos relacionados en una comparativa de 2013. [ 4 ] La búsqueda de motivos plantados es otro método de descubrimiento de motivos que se basa en un enfoque combinatorio.

Descubrimiento de motivos filogenéticos

También se han descubierto motivos mediante un enfoque filogenético , estudiando genes similares en diferentes especies. Por ejemplo, al alinear las secuencias de aminoácidos especificadas por el gen GCM ( glial cells missing ) en humanos, ratones y D. melanogaster , Akiyama y otros descubrieron un patrón que denominaron motivo GCM en 1996. [ 5 ] Abarca aproximadamente 150 residuos de aminoácidos y comienza de la siguiente manera:

WDIND*.*P..*...D.F.*W***.**.IYS**...A.*H*S*WAMRNTNNHN

Aquí, cada uno .representa un aminoácido individual o un espacio, e *indica un miembro de una familia de aminoácidos estrechamente relacionada. Los autores pudieron demostrar que el motivo tiene actividad de unión al ADN.

Un enfoque similar es comúnmente utilizado por bases de datos modernas de dominios de proteínas como Pfam : curadores humanos seleccionarían un conjunto de secuencias que se sabe que están relacionadas y usarían programas informáticos para alinearlas y producir el perfil de motivos (Pfam usa HMM , que pueden usarse para identificar otras proteínas relacionadas. [ 6 ] Un enfoque filogenético también puede usarse para mejorar el algoritmo MEME de novo , siendo PhyloGibbs un ejemplo. [ 7 ]

Descubrimiento de pares de motivos de novo

En 2017, se desarrolló MotifHyades como una herramienta de descubrimiento de motivos que se puede aplicar directamente a secuencias emparejadas. [ 8 ]

Reconocimiento de novo de motivos a partir de proteínas

En 2018, se propuso un enfoque de campo aleatorio de Markov para inferir motivos de ADN a partir de dominios de unión al ADN de proteínas. [ 9 ]

Algoritmos de descubrimiento de motivos

Los algoritmos de descubrimiento de motivos emplean diversas estrategias para descubrir patrones en secuencias de ADN. La integración de enfoques enumerativos, probabilísticos e inspirados en la naturaleza demuestra su adaptabilidad, y el uso de múltiples métodos resulta eficaz para mejorar la precisión de la identificación.

Enfoque enumerativo: [ 2 ]

Para iniciar el proceso de descubrimiento de motivos, el enfoque enumerativo emplea algoritmos que generan y evalúan meticulosamente posibles motivos. Técnicas pioneras en este campo, como YMF y DREME, analizan sistemáticamente la secuencia en busca de motivos cortos. Complementando estas técnicas, métodos basados ​​en agrupamiento, como CisFinder, emplean matrices de sustitución de nucleótidos para agrupar motivos, mitigando eficazmente la redundancia. Asimismo, métodos basados ​​en árboles, como Weeder y FMotif, aprovechan las estructuras de árbol, y métodos basados ​​en la teoría de grafos (por ejemplo, WINNOWER) emplean representaciones gráficas, demostrando la riqueza de las estrategias de enumeración.

Enfoque probabilístico: [ 2 ]

Adentrándonos en el ámbito probabilístico, este enfoque aprovecha los modelos de probabilidad para discernir motivos dentro de las secuencias. MEME, un ejemplo determinista, emplea el algoritmo Expectation-Maximization para optimizar las matrices de ponderación de posición (PWM) y desentrañar regiones conservadas en secuencias de ADN no alineadas. En contraste, las metodologías estocásticas como el muestreo de Gibbs inician el descubrimiento de motivos con asignaciones aleatorias de posiciones, refinando iterativamente las predicciones. Este marco probabilístico captura con destreza la incertidumbre inherente al descubrimiento de motivos.

Enfoque avanzado: [ 2 ]

En su evolución, el descubrimiento avanzado de motivos incorpora técnicas sofisticadas, con el modelado bayesiano [ 10 ] como elemento central. LOGOS y BaMM, ejemplos de este grupo, integran de forma compleja enfoques bayesianos y modelos de Markov en su metodología para la identificación de motivos. La incorporación de métodos de agrupamiento bayesiano refuerza la base probabilística, proporcionando un marco integral para el reconocimiento de patrones en secuencias de ADN.

Algoritmos heurísticos e inspirados en la naturaleza: [ 2 ]

Surge una categoría distinta, donde los algoritmos se inspiran en el ámbito biológico. Los algoritmos genéticos (AG) , representados por FMGA y MDGA, [ 11 ] exploran la búsqueda de motivos mediante operadores genéticos y estrategias especializadas. Aprovechando los principios de la inteligencia colectiva, los algoritmos de optimización por enjambre de partículas (PSO) , colonia de abejas artificiales (ABC) y búsqueda del cuco (CS) , presentes en GAEM, GARP y MACS, se adentran en la exploración basada en feromonas. Estos algoritmos, que reflejan la adaptabilidad y la dinámica cooperativa de la naturaleza, sirven como estrategias vanguardistas para la identificación de motivos. La síntesis de técnicas heurísticas en enfoques híbridos subraya la adaptabilidad de estos algoritmos en el complejo campo del descubrimiento de motivos.

Este gráfico muestra muchos tipos diferentes de algoritmos utilizados en el descubrimiento de motivos de secuencia y sus categorías.

Casos de motivos

Códigos de cadena tridimensionales

El represor del operón de lactosa de E. coli LacI ( PDB : 1lcc ​chain A) y el activador del gen catabólico de E. coli ( PDB : 3gap ​chain A) tienen ambos un motivo hélice-giro-hélice , pero sus secuencias de aminoácidos no muestran mucha similitud, como se muestra en la tabla a continuación. En 1997, Matsuda, et al. idearon un código que llamaron "código de cadena tridimensional" para representar la estructura de la proteína como una cadena de letras. Este esquema de codificación revela la similitud entre las proteínas mucho más claramente que la secuencia de aminoácidos (ejemplo del artículo): [ 12 ] El código codifica los ángulos de torsión entre los carbonos alfa del esqueleto de la proteína . "W" siempre corresponde a una hélice alfa.

Véase también

Referencias

Fuentes primarias

  1. Dlakić, Mensur; Harrington, Rodney E. (1996). "Los efectos del contexto de la secuencia en la curvatura del ADN" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 93 (9): 3847– 3852. Bibcode : 1996PNAS...93.3847D . doi : 10.1073/pnas.93.9.3847 . ISSN 0027-8424 . JSTOR 39155. PMC 39447. PMID 8632978 .    
  2. 1 2 3 4 5 Hashim, Fatma A.; Mabrouk, Mai S.; Al-Atabany, Walid (2019). "Revisión de diferentes algoritmos de búsqueda de motivos de secuencia" . Avicenna Journal of Medical Biotechnology . 11 (2): 130– 148. ISSN 2008-2835 . PMC 6490410. PMID 31057715 .   
  3. Bailey TL, Williams N, Misleh C, Li WW (julio de 2006). "MEME: descubrimiento y análisis de motivos de secuencias de ADN y proteínas" . Nucleic Acids Research . 34 (número especial de servidores web): W369-73. doi : 10.1093 / nar/gkl198 . PMC 1538909. PMID 16845028 .  
  4. Weirauch MT, Cote A, Norel R, Annala M, Zhao Y, Riley TR, et al. (febrero de 2013). " Evaluación de métodos para modelar la especificidad de secuencia de factores de transcripción" . Nature Biotechnology . 31 (2): 126– 34. doi : 10.1038/nbt.2486 . PMC 3687085. PMID 23354101 .   
  5. Akiyama Y, Hosoya T, Poole AM, Hotta Y (diciembre de 1996). "El motivo gcm: un nuevo motivo de unión al ADN conservado en Drosophila y mamíferos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 93 (25): 14912– 6. Bibcode : 1996PNAS...9314912A . doi : 10.1073/pnas.93.25.14912 . PMC 26236. PMID 8962155 .  
  6. "Modelado en Pfam" . Pfam . Consultado el 14 de diciembre de 2023 .
  7. Siddharthan R, Siggia ED, van Nimwegen E (diciembre de 2005). "PhyloGibbs: un buscador de motivos de muestreo de Gibbs que incorpora filogenia" . PLOS Computational Biology . 1 (7) e67. Bibcode : 2005PLSCB...1...67S . doi : 10.1371/journal.pcbi.0010067 . PMC 1309704. PMID 16477324 .  
  8. Wong KC (octubre de 2017). "MotifHyades: maximización de expectativas para el descubrimiento de pares de motivos de ADN de novo en secuencias emparejadas" . Bioinformatics . 33 (19): 3028–3035 . doi : 10.1093/bioinformatics/btx381 . PMID 28633280 . 
  9. Wong KC (septiembre de 2018). "Modelado de reconocimiento de motivos de ADN a partir de secuencias de proteínas" . iScience . 7 : 198–211 . Bibcode : 2018iSci....7..198W . doi : 10.1016/j.isci.2018.09.003 . PMC 6153143. PMID 30267681 .  
  10. Miller, Andrew K.; Print, Cristin G.; Nielsen, Poul MF; Crampin, Edmund J. (2010-11-18). " Una búsqueda bayesiana de motivos transcripcionales" . PLOS ONE . 5 (11) e13897. Bibcode : 2010PLoSO...513897M . doi : 10.1371/journal.pone.0013897 . ISSN 1932-6203 . PMC 2987817. PMID 21124986 .   
  11. Che, Dongsheng; Song, Yinglei; Rasheed, Khaled (25 de junio de 2005). "MDGA: Descubrimiento de motivos mediante un algoritmo genético" . Actas de la 7.ª conferencia anual sobre computación genética y evolutiva . GECCO '05. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 447–452 . doi : 10.1145/1068009.1068080 . ISBN  978-1-59593-010-1. S2CID 7892935 . 
  12. Matsuda H, Taniguchi F, Hashimoto A (1997). "Un enfoque para la detección de motivos estructurales de proteínas utilizando un esquema de codificación de conformaciones de la cadena principal" (PDF) . Simposio del Pacífico sobre Biocomputación. Simposio del Pacífico sobre Biocomputación : 280–91 . PMID 9390299 . 

Lecturas adicionales

  • Kadaveru K, Vyas J, Schiller MR (mayo de 2008). "Infección viral y enfermedad humana: perspectivas a partir de minimotivos" . Frontiers in Bioscience . 13 (13): 6455–71 . doi : 10.2741/3166 . PMC 2628544. PMID 18508672 .  
  • Stormo GD (enero de 2000). "Sitios de unión al ADN: representación y descubrimiento". Bioinformática . 16 (1): 16– 23. doi : 10.1093/bioinformatics/16.1.16 . PMID 10812473 . 

Fuentes primarias

  • Altarawy D, Ismail MA, Ghanem S (2009). "MProfiler: Un método basado en perfiles para el descubrimiento de motivos de ADN". Reconocimiento de patrones en bioinformática . Notas de clase en ciencias de la computación. Vol.  5780. pp. 13–23 . doi : 10.1007/978-3-642-04031-3_2 . ISBN  978-3-642-04030-6.
  • Schiller MR (2007). "Minimotif miner: una herramienta computacional para investigar la función de las proteínas, las enfermedades y la diversidad genética". Current Protocols in Protein Science . 48 (1). Wiley: 2.12.1–2.12.14. doi : 10.1002/0471140864.ps0212s48 . ISBN 978-0-471-14086-3. PMID 18429315 . S2CID 10406520 .  
  • Balla S, Thapar V, Verma S, Luong T, Faghri T, Huang CH, et  al. (marzo de 2006). " Minimotif Miner: una herramienta para investigar la función de las proteínas" . Nature Methods . 3 (3): 175– 7. doi : 10.1038/nmeth856 . PMID 16489333. S2CID 15571142 .