
En biología molecular , los marcos de lectura se definen como segmentos de secuencia de ADN entre los codones de inicio y de parada . Generalmente, esto se considera dentro de una región estudiada de una secuencia de ADN procariota , donde solo uno de los seis posibles marcos de lectura estará "abierto" (la "lectura", sin embargo, se refiere al ARN producido por la transcripción del ADN y su posterior interacción con el ribosoma en la traducción ). Dicho marco de lectura abierto (ORF) puede [ 1 ] contener un codón de inicio (generalmente AUG en términos de ARN ) y, por definición, no puede extenderse más allá de un codón de parada (generalmente UAA, UAG o UGA en ARN). [ 2 ] Ese codón de inicio (no necesariamente el primero) indica dónde puede comenzar la traducción. El sitio de terminación de la transcripción se encuentra después del ORF, más allá del codón de parada de la traducción. Si la transcripción cesara antes del codón de parada, se produciría una proteína incompleta durante la traducción. [ 3 ]
En los genes eucariotas con múltiples exones , los intrones se eliminan y los exones se unen después de la transcripción para producir el ARNm final para la traducción de proteínas. En el contexto de la búsqueda de genes , la definición de inicio-parada de un ORF, por lo tanto, solo se aplica a los ARNm empalmados , no al ADN genómico, ya que los intrones pueden contener codones de parada y/o causar cambios entre marcos de lectura. Una definición alternativa dice que un ORF es una secuencia que tiene una longitud divisible por tres y está delimitada por codones de parada. [ 1 ] [ 4 ] Esta definición más general puede ser útil en el contexto de la transcriptómica y la metagenómica , donde un codón de inicio o de parada puede no estar presente en las secuencias obtenidas. Dicho ORF corresponde a partes de un gen en lugar del gen completo.
Importancia biológica
Un uso común de los marcos de lectura abiertos (ORF) es como una pieza de evidencia para ayudar en la predicción de genes . Los ORF largos se utilizan a menudo, junto con otra evidencia, para identificar inicialmente regiones candidatas codificantes de proteínas o regiones funcionales codificantes de ARN en una secuencia de ADN . [ 5 ] La presencia de un ORF no significa necesariamente que la región siempre se traduzca . Por ejemplo, en una secuencia de ADN generada aleatoriamente con un porcentaje igual de cada nucleótido , se esperaría un codón de parada una vez cada 21 codones . [ 5 ] Un algoritmo simple de predicción de genes para procariotas podría buscar un codón de inicio seguido de un marco de lectura abierto que sea lo suficientemente largo como para codificar una proteína típica, donde el uso de codones de esa región coincida con la frecuencia característica para las regiones codificantes del organismo dado. [ 5 ] Por lo tanto, algunos autores dicen que un ORF debe tener una longitud mínima, por ejemplo 100 codones [ 6 ] o 150 codones. [ 5 ] Por sí solo, incluso un marco de lectura abierto largo no es evidencia concluyente de la presencia de un gen . [ 5 ]
Marcos de lectura abiertos cortos
Algunos marcos de lectura abiertos cortos (sORF), [ 7 ] también conocidos como marcos de lectura abiertos pequeños (smORF), [ 8 ] generalmente < 100 codones de longitud, [ 9 ] que carecen de las características clásicas de los genes codificadores de proteínas (tanto de ncRNA como de mRNA) pueden producir péptidos funcionales . [ 10 ] Codifican microproteínas o proteínas codificadas por sORF (SEP). La 5'-UTR de aproximadamente el 50% de los mRNA de mamíferos contiene uno o varios sORF, [ 11 ] también llamados ORF corriente arriba (uORF). Sin embargo, menos del 10% de los mRNA de vertebrados analizados en un estudio de 1994 contenían codones AUG delante del ORF principal. Se encontraron uORF en dos tercios de los protooncogenes y proteínas relacionadas. [ 12 ] Entre el 64 % y el 75 % de los sitios de inicio de traducción de sORF encontrados experimentalmente se conservan en los genomas humano y de ratón, lo que puede indicar que estos elementos tienen una función. [ 13 ] Sin embargo, los sORF a menudo solo se encuentran en las formas minoritarias de los ARNm y evitan la selección; la alta conservación de los sitios de inicio puede estar relacionada con su ubicación dentro de los promotores de los genes relevantes. Esto es característico del gen SLAMF1 , por ejemplo. [ 14 ]
Traducción de seis fotogramas
Dado que el ADN se interpreta en grupos de tres nucleótidos (codones), una cadena de ADN tiene tres marcos de lectura distintos. [ 15 ] La doble hélice de una molécula de ADN tiene dos cadenas antiparalelas; como cada una de las dos cadenas tiene tres marcos de lectura, existen seis posibles traducciones de marcos. [ 15 ]

Software
Descubridor
El ORF Finder (Buscador de Marcos de Lectura Abiertos) [ 16 ] es una herramienta de análisis gráfico que encuentra todos los marcos de lectura abiertos de un tamaño mínimo seleccionable en la secuencia del usuario o en una secuencia ya presente en la base de datos. Esta herramienta identifica todos los marcos de lectura abiertos utilizando los códigos genéticos estándar o alternativos. La secuencia de aminoácidos deducida se puede guardar en varios formatos y comparar con la base de datos de secuencias mediante el servidor BLAST ( Básicamente, Local Alignment Search Tool ). El ORF Finder resulta útil para preparar envíos de secuencias completos y precisos. También se incluye con el software de envío de secuencias Sequin (analizador de secuencias).
Investigador
ORF Investigator [ 17 ] es un programa que no solo proporciona información sobre las secuencias codificantes y no codificantes, sino que también puede realizar alineamientos globales por pares de diferentes secuencias de regiones génicas/de ADN. La herramienta encuentra eficientemente los ORF para las secuencias de aminoácidos correspondientes, los convierte a su código de aminoácido de una sola letra y proporciona sus ubicaciones en la secuencia. El alineamiento global por pares entre las secuencias facilita la detección de diferentes mutaciones, incluyendo polimorfismos de un solo nucleótido . Se utilizan algoritmos de Needleman-Wunsch para el alineamiento de genes. ORF Investigator está escrito en el lenguaje de programación portátil Perl y, por lo tanto, está disponible para usuarios de todos los sistemas operativos comunes.
Vaticinador
OrfPredictor [ 18 ] es un servidor web diseñado para identificar regiones codificantes de proteínas en secuencias derivadas de etiquetas de secuencia expresada (EST). Para secuencias de consulta con una coincidencia en BLASTX, el programa predice las regiones codificantes basándose en los marcos de lectura de traducción identificados en los alineamientos de BLASTX; de lo contrario, predice la región codificante más probable basándose en las señales intrínsecas de las secuencias de consulta. La salida son las secuencias peptídicas predichas en formato FASTA y una línea de definición que incluye el ID de consulta, el marco de lectura de traducción y las posiciones de nucleótidos donde comienza y termina la región codificante. OrfPredictor facilita la anotación de secuencias derivadas de EST, en particular, para proyectos de EST a gran escala.
ORF Predictor utiliza una combinación de las dos definiciones de ORF mencionadas anteriormente. Busca secuencias que comienzan con un codón de inicio y terminan con un codón de parada. Como criterio adicional, busca un codón de parada en la región 5' no traducida (UTR o NTR, región no traducida [ 19 ] ). El servidor web de OrfPredictor no recibió soporte adicional; la herramienta independiente OrfPredictor se puede descargar en el siguiente sitio ( http://bioinformatics.ysu.edu/publication/tools_download/ ).
ORFik
ORFik es un paquete de R en Bioconductor para encontrar marcos de lectura abiertos y utilizar tecnologías de secuenciación de próxima generación para justificar los ORF. [ 20 ] [ 21 ]
orfipy
orfipy es una herramienta escrita en Python / Cython para extraer ORF de forma extremadamente rápida y flexible. [ 22 ] orfipy puede trabajar con secuencias FASTA y FASTQ, tanto en formato plano como comprimido con gzip, y ofrece varias opciones para ajustar las búsquedas de ORF; estas incluyen especificar los codones de inicio y parada, informar sobre ORF parciales y utilizar tablas de traducción personalizadas. Los resultados se pueden guardar en múltiples formatos, incluido el formato BED, que ahorra espacio. orfipy es particularmente rápido para datos que contienen múltiples secuencias FASTA más pequeñas, como ensamblajes de transcriptomas de novo. [ 23 ]
Véase también
- Región de codificación
- Gen putativo
- Sequerome : una herramienta de perfilado de secuencias que vincula cada registro BLAST con el ORF del NCBI , lo que permite un análisis completo del ORF de un informe BLAST.
- Micropéptido
- Péptido
Referencias
- 1 2 Sieber P, Platzer M, Schuster S (marzo de 2018). "Revisión de la definición de marco de lectura abierto". Trends in Genetics . 34 (3): 167– 170. doi : 10.1016/j.tig.2017.12.009 . PMID 29366605 .
- ↑ Brody LC (2021-08-25). "Codón de parada" . Instituto Nacional de Investigación del Genoma Humano . Institutos Nacionales de Salud . Recuperado el 25 de agosto de 2021 .
- ↑ Slonczewski J, Foster JW (2009). Microbiología: Una ciencia en evolución . Nueva York: WW Norton & Co. ISBN 978-0-393-97857-5OCLC 185042615
- ↑ Claverie JM (1997). "Métodos computacionales para la identificación de genes en secuencias genómicas de vertebrados" . Human Molecular Genetics . 6 (10): 1735– 44. doi : 10.1093/hmg/6.10.1735 . PMID 9300666 .
- 1 2 3 4 5 Deonier R, Tavaré S , Waterman M (2005). Análisis computacional del genoma: una introducción . Springer-Verlag . pág. 25. ISBN 978-0-387-98785-9.
- ↑ Claverie JM, Poirot O, Lopez F (1997). "La dificultad de identificar genes en secuencias anónimas de vertebrados". Computers & Chemistry . 21 (4): 203– 14. doi : 10.1016/s0097-8485(96)00039-3 . PMID 9415985 .
- ↑ Leong, Alyssa Zi-Xin; Lee, Pey Yee; Mohtar, M. Aiman; Syafruddin, Saiful Effendi; Pung, Yuh-Fen; Low, Teck Yew (2022). "Marcos de lectura abiertos cortos (sORF) y microproteínas: una actualización sobre sus medidas de identificación y validación" . Journal of Biomedical Science . 29 (1): 19. doi : 10.1186/s12929-022-00802-5 . PMC 8928697. PMID 35300685 .
- ↑ Vakirlis, Nikolaos; Vance, Zoe; Duggan, Kate M.; McLysaght, Aoife (2022). "Nacimiento de novo de microproteínas funcionales en el linaje humano" . Cell Reports . 41 ( 12) 111808. doi : 10.1016/j.celrep.2022.111808 . PMC 10073203. PMID 36543139. S2CID 254966620 .
- ↑ Kute, Preeti Madhav; Soukarieh, Omar; Tjeldnes, Håkon; Trégouët, David-Alexandre; Valen, Eivind (2022). " Pequeños marcos de lectura abiertos, cómo encontrarlos y determinar su función" . Frontiers in Genetics . 12 796060. doi : 10.3389/fgene.2021.796060 . PMC 8831751. PMID 35154250 .
- ↑ Zanet J, Benrabah E, Li T, Pélissier-Monier A, Chanut-Delalande H, Ronsin B, et al. (septiembre de 2015). "Los péptidos Pri sORF inducen un procesamiento selectivo de proteínas mediado por el proteasoma" (PDF) . Science . 349 (6254): 1356– 1358. Bibcode : 2015Sci...349.1356Z . doi : 10.1126 /science.aac5677 . PMID 26383956. S2CID 206639549 .
- ↑ Wethmar K, Barbosa-Silva A, Andrade-Navarro MA, Leutz A (enero de 2014). "uORFdb: una base de datos bibliográfica integral sobre la biología de los uORF eucariotas" . Nucleic Acids Research . 42 (número especial de bases de datos): D60– D67. doi : 10.1093/nar/gkt952 . PMC 3964959. PMID 24163100 .
- ↑ Geballe, AP; Morris, DR (abril de 1994). "Codones de iniciación en las regiones líderes 5' de los ARNm como reguladores de la traducción". Trends in Biochemical Sciences . 19 (4): 159– 164. doi : 10.1016/0968-0004(94)90277-1 . ISSN 0968-0004 . PMID 8016865 .
- ↑ Lee S, Liu B, Lee S, Huang SX, Shen B, Qian SB (septiembre de 2012). "Mapeo global de sitios de iniciación de la traducción en células de mamíferos con resolución de un solo nucleótido" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 109 (37): E2424– E2432. doi : 10.1073/pnas.1207846109 . PMC 3443142. PMID 22927429 .
- ^ Schwartz AM, Putlyaeva LV, Covich M, Klepikova AV, Akulich KA, Vorontsov IE, et al. (octubre de 2016). "El factor 1 temprano de células B (EBF1) es fundamental para el control transcripcional del gen SLAMF1 en células B humanas". Biochimica et Biophysica Acta (BBA) - Mecanismos reguladores de genes . 1859 (10): 1259– 1268. doi : 10.1016/j.bbagrm.2016.07.004 . PMID 27424222 .
- 1 2 Pearson WR, Wood T, Zhang Z, Miller W (noviembre de 1997). "Comparación de secuencias de ADN con secuencias de proteínas". Genomics . 46 (1): 24– 36. doi : 10.1006/geno.1997.4995 . PMID 9403055 . S2CID 6413018 .
- ↑ "ORFfinder" . Centro Nacional de Información Biotecnológica .
- ↑ Dhar DV, Kumar MS (2012). "ORF Investigator: Una nueva herramienta para la búsqueda de ORF que combina la alineación global de genes por pares". Research Journal of Recent Sciences . 1 (11): 32– 35.
- ↑ "OrfPredictor" . bioinformatics.ysu.edu . Archivado del original el 22/12/2015 . Consultado el 17/12/2015 .
- ↑ Carrington JC, Freed DD (abril de 1990). "Mejora de la traducción independiente de la caperuza por una región 5' no traducida de un potyvirus vegetal" . Journal of Virology . 64 (4): 1590–7 . doi : 10.1128/JVI.64.4.1590-1597.1990 . PMC 249294. PMID 2319646 .
- ^ Kornel Labun, Haakon Tjeldnes (2018). "ORFik - Marcos de lectura abiertos en genómica" . bioconductor.org . doi : 10.18129/B9.bioc.ORFik .
- ↑ Tjeldnes, Håkon; Labún, Kornel; Torres Cleuren, Yamila; Chyżyńska, Katarzyna; Świrski, Michał; Valen, Eivind (2021). "ORFik: un completo conjunto de herramientas de R para el análisis de la traducción" . Bioinformática BMC . 22 (1): 336. doi : 10.1186/s12859-021-04254-w . PMC 8214792 . PMID 34147079 .
- ↑ Singh U, Wurtele ES (febrero de 2021). " orfipy: una herramienta rápida y flexible para extraer ORF" . Bioinformatics . 37 (18): 3019–3020 . doi : 10.1093/bioinformatics/btab090 . ISSN 1367-4803 . PMC 8479652. PMID 33576786 .
- ↑ Singh U (13-02-2021), urmi-21/orfipy , consultado el 13-02-2021
Enlaces externos
- Traducción y marcos de lectura abiertos archivados el 6 de abril de 2011 en la Wayback Machine.
- hORFeome V5.1 - Una herramienta interactiva basada en la web para la colección de ORFeomas Humanos de CCSB.
- ORF Marker : una herramienta de escritorio gratuita, rápida y multiplataforma con interfaz gráfica de usuario (GUI) para predecir y analizar ORF.
- StarORF : una herramienta GUI multiplataforma basada en Java para predecir y analizar ORF y obtener secuencias complementarias inversas.
- ORFPredictor Archivado el 22/12/2015 en Wayback Machine : un servidor web diseñado para la predicción de ORF y la traducción de un lote de secuencias EST o cDNA.
- Genética molecular
- Bioinformática