Se han propuesto varios modelos de Markov diferentes para la evolución de secuencias de ADN. [ 1 ] Estos modelos de sustitución difieren en los parámetros utilizados para describir las tasas a las que un nucleótido reemplaza a otro durante la evolución. Estos modelos se utilizan frecuentemente en análisis filogenéticos moleculares . En particular, se utilizan durante el cálculo de la verosimilitud de un árbol (en los enfoques bayesianos y de máxima verosimilitud para la estimación de árboles) y se utilizan para estimar la distancia evolutiva entre secuencias a partir de las diferencias observadas entre ellas.
Introducción
Estos modelos son descripciones fenomenológicas de la evolución del ADN como una secuencia de cuatro estados discretos. Estos modelos de Markov no describen explícitamente el mecanismo de mutación ni la acción de la selección natural. Más bien, describen las tasas relativas de diferentes cambios. Por ejemplo, es probable que tanto los sesgos mutacionales como la selección purificadora que favorece los cambios conservadores sean responsables de la tasa relativamente alta de transiciones en comparación con las transversiones en las secuencias en evolución. Sin embargo, el modelo de Kimura (K80) que se describe a continuación solo intenta capturar el efecto de ambas fuerzas en un parámetro que refleja la tasa relativa de transiciones a transversiones.
Los análisis evolutivos de secuencias se realizan en una amplia variedad de escalas temporales. Por lo tanto, resulta conveniente expresar estos modelos en términos de las tasas instantáneas de cambio entre diferentes estados (las matrices Q que se muestran a continuación). Si se nos proporciona un estado inicial (ancestral) en una posición, la matriz Q del modelo y una longitud de rama que expresa el número esperado de cambios ocurridos desde el ancestro, podemos derivar la probabilidad de que la secuencia descendiente presente cada uno de los cuatro estados. Los detalles matemáticos de esta transformación de matriz de tasas a matriz de probabilidad se describen en la sección de matemáticas de los modelos de sustitución de la página de modelos de sustitución . Al expresar los modelos en términos de las tasas instantáneas de cambio, podemos evitar estimar un gran número de parámetros para cada rama de un árbol filogenético (o para cada comparación si el análisis implica muchas comparaciones de secuencias por pares).
Los modelos descritos en esta página describen la evolución de un único sitio dentro de un conjunto de secuencias. Se utilizan a menudo para analizar la evolución de un locus completo , bajo la simplificación de que los diferentes sitios evolucionan de forma independiente y se distribuyen de manera idéntica . Esta suposición puede justificarse si se asume que los sitios evolucionan de forma neutral . Si el efecto principal de la selección natural sobre la evolución de las secuencias es restringir algunos sitios, se pueden utilizar modelos de heterogeneidad de tasas entre sitios. Este enfoque permite estimar una única matriz de tasas relativas de sustitución y otro conjunto de parámetros que describen la varianza en la tasa total de sustitución entre sitios.
La evolución del ADN como una cadena de Markov en tiempo continuo
Cadenas de Markov de tiempo continuo
Las cadenas de Markov de tiempo continuo tienen las matrices de transición habituales que, además, están parametrizadas por el tiempo,. Específicamente, sison los estados, luego la matriz de transición
- donde cada entrada individual,se refiere a la probabilidad de que el estadocambiará al estadoa tiempo.
Ejemplo: Nos gustaría modelar el proceso de sustitución en secuencias de ADN ( es decir , Jukes-Cantor , Kimura, etc. ) en tiempo continuo. Las matrices de transición correspondientes tendrán el siguiente aspecto:
donde los bloques de 2 × 2 superior izquierdo e inferior derecho corresponden a las probabilidades de transición y los bloques de 2 × 2 superior derecho e inferior izquierdo corresponden a las probabilidades de transversión .
Suposición: Si en algún momento, la cadena de Markov está en estado, entonces la probabilidad de que en el tiempoestará en el estadodepende únicamente de,yEsto nos permite entonces escribir esa probabilidad como.
Teorema: Las matrices de transición en tiempo continuo satisfacen:
Nota: Existe una posible confusión entre dos significados de la palabra transición . (i) En el contexto de las cadenas de Markov , transición es el término general para el cambio entre dos estados. (ii) En el contexto de los cambios de nucleótidos en las secuencias de ADN , transición es un término específico para el intercambio entre las dos purinas (A ↔ G) o las dos pirimidinas (C ↔ T) (para más detalles, véase el artículo sobre transiciones en genética ). Por el contrario, un intercambio entre una purina y una pirimidina se denomina transversión .
Derivación de la dinámica de la sustitución
Consideremos una secuencia de ADN de longitud fija m que evoluciona en el tiempo mediante reemplazo de bases. Supongamos que los procesos seguidos por los m sitios son independientes markovianos, idénticamente distribuidos y que el proceso es constante en el tiempo. Para un sitio en particular, sea
sea el conjunto de estados posibles para el sitio, y
sus respectivas probabilidades en el momento. Para dos distintos, dejarsea la tasa de transición del estadopara declarar. De manera similar, para cualquier, sea la tasa total de cambio deser
Los cambios en la distribución de probabilidaddurante pequeños intervalos de tiemposon dados por
En otras palabras, (en lenguaje frecuentista), la frecuencia dees en ese momentoes igual a la frecuencia en el tiempomenos la frecuencia de la pérdidamás la frecuencia de los recién creados's.
De forma similar para las probabilidades,yEstas ecuaciones se pueden escribir de forma compacta como
dónde
se conoce como la matriz de tasas . Tenga en cuenta que, por definición, la suma de las entradas en cada fila dees igual a cero. De ello se deduce que
Para un proceso estacionario , dondeno depende del tiempo t , esta ecuación diferencial se puede resolver. Primero,
dóndedenota la exponencial de la matriz. Como resultado,
Ergodicidad
Si la cadena de Markov es irreducible , es decir, si siempre es posible pasar de un estado a otroa un estado(posiblemente en varios pasos), entonces también es ergódico . Como resultado, tiene una distribución estacionaria única., dóndecorresponde a la proporción de tiempo que se pasa en el estadodespués de que la cadena de Markov se haya ejecutado durante un tiempo infinito. En la evolución del ADN, bajo el supuesto de un proceso común para cada sitio, las frecuencias estacionariascorresponden a composiciones de base de equilibrio. De hecho, observe que dado que la distribución estacionariaSatisface, vemos que cuando la distribución actuales la distribución estacionariatenemos
En otras palabras, las frecuencias deno cambiar.
Reversibilidad temporal
Definición : Un proceso de Markov estacionario es reversible en el tiempo si (en el estado estacionario) la cantidad de cambio del estadoaes igual a la cantidad de cambio dea(aunque los dos estados pueden ocurrir con frecuencias diferentes). Esto significa que:
No todos los procesos estacionarios son reversibles; sin embargo, la mayoría de los modelos de evolución del ADN que se utilizan habitualmente asumen la reversibilidad temporal, lo que se considera una suposición razonable.
Bajo el supuesto de reversibilidad temporal, seaEntonces es fácil ver que:
Definición El término simétricoSe denomina intercambiabilidad entre estados.y. En otras palabras,es la fracción de la frecuencia del estadoese es el resultado de transiciones de estadopara declarar.
Corolario Las 12 entradas fuera de la diagonal de la matriz de tasas,(tenga en cuenta que las entradas fuera de la diagonal determinan las entradas diagonales, ya que las filas deLa suma de los dígitos (que es igual a cero) puede determinarse completamente mediante 9 números; estos son: 6 términos de intercambiabilidad y 3 frecuencias estacionarias., (ya que las frecuencias estacionarias suman 1).
Escalado de longitudes de ramas
Al comparar secuencias existentes, se puede determinar el grado de divergencia de secuencias. Esta medida directa de divergencia proporciona información sobre la cantidad de cambios que han ocurrido a lo largo del camino que separa las secuencias. El simple recuento de diferencias (la distancia de Hamming ) entre secuencias a menudo subestima la cantidad de sustituciones debido a los múltiples eventos (véase homoplasia ). Intentar estimar la cantidad exacta de cambios que han ocurrido es difícil y, por lo general, innecesario. En cambio, las longitudes de rama (y las longitudes de camino) en los análisis filogenéticos se suelen expresar como la cantidad esperada de cambios por sitio. La longitud del camino es el producto de la duración del camino en el tiempo y la tasa media de sustituciones. Si bien su producto se puede estimar, la tasa y el tiempo no se pueden identificar a partir de la divergencia de secuencias.
Las descripciones de las matrices de tasas en esta página reflejan con precisión la magnitud relativa de las diferentes sustituciones, pero estas matrices no están escaladas de manera que una longitud de rama de 1 produzca un cambio esperado. Este escalado se puede lograr multiplicando cada elemento de la matriz por el mismo factor, o simplemente escalando las longitudes de rama. Si usamos β para denotar el factor de escalado y ν para denotar la longitud de rama medida en el número esperado de sustituciones por sitio, entonces βν se usa en las fórmulas de probabilidad de transición a continuación en lugar de μ t . Nótese que ν es un parámetro que se estima a partir de los datos y se denomina longitud de rama, mientras que β es simplemente un número que se puede calcular a partir de la matriz de tasas (no es un parámetro libre independiente).
El valor de β se puede encontrar forzando la tasa esperada de flujo de estados a 1. Las entradas diagonales de la matriz de tasas (la matriz Q ) representan -1 veces la tasa de salida de cada estado. Para modelos reversibles en el tiempo , conocemos las frecuencias de los estados de equilibrio (estas son simplemente el valor del parámetro π i para el estado i ). Por lo tanto, podemos encontrar la tasa esperada de cambio calculando la suma del flujo de salida de cada estado ponderada por la proporción de sitios que se espera que estén en esa clase. Establecer β como el recíproco de esta suma garantizará que el proceso escalado tenga un flujo esperado de 1:
Por ejemplo, en el Jukes-Cantor, el factor de escala sería 4/(3 μ ) porque la tasa de salida de cada estado es 3μ/4 .
Modelos más comunes de evolución del ADN
Modelo JC69 (Jukes y Cantor 1969)
JC69, el modelo de Jukes y Cantor de 1969, [ 2 ] es el modelo de sustitución más simple . Tiene varias suposiciones. Asume frecuencias base iguales.y tasas de mutación iguales . Por lo tanto, el único parámetro de este modelo es, la tasa de sustitución global. Como se mencionó anteriormente, esta variable se convierte en una constante cuando normalizamos la tasa media a 1.

Cuando la longitud de la rama,, se mide en el número esperado de cambios por sitio entonces:
Vale la pena señalar que¿Qué representa la suma de cualquier columna (o fila) de la matriz?multiplicado por el tiempo y, por lo tanto, significa el número esperado de sustituciones en el tiempo.(duración de la rama) para cada sitio en particular (por sitio) cuando la tasa de sustitución es igual a.
Dada la proporciónde sitios que difieren entre las dos secuencias la estimación de Jukes-Cantor de la distancia evolutiva (en términos del número esperado de cambios) entre dos secuencias viene dada por
Elen esta fórmula se hace referencia frecuentemente como la-distancia. Es una estadística suficiente para calcular la corrección de distancia de Jukes-Cantor, pero no es suficiente para el cálculo de la distancia evolutiva bajo los modelos más complejos que siguen (tenga en cuenta también queutilizado en fórmulas posteriores no es idéntico a la "-distancia").
Modelo K80 (Kimura 1980)
K80, el modelo de Kimura de 1980, [ 3 ] a menudo denominado modelo de dos parámetros de Kimura (o modelo K2P ), distingue entre transiciones (, es decir, de purina a purina, o, es decir, de pirimidina a pirimidina) y transversiones (de purina a pirimidina o viceversa). En la descripción original del modelo de Kimura, α y β se usaban para denotar las tasas de estos tipos de sustituciones, pero ahora es más común establecer la tasa de transversiones en 1 y usar κ para denotar la relación de tasas de transición/transversión (como se hace a continuación). El modelo K80 supone que todas las bases son igualmente frecuentes ().
Matriz de tasas con columnas que corresponden a,,, y, respectivamente.
La distancia de Kimura de dos parámetros viene dada por:
donde p es la proporción de sitios que muestran diferencias transicionales y q es la proporción de sitios que muestran diferencias transversionales.
Modelo K81 (Kimura 1981)
K81, el modelo de Kimura de 1981, [ 4 ] a menudo llamado modelo de tres parámetros de Kimura (modelo K3P) o modelo de tres tipos de sustitución de Kimura (K3ST), tiene tasas distintas para las transiciones y dos tipos distintos de transversiones . Los dos tipos de transversión son aquellos que conservan las propiedades débiles/fuertes de los nucleótidos (es decir,y, denotado por el símbolo[ 4 ] ) y aquellos que conservan las propiedades amino/ceto de los nucleótidos (es decir,y, denotado por el símbolo[ 4 ] ). El modelo K81 supone que todas las frecuencias base de equilibrio son iguales (es decir,).
Matriz de tasas con columnas que corresponden a,,, y, respectivamente.
El modelo K81 se utiliza con mucha menos frecuencia que el modelo K80 (K2P) para la estimación de distancias y rara vez es el modelo que mejor se ajusta en la filogenética de máxima verosimilitud. A pesar de estos hechos, el modelo K81 se ha seguido estudiando en el contexto de la filogenética matemática. [ 5 ] [ 6 ] [ 7 ] Una propiedad importante es la capacidad de realizar una transformación de Hadamard asumiendo que los patrones de sitios se generaron en un árbol con nucleótidos que evolucionan bajo el modelo K81. [ 8 ] [ 9 ] [ 10 ]
Cuando se utiliza en el contexto de la filogenética, la transformación de Hadamard proporciona un medio elegante y totalmente invertible para calcular las frecuencias esperadas de patrones de sitios dada una serie de longitudes de ramas (o viceversa). A diferencia de muchos cálculos de máxima verosimilitud, los valores relativos para,, ypuede variar entre ramas y la transformación de Hadamard puede incluso proporcionar evidencia de que los datos no se ajustan a un árbol. La transformación de Hadamard también se puede combinar con una amplia variedad de métodos para acomodar la heterogeneidad de la tasa entre sitios, [ 11 ] utilizando distribuciones continuas en lugar de las aproximaciones discretas que se utilizan típicamente en la filogenética de máxima verosimilitud [ 12 ] (aunque hay que sacrificar la invertibilidad de la transformación de Hadamard para usar ciertas distribuciones de heterogeneidad de la tasa entre sitios [ 11 ] ).
Modelo F81 (Felsenstein 1981)
F81, el modelo de Felsenstein de 1981, [ 13 ] es una extensión del modelo JC69 en el que se permite que las frecuencias base varíen desde 0,25 ()
Matriz de tasas:
Cuando la longitud de la rama, ν, se mide en el número esperado de cambios por sitio, entonces:
Modelo HKY85 (Hasegawa, Kishino y Yano 1985)
HKY85, el modelo de Hasegawa, Kishino y Yano de 1985, [ 14 ] puede considerarse como una combinación de las extensiones realizadas en los modelos de Kimura80 y Felsenstein81. Es decir, distingue entre la tasa de transiciones y transversiones (utilizando el parámetro κ), y permite frecuencias base desiguales ().
Matriz de tasas
Si expresamos la longitud de la rama, ν, en términos del número esperado de cambios por sitio, entonces:
y la fórmula para las demás combinaciones de estados se puede obtener sustituyendo las frecuencias base apropiadas.
Felsenstein describió un modelo similar (pero no equivalente) en 1984 utilizando una parametrización diferente; [ 15 ] ese último modelo se conoce como el modelo F84. [ 16 ]
Modelo T92 (Tamura 1992)
T92, el modelo de Tamura de 1992, [ 17 ] es una extensión de K80 que añade un parámetro más, el contenido de G+C , un parámetro de frecuencia base compuesta.(también se ha señalado)Es útil cuando existen fuertes sesgos de transición-transversión y contenido de G+C, como en el caso del ADN mitocondrial de Drosophila . [ 17 ]
T92 corresponde a la matriz de tasas
La distancia evolutiva entre dos secuencias de ADN según este modelo viene dada por
dóndeyes el contenido G+C ().
Este método también puede tratarse como una simplificación de HKY85, ya que asume la segunda regla de paridad de Chargaff , donde los nucleótidos emparejados tienen la misma frecuencia en una sola hebra de ADN, G y C por un lado, y A y T por otro. En otras palabras, las frecuencias de cuatro bases se expresan como una función de:
por lo tanto, se eliminan dos grados de libertad.
Modelo TN93 (Tamura y Nei, 1993)
TN93, el modelo de Tamura y Nei de 1993, [ 18 ] distingue entre los dos tipos diferentes de transición ; es decir () se le permite tener una tasa diferente a (Se supone que todas las transversiones ocurren a la misma velocidad, pero se permite que esa velocidad sea diferente de las dos velocidades de las transiciones.
TN93 también permite frecuencias base desiguales ().
Matriz de tasas
Modelo GTR (Tavaré 1986)
GTR, el modelo generalizado reversible en el tiempo de Tavaré 1986, [ 19 ] es el modelo reversible en el tiempo neutral, independiente y de sitios finitos más general posible. Fue descrito por primera vez en forma general por Simon Tavaré en 1986. [ 19 ]
Los parámetros GTR consisten en un vector de frecuencia base de equilibrio,, dando la frecuencia con la que cada base aparece en cada sitio, y la matriz de tasas
Dónde
Grados de libertad frente al número de parámetros
GTR (para cuatro caracteres, como suele ser el caso en filogenética) como se indicó anteriormente incluye 6 parámetros de tasa de sustitución y 4 parámetros de frecuencia de base. Sin embargo, solo están presentes 3 parámetros de frecuencia de base "verdaderos" que actúan como grados de libertad porqueLos métodos filogenéticos también son invariantes a la escala con respecto a la tasa de sustitución.También es invariante a escala (lo que hace razonable establecer), por lo que en realidad solo hay 8 grados de libertad. [ 20 ] : (Tasas de sustitución de bases)
La idea anterior también se aplica a otros modelos. El modelo K81 tiene 2 grados de libertad porque las tres tasas actúan efectivamente como dos. El modelo TN93 tiene 5 grados de libertad, 2 de las tasas y 3 de las frecuencias base. [ 20 ] : (Tasas de sustitución de base)
Conjuntos de caracteres más grandes
En general, para calcular el número de parámetros GTR dado un alfabeto de tamaño n , tendríamos n - 1 parámetros de frecuencia yparámetros de velocidad, para un total deparámetros. Por ejemplo, para una secuencia de aminoácidos (hay 20 aminoácidos "estándar" que componen las proteínas ), se encontrarían 208 parámetros.
Sin embargo, al estudiar las regiones codificantes del genoma, es más común trabajar con un modelo de sustitución de codones (un codón son tres bases y codifica un aminoácido en una proteína).codones (61 si solo se cuentan los que no son de parada), lo que supone un número irrazonablemente grande de grados de libertad para que funcione un modelo de tipo GTR.
Modelos de sustitución de dos estados
Una forma alternativa de analizar datos de secuencias de ADN es recodificar los nucleótidos como purinas (R) y pirimidinas (Y); [ 21 ] [ 22 ] esta práctica se denomina a menudo codificación RY. [ 23 ] Las inserciones y deleciones en alineamientos de secuencias múltiples también pueden codificarse como datos binarios [ 24 ] y analizarse utilizando un modelo de dos estados. [ 25 ] [ 26 ]
El modelo de dos estados más simple de evolución de secuencias se llama modelo de Cavender-Farris o modelo de Cavender-Farris- Neyman (CFN); el nombre de este modelo refleja el hecho de que fue descrito independientemente en varias publicaciones diferentes. [ 27 ] [ 28 ] [ 29 ] El modelo CFN es idéntico al modelo de Jukes-Cantor adaptado a dos estados e incluso se ha implementado como el modelo "JC2" en el popular paquete de software IQ-TREE (usar este modelo en IQ-TREE requiere codificar los datos como 0 y 1 en lugar de R e Y; el popular paquete de software PAUP* puede interpretar una matriz de datos que comprende solo R e Y como datos para ser analizados usando el modelo CFN). También es sencillo analizar datos binarios usando la transformación filogenética de Hadamard . [ 30 ] El modelo alternativo de dos estados permite que los parámetros de frecuencia de equilibrio de R e Y (o 0 y 1) tomen valores distintos de 0,5 agregando un único parámetro libre; Este modelo se denomina indistintamente CFu [ 21 ] o GTR2 (en IQ-TREE).
Otros métodos de recodificación son WS (débil-fuerte) y MK (amino-ceto).
Modelos de Lie-Markov
Los modelos de Lie-Markov son, desde un punto de vista matemático, modelos de Markov que forman un álgebra de Lie . [ 31 ] Para el matemático, esto los hace cerrados bajo la multiplicación de matrices . Desde el punto de vista de un filogenetista, estos modelos tienen la ventaja de poder agregar o eliminar taxones sin afectar los patrones de sitios que el modelo puede generar sobre los taxones restantes. También existe una jerarquía natural de modelos basada en la cantidad de parámetros que se pueden cambiar. Algunos modelos existentes, como JC y F81, ya son modelos de Lie-Markov, mientras que GTR no lo es. [ 32 ] Los modelos de Lie-Markov (con RY, WS o MK) están disponibles en IQ-TREE. [ 20 ]
Véase también
Referencias
- ↑ Arenas, Miguel (2015). "Tendencias en los modelos de sustitución de la evolución molecular" . Frontiers in Genetics . 6 : 319. doi : 10.3389/fgene.2015.00319 . ISSN 1664-8021 . PMC 4620419. PMID 26579193 .
- ↑ Jukes TH, Cantor CR (1969). Evolución de las moléculas de proteínas . Nueva York: Academic Press. págs. 21–132 .
- ↑ Kimura M (diciembre de 1980). "Un método simple para estimar las tasas evolutivas de sustituciones de bases a través de estudios comparativos de secuencias de nucleótidos". Journal of Molecular Evolution . 16 (2): 111– 20. Bibcode : 1980JMolE..16..111K . doi : 10.1007/BF01731581 . PMID 7463489. S2CID 19528200 .
- 1 2 3 Kimura M (enero de 1981). "Estimación de distancias evolutivas entre secuencias de nucleótidos homólogas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 78 ( 1): 454– 8. Bibcode : 1981PNAS...78..454K . doi : 10.1073/pnas.78.1.454 . PMC 319072. PMID 6165991 .
- ↑ Bashford JD, Jarvis PD, Sumner JG, Steel MA (2004-02-25). "Simetría U (1) × U (1) × U (1) del modelo 3ST de Kimura y procesos de ramificación filogenética". Journal of Physics A: Mathematical and General . 37 (8): L81– L89. arXiv : q-bio/0310037 . doi : 10.1088/0305-4470/37/8/L01 . S2CID 7845860 .
- ↑ Sumner JG, Charleston MA, Jermiin LS, Jarvis PD (agosto de 2008). "Invariantes de Markov, pletismos y filogenética". Journal of Theoretical Biology . 253 (3): 601– 15. arXiv : 0711.3503 . Bibcode : 2008JThBi.253..601S . doi : 10.1016/j.jtbi.2008.04.001 . PMID 18513747. S2CID 6851591 .
- ↑ Sumner JG, Jarvis PD, Holland BR (diciembre de 2014). "Un enfoque tensorial para la inversión de modelos filogenéticos basados en grupos" . BMC Evolutionary Biology . 14 (1) 236. arXiv : 1212.3888 . Bibcode : 2014BMCEE..14..236S . doi : 10.1186/s12862-014-0236-6 . PMC 4268818. PMID 25472897 .
- ↑ Hendy MD, Penny D, Steel MA (abril de 1994). "Un análisis discreto de Fourier para árboles evolutivos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 91 (8): 3339–43 . Bibcode : 1994PNAS...91.3339H . doi : 10.1073 / pnas.91.8.3339 . PMC 43572. PMID 8159749 .
- ↑ Hendy MD (2005). "Conjugación de Hadamard: una herramienta analítica para la filogenética" . En Gascuel O (ed.). Matemáticas de la evolución y la filogenia . Oxford University Press. pp. 143–177 . ISBN 978-0198566106.
- ↑ Hendy MD, Snir S (julio de 2008). "Conjugación de Hadamard para el modelo 3ST de Kimura: prueba combinatoria usando conjuntos de caminos". IEEE/ACM Transactions on Computational Biology and Bioinformatics . 5 (3): 461– 71. arXiv : q-bio/0505055 . Bibcode : 2008ITCBB...5..461H . doi : 10.1109/TCBB.2007.70227 . PMID 18670048 . S2CID 20633916 .
- 1 2 Waddell PJ, Penny D, Moore T (agosto de 1997). "Conjugaciones de Hadamard y modelado de la evolución de secuencias con tasas desiguales entre sitios". Molecular Phylogenetics and Evolution . 8 (1): 33– 50. Bibcode : 1997MolPE...8...33W . doi : 10.1006/mpev.1997.0405 . PMID 9242594 .
- ↑ Yang Z (septiembre de 1994). "Estimación filogenética de máxima verosimilitud a partir de secuencias de ADN con tasas variables en diferentes sitios: métodos aproximados". Journal of Molecular Evolution . 39 (3): 306–14 . Bibcode : 1994JMolE..39..306Y . CiteSeerX 10.1.1.305.951 . doi : 10.1007/BF00160154 . PMID 7932792. S2CID 17911050 .
- ↑ Felsenstein J (1981). "Árboles evolutivos a partir de secuencias de ADN: un enfoque de máxima verosimilitud". Journal of Molecular Evolution . 17 (6): 368– 76. Bibcode : 1981JMolE..17..368F . doi : 10.1007/BF01734359 . PMID 7288891 . S2CID 8024924 .
- ↑ Hasegawa M, Kishino H, Yano T (1985). "Datación de la separación entre humanos y simios mediante un reloj molecular de ADN mitocondrial". Journal of Molecular Evolution . 22 (2): 160– 74. Bibcode : 1985JMolE..22..160H . doi : 10.1007/BF02101694 . PMID 3934395. S2CID 25554168 .
- ↑ Kishino H, Hasegawa M (agosto de 1989). "Evaluación de la estimación de máxima verosimilitud de las topologías de árboles evolutivos a partir de datos de secuencias de ADN y el orden de ramificación en hominoidea". Journal of Molecular Evolution . 29 (2): 170– 9. Bibcode : 1989JMolE..29..170K . doi : 10.1007/BF02100115 . PMID 2509717. S2CID 8045061 .
- ↑ Felsenstein J, Churchill GA (enero de 1996). "Un enfoque de modelo oculto de Markov para la variación entre sitios en la tasa de evolución" . Biología molecular y evolución . 13 (1): 93–104 . doi : 10.1093/oxfordjournals.molbev.a025575 . hdl : 1813/31897 . PMID 8583911 .
- 1 2 Tamura K (julio de 1992). "Estimación del número de sustituciones de nucleótidos cuando existen fuertes sesgos de transición-transversión y contenido de G+C" . Biología molecular y evolución . 9 (4): 678– 87. doi : 10.1093/oxfordjournals.molbev.a040752 . PMID 1630306 .
- ↑ Tamura K, Nei M (mayo de 1993). "Estimación del número de sustituciones de nucleótidos en la región de control del ADN mitocondrial en humanos y chimpancés" . Biología Molecular y Evolución . 10 (3): 512– 26. doi : 10.1093/oxfordjournals.molbev.a040023 . PMID 8336541 .
- 1 2 Tavaré S (1986). "Algunos problemas probabilísticos y estadísticos en el análisis de secuencias de ADN" (PDF) . Lecciones de matemáticas en las ciencias de la vida . 17 : 57–86 .
- 1 2 3 "Modelos de sustitución" . iqtree.github.io .
- 1 2 Braun EL, Kimball RT (agosto de 2002). Kjer K (ed.). "Examinando las divergencias aviares basales con secuencias mitocondriales: complejidad del modelo, muestreo de taxones y longitud de la secuencia" . Systematic Biology . 51 (4): 614– 625. doi : 10.1080/10635150290102294 . PMID 12228003 .
- ↑ Phillips MJ, Delsuc F, Penny D (julio de 2004). "Filogenia a escala genómica y detección de sesgos sistemáticos" . Biología molecular y evolución . 21 (7): 1455– 1458. doi : 10.1093/molbev/msh137 . PMID 15084674 .
- ↑ Ishikawa SA, Inagaki Y, Hashimoto T (enero de 2012). "Los modelos de codificación RY y no homogéneos pueden mejorar las inferencias de máxima verosimilitud a partir de datos de secuencias de nucleótidos con heterogeneidad composicional paralela" . Evolutionary Bioinformatics Online . 8 EBO.S9017: 357–371 . doi : 10.4137/EBO.S9017 . PMC 3394461. PMID 22798721 .
- ↑ Simmons MP, Ochoterena H (junio de 2000). "Las brechas como caracteres en los análisis filogenéticos basados en secuencias" . Systematic Biology . 49 (2): 369–381 . doi : 10.1093/sysbio/49.2.369 . PMID 12118412 .
- ↑ Yuri T, Kimball RT, Harshman J, Bowie RC, Braun MJ, Chojnowski JL, et al. (marzo de 2013). " Análisis de parsimonia y basados en modelos de inserciones/deleciones en genes nucleares aviares revelan señales filogenéticas congruentes e incongruentes" . Biology . 2 (1): 419– 444. doi : 10.3390/biology2010419 . PMC 4009869. PMID 24832669 .
- ↑ Houde P, Braun EL, Narula N, Minjares U, Mirarab S (2019-07-06). "Señal filogenética de inserciones/deleciones y la radiación neoaviana" . Diversity . 11 (7): 108. Bibcode : 2019Diver..11..108H . doi : 10.3390/d11070108 .
- ↑ Cavender JA (agosto de 1978). "Taxonomía con confianza". Mathematical Biosciences . 40 ( 3–4 ): 271–280 . doi : 10.1016/0025-5564(78)90089-5 .
- ↑ Farris JS (1973-09-01). "Un modelo de probabilidad para inferir árboles evolutivos" . Systematic Biology . 22 (3): 250– 256. doi : 10.1093/sysbio/22.3.250 . ISSN 1063-5157 .
- ↑ Neyman J (1971). Gupta SS, Yackel J (eds.). Estudios moleculares de la evolución: una fuente de nuevos problemas estadísticos . Nueva York, NY, EE. UU.: New York Academic Press. págs. 1–27 .
- ↑ Waddell PJ, Penny D, Moore T (agosto de 1997). "Conjugaciones de Hadamard y modelado de la evolución de secuencias con tasas desiguales entre sitios". Molecular Phylogenetics and Evolution . 8 (1): 33– 50. Bibcode : 1997MolPE...8...33W . doi : 10.1006/mpev.1997.0405 . PMID 9242594 .
- ↑ Sumner, JG; Fernández-Sánchez, J.; Jarvis, PD (abril de 2012). "Modelos de Lie-Markov". Journal of Theoretical Biology . 298 : 16–31 . arXiv : 1105.4680 . Bibcode : 2012JThBi.298...16S . doi : 10.1016/j.jtbi.2011.12.017 . PMID 22212913 .
- ↑ Woodhams, Michael D.; Fernández-Sánchez, Jesús; Sumner, Jeremy G. (1 de julio de 2015). "Una nueva jerarquía de modelos filogenéticos consistente con tasas de sustitución heterogéneas" . Systematic Biology . 64 (4): 638– 650. doi : 10.1093/sysbio/syv021 . PMC 4468350. PMID 25858352 .
Lecturas adicionales
- Gu X, Li WH (septiembre de 1992). "Tasas más altas de sustitución de aminoácidos en roedores que en humanos" . Molecular Phylogenetics and Evolution . 1 (3): 211– 4. Bibcode : 1992MolPE...1..211G . doi : 10.1016/1055-7903(92)90017-B . PMID 1342937 .
- Li WH, Ellsworth DL, Krushkal J, Chang BH, Hewett-Emmett D (febrero de 1996). "Tasas de sustitución de nucleótidos en primates y roedores y la hipótesis del efecto del tiempo de generación". Molecular Phylogenetics and Evolution . 5 (1): 182– 7. Bibcode : 1996MolPE...5..182L . doi : 10.1006/mpev.1996.0012 . PMID 8673286 .
Enlaces externos
- DAWG: Ensamblaje de ADN con huecos : software gratuito para simular la evolución de secuencias.
- Bioinformática
- Filogenética
- Filogenética computacional
- modelos de Markov