Articulo de referencia

Modelos de evolución del ADN

Se han propuesto varios modelos de Markov diferentes para la evolución de secuencias de ADN. [ 1 ] Estos modelos de sustitución difieren en los parámetros utilizados para descri...

Se han propuesto varios modelos de Markov diferentes para la evolución de secuencias de ADN. [ 1 ] Estos modelos de sustitución difieren en los parámetros utilizados para describir las tasas a las que un nucleótido reemplaza a otro durante la evolución. Estos modelos se utilizan frecuentemente en análisis filogenéticos moleculares . En particular, se utilizan durante el cálculo de la verosimilitud de un árbol (en los enfoques bayesianos y de máxima verosimilitud para la estimación de árboles) y se utilizan para estimar la distancia evolutiva entre secuencias a partir de las diferencias observadas entre ellas.

Introducción

Estos modelos son descripciones fenomenológicas de la evolución del ADN como una secuencia de cuatro estados discretos. Estos modelos de Markov no describen explícitamente el mecanismo de mutación ni la acción de la selección natural. Más bien, describen las tasas relativas de diferentes cambios. Por ejemplo, es probable que tanto los sesgos mutacionales como la selección purificadora que favorece los cambios conservadores sean responsables de la tasa relativamente alta de transiciones en comparación con las transversiones en las secuencias en evolución. Sin embargo, el modelo de Kimura (K80) que se describe a continuación solo intenta capturar el efecto de ambas fuerzas en un parámetro que refleja la tasa relativa de transiciones a transversiones.

Los análisis evolutivos de secuencias se realizan en una amplia variedad de escalas temporales. Por lo tanto, resulta conveniente expresar estos modelos en términos de las tasas instantáneas de cambio entre diferentes estados (las matrices Q que se muestran a continuación). Si se nos proporciona un estado inicial (ancestral) en una posición, la matriz Q del modelo y una longitud de rama que expresa el número esperado de cambios ocurridos desde el ancestro, podemos derivar la probabilidad de que la secuencia descendiente presente cada uno de los cuatro estados. Los detalles matemáticos de esta transformación de matriz de tasas a matriz de probabilidad se describen en la sección de matemáticas de los modelos de sustitución de la página de modelos de sustitución . Al expresar los modelos en términos de las tasas instantáneas de cambio, podemos evitar estimar un gran número de parámetros para cada rama de un árbol filogenético (o para cada comparación si el análisis implica muchas comparaciones de secuencias por pares).

Los modelos descritos en esta página describen la evolución de un único sitio dentro de un conjunto de secuencias. Se utilizan a menudo para analizar la evolución de un locus completo , bajo la simplificación de que los diferentes sitios evolucionan de forma independiente y se distribuyen de manera idéntica . Esta suposición puede justificarse si se asume que los sitios evolucionan de forma neutral . Si el efecto principal de la selección natural sobre la evolución de las secuencias es restringir algunos sitios, se pueden utilizar modelos de heterogeneidad de tasas entre sitios. Este enfoque permite estimar una única matriz de tasas relativas de sustitución y otro conjunto de parámetros que describen la varianza en la tasa total de sustitución entre sitios.

La evolución del ADN como una cadena de Markov en tiempo continuo

Cadenas de Markov de tiempo continuo

Las cadenas de Markov de tiempo continuo tienen las matrices de transición habituales que, además, están parametrizadas por el tiempo,t{\displaystyle t}. Específicamente, simi1,mi2,mi3,mi4{\ Displaystyle E_ {1}, E_ {2}, E_ {3}, E_ {4}}son los estados, luego la matriz de transición

PAG(t)=(PAGij(t)){\displaystyle P(t)={\big (}P_{ij}(t){\big )}}donde cada entrada individual,PAGij(t){\displaystyle P_{ij}(t)}se refiere a la probabilidad de que el estadomii{\displaystyle E_{i}}cambiará al estadomij{\displaystyle E_{j}}a tiempot{\displaystyle t}.

Ejemplo: Nos gustaría modelar el proceso de sustitución en secuencias de ADN ( es decir , Jukes-Cantor , Kimura, etc. ) en tiempo continuo. Las matrices de transición correspondientes tendrán el siguiente aspecto:

PAG(t)=(pagAA(t)pagAGRAMO(t)pagAdo(t)pagAT(t)pagGRAMOA(t)pagGRAMOGRAMO(t)pagGRAMOdo(t)pagGRAMOT(t)pagdoA(t)pagdoGRAMO(t)pagdodo(t)pagdoT(t)pagTA(t)pagTGRAMO(t)pagTdo(t)pagTT(t)){\displaystyle P(t)={\begin{pmatrix}p_{\mathrm {AA} }(t)&p_{\mathrm {AG} }(t)&p_{\mathrm {AC} }(t)&p_{\mathrm {AT} }(t)\\p_{\mathrm {GA} }(t)&p_{\mathrm {GG} }(t)&p_{\mathrm {GC} }(t)&p_{\mathrm {GT} }(t)\\p_{\mathrm {CA} }(t)&p_{\mathrm {CG} }(t)&p_{\mathrm {CC} }(t)&p_{\mathrm {CT} }(t)\\p_{\mathrm {TA} }(t)&p_{\mathrm {TG} }(t)&p_{\mathrm {TC} }(t)&p_{\mathrm {TT} }(t)\end{pmatrix}}}

donde los bloques de 2 × 2 superior izquierdo e inferior derecho corresponden a las probabilidades de transición y los bloques de 2 × 2 superior derecho e inferior izquierdo corresponden a las probabilidades de transversión .    

Suposición: Si en algún momentot0{\displaystyle t_{0}}, la cadena de Markov está en estadomii{\displaystyle E_{i}}, entonces la probabilidad de que en el tiempot0+t{\displaystyle t_{0}+t}estará en el estadomij{\displaystyle E_{j}}depende únicamente dei{\displaystyle i},j{\displaystyle j}yt{\displaystyle t}Esto nos permite entonces escribir esa probabilidad comopagij(t){\displaystyle p_{ij}(t)}.

Teorema: Las matrices de transición en tiempo continuo satisfacen:

PAG(t+τ)=PAG(t)PAG(τ){\displaystyle P(t+\tau )=P(t)P(\tau )}

Nota: Existe una posible confusión entre dos significados de la palabra transición . (i) En el contexto de las cadenas de Markov , transición es el término general para el cambio entre dos estados. (ii) En el contexto de los cambios de nucleótidos en las secuencias de ADN , transición es un término específico para el intercambio entre las dos purinas (A ↔ G) o las dos pirimidinas (C ↔ T) (para más detalles, véase el artículo sobre transiciones en genética ). Por el contrario, un intercambio entre una purina y una pirimidina se denomina transversión .

Derivación de la dinámica de la sustitución

Consideremos una secuencia de ADN de longitud fija m que evoluciona en el tiempo mediante reemplazo de bases. Supongamos que los procesos seguidos por los m sitios son independientes markovianos, idénticamente distribuidos y que el proceso es constante en el tiempo. Para un sitio en particular, sea

mi={A,GRAMO,do,T}{\displaystyle {\mathcal {E}}=\{A,\,G,\,C,\,T\}}

sea ​​el conjunto de estados posibles para el sitio, y

pag(t)=(pagA(t),pagGRAMO(t),pagdo(t),pagT(t)){\displaystyle \mathbf {p} (t)=(p_{A}(t),\,p_{G}(t),\,p_{C}(t),\,p_{T}(t))}

sus respectivas probabilidades en el momentot{\displaystyle t}. Para dos distintosincógnita,ymi{\displaystyle x,y\in {\mathcal {E}}}, dejarμincógnitay {\displaystyle \mu _{xy}\ }sea ​​la tasa de transición del estadoincógnita{\displaystyle x}para declarary{\displaystyle y}. De manera similar, para cualquierincógnita{\displaystyle x}, sea la tasa total de cambio deincógnita{\displaystyle x}ser

μincógnita=yincógnitaμincógnitay.{\displaystyle \mu _{x}=\sum _{y\neq x}\mu _{xy}\,.}

Los cambios en la distribución de probabilidadpagA(t){\displaystyle p_{A}(t)}durante pequeños intervalos de tiempoΔt{\displaystyle \Delta t}son dados por

pagA(t+Δt)=pagA(t)pagA(t)μAΔt+incógnitaApagincógnita(t)μincógnitaAΔt.{\displaystyle p_{A}(t+\Delta t)=p_{A}(t)-p_{A}(t)\mu _{A}\Delta t+\sum _{x\neq A}p_{x}(t)\mu _{xA}\Delta t\,.}

En otras palabras, (en lenguaje frecuentista), la frecuencia deA{\displaystyle A}es en ese momentot+Δt{\displaystyle t+\Delta t}es igual a la frecuencia en el tiempot{\displaystyle t}menos la frecuencia de la pérdidaA{\displaystyle A}más la frecuencia de los recién creadosA{\displaystyle A}'s.

De forma similar para las probabilidadespagGRAMO(t){\displaystyle p_{G}(t)},pagdo(t){\displaystyle p_{C}(t)}ypagT(t){\displaystyle p_{T}(t)}Estas ecuaciones se pueden escribir de forma compacta como

pag(t+Δt)=pag(t)+pag(t)QΔt,{\displaystyle \mathbf {p} (t+\Delta t)=\mathbf {p} (t)+\mathbf {p} (t)Q\Delta t\,,}

dónde

Q=(μAμAGRAMOμAdoμATμGRAMOAμGRAMOμGRAMOdoμGRAMOTμdoAμdoGRAMOμdoμdoTμTAμTGRAMOμTdoμT){\displaystyle Q={\begin{pmatrix}-\mu _{A}&\mu _{AG}&\mu _{AC}&\mu _{AT}\\\mu _{GA}&-\mu _{G}&\mu _{GC}&\mu _{GT}\\\mu _{CA}&\mu _{CG}&-\mu _{C}&\mu _{CT}\\\mu _{TA}&\mu _{TG}&\mu _{TC}&-\mu _{T}\end{pmatrix}}}

se conoce como la matriz de tasas . Tenga en cuenta que, por definición, la suma de las entradas en cada fila deQ{\displaystyle Q}es igual a cero. De ello se deduce que

pag(t)=pag(t)Q.{\displaystyle \mathbf {p} '(t)=\mathbf {p} (t)Q\,.}

Para un proceso estacionario , dondeQ{\displaystyle Q}no depende del tiempo t , esta ecuación diferencial se puede resolver. Primero,

PAG(t)=exp(tQ),{\displaystyle P(t)=\exp(tQ),}

dóndeexp(tQ){\displaystyle \exp(tQ)}denota la exponencial de la matriztQ{\displaystyle tQ}. Como resultado,

pag(t)=pag(0)PAG(t)=pag(0)exp(tQ).{\displaystyle \mathbf {p} (t)=\mathbf {p} (0)P(t)=\mathbf {p} (0)\exp(tQ)\,.}

Ergodicidad

Si la cadena de Markov es irreducible , es decir, si siempre es posible pasar de un estado a otroincógnita{\displaystyle x}a un estadoy{\displaystyle y}(posiblemente en varios pasos), entonces también es ergódico . Como resultado, tiene una distribución estacionaria única.π={πincógnita,incógnitami}{\displaystyle {\boldsymbol {\pi }}=\{\pi _{x},\,x\in {\mathcal {E}}\}}, dóndeπincógnita{\displaystyle \pi _{x}}corresponde a la proporción de tiempo que se pasa en el estadoincógnita{\displaystyle x}después de que la cadena de Markov se haya ejecutado durante un tiempo infinito. En la evolución del ADN, bajo el supuesto de un proceso común para cada sitio, las frecuencias estacionariasπA,πGRAMO,πdo,πT{\displaystyle \pi _{A},\,\pi _{G},\,\pi _{C},\,\pi _{T}}corresponden a composiciones de base de equilibrio. De hecho, observe que dado que la distribución estacionariaπ{\displaystyle {\boldsymbol {\pi }}}SatisfaceπQ=0{\displaystyle {\boldsymbol {\pi }}Q=0}, vemos que cuando la distribución actualpag(t){\displaystyle \mathbf {p} (t)}es la distribución estacionariaπ{\displaystyle {\boldsymbol {\pi }}}tenemos

pag(t)=pag(t)Q=πQ=0.{\displaystyle {\mathbf {p} '(t)=\mathbf {p} (t)Q={\boldsymbol {\pi }}}Q=0\,.}

En otras palabras, las frecuencias depagA(t),pagGRAMO(t),pagdo(t),pagT(t){\displaystyle p_{A}(t),\,p_{G}(t),\,p_{C}(t),\,p_{T}(t)}no cambiar.

Reversibilidad temporal

Definición : Un proceso de Markov estacionario es reversible en el tiempo si (en el estado estacionario) la cantidad de cambio del estadoincógnita {\displaystyle x\ }ay {\displaystyle y\ }es igual a la cantidad de cambio dey {\displaystyle y\ }aincógnita {\displaystyle x\ }(aunque los dos estados pueden ocurrir con frecuencias diferentes). Esto significa que:

πincógnitaμincógnitay=πyμyincógnita {\displaystyle \pi _{x}\mu _{xy}=\pi _{y}\mu _{yx}\ }

No todos los procesos estacionarios son reversibles; sin embargo, la mayoría de los modelos de evolución del ADN que se utilizan habitualmente asumen la reversibilidad temporal, lo que se considera una suposición razonable.

Bajo el supuesto de reversibilidad temporal, seasincógnitay=μincógnitay/πy {\displaystyle s_{xy}=\mu _{xy}/\pi _{y}\ }Entonces es fácil ver que:

sincógnitay=syincógnita {\displaystyle s_{xy}=s_{yx}\ }

Definición El término simétricosincógnitay {\displaystyle s_{xy}\ }Se denomina intercambiabilidad entre estados.incógnita {\displaystyle x\ }yy {\displaystyle y\ }. En otras palabras,sincógnitay {\displaystyle s_{xy}\ }es la fracción de la frecuencia del estadoincógnita {\displaystyle x\ }ese es el resultado de transiciones de estadoy {\displaystyle y\ }para declararincógnita {\displaystyle x\ }.

Corolario Las 12 entradas fuera de la diagonal de la matriz de tasas,Q {\displaystyle Q\ }(tenga en cuenta que las entradas fuera de la diagonal determinan las entradas diagonales, ya que las filas deQ {\displaystyle Q\ }La suma de los dígitos (que es igual a cero) puede determinarse completamente mediante 9 números; estos son: 6 términos de intercambiabilidad y 3 frecuencias estacionarias.πincógnita {\displaystyle \pi _{x}\ }, (ya que las frecuencias estacionarias suman 1).

Escalado de longitudes de ramas

Al comparar secuencias existentes, se puede determinar el grado de divergencia de secuencias. Esta medida directa de divergencia proporciona información sobre la cantidad de cambios que han ocurrido a lo largo del camino que separa las secuencias. El simple recuento de diferencias (la distancia de Hamming ) entre secuencias a menudo subestima la cantidad de sustituciones debido a los múltiples eventos (véase homoplasia ). Intentar estimar la cantidad exacta de cambios que han ocurrido es difícil y, por lo general, innecesario. En cambio, las longitudes de rama (y las longitudes de camino) en los análisis filogenéticos se suelen expresar como la cantidad esperada de cambios por sitio. La longitud del camino es el producto de la duración del camino en el tiempo y la tasa media de sustituciones. Si bien su producto se puede estimar, la tasa y el tiempo no se pueden identificar a partir de la divergencia de secuencias.

Las descripciones de las matrices de tasas en esta página reflejan con precisión la magnitud relativa de las diferentes sustituciones, pero estas matrices no están escaladas de manera que una longitud de rama de 1 produzca un cambio esperado. Este escalado se puede lograr multiplicando cada elemento de la matriz por el mismo factor, o simplemente escalando las longitudes de rama. Si usamos β para denotar el factor de escalado y ν para denotar la longitud de rama medida en el número esperado de sustituciones por sitio, entonces βν se usa en las fórmulas de probabilidad de transición a continuación en lugar de μ t . Nótese que ν es un parámetro que se estima a partir de los datos y se denomina longitud de rama, mientras que β es simplemente un número que se puede calcular a partir de la matriz de tasas (no es un parámetro libre independiente).

El valor de β se puede encontrar forzando la tasa esperada de flujo de estados a 1. Las entradas diagonales de la matriz de tasas (la matriz Q ) representan -1 veces la tasa de salida de cada estado. Para modelos reversibles en el tiempo , conocemos las frecuencias de los estados de equilibrio (estas son simplemente el valor del parámetro π i para el estado i ). Por lo tanto, podemos encontrar la tasa esperada de cambio calculando la suma del flujo de salida de cada estado ponderada por la proporción de sitios que se espera que estén en esa clase. Establecer β como el recíproco de esta suma garantizará que el proceso escalado tenga un flujo esperado de 1:

β=1/(iπiμii){\displaystyle \beta =1/\left(-\sum _{i}\pi _{i}\mu _{ii}\right)}

Por ejemplo, en el Jukes-Cantor, el factor de escala sería 4/(3 μ ) porque la tasa de salida de cada estado es 3μ/4 .

Modelos más comunes de evolución del ADN

Modelo JC69 (Jukes y Cantor 1969)

JC69, el modelo de Jukes y Cantor de 1969, [ 2 ] es el modelo de sustitución más simple . Tiene varias suposiciones. Asume frecuencias base iguales.(πA=πGRAMO=πdo=πT=14){\displaystyle \left(\pi _{A}=\pi _{G}=\pi _{C}=\pi _{T}={1 \over 4}\right)}y tasas de mutación iguales . Por lo tanto, el único parámetro de este modelo esμ{\displaystyle \mu }, la tasa de sustitución global. Como se mencionó anteriormente, esta variable se convierte en una constante cuando normalizamos la tasa media a 1.

Q=(μ4μ4μ4μ4μ4μ4μ4μ4μ4μ4μ4μ4){\displaystyle Q={\begin{pmatrix}{*}&{\mu \over 4}&{\mu \over 4}&{\mu \over 4}\\{\mu \over 4}&{*}&{\mu \over 4}&{\mu \over 4}\\{\mu \over 4}&{\mu \over 4}&{*}&{\mu \over 4}\\{\mu \over 4}&{\mu \over 4}&{\mu \over 4}&{*}\end{pmatrix}}}
ProbabilidadPAGij{\displaystyle P_{ij}}de cambiar desde el estado iniciali{\displaystyle i}al estado finalj{\displaystyle j}en función de la longitud de la rama (ν{\displaystyle \nu }) para JC69. Curva roja: estados de nucleótidosi{\displaystyle i}yj{\displaystyle j}son diferentes. Curva azul: los estados inicial y final son iguales. Después de un tiempo prolongado, las probabilidades tienden a las frecuencias de equilibrio de nucleótidos (0,25: línea discontinua).
PAG=(14+34mitμ1414mitμ1414mitμ1414mitμ1414mitμ14+34mitμ1414mitμ1414mitμ1414mitμ1414mitμ14+34mitμ1414mitμ1414mitμ1414mitμ1414mitμ14+34mitμ){\displaystyle P={\begin{pmatrix}{{1 \over 4}+{3 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}\\\\{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}+{3 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}\\\\{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}+{3 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}\\\\{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}-{1 \over 4}e^{-t\mu }}&{{1 \over 4}+{3 \over 4}e^{-t\mu }}\end{pmatrix}}}

Cuando la longitud de la rama,ν{\displaystyle \nu }, se mide en el número esperado de cambios por sitio entonces:

PAGij(ν)={14+34mi4ν/3 si i=j1414mi4ν/3 si ij{\displaystyle P_{ij}(\nu )=\left\{{\begin{array}{cc}{1 \over 4}+{3 \over 4}e^{-4\nu /3}&{\mbox{ if }}i=j\\{1 \over 4}-{1 \over 4}e^{-4\nu /3}&{\mbox{ if }}i\neq j\end{array}}\right.}

Vale la pena señalar queν=34tμ=(μ4+μ4+μ4)t{\displaystyle \nu ={3 \over 4}t\mu =({\mu \over 4}+{\mu \over 4}+{\mu \over 4})t}¿Qué representa la suma de cualquier columna (o fila) de la matriz?Q{\displaystyle Q}multiplicado por el tiempo y, por lo tanto, significa el número esperado de sustituciones en el tiempo.t{\displaystyle t}(duración de la rama) para cada sitio en particular (por sitio) cuando la tasa de sustitución es igual aμ{\displaystyle \mu }.

Dada la proporciónpag{\displaystyle p}de sitios que difieren entre las dos secuencias la estimación de Jukes-Cantor de la distancia evolutiva (en términos del número esperado de cambios) entre dos secuencias viene dada por

d^=34ln(143pag)=ν^{\displaystyle {\hat {d}}=-{3 \over 4}\ln({1-{4 \over 3}p})={\hat {\nu }}}

Elpag{\displaystyle p}en esta fórmula se hace referencia frecuentemente como lapag{\displaystyle p}-distancia. Es una estadística suficiente para calcular la corrección de distancia de Jukes-Cantor, pero no es suficiente para el cálculo de la distancia evolutiva bajo los modelos más complejos que siguen (tenga en cuenta también quepag{\displaystyle p}utilizado en fórmulas posteriores no es idéntico a la "pag{\displaystyle p}-distancia").

Modelo K80 (Kimura 1980)

K80, el modelo de Kimura de 1980, [ 3 ] a menudo denominado modelo de dos parámetros de Kimura (o modelo K2P ), distingue entre transiciones (AGRAMO{\displaystyle A\leftrightarrow G}, es decir, de purina a purina, odoT{\displaystyle C\leftrightarrow T}, es decir, de pirimidina a pirimidina) y transversiones (de purina a pirimidina o viceversa). En la descripción original del modelo de Kimura, α y β se usaban para denotar las tasas de estos tipos de sustituciones, pero ahora es más común establecer la tasa de transversiones en 1 y usar κ para denotar la relación de tasas de transición/transversión (como se hace a continuación). El modelo K80 supone que todas las bases son igualmente frecuentes (πA=πGRAMO=πdo=πT=14{\displaystyle \pi _{A}=\pi _{G}=\pi _{C}=\pi _{T}={1 \over 4}}).

Matriz de tasas Q=(κ11κ1111κ11κ){\displaystyle Q={\begin{pmatrix}{*}&{\kappa }&{1}&{1}\\{\kappa }&{*}&{1}&{1}\\{1}&{1}&{*}&{\kappa }\\{1}&{1}&{\kappa }&{*}\end{pmatrix}}}con columnas que corresponden aA{\displaystyle A},GRAMO{\displaystyle G},do{\displaystyle C}, yT{\displaystyle T}, respectivamente.

La distancia de Kimura de dos parámetros viene dada por:

K=12ln((12pagq)12q){\displaystyle K=-{1 \over 2}\ln((1-2p-q){\sqrt {1-2q}})}

donde p es la proporción de sitios que muestran diferencias transicionales y q es la proporción de sitios que muestran diferencias transversionales.

Modelo K81 (Kimura 1981)

K81, el modelo de Kimura de 1981, [ 4 ] a menudo llamado modelo de tres parámetros de Kimura (modelo K3P) o modelo de tres tipos de sustitución de Kimura (K3ST), tiene tasas distintas para las transiciones y dos tipos distintos de transversiones . Los dos tipos de transversión son aquellos que conservan las propiedades débiles/fuertes de los nucleótidos (es decir,AT{\displaystyle A\leftrightarrow T}ydoGRAMO{\displaystyle C\leftrightarrow G}, denotado por el símboloγ{\displaystyle \gamma }[ 4 ] ) y aquellos que conservan las propiedades amino/ceto de los nucleótidos (es decir,Ado{\displaystyle A\leftrightarrow C}yGRAMOT{\displaystyle G\leftrightarrow T}, denotado por el símboloβ{\displaystyle \beta }[ 4 ] ). El modelo K81 supone que todas las frecuencias base de equilibrio son iguales (es decir,πA=πGRAMO=πdo=πT=0,25{\displaystyle \pi _{A}=\pi _{G}=\pi _{C}=\pi _{T}=0.25}).

Matriz de tasas Q=(αβγαγββγαγβα){\displaystyle Q={\begin{pmatrix}{*}&{\alpha }&{\beta }&{\gamma }\\{\alpha }&{*}&{\gamma }&{\beta }\\{\beta }&{\gamma }&{*}&{\alpha }\\{\gamma }&{\beta }&{\alpha }&{*}\end{pmatrix}}}con columnas que corresponden aA{\displaystyle A},GRAMO{\displaystyle G},do{\displaystyle C}, yT{\displaystyle T}, respectivamente.

El modelo K81 se utiliza con mucha menos frecuencia que el modelo K80 (K2P) para la estimación de distancias y rara vez es el modelo que mejor se ajusta en la filogenética de máxima verosimilitud. A pesar de estos hechos, el modelo K81 se ha seguido estudiando en el contexto de la filogenética matemática. [ 5 ] [ 6 ] [ 7 ] Una propiedad importante es la capacidad de realizar una transformación de Hadamard asumiendo que los patrones de sitios se generaron en un árbol con nucleótidos que evolucionan bajo el modelo K81. [ 8 ] [ 9 ] [ 10 ]

Cuando se utiliza en el contexto de la filogenética, la transformación de Hadamard proporciona un medio elegante y totalmente invertible para calcular las frecuencias esperadas de patrones de sitios dada una serie de longitudes de ramas (o viceversa). A diferencia de muchos cálculos de máxima verosimilitud, los valores relativos paraα{\displaystyle \alpha },β{\displaystyle \beta }, yγ{\displaystyle \gamma }puede variar entre ramas y la transformación de Hadamard puede incluso proporcionar evidencia de que los datos no se ajustan a un árbol. La transformación de Hadamard también se puede combinar con una amplia variedad de métodos para acomodar la heterogeneidad de la tasa entre sitios, [ 11 ] utilizando distribuciones continuas en lugar de las aproximaciones discretas que se utilizan típicamente en la filogenética de máxima verosimilitud [ 12 ] (aunque hay que sacrificar la invertibilidad de la transformación de Hadamard para usar ciertas distribuciones de heterogeneidad de la tasa entre sitios [ 11 ] ).

Modelo F81 (Felsenstein 1981)

F81, el modelo de Felsenstein de 1981, [ 13 ] es una extensión del modelo JC69 en el que se permite que las frecuencias base varíen desde 0,25 (πAπGRAMOπdoπT{\displaystyle \pi _{A}\neq \pi _{G}\neq \pi _{C}\neq \pi _{T}})

Matriz de tasas:

Q=(πGRAMOπdoπTπAπdoπTπAπGRAMOπTπAπGRAMOπdo){\displaystyle Q={\begin{pmatrix}{*}&{\pi _{G}}&{\pi _{C}}&{\pi _{T}}\\{\pi _{A}}&{*}&{\pi _{C}}&{\pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{*}&{\pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{\pi _{C}}&{*}\end{pmatrix}}}

Cuando la longitud de la rama, ν, se mide en el número esperado de cambios por sitio, entonces:

β=1/(1πA2πdo2πGRAMO2πT2){\displaystyle \beta =1/(1-\pi _{A}^{2}-\pi _{C}^{2}-\pi _{G}^{2}-\pi _{T}^{2})}
PAGij(ν)={miβν+πj(1miβν) si i=jπj(1miβν) si ij{\displaystyle P_{ij}(\nu )=\left\{{\begin{array}{cc}e^{-\beta \nu }+\pi _{j}\left(1-e^{-\beta \nu }\right)&{\mbox{ if }}i=j\\\pi _{j}\left(1-e^{-\beta \nu }\right)&{\mbox{ if }}i\neq j\end{array}}\right.}

Modelo HKY85 (Hasegawa, Kishino y Yano 1985)

HKY85, el modelo de Hasegawa, Kishino y Yano de 1985, [ 14 ] puede considerarse como una combinación de las extensiones realizadas en los modelos de Kimura80 y Felsenstein81. Es decir, distingue entre la tasa de transiciones y transversiones (utilizando el parámetro κ), y permite frecuencias base desiguales (πAπGRAMOπdoπT{\displaystyle \pi _{A}\neq \pi _{G}\neq \pi _{C}\neq \pi _{T}}).

Matriz de tasas Q=(κπGRAMOπdoπTκπAπdoπTπAπGRAMOκπTπAπGRAMOκπdo){\displaystyle Q={\begin{pmatrix}{*}&{\kappa \pi _{G}}&{\pi _{C}}&{\pi _{T}}\\{\kappa \pi _{A}}&{*}&{\pi _{C}}&{\pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{*}&{\kappa \pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{\kappa \pi _{C}}&{*}\end{pmatrix}}}

Si expresamos la longitud de la rama, ν, en términos del número esperado de cambios por sitio, entonces:

β=12(πA+πGRAMO)(πdo+πT)+2κ[(πAπGRAMO)+(πdoπT)]{\displaystyle \beta ={\frac {1}{2(\pi _{A}+\pi _{G})(\pi _{C}+\pi _{T})+2\kappa [(\pi _{A}\pi _{G})+(\pi _{C}\pi _{T})]}}}
PAGAA(ν,κ,π)=[πA(πA+πGRAMO+(πdo+πT)miβν)+πGRAMOmi(1+(πA+πGRAMO)(κ1.0))βν]/(πA+πGRAMO){\displaystyle P_{AA}(\nu ,\kappa ,\pi )=\left[\pi _{A}\left(\pi _{A}+\pi _{G}+(\pi _{C}+\pi _{T})e^{-\beta \nu }\right)+\pi _{G}e^{-(1+(\pi _{A}+\pi _{G})(\kappa -1.0))\beta \nu }\right]/(\pi _{A}+\pi _{G})}
PAGAdo(ν,κ,π)=πdo(1.0miβν){\displaystyle P_{AC}(\nu ,\kappa ,\pi )=\pi _{C}\left(1.0-e^{-\beta \nu }\right)}
PAGAGRAMO(ν,κ,π)=[πGRAMO(πA+πGRAMO+(πdo+πT)miβν)πGRAMOmi(1+(πA+πGRAMO)(κ1.0))βν]/(πA+πGRAMO){\displaystyle P_{AG}(\nu ,\kappa ,\pi )=\left[\pi _{G}\left(\pi _{A}+\pi _{G}+(\pi _{C}+\pi _{T})e^{-\beta \nu }\right)-\pi _{G}e^{-(1+(\pi _{A}+\pi _{G})(\kappa -1.0))\beta \nu }\right]/\left(\pi _{A}+\pi _{G}\right)}
PAGAT(ν,κ,π)=πT(1.0miβν){\displaystyle P_{AT}(\nu ,\kappa ,\pi )=\pi _{T}\left(1.0-e^{-\beta \nu }\right)}

y la fórmula para las demás combinaciones de estados se puede obtener sustituyendo las frecuencias base apropiadas.

Felsenstein describió un modelo similar (pero no equivalente) en 1984 utilizando una parametrización diferente; [ 15 ] ese último modelo se conoce como el modelo F84. [ 16 ]

Modelo T92 (Tamura 1992)

T92, el modelo de Tamura de 1992, [ 17 ] es una extensión de K80 que añade un parámetro más, el contenido de G+C , un parámetro de frecuencia base compuesta.θ(0,1){\displaystyle \theta \in (0,1)}(también se ha señaladoπGRAMOdo{\displaystyle \pi _{GC}})=πGRAMO+πdo{\displaystyle =\pi _{G}+\pi _{C}}=1(πA+πT).{\displaystyle =1-(\pi _{A}+\pi _{T}).}Es útil cuando existen fuertes sesgos de transición-transversión y contenido de G+C, como en el caso del ADN mitocondrial de Drosophila . [ 17 ]

T92 corresponde a la matriz de tasasQ=(κπGRAMOdo/2πGRAMOdo/2πAT/2κπAT/2πGRAMOdo/2πAT/2πAT/2πGRAMOdo/2κπAT/2πAT/2πGRAMOdo/2κπGRAMOdo/2){\displaystyle Q={\begin{pmatrix}{*}&{\kappa \pi _{GC}/2}&{\pi _{GC}/2}&{\pi _{AT}/2}\\{\kappa \pi _{AT}/2}&{*}&{\pi _{GC}/2}&{\pi _{AT}/2}\\{\pi _{AT}/2}&{\pi _{GC}/2}&{*}&{\kappa \pi _{AT}/2}\\{\pi _{AT}/2}&{\pi _{GC}/2}&{\kappa \pi _{GC}/2}&{*}\end{pmatrix}}}

La distancia evolutiva entre dos secuencias de ADN según este modelo viene dada por

d=hln(1paghq)12(1h)ln(12q){\displaystyle d=-h\ln(1-{p \over h}-q)-{1 \over 2}(1-h)\ln(1-2q)}

dóndeh=2θ(1θ){\displaystyle h=2\theta (1-\theta )}yθ{\displaystyle \theta }es el contenido G+C (πGRAMOdo=πGRAMO+πdo{\displaystyle \pi _{GC}=\pi _{G}+\pi _{C}}).

Este método también puede tratarse como una simplificación de HKY85, ya que asume la segunda regla de paridad de Chargaff , donde los nucleótidos emparejados tienen la misma frecuencia en una sola hebra de ADN, G y C por un lado, y A y T por otro. En otras palabras, las frecuencias de cuatro bases se expresan como una función deπGRAMOdo{\displaystyle \pi _{GC}}:

πGRAMO=πdo=πGRAMOdo2{\displaystyle \pi _{G}=\pi _{C}={\pi _{GC} \over 2}}
πA=πT=(1πGRAMOdo)2{\displaystyle \pi _{A}=\pi _{T}={(1-\pi _{GC}) \over 2}}

por lo tanto, se eliminan dos grados de libertad.

Modelo TN93 (Tamura y Nei, 1993)

TN93, el modelo de Tamura y Nei de 1993, [ 18 ] distingue entre los dos tipos diferentes de transición ; es decir (AGRAMO{\displaystyle A\leftrightarrow G}) se le permite tener una tasa diferente a (doT{\displaystyle C\leftrightarrow T}Se supone que todas las transversiones ocurren a la misma velocidad, pero se permite que esa velocidad sea diferente de las dos velocidades de las transiciones.

TN93 también permite frecuencias base desiguales (πAπGRAMOπdoπT{\displaystyle \pi _{A}\neq \pi _{G}\neq \pi _{C}\neq \pi _{T}}).

Matriz de tasas Q=(κ1πGRAMOπdoπTκ1πAπdoπTπAπGRAMOκ2πTπAπGRAMOκ2πdo){\displaystyle Q={\begin{pmatrix}{*}&{\kappa _{1}\pi _{G}}&{\pi _{C}}&{\pi _{T}}\\{\kappa _{1}\pi _{A}}&{*}&{\pi _{C}}&{\pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{*}&{\kappa _{2}\pi _{T}}\\{\pi _{A}}&{\pi _{G}}&{\kappa _{2}\pi _{C}}&{*}\end{pmatrix}}}

Modelo GTR (Tavaré 1986)

GTR, el modelo generalizado reversible en el tiempo de Tavaré 1986, [ 19 ] es el modelo reversible en el tiempo neutral, independiente y de sitios finitos más general posible. Fue descrito por primera vez en forma general por Simon Tavaré en 1986. [ 19 ]

Los parámetros GTR consisten en un vector de frecuencia base de equilibrio,Π=(πA,πGRAMO,πdo,πT){\displaystyle \Pi =(\pi _{A},\pi _{G},\pi _{C},\pi _{T})}, dando la frecuencia con la que cada base aparece en cada sitio, y la matriz de tasas

Q=((απGRAMO+βπdo+γπT)απGRAMOβπdoγπTαπA(απA+δπdo+ϵπT)δπdoϵπTβπAδπGRAMO(βπA+δπGRAMO+ηπT)ηπTγπAϵπGRAMOηπdo(γπA+ϵπGRAMO+ηπdo)){\displaystyle Q={\begin{pmatrix}{-(\alpha \pi _{G}+\beta \pi _{C}+\gamma \pi _{T})}&{\alpha \pi _{G}}&{\beta \pi _{C}}&{\gamma \pi _{T}}\\{\alpha \pi _{A}}&{-(\alpha \pi _{A}+\delta \pi _{C}+\epsilon \pi _{T})}&{\delta \pi _{C}}&{\epsilon \pi _{T}}\\{\beta \pi _{A}}&{\delta \pi _{G}}&{-(\beta \pi _{A}+\delta \pi _{G}+\eta \pi _{T})}&{\eta \pi _{T}}\\{\gamma \pi _{A}}&{\epsilon \pi _{G}}&{\eta \pi _{C}}&{-(\gamma \pi _{A}+\epsilon \pi _{G}+\eta \pi _{C})}\end{pmatrix}}}

Dónde

α=r(AGRAMO)=r(GRAMOA)β=r(Ado)=r(doA)γ=r(AT)=r(TA)δ=r(GRAMOdo)=r(doGRAMO)ϵ=r(GRAMOT)=r(TGRAMO)η=r(doT)=r(Tdo){\displaystyle {\begin{aligned}\alpha =r(A\rightarrow G)=r(G\rightarrow A)\\\beta =r(A\rightarrow C)=r(C\rightarrow A)\\\gamma =r(A\rightarrow T)=r(T\rightarrow A)\\\delta =r(G\rightarrow C)=r(C\rightarrow G)\\\epsilon =r(G\rightarrow T)=r(T\rightarrow G)\\\eta =r(C\rightarrow T)=r(T\rightarrow C)\end{aligned}}}

Grados de libertad frente al número de parámetros

GTR (para cuatro caracteres, como suele ser el caso en filogenética) como se indicó anteriormente incluye 6 parámetros de tasa de sustitución y 4 parámetros de frecuencia de base. Sin embargo, solo están presentes 3 parámetros de frecuencia de base "verdaderos" que actúan como grados de libertad porqueπA+πGRAMO+πdo+πT=1{\displaystyle \pi _{A}+\pi _{G}+\pi _{C}+\pi _{T}=1}Los métodos filogenéticos también son invariantes a la escala con respecto a la tasa de sustitución.μ=α+β+γ+δ+ϵ+η{\displaystyle \mu =\alpha +\beta +\gamma +\delta +\epsilon +\eta }También es invariante a escala (lo que hace razonable establecerμ=1{\displaystyle \mu =1}), por lo que en realidad solo hay 8 grados de libertad. [ 20 ] : (Tasas de sustitución de bases)

La idea anterior también se aplica a otros modelos. El modelo K81 tiene 2 grados de libertad porque las tres tasas actúan efectivamente como dos. El modelo TN93 tiene 5 grados de libertad, 2 de las tasas y 3 de las frecuencias base. [ 20 ] : (Tasas de sustitución de base)

Conjuntos de caracteres más grandes

En general, para calcular el número de parámetros GTR dado un alfabeto de tamaño n , tendríamos n - 1 parámetros de frecuencia y12(norte2norte)1{\displaystyle {\frac {1}{2}}(n^{2}-n)-1}parámetros de velocidad, para un total de12norte2+12norte2{\displaystyle {\frac {1}{2}}n^{2}+{\frac {1}{2}}n-2}parámetros. Por ejemplo, para una secuencia de aminoácidos (hay 20 aminoácidos "estándar" que componen las proteínas ), se encontrarían 208 parámetros.

Sin embargo, al estudiar las regiones codificantes del genoma, es más común trabajar con un modelo de sustitución de codones (un codón son tres bases y codifica un aminoácido en una proteína).43=64{\displaystyle 4^{3}=64}codones (61 si solo se cuentan los que no son de parada), lo que supone un número irrazonablemente grande de grados de libertad para que funcione un modelo de tipo GTR.

Modelos de sustitución de dos estados

Una forma alternativa de analizar datos de secuencias de ADN es recodificar los nucleótidos como purinas (R) y pirimidinas (Y); [ 21 ] [ 22 ] esta práctica se denomina a menudo codificación RY. [ 23 ] Las inserciones y deleciones en alineamientos de secuencias múltiples también pueden codificarse como datos binarios [ 24 ] y analizarse utilizando un modelo de dos estados. [ 25 ] [ 26 ]

El modelo de dos estados más simple de evolución de secuencias se llama modelo de Cavender-Farris o modelo de Cavender-Farris- Neyman (CFN); el nombre de este modelo refleja el hecho de que fue descrito independientemente en varias publicaciones diferentes. [ 27 ] [ 28 ] [ 29 ] El modelo CFN es idéntico al modelo de Jukes-Cantor adaptado a dos estados e incluso se ha implementado como el modelo "JC2" en el popular paquete de software IQ-TREE (usar este modelo en IQ-TREE requiere codificar los datos como 0 y 1 en lugar de R e Y; el popular paquete de software PAUP* puede interpretar una matriz de datos que comprende solo R e Y como datos para ser analizados usando el modelo CFN). También es sencillo analizar datos binarios usando la transformación filogenética de Hadamard . [ 30 ] El modelo alternativo de dos estados permite que los parámetros de frecuencia de equilibrio de R e Y (o 0 y 1) tomen valores distintos de 0,5 agregando un único parámetro libre; Este modelo se denomina indistintamente CFu [ 21 ] o GTR2 (en IQ-TREE).

Otros métodos de recodificación son WS (débil-fuerte) y MK (amino-ceto).

Modelos de Lie-Markov

Los modelos de Lie-Markov son, desde un punto de vista matemático, modelos de Markov que forman un álgebra de Lie . [ 31 ] Para el matemático, esto los hace cerrados bajo la multiplicación de matrices . Desde el punto de vista de un filogenetista, estos modelos tienen la ventaja de poder agregar o eliminar taxones sin afectar los patrones de sitios que el modelo puede generar sobre los taxones restantes. También existe una jerarquía natural de modelos basada en la cantidad de parámetros que se pueden cambiar. Algunos modelos existentes, como JC y F81, ya son modelos de Lie-Markov, mientras que GTR no lo es. [ 32 ] Los modelos de Lie-Markov (con RY, WS o MK) están disponibles en IQ-TREE. [ 20 ]

Véase también

Referencias

  1. Arenas, Miguel (2015). "Tendencias en los modelos de sustitución de la evolución molecular" . Frontiers in Genetics . 6 : 319. doi : 10.3389/fgene.2015.00319 . ISSN 1664-8021 . PMC 4620419. PMID 26579193 .   
  2. Jukes TH, Cantor CR (1969). Evolución de las moléculas de proteínas . Nueva York: Academic Press. págs. 21–132 . 
  3. Kimura M (diciembre de 1980). "Un método simple para estimar las tasas evolutivas de sustituciones de bases a través de estudios comparativos de secuencias de nucleótidos". Journal of Molecular Evolution . 16 (2): 111– 20. Bibcode : 1980JMolE..16..111K . doi : 10.1007/BF01731581 . PMID 7463489. S2CID 19528200 .  
  4. 1 2 3 Kimura M (enero de 1981). "Estimación de distancias evolutivas entre secuencias de nucleótidos homólogas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 78 ( 1): 454– 8. Bibcode : 1981PNAS...78..454K . doi : 10.1073/pnas.78.1.454 . PMC 319072. PMID 6165991 .  
  5. Bashford JD, Jarvis PD, Sumner JG, Steel MA (2004-02-25). "Simetría U (1) × U (1) × U (1) del modelo 3ST de Kimura y procesos de ramificación filogenética". Journal of Physics A: Mathematical and General . 37 (8): L81– L89. arXiv : q-bio/0310037 . doi : 10.1088/0305-4470/37/8/L01 . S2CID 7845860 . 
  6. Sumner JG, Charleston MA, Jermiin LS, Jarvis PD (agosto de 2008). "Invariantes de Markov, pletismos y filogenética". Journal of Theoretical Biology . 253 (3): 601– 15. arXiv : 0711.3503 . Bibcode : 2008JThBi.253..601S . doi : 10.1016/j.jtbi.2008.04.001 . PMID 18513747. S2CID 6851591 .  
  7. Sumner JG, Jarvis PD, Holland BR (diciembre de 2014). "Un enfoque tensorial para la inversión de modelos filogenéticos basados ​​en grupos" . BMC Evolutionary Biology . 14 (1) 236. arXiv : 1212.3888 . Bibcode : 2014BMCEE..14..236S . doi : 10.1186/s12862-014-0236-6 . PMC 4268818. PMID 25472897 .  
  8. Hendy MD, Penny D, Steel MA (abril de 1994). "Un análisis discreto de Fourier para árboles evolutivos" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 91 (8): 3339–43 . Bibcode : 1994PNAS...91.3339H . doi : 10.1073 / pnas.91.8.3339 . PMC 43572. PMID 8159749 .  
  9. Hendy MD (2005). "Conjugación de Hadamard: una herramienta analítica para la filogenética" . En Gascuel O (ed.). Matemáticas de la evolución y la filogenia . Oxford University Press. pp. 143–177 . ISBN  978-0198566106.
  10. Hendy MD, Snir S (julio de 2008). "Conjugación de Hadamard para el modelo 3ST de Kimura: prueba combinatoria usando conjuntos de caminos". IEEE/ACM Transactions on Computational Biology and Bioinformatics . 5 (3): 461– 71. arXiv : q-bio/0505055 . Bibcode : 2008ITCBB...5..461H . doi : 10.1109/TCBB.2007.70227 . PMID 18670048 . S2CID 20633916 .  
  11. 1 2 Waddell PJ, Penny D, Moore T (agosto de 1997). "Conjugaciones de Hadamard y modelado de la evolución de secuencias con tasas desiguales entre sitios". Molecular Phylogenetics and Evolution . 8 (1): 33– 50. Bibcode : 1997MolPE...8...33W . doi : 10.1006/mpev.1997.0405 . PMID 9242594 . 
  12. Yang Z (septiembre de 1994). "Estimación filogenética de máxima verosimilitud a partir de secuencias de ADN con tasas variables en diferentes sitios: métodos aproximados". Journal of Molecular Evolution . 39 (3): 306–14 . Bibcode : 1994JMolE..39..306Y . CiteSeerX 10.1.1.305.951 . doi : 10.1007/BF00160154 . PMID 7932792. S2CID 17911050 .   
  13. Felsenstein J (1981). "Árboles evolutivos a partir de secuencias de ADN: un enfoque de máxima verosimilitud". Journal of Molecular Evolution . 17 (6): 368– 76. Bibcode : 1981JMolE..17..368F . doi : 10.1007/BF01734359 . PMID 7288891 . S2CID 8024924 .  
  14. Hasegawa M, Kishino H, Yano T (1985). "Datación de la separación entre humanos y simios mediante un reloj molecular de ADN mitocondrial". Journal of Molecular Evolution . 22 (2): 160– 74. Bibcode : 1985JMolE..22..160H . doi : 10.1007/BF02101694 . PMID 3934395. S2CID 25554168 .  
  15. Kishino H, Hasegawa M (agosto de 1989). "Evaluación de la estimación de máxima verosimilitud de las topologías de árboles evolutivos a partir de datos de secuencias de ADN y el orden de ramificación en hominoidea". Journal of Molecular Evolution . 29 (2): 170– 9. Bibcode : 1989JMolE..29..170K . doi : 10.1007/BF02100115 . PMID 2509717. S2CID 8045061 .  
  16. Felsenstein J, Churchill GA (enero de 1996). "Un enfoque de modelo oculto de Markov para la variación entre sitios en la tasa de evolución" . Biología molecular y evolución . 13 (1): 93–104 . doi : 10.1093/oxfordjournals.molbev.a025575 . hdl : 1813/31897 . PMID 8583911 . 
  17. 1 2 Tamura K (julio de 1992). "Estimación del número de sustituciones de nucleótidos cuando existen fuertes sesgos de transición-transversión y contenido de G+C" . Biología molecular y evolución . 9 (4): 678– 87. doi : 10.1093/oxfordjournals.molbev.a040752 . PMID 1630306 . 
  18. Tamura K, Nei M (mayo de 1993). "Estimación del número de sustituciones de nucleótidos en la región de control del ADN mitocondrial en humanos y chimpancés" . Biología Molecular y Evolución . 10 (3): 512– 26. doi : 10.1093/oxfordjournals.molbev.a040023 . PMID 8336541 . 
  19. 1 2 Tavaré S (1986). "Algunos problemas probabilísticos y estadísticos en el análisis de secuencias de ADN" (PDF) . Lecciones de matemáticas en las ciencias de la vida . 17 : 57–86 .
  20. 1 2 3 "Modelos de sustitución" . iqtree.github.io .
  21. 1 2 Braun EL, Kimball RT (agosto de 2002). Kjer K (ed.). "Examinando las divergencias aviares basales con secuencias mitocondriales: complejidad del modelo, muestreo de taxones y longitud de la secuencia" . Systematic Biology . 51 (4): 614– 625. doi : 10.1080/10635150290102294 . PMID 12228003 . 
  22. Phillips MJ, Delsuc F, Penny D (julio de 2004). "Filogenia a escala genómica y detección de sesgos sistemáticos" . Biología molecular y evolución . 21 (7): 1455– 1458. doi : 10.1093/molbev/msh137 . PMID 15084674 . 
  23. Ishikawa SA, Inagaki Y, Hashimoto T (enero de 2012). "Los modelos de codificación RY y no homogéneos pueden mejorar las inferencias de máxima verosimilitud a partir de datos de secuencias de nucleótidos con heterogeneidad composicional paralela" . Evolutionary Bioinformatics Online . 8 EBO.S9017: 357–371 . doi : 10.4137/EBO.S9017 . PMC 3394461. PMID 22798721 .  
  24. Simmons MP, Ochoterena H (junio de 2000). "Las brechas como caracteres en los análisis filogenéticos basados ​​en secuencias" . Systematic Biology . 49 (2): 369–381 . doi : 10.1093/sysbio/49.2.369 . PMID 12118412 . 
  25. Yuri T, Kimball RT, Harshman J, Bowie RC, Braun MJ, Chojnowski JL, et al. (marzo de 2013). " Análisis de parsimonia y basados ​​en modelos de inserciones/deleciones en genes nucleares aviares revelan señales filogenéticas congruentes e incongruentes" . Biology . 2 (1): 419– 444. doi : 10.3390/biology2010419 . PMC 4009869. PMID 24832669 .   
  26. Houde P, Braun EL, Narula N, Minjares U, Mirarab S (2019-07-06). "Señal filogenética de inserciones/deleciones y la radiación neoaviana" . Diversity . 11 (7): 108. Bibcode : 2019Diver..11..108H . doi : 10.3390/d11070108 .
  27. Cavender JA (agosto de 1978). "Taxonomía con confianza". Mathematical Biosciences . 40 ( 3–4 ): 271–280 . doi : 10.1016/0025-5564(78)90089-5 .
  28. Farris JS (1973-09-01). "Un modelo de probabilidad para inferir árboles evolutivos" . Systematic Biology . 22 (3): 250– 256. doi : 10.1093/sysbio/22.3.250 . ISSN 1063-5157 . 
  29. Neyman J (1971). Gupta SS, Yackel J (eds.). Estudios moleculares de la evolución: una fuente de nuevos problemas estadísticos . Nueva York, NY, EE. UU.: New York Academic Press. págs. 1–27 . 
  30. Waddell PJ, Penny D, Moore T (agosto de 1997). "Conjugaciones de Hadamard y modelado de la evolución de secuencias con tasas desiguales entre sitios". Molecular Phylogenetics and Evolution . 8 (1): 33– 50. Bibcode : 1997MolPE...8...33W . doi : 10.1006/mpev.1997.0405 . PMID 9242594 . 
  31. Sumner, JG; Fernández-Sánchez, J.; Jarvis, PD (abril de 2012). "Modelos de Lie-Markov". Journal of Theoretical Biology . 298 : 16–31 . arXiv : 1105.4680 . Bibcode : 2012JThBi.298...16S . doi : 10.1016/j.jtbi.2011.12.017 . PMID 22212913 . 
  32. Woodhams, Michael D.; Fernández-Sánchez, Jesús; Sumner, Jeremy G. (1 de julio de 2015). "Una nueva jerarquía de modelos filogenéticos consistente con tasas de sustitución heterogéneas" . Systematic Biology . 64 (4): 638– 650. doi : 10.1093/sysbio/syv021 . PMC 4468350. PMID 25858352 .  

Lecturas adicionales

  • Gu X, Li WH (septiembre de 1992). "Tasas más altas de sustitución de aminoácidos en roedores que en humanos" . Molecular Phylogenetics and Evolution . 1 (3): 211– 4. Bibcode : 1992MolPE...1..211G . doi : 10.1016/1055-7903(92)90017-B . PMID 1342937 . 
  • Li WH, Ellsworth DL, Krushkal J, Chang BH, Hewett-Emmett D (febrero de 1996). "Tasas de sustitución de nucleótidos en primates y roedores y la hipótesis del efecto del tiempo de generación". Molecular Phylogenetics and Evolution . 5 (1): 182– 7. Bibcode : 1996MolPE...5..182L . doi : 10.1006/mpev.1996.0012 . PMID 8673286 . 
  • DAWG: Ensamblaje de ADN con huecos : software gratuito para simular la evolución de secuencias.