Articulo de referencia

proceso coalescente multiespecie

El proceso coalescente multiespecie es un modelo de proceso estocástico que describe las relaciones genealógicas para una muestra de secuencias de ADN tomadas de varias especies...

El proceso coalescente multiespecie es un modelo de proceso estocástico que describe las relaciones genealógicas para una muestra de secuencias de ADN tomadas de varias especies. [ 1 ] [ 2 ] Representa la aplicación de la teoría coalescente al caso de múltiples especies. Los resultados coalescentes multiespecie se dan en casos donde las relaciones entre especies para un gen individual (el árbol genético ) pueden diferir de la historia más amplia de la especie (el árbol de especies ). Tiene implicaciones importantes para la teoría y la práctica de la filogenética [ 3 ] [ 4 ] y para la comprensión de la evolución del genoma .

Un árbol genético es un grafo binario que describe las relaciones evolutivas entre una muestra de secuencias para un locus no recombinante. Un árbol de especies describe las relaciones evolutivas entre un conjunto de especies, asumiendo una evolución arbórea. Sin embargo, varios procesos pueden generar discrepancias entre los árboles genéticos y los árboles de especies . El modelo de coalescencia multiespecie proporciona un marco para inferir filogenias de especies, teniendo en cuenta el polimorfismo ancestral y el conflicto entre árboles genéticos y de especies . Este proceso también se denomina coalescencia censurada . [ 1 ]

Además de la estimación de árboles de especies, el modelo coalescente multiespecie también proporciona un marco para utilizar datos genómicos para abordar una serie de problemas biológicos, como la estimación de tiempos de divergencia de especies, tamaños poblacionales de especies ancestrales, delimitación de especies e inferencia del flujo genético entre especies . [ 5 ] [ 6 ]

Congruencia entre el árbol genético y el árbol de especies

Coalescencia multiespecie para árbol enraizado de tres taxones
Ilustración del coalescente multiespecie que muestra la relación entre el árbol de especies (contorno negro) y los árboles genéticos (líneas rojas discontinuas insertadas en el árbol de especies). El tiempo transcurrido entre los dos eventos de especiación (T, medido en unidades de coalescencia) se puede utilizar para calcular la probabilidad de los cuatro árboles genéticos posibles (mediante las ecuaciones mostradas). Cabe destacar que dos de los árboles genéticos son topológicamente idénticos, pero difieren en los momentos en que se fusionan los linajes.

Si consideramos un árbol enraizado de tres taxones, el árbol filogenético no trivial más simple, hay tres topologías de árbol diferentes [ 7 ] pero cuatro árboles genéticos posibles. [ 8 ] La existencia de cuatro árboles genéticos distintos a pesar del menor número de topologías refleja el hecho de que hay árboles genéticos topológicamente idénticos que difieren en sus tiempos de coalescencia. En el árbol de tipo 1, los alelos en las especies A y B coalescen después del evento de especiación que separó el linaje AB del linaje C. En el árbol de tipo 2, los alelos en las especies A y B coalescen antes del evento de especiación que separó el linaje AB del linaje C (en otras palabras, el árbol de tipo 2 es un árbol de coalescencia profunda ). Los árboles genéticos de tipo 1 y tipo 2 son congruentes con el árbol de especies. Los otros dos árboles genéticos difieren del árbol de especies; los dos árboles genéticos discordantes también son árboles de coalescencia profunda .

La distribución de los tiempos de coalescencia es continua para todos estos árboles. En otras palabras, el tiempo exacto de coalescencia puede variar entre dos loci cualesquiera con el mismo árbol genético. Sin embargo, resulta conveniente dividir los árboles según si la coalescencia ocurrió antes o después del primer evento de especiación.

Dada la longitud de rama interna en unidades coalescentes, es sencillo calcular la probabilidad de cada árbol genético. [ 9 ] Para organismos diploides , la longitud de rama en unidades coalescentes es el número de generaciones entre los eventos de especiación dividido por el doble del tamaño efectivo de la población . Dado que los tres árboles de coalescencia profunda son equiprobables y dos de ellos son discordantes, es fácil ver que la probabilidad de que un árbol genético enraizado de tres taxones sea congruente con el árbol de especies es:

PAG(doonortegramorminortedomi)=123exp(T)=123exp(t2nortemi){\displaystyle {\begin{aligned}P(congruencia)&=1-{\frac {2}{3}}\exp(-T)=1-{\frac {2}{3}}\exp(-{\frac {t}{2N_{e}}})\end{aligned}}}

Hemiplasia frente a homoplasia verdadera
Ejemplos de árboles de especies con un árbol genético incrustado que muestra las diferencias entre hemiplasia (que requiere diferencias entre el árbol genético y el árbol de especies) y homoplasia verdadera (que puede ocurrir en un árbol genético congruente con el árbol de especies o en un árbol genético discordante con el árbol de especies). Usamos homoplasia verdadera para el ejemplo que muestra homoplasia para enfatizar que tanto la hemiplasia como la homoplasia parecen homoplásicas dado el árbol de especies. Este ejemplo muestra los orígenes de algún rasgo en el árbol genético (azul). La presencia (+) o ausencia (-) del rasgo en cada especie se indica en la parte superior de la figura. Nótese que la homoplasia puede reflejar dos (o más) ganancias independientes (como se muestra aquí) y también puede reflejar un solo origen seguido de una pérdida (o múltiples pérdidas).

Donde la longitud de la rama en unidades coalescentes ( T ) también se escribe de forma alternativa: el número de generaciones ( t ) dividido por el doble del tamaño efectivo de la población ( N e ). Pamilo y Nei [ 9 ] también derivaron la probabilidad de congruencia para árboles enraizados de cuatro y cinco taxones, así como un límite superior general para la probabilidad de congruencia para árboles más grandes. Rosenberg [ 10 ] continuó con ecuaciones utilizadas para el conjunto completo de topologías (aunque el gran número de árboles filogenéticos distintos que se vuelve posible a medida que aumenta el número de taxones [ 7 ] hace que estas ecuaciones sean impracticables a menos que el número de taxones sea muy limitado).

El fenómeno de la hemiplasia es una extensión natural de la idea básica que subyace a la discordancia entre el árbol genético y el árbol de especies. Si consideramos la distribución de algún carácter que no coincide con el árbol de especies, podría reflejar homoplasia (múltiples orígenes independientes del carácter o un único origen seguido de múltiples pérdidas) o podría reflejar hemiplasia (un único origen del rasgo asociado a un árbol genético que no coincide con el árbol de especies).

El fenómeno denominado clasificación incompleta de linajes (a menudo abreviado como ILS en la literatura científica [ 11 ] ) está vinculado a este fenómeno. Si examinamos la ilustración de la hemiplasia con un árbol enraizado de cuatro taxones (véase la imagen de la derecha), el linaje entre el ancestro común de los taxones A, B y C y el ancestro común de los taxones A y B debe ser polimórfico para el alelo con el rasgo derivado (por ejemplo, una inserción de un elemento transponible [ 12 ] ) y el alelo con el rasgo ancestral. El concepto de clasificación incompleta de linajes refleja, en última instancia, la persistencia de polimorfismos a través de uno o más eventos de especiación.

Descripción matemática de la coalescencia multiespecie

Se analiza la densidad de probabilidad de los árboles genéticos bajo el modelo coalescente multiespecie, junto con su uso para la estimación de parámetros utilizando datos de secuencias multilocus.

Supuestos

En el modelo básico de coalescencia multiespecie, se asume que la filogenia de las especies es conocida. Asimismo, se asume un aislamiento completo tras la divergencia de las especies, sin migración, hibridación ni introgresión. Adicionalmente, se asume la ausencia de recombinación, de modo que todos los sitios dentro del locus comparten el mismo árbol genético (topología y tiempos de coalescencia). Sin embargo, el modelo básico puede extenderse de diferentes maneras para incorporar migración o introgresión, cambios en el tamaño de la población y recombinación. [ 13 ] [ 14 ]

Datos y parámetros del modelo

El modelo y la implementación de este método se pueden aplicar a cualquier árbol de especies. Como ejemplo, se considera el árbol de especies de los grandes simios : humanos (H), chimpancés (C), gorilas (G) y orangutanes (O). Se supone que la topología del árbol de especies, (((HC)G)O)) , es conocida y fija en el análisis (Figura 1). [ 1 ] SeaD={Di}{\displaystyle D=\{D_{i}\}}sea ​​el conjunto de datos completo, dondeDi{\displaystyle {D_{i}}}representar la alineación de secuencias en el locusi{\displaystyle i}, coni=1,2,,L{\displaystyle i=1,2,\ldots ,L}para un total deL{\displaystyle L}loci.

El tamaño de la población de una especie actual solo se considera si se muestrea más de un individuo de esa especie en algunos lugares.

Los parámetros del modelo para el ejemplo de la Figura 1 incluyen los tres tiempos de divergencia.τHdo{\displaystyle \tau _{HC}},τHdoGRAMO{\displaystyle \tau _{HCG}}yτHdoGRAMOO{\displaystyle \tau _{HCGO}}y parámetros del tamaño de la poblaciónθH{\displaystyle \theta _{H}}para los humanos;θdo{\displaystyle \theta _{C}}para los chimpancés; yθHdo{\displaystyle \theta _{HC}},θHdoGRAMO{\displaystyle \theta _{HCG}}yθHdoGRAMOO{\displaystyle \theta _{HCGO}}para las tres especies ancestrales.

Los tiempos de divergencia (τ{\displaystyle \tau }Los valores de s se miden por el número esperado de mutaciones por sitio desde el nodo ancestral en el árbol de especies hasta el momento actual (Figura 1 de Rannala y Yang, 2003).

Por lo tanto, los parámetros sonΘ={θH,θdo,θHdo,θHdoGRAMO,θHdoGRAMOO,τHdo,τHdoGRAMO,τHdoGRAMOO}{\displaystyle \Theta =\{\theta _{H},\theta _{C},\theta _{HC},\theta _{HCG},\theta _{HCGO},\tau _{HC},\tau _{HCG},\tau _{HCGO}\}}.

Distribución de genealogías genéticas

La distribución conjunta deF(Ti,tiΘ){\displaystyle f(T_{i},t_{i}\mid \Theta )}se deriva directamente en esta sección. [ 1 ] Dos secuencias de especies diferentes pueden coalescer solo en una población que sea ancestral a las dos especies. Por ejemplo, las secuencias H y G pueden coalescer en poblaciones HCG o HCGO, pero no en poblaciones H o HC. Los procesos de coalescencia en diferentes poblaciones son diferentes.

Para cada población, la genealogía se rastrea hacia atrás en el tiempo, hasta el final de la población en el momentoτ{\displaystyle \tau }y el número de linajes(metro){\displaystyle (m)}la cantidad de linajes que ingresan a la población y el número de linajes que la abandonan(norte){\displaystyle (n)}se registran. Por ejemplo,metro=3,norte=2,{\displaystyle m=3,n=2,}yτ=τHdo{\displaystyle \tau =\tau _ {HC}}, para la población H (Tabla 1). [ 1 ] Este proceso se denomina proceso coalescente censurado porque el proceso coalescente para una población puede terminar antes de que todos los linajes que entraron en la población hayan coalescido. Sinorte1{\displaystyle n\geq 1}La población está compuesta por norte{\displaystyle n}subárboles o linajes desconectados.

Con una unidad de tiempo definida como el tiempo necesario para acumular una mutación por sitio, cualesquiera dos linajes se fusionan a la velocidad2θ{\displaystyle {\frac {2}{\theta }}}El tiempo de esperatj{\displaystyle t_{j}}hasta el próximo evento coalescente, que reduce el número de linajes dej{\displaystyle j}aj1{\displaystyle j-1}tiene densidad exponencial

F(tj)=j(j1)22θexp{j(j1)22θtj},j=metro,metro1,,norte+1{\displaystyle f(t_{j})={\frac {j(j-1)}{2}}{\frac {2}{\theta }}\exp\{-{\frac {j(j-1)}{2}}{\frac {2}{\theta }}t_{j}\},\quad j=m,m-1,\ldots ,n+1}

Sinorte1{\displaystyle n\geq 1}, la probabilidad de que no ocurra ningún evento coalescente entre el último y el final de la población en el tiempoτ{\displaystyle \tau }; es decir, durante el intervalo de tiempoτ(tmetro+tmetro1++tnorte+1){\displaystyle \tau -(t_{m}+t_{m-1}+\ldots +t_{n+1})}Esta probabilidad esexp{norte(norte1)θ[τ(tmetro+tmetro1++tnorte+1)]{\displaystyle \exp\{-{\frac {n(n-1)}{\theta }}[\tau -(t_{m}+t_{m-1}+\ldots +t_{n+1})]}y es 1 sinorte=1{\displaystyle n=1}.

(Nota: Cabe recordar que la probabilidad de que no ocurran eventos en un intervalo de tiempot{\displaystyle t}para un proceso de Poisson con tasaλ{\displaystyle \lambda }esmiλt{\displaystyle e^{-\lambda t}}. Aquí la tasa de coalescencia cuando haynorte{\displaystyle n}los linajes sonλ=norte(norte1)θ{\displaystyle \lambda ={\frac {n(n-1)}{\theta }}}.)

Además, para derivar la probabilidad de una topología de árbol genético particular en la población, si ocurre un evento coalescente en una muestra dej{\displaystyle j}linajes, la probabilidad de que un par particular de linajes se fusionen es1/(j2)=2/j(j1),j=metro,metro1,,norte+1{\displaystyle 1/{\binom {j}{2}}=2/j(j-1),\quad j=m,m-1,\ldots ,n+1}.

Multiplicando estas probabilidades entre sí, la distribución de probabilidad conjunta de la topología del árbol genético en la población y sus tiempos de coalescenciatmetro,tmetro+1,,tnorte+1{\displaystyle t_{m},t_{m+1},\ldots ,t_{n+1}}como

j=norte+1metro[2θexp{j(j1)θtj}]exp{norte(norte1)θ(τ(tmetro+tmetro+1++tnorte+1))}{\displaystyle \prod _{j=n+1}^{m}{\Big [}{\frac {2}{\theta }}\exp {\Big \{}-{\frac {j(j-1)}{\theta }}t_{j}{\Big \}}{\Big ]}\exp {\Big \{}-{\frac {n(n-1)}{\theta }}(\tau -(t_{m}+t_{m+1}+\ldots +t_{n+1})){\Big \}}}.

La probabilidad del árbol genético y los tiempos de coalescencia para el locus es el producto de dichas probabilidades en todas las poblaciones. Por lo tanto, la genealogía genética de la Figura 1, [ 1 ] [ 15 ] tenemos

F(GRAMOiΘ)=[2/θHexp{6t3(H)/θH}exp{2(τHdot3(H))/θH}]×[2/θdoexp{2t2(do)/θdo}]×[2/θHdoexp{6t3Hdo/θHdo}]×[2/θHdoexp{2t2Hdo/θHdo}]×[exp{2(τHdoGRAMOτHGRAMO(t3Hdo+t2Hdo))/θHdoGRAMO}]×[2/θHdoGRAMOOexp{6t3HdoGRAMOO/θHdoGRAMOO}]×[2/θHdoGRAMOOexp{2t2HdoGRAMOO/θHdoGRAMOO}]{\displaystyle {\begin{aligned}f(G_{i}\mid \Theta )&=[2/\theta _{H}\exp\{-6t_{3}^{(H)}/\theta _{H}\}\exp\{-2(\tau _{HC}-t_{3}^{(H)})/\theta _{H}\}]\\&{}\times [2/\theta _{C}\exp\{-2t_{2}^{(C)}/\theta _{C}\}]\\&{}\times [2/\theta _{HC}\exp\{-6t_{3}^{HC}/\theta _{HC}\}]\times [2/\theta _{HC}\exp\{-2t_{2}^{HC}/\theta _{HC}\}]\\&{}\times [\exp\{-2(\tau _{HCG}-\tau _{HG}-(t_{3}^{HC}+t_{2}^{HC}))/\theta _{HCG}\}]\\&{}\times [2/\theta _{HCGO}\exp\{-6t_{3}^{HCGO}/\theta _{HCGO}\}]\times [2/\theta _{HCGO}\exp\{-2t_{2}^{HCGO}/\theta _{HCGO}\}]\end{aligned}}}

Inferencia basada en la verosimilitud

La genealogía genéticaGRAMOi{\displaystyle G_{i}}en cada locusi{\displaystyle i}está representada por la topología de árbolTi{\displaystyle T_{i}}y los tiempos de coalescenciati{\displaystyle t_{i}}Dado el árbol de especies y los parámetrosΘ{\displaystyle \Theta }sobre ella, la distribución de probabilidad deGRAMOi={Ti,ti}{\displaystyle G_{i}=\{T_{i},t_{i}\}}se especifica mediante el proceso coalescente como

F(GRAMOΘ)=iF(GRAMOiΘ)=iF(Ti,tiΘ){\displaystyle f(G\mid \Theta )=\prod _{i}f(G_{i}\mid \Theta )=\prod _{i}f(T_{i},t_{i}\mid \Theta )},

dóndeF(GRAMOiΘ)=F(Ti,tiΘ){\displaystyle f(G_{i}\mid \Theta )=f(T_{i},t_{i}\mid \Theta )}es la densidad de probabilidad para el árbol genético en el locus locusi{\displaystyle i}, [ 1 ] y el producto es porque asumimos que los árboles genéticos son independientes dados los parámetros.

La probabilidad de los datosDi{\displaystyle D_{i}}dado el árbol genético y los tiempos de coalescencia (y por lo tanto las longitudes de las ramas) en el locus,F(DiGRAMOi){\displaystyle f(D_{i}\mid G_{i})}, es la probabilidad filogenética de Felsenstein. [ 16 ] Debido a la suposición de evolución independiente a través de los loci,

F(DGRAMO)=iF(DiGRAMOi){\displaystyle f(D\mid G)=\prod _{i}f(D_{i}\mid G_{i})}

La función de verosimilitud o la probabilidad de los datos de la secuencia dados los parámetros.Θ{\displaystyle \Theta }es entonces un promedio sobre los árboles genéticos no observados

F(DΘ)=F(DGRAMO)F(GRAMOΘ)dGRAMO,{\displaystyle f(D\mid \Theta )=\int f(D\mid G)f(G\mid \Theta )dG,}

donde la integración representa la suma sobre todas las topologías posibles del árbol genético (Ti{\displaystyle T_{i}}) y, para cada topología posible en cada lugar, integración sobre los tiempos de coalescencia.ti{\displaystyle t_{i}}. [ 17 ] Esto es en general intratable excepto para árboles de especies muy pequeñas.

En la inferencia bayesiana , asignamos una distribución a priori a los parámetros,F(Θ){\displaystyle f(\Theta )}y luego la distribución posterior se da como

F(ΘD)=F(Θ,GRAMOD)dGRAMO,{\displaystyle f(\Theta \mid D)=\int f(\Theta ,G\mid D)dG,}

donde nuevamente la integración representa la suma sobre todas las topologías posibles del árbol genético (Ti{\displaystyle T_{i}}) y la integración a lo largo de los tiempos de coalescenciati{\displaystyle t_{i}}En la práctica, esta integración sobre los árboles genéticos se logra mediante un algoritmo de Monte Carlo de cadena de Markov , que toma muestras de la distribución condicional conjunta de los parámetros y los árboles genéticos.

F(Θ,GRAMOD)F(DGRAMO)F(GRAMOΘ)F(Θ).{\displaystyle f(\Theta ,G\mid D)\propto f(D\mid G)f(G\mid \Theta )f(\Theta ).}

Lo anterior supone que el árbol de especies es fijo. En la estimación del árbol de especies, el árbol de especies (S{\displaystyle S}) también cambia, de modo que la distribución condicional conjunta (de la cual las muestras MCMC) es

F(S,Θ,GRAMOD)F(DGRAMO)F(GRAMOS,Θ)F(Θ)F(S),{\displaystyle f(S,\Theta ,G\mid D)\propto f(D\mid G)f(G\mid S,\Theta )f(\Theta )f(S),}

dóndeF(S){\displaystyle f(S)}es la prior en árboles de especies.

A diferencia de los métodos de resumen en dos pasos, los métodos de máxima verosimilitud promedian los árboles genéticos. Esto significa que utilizan la información de las longitudes de las ramas (tiempos de coalescencia) en los árboles genéticos y, al mismo tiempo, tienen en cuenta sus incertidumbres (debido a la longitud limitada de las secuencias en los alineamientos). Esto también explica por qué los métodos de máxima verosimilitud son computacionalmente mucho más exigentes que los métodos de resumen en dos pasos.

Cadena de Markov Monte Carlo bajo la coalescencia multiespecie

La integración o suma sobre los árboles genéticos en la definición de la función de verosimilitud anterior es prácticamente imposible de calcular excepto para árboles de especies muy pequeños con solo dos o tres especies. [ 18 ] Los métodos de verosimilitud completa o de datos completos, basados ​​en el cálculo de la función de verosimilitud en alineaciones de secuencias, se han basado principalmente en algoritmos de Monte Carlo de cadena de Markov. Los algoritmos MCMC bajo el modelo coalescente multiespecie son similares a los utilizados en filogenética bayesiana pero son claramente más complejos, principalmente debido al hecho de que los árboles genéticos en múltiples loci y el árbol de especies tienen que ser compatibles: la divergencia de secuencias tiene que ser anterior a la divergencia de especies. Como resultado, cambiar el árbol de especies mientras los árboles genéticos están fijos (o cambiar un árbol genético mientras el árbol de especies está fijo) conduce a algoritmos ineficientes con propiedades de mezcla deficientes. Se han realizado esfuerzos considerables para diseñar algoritmos inteligentes que cambien el árbol de especies y los árboles genéticos de manera coordinada, como en el algoritmo de banda elástica para cambiar los tiempos de divergencia de especies, [ 1 ] los movimientos coordinados NNI, SPR y NodeSlider. [ 19 ] [ 20 ]

Consideremos, por ejemplo, el caso de dos especies ( A y B ) y dos secuencias en cada locus, con un tiempo de divergencia de secuencia.ti{\displaystyle t_{i}}en el lugari{\displaystyle i}. Tenemosti<τ{\displaystyle t_{i}<\tau }a pesar dei{\displaystyle i}Cuando queremos cambiar el tiempo de divergencia de las especiesτ{\displaystyle \tau }dentro de la limitación de la actualti{\displaystyle t_{i}}, puede que tengamos muy poco margen de cambio, ya queτ{\displaystyle \tau }puede ser prácticamente idéntico al más pequeño de losti{\displaystyle t_{i}}. El algoritmo de la banda elástica [ 1 ] cambiaτ{\displaystyle \tau }sin tener en cuenta lati{\displaystyle t_{i}}y luego modifica elti{\displaystyle t_{i}}De forma determinista, del mismo modo que las marcas en una goma elástica se mueven cuando se sujeta desde un punto fijo y se tira de ella hacia un extremo. En general, este movimiento de la goma elástica garantiza que las edades de los nodos en los árboles genéticos se modifiquen para que sigan siendo compatibles con el tiempo de divergencia de las especies modificado.

Los métodos de máxima verosimilitud tienden a alcanzar su límite cuando los datos constan de unos pocos cientos de loci, aunque se han analizado más de 10 000 loci en algunos estudios publicados. [ 21 ] [ 22 ]

Extensiones

El modelo básico de coalescencia multiespecie puede extenderse de varias maneras para incorporar factores importantes del proceso biológico de reproducción y deriva genética. [ 13 ] [ 14 ] Por ejemplo, la incorporación de la migración en tiempo continuo da lugar al modelo MSC+M (para MSC con migración), también conocido como modelo de aislamiento con migración o IM. [ 23 ] [ 24 ] La incorporación de la hibridación/introgresión episódica da lugar al modelo MSC con introgresión (MSci) [ 25 ] o al modelo de coalescencia de red multiespecie (MSNC). [ 26 ] [ 27 ]

Impacto en la estimación filogenética

La coalescencia multiespecie tiene profundas implicaciones para la teoría y la práctica de la filogenética molecular . [ 3 ] [ 4 ] Dado que los árboles genéticos individuales pueden diferir del árbol de especies, no se puede estimar el árbol para un solo locus y asumir que el árbol genético corresponde al árbol de especies. De hecho, se puede estar prácticamente seguro de que cualquier árbol genético individual diferirá del árbol de especies para al menos algunas relaciones cuando se considera cualquier número razonable de taxones. Sin embargo, la discordancia árbol genético-árbol de especies tiene un impacto en la teoría y la práctica de la estimación del árbol de especies que va más allá de la simple observación de que no se puede usar un solo árbol genético para estimar el árbol de especies porque hay una parte del espacio de parámetros donde el árbol genético más frecuente es incongruente con el árbol de especies. Esta parte del espacio de parámetros se llama zona de anomalía [ 28 ] y cualquier árbol genético discordante que se espera que surja con más frecuencia que el árbol genético que coincide con el árbol de especies se llama árbol genético anómalo .

La existencia de la zona anómala implica que no se puede simplemente estimar un gran número de árboles genéticos y asumir que el árbol genético recuperado el mayor número de veces es el árbol de especies. Por supuesto, estimar el árbol de especies mediante una "votación democrática" de árboles genéticos solo funcionaría para un número limitado de taxones fuera de la zona anómala dado el número extremadamente grande de árboles filogenéticos posibles. [ 7 ] Sin embargo, la existencia de los árboles genéticos anómalos también significa que los métodos simples para combinar árboles genéticos, como el método de consenso de regla de mayoría extendida ("codicioso") o el enfoque de superárbol de representación matricial con parsimonia (MRP) [ 29 ] [ 30 ] , no serán estimadores consistentes del árbol de especies [ 31 ] [ 32 ] (es decir, serán engañosos). Simplemente generar el árbol de consenso de regla de mayoría para los árboles genéticos, donde se retienen los grupos que están presentes en al menos el 50% de los árboles genéticos, no será engañoso siempre que se utilice un número suficiente de árboles genéticos. [ 31 ] Sin embargo, esta capacidad del árbol de consenso de regla de mayoría para un conjunto de árboles genéticos para evitar clados incorrectos tiene el costo de tener grupos no resueltos.

Las simulaciones han demostrado que hay partes del espacio de parámetros del árbol de especies donde las estimaciones de máxima verosimilitud de la filogenia son árboles incorrectos con una probabilidad creciente a medida que aumenta la cantidad de datos analizados. [ 33 ] Esto es importante porque el "enfoque de concatenación", donde se concatenan alineamientos de secuencias múltiples de diferentes loci para formar un único alineamiento de supermatriz grande que luego se usa para el análisis de máxima verosimilitud (o MCMC bayesiano ), es fácil de implementar y comúnmente usado en estudios empíricos. Esto representa un caso de especificación incorrecta del modelo porque el enfoque de concatenación asume implícitamente que todos los árboles genéticos tienen la misma topología. [ 34 ] De hecho, ahora se ha demostrado que los análisis de datos generados bajo el coalescente multiespecie usando el análisis de máxima verosimilitud de un dato concatenado no garantizan converger en el verdadero árbol de especies a medida que aumenta el número de loci usados ​​para el análisis [ 35 ] [ 36 ] [ 37 ] (es decir, la concatenación de máxima verosimilitud es estadísticamente inconsistente).

Software para inferencia bajo el modelo coalescente multiespecie

Existen dos enfoques básicos para la estimación filogenética en el marco coalescente multiespecie: 1) métodos de máxima verosimilitud o de datos completos que operan directamente sobre alineaciones de secuencias multilocus, incluyendo métodos de máxima verosimilitud y bayesianos, y 2) métodos de resumen, que utilizan un resumen de los datos de secuencia originales, incluyendo los métodos de dos pasos que utilizan árboles genéticos estimados como entrada de resumen y SVDQuartets, que utilizan recuentos de patrones de sitios agrupados en loci como entrada de resumen.

Referencias

  1. 1 2 3 4 5 6 7 8 9 Rannala B, Yang Z (agosto de 2003). "Estimación bayesiana de los tiempos de divergencia de especies y tamaños de poblaciones ancestrales utilizando secuencias de ADN de múltiples loci" . Genetics . 164 ( 4): 1645– 56. doi : 10.1093/genetics/164.4.1645 . PMC 1462670. PMID 12930768 .  
  2. Degnan JH, Rosenberg NA (junio de 2009). "Discordancia en árboles genéticos, inferencia filogenética y coalescencia multiespecie". Trends in Ecology & Evolution . 24 (6): 332– 40. Bibcode : 2009TEcoE..24..332D . doi : 10.1016/j.tree.2009.01.009 . PMID 19307040 . 
  3. 1 2 Maddison WP (1997-09-01). "Árboles genéticos en árboles de especies" . Biología Sistemática . 46 (3): 523– 536. doi : 10.1093/sysbio/46.3.523 . ISSN 1063-5157 . 
  4. 1 2 Edwards SV (enero de 2009). "¿Está surgiendo una nueva teoría general de sistemática molecular?" . Evolution; International Journal of Organic Evolution . 63 (1): 1– 19. doi : 10.1111/j.1558-5646.2008.00549.x . PMID 19146594 . 
  5. ^ Yang, Ziheng (15 de mayo de 2014), "Simulación de la evolución molecular", Evolución molecular , Oxford University Press, págs. 418–441 , doi : 10.1093/acprof:oso/9780199602605.003.0012 , ISBN  978-0-19-960260-5
  6. Bruce Rannala, Scott V. Edwards, Adam Leaché y Ziheng Yang (2020). El modelo coalescente multiespecie y la inferencia del árbol de especies. En Scornavacca, C., Delsuc, F. y Galtier, N., editores, Filogenética en la era genómica, capítulo n.° 3.3, págs. 3.3:1–3.3:21. Sin editorial comercial | Libro de acceso abierto de los autores.
  7. 1 2 3 Felsenstein J (marzo de 1978). "El número de árboles evolutivos". Zoología sistemática . 27 (1): 27– 33. doi : 10.2307/2412810 . JSTOR 2412810 . 
  8. Hobolth A, Christensen OF, Mailund T, Schierup MH (febrero de 2007). "Relaciones genómicas y tiempos de especiación de humanos, chimpancés y gorilas inferidos a partir de un modelo oculto de Markov coalescente" . PLOS Genetics . 3 (2) e7. doi : 10.1371/journal.pgen.0030007 . PMC 1802818. PMID 17319744 .  
  9. 1 2 Pamilo P, Nei M (septiembre de 1988). "Relaciones entre árboles genéticos y árboles de especies" . Biología molecular y evolución . 5 (5): 568– 83. doi : 10.1093/oxfordjournals.molbev.a040517 . PMID 3193878 . 
  10. Rosenberg NA (marzo de 2002). "La probabilidad de concordancia topológica de árboles genéticos y árboles de especies". Theoretical Population Biology . 61 (2): 225– 47. Bibcode : 2002TPBio..61..225R . doi : 10.1006/tpbi.2001.1568 . PMID 11969392 . 
  11. Jarvis ED, Mirarab S, Aberer AJ, Li B, Houde P, Li C, et al. (diciembre de 2014). " Los análisis del genoma completo resuelven las ramas tempranas en el árbol de la vida de las aves modernas" . Science . 346 (6215): 1320–31 . Bibcode : 2014Sci...346.1320J . doi : 10.1126/science.1253451 . PMC 4405904. PMID 25504713 .   
  12. Suh A, Smeds L, Ellegren H (agosto de 2015). Penny D (ed.). "La dinámica de la clasificación incompleta de linajes a través de la antigua radiación adaptativa de las aves neoavianas" . PLOS Biology . 13 (8) e1002224. doi : 10.1371/journal.pbio.1002224 . PMC 4540587. PMID 26284513 .  
  13. 1 2 "Modelado de la hibridación bajo el modelo de coalescencia multiespecie en red" .
  14. 1 2 "El modelo coalescente multiespecie y la inferencia del árbol de especies" . Filogenética en la era genómica . Sin editorial comercial | Libro de acceso abierto de los autores. 2020.Libro de acceso abierto de los autores.
  15. Yang Z (2014). Evolución molecular: un enfoque estadístico (Primera ed.). Oxford: Oxford University Press. pp. Capítulo 9. ISBN   978-0-19-960260-5OCLC 869346345 
  16. Felsenstein J (1981). " Árboles evolutivos a partir de secuencias de ADN: un enfoque de máxima verosimilitud". Journal of Molecular Evolution . 17 (6): 368– 76. Bibcode : 1981JMolE..17..368F . doi : 10.1007/BF01734359 . PMID 7288891. S2CID 8024924 .  
  17. Xu B, Yang Z (diciembre de 2016). "Desafíos en la estimación de árboles de especies bajo el modelo coalescente multiespecie" . Genetics . 204 ( 4): 1353– 1368. doi : 10.1534/genetics.116.190173 . PMC 5161269. PMID 27927902 .  
  18. Yang, Ziheng (2002-12-01). "Estimación de probabilidad y bayesiana de tamaños de poblaciones ancestrales en hominoideos utilizando datos de múltiples loci" . Genetics . 162 ( 4): 1811– 1823. doi : 10.1093/genetics/162.4.1811 . ISSN 0016-6731 . PMC 1462394. PMID 12524351 .   
  19. Yang, Z.; Rannala, B. (2014-12-01). "Delimitación de especies sin guía mediante datos de secuencias de ADN de múltiples loci" . Biología molecular y evolución . 31 (12): 3125– 3135. doi : 10.1093/molbev/msu279 . ISSN 0737-4038 . PMC 4245825. PMID 25274273 .   
  20. Rannala, Bruce; Yang, Ziheng (2017-01-04). "Inferencia eficiente de árboles de especies bayesianos bajo el coalescente multiespecie" . Systematic Biology . 66 (5): 823– 842. doi : 10.1093/sysbio / syw119 . ISSN 1063-5157 . PMC 8562347. PMID 28053140 .   
  21. Shi, Cheng-Min; Yang, Ziheng (2018-01-01). "Análisis basados ​​en coalescencia de datos de secuencias genómicas proporcionan una resolución robusta de las relaciones filogenéticas entre los principales grupos de gibones" . Biología molecular y evolución . 35 (1): 159– 179. doi : 10.1093/molbev/msx277 . ISSN 0737-4038 . PMC 5850733. PMID 29087487 .   
  22. Thawornwattana, Yuttapong; Dalquen, Daniel; Yang, Ziheng (2018-10-01). Tamura, Koichiro (ed.). "Análisis coalescente de datos filogenómicos resuelve con confianza las relaciones de especies en el complejo de especies Anopheles gambiae" . Biología molecular y evolución . 35 (10): 2512– 2527. doi : 10.1093/molbev/msy158 . ISSN 0737-4038 . PMC 6188554. PMID 30102363 .   
  23. Hola, Jody (abril de 2010). "Aislamiento con modelos de migración para más de dos poblaciones" . Biología molecular y evolución . 27 (4): 905–920 . doi : 10.1093/molbev/msp296 . ISSN 1537-1719 . PMC 2877539. PMID 19955477 .   
  24. Zhu, T.; Yang, Z. (2012-10-01). "Implementación de máxima verosimilitud de un modelo de aislamiento con migración con tres especies para probar la especiación con flujo genético" . Biología molecular y evolución . 29 (10): 3131– 3142. doi : 10.1093/molbev/mss118 . ISSN 0737-4038 . PMID 22504520 .  
  25. Flouri, Tomáš; Jiao, Xiyun; Rannala, Bruce; Yang, Ziheng (2020-04-01). Rosenberg, Michael (ed.). " Una implementación bayesiana del modelo coalescente multiespecie con introgresión para el análisis filogenómico" . Biología molecular y evolución . 37 (4): 1211– 1223. doi : 10.1093/molbev/msz296 . ISSN 0737-4038 . PMC 7086182. PMID 31825513 .   
  26. Wen, Dingqiao; Nakhleh, Luay (2018-05-01). Kubatko, Laura (ed.). "Coestimación de filogenias reticuladas y árboles genéticos a partir de datos de secuencias multilocus" . Systematic Biology . 67 (3): 439– 457. doi : 10.1093/sysbio/syx085 . ISSN 1063-5157 . PMID 29088409 .  
  27. Zhang, Chi; Ogilvie, Huw A; Drummond, Alexei J; Stadler, Tanja (2018-02-01). "Inferencia bayesiana de redes de especies a partir de datos de secuencias multilocus" . Biología molecular y evolución . 35 (2): 504– 517. doi : 10.1093/molbev/msx307 . ISSN 0737-4038 . PMC 5850812. PMID 29220490 .   
  28. Degnan JH, Rosenberg NA (mayo de 2006). Wakeley J (ed.). "Discordancia de los árboles de especies con sus árboles genéticos más probables" . PLOS Genetics . 2 (5) e68. doi : 10.1371/journal.pgen.0020068 . PMC 1464820. PMID 16733550 .  
  29. Baum BR (febrero de 1992). "Combinación de árboles como método para combinar conjuntos de datos para inferencia filogenética y la conveniencia de combinar árboles genéticos". Taxon . 41 (1): 3– 10. doi : 10.2307/1222480 . ISSN 0040-0262 . JSTOR 1222480 .  
  30. Ragan MA (marzo de 1992). "Inferencia filogenética basada en la representación matricial de árboles". Molecular Phylogenetics and Evolution . 1 (1): 53– 58. Bibcode : 1992MolPE...1...53R . doi : 10.1016/1055-7903(92)90035-F . PMID 1342924 . 
  31. 1 2 Degnan JH, DeGiorgio M, Bryant D, Rosenberg NA (febrero de 2009). "Propiedades de los métodos de consenso para inferir árboles de especies a partir de árboles de genes" . Systematic Biology . 58 (1): 35– 54. doi : 10.1093/sysbio/syp008 . PMC 2909780. PMID 20525567 .  
  32. Wang Y, Degnan JH (2011-05-02). "Rendimiento de la representación matricial con parsimonia para inferir especies a partir de árboles genéticos". Aplicaciones estadísticas en genética y biología molecular . 10 (1). doi : 10.2202/1544-6115.1611 . S2CID 199663909 . 
  33. Kubatko LS, Degnan JH (febrero de 2007). Collins T (ed.). "Inconsistencia de las estimaciones filogenéticas a partir de datos concatenados bajo coalescencia" . Systematic Biology . 56 (1): 17–24 . doi : 10.1080/10635150601146041 . PMID 17366134 . 
  34. Warnow T (mayo de 2015). " Análisis de concatenación en presencia de clasificación de linajes incompleta" . PLOS Currents . 7. doi : 10.1371/currents.tol.8d41ac0f13d1abedf4c4a59f5d17b1f7 . PMC 4450984. PMID 26064786 .  
  35. Roch S, Steel M (marzo de 2015). "La reconstrucción de árboles basada en la verosimilitud en una concatenación de conjuntos de datos de secuencias alineadas puede ser estadísticamente inconsistente". Theoretical Population Biology . 100C : 56–62 . arXiv : 1409.2051 . Bibcode : 2015TPBio.100...56R . doi : 10.1016/j.tpb.2014.12.005 . PMID 25545843 . 
  36. Mendes FK, Hahn MW (enero de 2018). "Por qué falla la concatenación cerca de la zona de anomalía" . Systematic Biology . 67 (1): 158– 169. doi : 10.1093/sysbio/syx063 . PMID 28973673 . 
  37. Roch S, Nute M, Warnow T (marzo de 2019). Kubatko L (ed.). "Atracción de ramas largas en la estimación de árboles de especies: inconsistencia de la verosimilitud particionada y los métodos de resumen basados ​​en topología". Systematic Biology . 68 (2): 281– 297. arXiv : 1803.02800 . doi : 10.1093/sysbio/syy061 . PMID 30247732 . 
  38. Sayyari E, Mirarab S (julio de 2016). "Cálculo rápido basado en coalescencia del soporte de rama local a partir de frecuencias de cuartetos" . Biología molecular y evolución . 33 (7): 1654– 68. doi : 10.1093/molbev/msw079 . PMC 4915361. PMID 27189547 .  
  39. Mirarab S, Reaz R, Bayzid MS, Zimmermann T, Swenson MS, Warnow T (septiembre de 2014). "ASTRAL: estimación de árboles de especies basada en coalescencia a escala genómica" . Bioinformatics . 30 (17): i541-8. doi : 10.1093/bioinformatics/btu462 . PMC 4147915. PMID 25161245 .  
  40. Zhang C, Rabiee M, Sayyari E, Mirarab S (mayo de 2018). "ASTRAL-III: reconstrucción de árboles de especies en tiempo polinomial a partir de árboles genéticos parcialmente resueltos" . BMC Bioinformatics . 19 (Supl. 6): 153. doi : 10.1186/s12859-018-2129-y . PMC 5998893. PMID 29745866 .  
  41. Liu, Liang; Yu, Lili (2011-10-01). "Estimación de árboles de especies a partir de árboles genéticos sin raíz" . Systematic Biology . 60 (5): 661– 667. doi : 10.1093/sysbio/syr027 . ISSN 1076-836X . PMID 21447481 .  
  42. Rhodes JA, Nute MG, Warnow T. (enero de 2020). "NJst y ASTRID no son estadísticamente consistentes bajo un modelo aleatorio de datos faltantes". arXiv:2001.07844 https://arxiv.org/abs/2001.07844
  43. Vachaspati, Pranjal; Warnow, Tandy (diciembre de 2015). "ASTRID: Árboles de especies precisos a partir de distancias entre nodos" . BMC Genomics . 16 (S10): S3. doi : 10.1186/1471-2164-16-S10-S3 . ISSN 1471-2164 . PMC 4602181. PMID 26449326 .   
  44. Yang Z (2015-10-01). "El programa BPP para la estimación de árboles de especies y la delimitación de especies" . Current Zoology . 61 (5): 854– 865. doi : 10.1093/czoolo/61.5.854 . ISSN 2396-9814 . 
  45. Flouri T, Jiao X, Rannala B, Yang Z (octubre de 2018). Yoder AD (ed.). " Inferencia de árboles de especies con BPP utilizando secuencias genómicas y el coalescente multiespecie" . Biología molecular y evolución . 35 (10): 2585–2593 . doi : 10.1093/molbev/msy147 . PMC 6188564. PMID 30053098 .  
  46. Jones GR, Aydin Z, Oxelman B (2015-10-01). "TDISSECT: un método de descubrimiento bayesiano sin asignación para la delimitación de especies bajo el coalescente multiespecie" . Bioinformatics . 31 (7): 991– 998. doi : 10.1093/bioinformatics/btu770 . PMID 25422051 . 
  47. Jones G (10 de junio de 2016). Oxelman B (ed.). "Mejoras algorítmicas para la delimitación de especies y la estimación de filogenia bajo el coalescente multiespecie". Journal of Mathematical Biology . 74 ( 1–2 ): 447–467 . doi : 10.1007/s00285-016-1034-0 . PMID 27287395. S2CID 13308130 .  
  48. Heled, J.; Drummond, AJ (2010-03-01). "Inferencia bayesiana de árboles de especies a partir de datos multilocus" . Biología molecular y evolución . 27 (3): 570– 580. doi : 10.1093 / molbev/msp274 . ISSN 0737-4038 . PMC 2822290. PMID 19906793 .   
  49. Liu L, Yu L, Edwards SV (octubre de 2010). "Un enfoque de máxima pseudoverosimilitud para estimar árboles de especies bajo el modelo coalescente" . BMC Evolutionary Biology . 10 (1): 302. Bibcode : 2010BMCEE..10..302L . doi : 10.1186/1471-2148-10-302 . PMC 2976751. PMID 20937096 .  
  50. Chifman J, Kubatko L (diciembre de 2014). " Inferencia de cuartetos a partir de datos de SNP bajo el modelo coalescente" . Bioinformatics . 30 (23): 3317–24 . doi : 10.1093/bioinformatics/btu530 . PMC 4296144. PMID 25104814 .  
  51. Snir, Sagi; Rao, Satish (enero de 2012). "Quartet MaxCut: un algoritmo rápido para la fusión de árboles de cuartetos". Molecular Phylogenetics and Evolution . 62 (1): 1– 8. doi : 10.1016/j.ympev.2011.06.021 .
  52. Avni, Eliran; Cohen, Reuven; Snir, Sagi (marzo de 2015). "Filogenética de cuartetos ponderados". Systematic Biology . 64 (2): 233– 242. doi : 10.1093/sysbio/syu087 .
  53. Mirarab, S.; Reaz, R.; Bayzid, Md. S.; Zimmermann, T.; Swenson, MS; Warnow, T. (1 de septiembre de 2014). "ASTRAL: estimación de árboles de especies basada en coalescencia a escala genómica" . Bioinformatics . 30 (17): i541– i548. doi : 10.1093/bioinformatics/btu462 . PMC 4147915 . 
  54. Allman, Elizabeth S.; Degnan, James H.; Rhodes, John A. (junio de 2011). "Identificación del árbol de especies enraizado a partir de la distribución de árboles genéticos no enraizados bajo el coalescente". Journal of Mathematical Biology . 62 (6): 833– 862. arXiv : 0912.4472 . doi : 10.1007/s00285-010-0355-7 .
  55. Han, Yunheng; Molloy, Erin K. (17 de mayo de 2023). "Mejora de la construcción de grafos de cuartetos para una estimación escalable y precisa de árboles de especies a partir de árboles genéticos" . Genome Research . doi : 10.1101/gr.277629.122 . PMC 10538498 . 
  56. Han, Yunheng; Molloy, Erin K (25 de febrero de 2025). "Mayor robustez frente a la incompletitud del árbol genético, errores de estimación y errores sistemáticos de homología con TREE-QMC ponderado". Systematic Biology . doi : 10.1093/sysbio/syaf009 .