Articulo de referencia

Índice de fijación

Valores de Fst entre poblaciones europeas El índice de fijación ( FST ) es una medida de la diferenciación poblacional debida a la estructura genética . Se estima frecuentemente...

Valores de Fst entre poblaciones europeas

El índice de fijación ( FST ) es una medida de la diferenciación poblacional debida a la estructura genética . Se estima frecuentemente a partir de datos de polimorfismo genético , como polimorfismos de un solo nucleótido (SNP) o microsatélites . Desarrollado como un caso especial de la estadística F de Wright , es una de las estadísticas más utilizadas en genética de poblaciones . Sus valores oscilan entre 0 y 1, donde 0 indica ausencia de diferenciación y 1, diferenciación completa.

Interpretación

Esta comparación de la variabilidad genética dentro y entre poblaciones se utiliza frecuentemente en genética de poblaciones aplicada . Los valores oscilan entre 0 y 1. Un valor de cero implica panmixia completa ; es decir, que las dos poblaciones se reproducen libremente. Un valor de uno implica que toda la variación genética se explica por la estructura poblacional y que las dos poblaciones no comparten ninguna diversidad genética.

Para modelos idealizados como el modelo de isla finita de Wright , F ST se puede utilizar para estimar las tasas de migración. Bajo ese modelo, la tasa de migración es

METRO=metroμ14(1FST1){\displaystyle M={\frac {m}{\mu }}\approx {\frac {1}{4}}\left({\frac {1}{F_{ST}}}-1\right)},

donde m es la tasa de migración por generación, yμ{\displaystyle \mu }es la tasa de mutación por generación. [ 1 ]

La interpretación de F ST puede ser difícil cuando los datos analizados son altamente polimórficos. En este caso, la probabilidad de identidad por descendencia es muy baja y F ST puede tener un límite superior arbitrariamente bajo, lo que podría llevar a una interpretación errónea de los datos. Además, estrictamente hablando, F ST no es una distancia en el sentido matemático, ya que no satisface la desigualdad triangular .

Definición

Dos de las definiciones más utilizadas para F ST en un locus dado se basan en 1) la varianza de las frecuencias alélicas entre poblaciones, y en 2) la probabilidad de identidad por descendencia .

Sipag¯{\displaystyle {\bar {p}}}es la frecuencia promedio de un alelo en la población total,σS2{\displaystyle \sigma _{S}^{2}}es la varianza en la frecuencia del alelo entre diferentes subpoblaciones, ponderada por los tamaños de las subpoblaciones, yσT2{\displaystyle \sigma _{T}^{2}}es la varianza del estado alélico en la población total, F ST se define como [ 2 ]

FST=σS2σT2=σS2pag¯(1pag¯){\displaystyle F_{ST}={\frac {\sigma _{S}^{2}}{\sigma _{T}^{2}}}={\frac {\sigma _{S}^{2}}{{\bar {p}}(1-{\bar {p}})}}}

La definición de Wright ilustra que FST mide la cantidad de varianza genética que puede explicarse por la estructura de la población. Esto también puede pensarse como la fracción de la diversidad total que no es consecuencia de la diversidad promedio dentro de las subpoblaciones, donde la diversidad se mide por la probabilidad de que dos alelos seleccionados al azar sean diferentes, a saber:2pag(1pag){\displaystyle 2p(1-p)}. Si la frecuencia alélica en eli{\displaystyle i}la población espagi{\displaystyle p_{i}}y el tamaño relativo de lai{\displaystyle i}la población esdoi{\displaystyle c_{i}}, entonces

FST=pag¯(1pag¯)doipagi(1pagi)pag¯(1pag¯)=pag¯(1pag¯)pag(1pag)¯pag¯(1pag¯){\displaystyle F_{ST}={\frac {{\bar {p}}(1-{\bar {p}})-\sum c_{i}p_{i}(1-p_{i})}{{\bar {p}}(1-{\bar {p}})}}={\frac {{\bar {p}}(1-{\bar {p}})-{\overline {p(1-p)}}}{{\bar {p}}(1-{\bar {p}})}}}

Alternativamente, [ 3 ]

FST=F0F¯1F¯{\displaystyle F_{ST}={\frac {f_{0}-{\bar {f}}}{1-{\bar {f}}}}}

dóndeF0{\displaystyle f_{0}}es la probabilidad de identidad por descendencia de dos individuos dado que los dos individuos están en la misma subpoblación, yF¯{\displaystyle {\bar {f}}}es la probabilidad de que dos individuos de la población total sean idénticos por descendencia. Usando esta definición, F ST puede interpretarse como una medida de cuán más cercanos están dos individuos de la misma subpoblación, en comparación con la población total. Si la tasa de mutación es pequeña, esta interpretación puede hacerse más explícita vinculando la probabilidad de identidad por descendencia con los tiempos de coalescencia : Sean T 0 y T el tiempo promedio de coalescencia para individuos de la misma subpoblación y la población total, respectivamente. Entonces,

FST1T0T{\displaystyle F_{ST}\approx 1-{\frac {T_{0}}{T}}}

Esta formulación tiene la ventaja de que el tiempo esperado para la coalescencia se puede estimar fácilmente a partir de datos genéticos, lo que llevó al desarrollo de varios estimadores para F ST .

Estimación

En la práctica, ninguna de las cantidades utilizadas para las definiciones se puede medir fácilmente. En consecuencia, se han propuesto varios estimadores. Un estimador particularmente simple aplicable a datos de secuencias de ADN es: [ 4 ]

FST=πEntreπDentroπEntre{\displaystyle F_{ST}={\frac {\pi _{\text{Entre}}-\pi _{\text{Dentro}}}{\pi _{\text{Entre}}}}}

dónde πEntre{\displaystyle \pi _{\text{Entre}}}yπDentro{\displaystyle \pi _{\text{Within}}}representan el número promedio de diferencias por pares entre dos individuos muestreados de diferentes subpoblaciones (πEntre{\displaystyle \pi _{\text{Between}}}) o de la misma subpoblación (πDentro{\displaystyle \pi _{\text{Within}}}La diferencia promedio por pares dentro de una población se puede calcular como la suma de las diferencias por pares dividida por el número de pares. Sin embargo, este estimador está sesgado cuando los tamaños de muestra son pequeños o si varían entre poblaciones. Por lo tanto, en la práctica se utilizan métodos más elaborados para calcular FST . Dos de los procedimientos más utilizados son el estimador de Weir y Cockerham (1984) [ 5 ] o realizar un análisis de varianza molecular . Una lista de implementaciones está disponible al final de este artículo.

FST en humanos

Valores de FST en poblaciones seleccionadas

Los valores de FST dependen en gran medida de la población estudiada. Grupos étnicos estrechamente relacionados, como los daneses frente a los holandeses , o los portugueses frente a los españoles, presentan valores significativamente inferiores al 1%, indistinguibles de la panmixia. Dentro de Europa, se ha observado que los grupos étnicos más divergentes tienen valores del orden del 7% ( sami frente a sardos ).

Se encuentran valores mayores si se comparan grupos homogéneos muy divergentes: el valor más alto encontrado fue cercano al 46%, entre los mbuti y los papúes . [ 6 ]

Distancias genéticas en poblaciones humanas

Distancias genéticas autosómicas basadas en marcadores clásicos

En su estudio *Historia y geografía de los genes humanos* (1994) , Cavalli-Sforza, Menozzi y Piazza ofrecen algunas de las estimaciones más detalladas y completas de las distancias genéticas entre poblaciones humanas, tanto dentro como entre continentes. Su base de datos inicial contiene 76 676 frecuencias genéticas (utilizando 120 polimorfismos sanguíneos), correspondientes a 6 633 muestras de diferentes ubicaciones. Al seleccionar y agrupar dichas muestras, limitan su análisis a 491 poblaciones.

Las 42 poblaciones mundiales utilizadas por los autores y sus FST reportadas.

Se centran en poblaciones aborígenes que se encontraban en su ubicación actual a finales del siglo XV, cuando comenzaron las grandes migraciones europeas. [ 7 ] Al estudiar la diferencia genética a nivel mundial, el número se reduce a 42 poblaciones representativas, agregando subpoblaciones caracterizadas por un alto nivel de similitud genética. Para estas 42 poblaciones, Cavalli-Sforza y ​​coautores informan distancias bilaterales calculadas a partir de 120 alelos. Entre este conjunto de 42 poblaciones mundiales, la mayor distancia genética observada es entre los pigmeos Mbuti y los papúes de Nueva Guinea, donde la distancia Fst es 0,4573, mientras que la menor distancia genética (0,0021) es entre los daneses y los ingleses.

Al considerar datos más desagregados para 26 poblaciones europeas, la distancia genética más pequeña (0,0009) se encuentra entre los holandeses y los daneses, y la más grande (0,0667) entre los lapones y los sardos. La distancia genética media entre los 861 pares disponibles de las 42 poblaciones seleccionadas fue de 0,1338 .

La siguiente tabla muestra el valor de Fst calculado por Cavalli-Sforza (1994) para algunas poblaciones:

Distancias genéticas autosómicas basadas en SNP

Un estudio de 2012 basado en datos del Proyecto Internacional HapMap estimó el FST entre las tres principales poblaciones "continentales" de europeos (combinando residentes de Utah de ascendencia del norte y oeste de Europa de la colección CEPH e italianos de la Toscana), asiáticos orientales (combinando chinos Han de Pekín, chinos del área metropolitana de Denver y japoneses de Tokio, Japón) y africanos subsaharianos (combinando Luhya de Webuye, Kenia, Maasai de Kinyawa, Kenia y Yoruba de Ibadan, Nigeria). Reportó un valor cercano al 12% entre poblaciones continentales y valores cercanos a la panmixia (menores del 1%) dentro de las poblaciones continentales. [ 8 ]

Distancias genéticas autosómicas basadas en la secuenciación del exoma completo (WES)

Valores de Fst por pares entre varias poblaciones basados ​​en la secuenciación del exoma completo (WES) en 2016: [ 11 ]

Programas para calcular F ST

  • Arlequín
  • Fstat
  • SMOGD [ 12 ]
  • diveRsity (paquete de R)
  • hierfstat (paquete de R)
  • FinePop [ 13 ] (paquete R)
  • Analizador de microsatélites (MSA) Archivado el 29/03/2015 en Wayback Machine
  • Herramientas VCF
  • ADN
  • Popoolation2

Módulos para el cálculo de F ST

Referencias

  1. Peter Beerli, Estimación de las tasas de migración y los tamaños de las poblaciones en poblaciones con estructura geográfica (1998), Avances en ecología molecular (ed. G. Carvalho). Serie científica A de la OTAN: Ciencias de la vida, IOS Press, Ámsterdam, 39-53.
  2. Holsinger, Kent E.; Bruce S. Weir (2009). "Genética en poblaciones geográficamente estructuradas: definición, estimación e interpretación de FST" . Nat Rev Genet . 10 (9): 639– 650. doi : 10.1038/nrg2611 . ISSN 1471-0056 . PMC 4687486. PMID 19687804 .   
  3. Richard Durrett (12 de agosto de 2008). Modelos de probabilidad para la evolución de secuencias de ADN . Springer. ISBN 978-0-387-78168-6Consultado el 25 de octubre de 2012 .
  4. Hudson, RR.; Slatkin, M.; Maddison, WP. (octubre de 1992). "Estimación de los niveles de flujo genético a partir de datos de secuencias de ADN" . Genetics . 132 ( 2): 583–9 . doi : 10.1093/genetics/132.2.583 . PMC 1205159. PMID 1427045 .  
  5. Weir, BS; Cockerham, C. Clark (1984). "Estimación de estadísticos F para el análisis de la estructura poblacional". Evolution . 38 (6): 1358– 1370. doi : 10.2307/2408641 . ISSN 0014-3820 . JSTOR 2408641 . PMID 28563791 .   
  6. Cavalli-Sforza et al. (1994), citado después de V. Ginsburgh, S. Weber, The Palgrave Handbook of Economics and Language , Springer (2016), p. 182 .
  7. ^ Cavalli-Sforza y ​​otros, 1994, pág. 24
  8. Elhaik, Eran (2012). " Distribuciones empíricas de FST a partir de datos de polimorfismo humano a gran escala" . PLOS ONE . 7 (11) e49837. Bibcode : 2012PLoSO...749837E . doi : 10.1371/journal.pone.0049837 . PMC 3504095. PMID 23185452 .  
  9. 1 2 Nelis, Mari; et al. (2009-05-08). Fleischer, Robert C. (ed.). "Estructura genética de los europeos: una perspectiva desde el noreste" . PLOS ONE . 4 (5) e5472. Bibcode : 2009PLoSO...4.5472N . doi : 10.1371/journal.pone.0005472 . PMC 2675054. PMID 19424496 .   , ver tabla
  10. Tian, ​​Chao; et al. (noviembre de 2009). "Subestructura genética de la población europea: definición adicional de marcadores informativos de ascendencia para distinguir entre diversos grupos étnicos europeos" . Molecular Medicine . 15 ( 11–12 ): 371–383 . doi : 10.2119/molmed.2009.00094 . ISSN 1076-1551 . PMC 2730349. PMID 19707526 .    , ver tabla
  11. Scott, E., Halees, A., Itan, Y. et al. Caracterización de la variación genética del Gran Oriente Medio para un mejor descubrimiento de genes de enfermedades . Nat Genet 48, 1071–1076 (2016). https://doi.org/10.1038/ng.3592 . Figura suplementaria 6: El mapa de calor de los valores FST por pares entre todas las poblaciones del Proyecto 1000 Genomas y GME identifica tres grupos con un bajo grado de diferenciación. .
  12. Crawford, Nicholas G. (2010). " smogd : software para la medición de la diversidad genética". Molecular Ecology Resources . 10 (3): 556– 557. doi : 10.1111/j.1755-0998.2009.02801.x . PMID 21565057 . S2CID 205970662 .  
  13. ^ Kitada S, Kitakado T, Kishino H (2007). "Inferencia empírica de Bayes de F (ST) por pares y su distribución en el genoma" . Genética . 177 (2): 861– 73. doi : 10.1534/genetics.107.077263 . PMC 2034649 . PMID 17660541 .  

Lecturas adicionales

  • Evolución y genética de poblaciones, volumen 2: la teoría de las frecuencias genéticas, págs. 294-295, S. Wright, Univ. de Chicago Press, Chicago, 1969.
  • Mapa de haplotipos del genoma humano, Consorcio Internacional HapMap, Nature 2005

Véase también

  • BioPerl - Bio::PopGen::PopStats
Obtenido de " https://en.wikipedia.org/w/index.php?title=Fixation_index&oldid=1313029437 "