Articulo de referencia

Perfil de expresión genética

Los mapas de calor de los valores de expresión génica muestran cómo las condiciones experimentales influyeron en la producción (expresión) de ARNm para un conjunto de genes. El ...

Los mapas de calor de los valores de expresión génica muestran cómo las condiciones experimentales influyeron en la producción (expresión) de ARNm para un conjunto de genes. El color verde indica una expresión reducida. El análisis de clúster ha ubicado un grupo de genes con expresión reducida en la esquina superior izquierda.

En el campo de la biología molecular , el perfil de expresión génica consiste en medir la actividad (la expresión ) de miles de genes simultáneamente para obtener una visión global de la función celular. Estos perfiles permiten, por ejemplo, distinguir entre células que se dividen activamente o mostrar cómo reaccionan las células ante un tratamiento específico. Muchos experimentos de este tipo miden simultáneamente un genoma completo , es decir, todos los genes presentes en una célula determinada.

Se pueden utilizar diversas tecnologías transcriptómicas para generar los datos necesarios para el análisis. Los microarrays de ADN [ 1 ] miden la actividad relativa de genes diana previamente identificados. Las técnicas basadas en secuencias, como RNA-Seq , proporcionan información sobre las secuencias de los genes, además de su nivel de expresión.

Fondo

El análisis del perfil de expresión génica es un paso lógico tras la secuenciación del genoma : la secuencia nos indica las posibles funciones de la célula, mientras que el perfil de expresión nos revela su función en un momento dado. Los genes contienen las instrucciones para la síntesis de ARN mensajero ( ARNm ), pero en cualquier momento, cada célula sintetiza ARNm a partir de solo una fracción de los genes que posee. Si un gen se utiliza para producir ARNm, se considera activado; de lo contrario, está desactivado. Diversos factores determinan si un gen está activado o desactivado, como la hora del día, la división celular, su entorno y las señales químicas de otras células. Por ejemplo, las células de la piel , del hígado y de los nervios activan (expresan) genes ligeramente diferentes, lo que en gran medida las distingue. Por lo tanto, un perfil de expresión permite deducir el tipo, el estado y el entorno de una célula, entre otros datos.

Los experimentos de perfilado de expresión a menudo implican la medición de la cantidad relativa de ARNm expresado en dos o más condiciones experimentales. Esto se debe a que los niveles alterados de una secuencia específica de ARNm sugieren una necesidad modificada de la proteína codificada por dicho ARNm, lo que podría indicar una respuesta homeostática o una condición patológica. Por ejemplo, niveles más altos de ARNm que codifica la alcohol deshidrogenasa sugieren que las células o tejidos estudiados están respondiendo a niveles elevados de etanol en su entorno. De manera similar, si las células de cáncer de mama expresan niveles más altos de ARNm asociados con un receptor transmembrana particular que las células normales, es posible que este receptor desempeñe un papel en el cáncer de mama. Un fármaco que interfiera con este receptor podría prevenir o tratar el cáncer de mama. En el desarrollo de un fármaco, se pueden realizar experimentos de perfilado de expresión génica para ayudar a evaluar su toxicidad, por ejemplo, buscando cambios en los niveles de expresión de los genes del citocromo P450 , que pueden ser un biomarcador del metabolismo del fármaco . [ 2 ] El perfilado de expresión génica podría convertirse en una prueba diagnóstica importante. [ 3 ] [ 4 ]

Comparación con la proteómica

El genoma humano contiene aproximadamente 20 000 genes que trabajan en conjunto para producir alrededor de 1 000 000 de proteínas distintas. Esto se debe al empalme alternativo y también a que las células realizan cambios importantes en las proteínas mediante modificación postraduccional después de su síntesis inicial, de modo que un gen determinado sirve de base para muchas versiones posibles de una proteína en particular. En cualquier caso, un solo experimento de espectrometría de masas puede identificar alrededor de 2000 proteínas [ 5 ] o el 0,2 % del total. Si bien el conocimiento de las proteínas precisas que produce una célula ( proteómica ) es más relevante que saber cuánto ARN mensajero se produce a partir de cada gen, el perfil de expresión génica proporciona la visión más global posible en un solo experimento. Sin embargo, la metodología de la proteómica está mejorando. En otras especies, como la levadura, es posible identificar más de 4000 proteínas en poco más de una hora. [ 6 ]

Uso en la generación y comprobación de hipótesis.

En ocasiones, un científico ya tiene una idea de lo que sucede, una hipótesis , y realiza un experimento de perfilado de expresión con la intención de refutarla. En otras palabras, el científico formula una predicción específica sobre los niveles de expresión que podría resultar falsa.

Más comúnmente, el perfil de expresión se lleva a cabo antes de que se sepa lo suficiente sobre cómo interactúan los genes con las condiciones experimentales como para que exista una hipótesis comprobable. Sin una hipótesis, no hay nada que refutar, pero el perfil de expresión puede ayudar a identificar una hipótesis candidata para experimentos futuros. La mayoría de los primeros experimentos de perfil de expresión, y muchos de los actuales, tienen esta forma [ 7 ] que se conoce como descubrimiento de clases. Un enfoque popular para el descubrimiento de clases implica agrupar genes o muestras similares utilizando uno de los muchos métodos de agrupamiento existentes, como el tradicional k-means o el agrupamiento jerárquico , o el más reciente MCL . [ 8 ] Además de seleccionar un algoritmo de agrupamiento, el usuario generalmente tiene que elegir una medida de proximidad apropiada (distancia o similitud) entre los objetos de datos. [ 9 ] La figura anterior representa el resultado de un clúster bidimensional, en el que las muestras similares (filas, arriba) y las sondas genéticas similares (columnas) se organizaron de manera que quedaran cerca unas de otras. La forma más simple de descubrimiento de clases sería enumerar todos los genes que cambiaron en más de una cierta cantidad entre dos condiciones experimentales.

La predicción de clases es más difícil que el descubrimiento de clases, pero permite responder preguntas de relevancia clínica directa, como por ejemplo: dado este perfil, ¿cuál es la probabilidad de que este paciente responda a este fármaco? Esto requiere numerosos ejemplos de perfiles que respondieron y no respondieron, así como técnicas de validación cruzada para diferenciarlos.

Limitaciones

En general, los estudios de perfiles de expresión informan sobre aquellos genes que mostraron diferencias estadísticamente significativas bajo condiciones experimentales modificadas. Esto suele ser una pequeña fracción del genoma por varias razones. Primero, las diferentes células y tejidos expresan un subconjunto de genes como consecuencia directa de la diferenciación celular , por lo que muchos genes se desactivan. Segundo, muchos genes codifican proteínas necesarias para la supervivencia en cantidades muy específicas, por lo que muchos genes no cambian. Tercero, las células utilizan muchos otros mecanismos para regular las proteínas, además de alterar la cantidad de ARNm , por lo que estos genes pueden permanecer expresados ​​de forma constante incluso cuando las concentraciones de proteínas aumentan y disminuyen. Cuarto, las limitaciones financieras restringen los experimentos de perfiles de expresión a un pequeño número de observaciones del mismo gen en condiciones idénticas, lo que reduce la potencia estadística del experimento e imposibilita la identificación de cambios importantes pero sutiles. Finalmente, se requiere un gran esfuerzo para discutir la importancia biológica de cada gen regulado, por lo que los científicos a menudo limitan su discusión a un subconjunto. Las técnicas más recientes de análisis de microarrays automatizan ciertos aspectos de la atribución de importancia biológica a los resultados de los perfiles de expresión, pero este sigue siendo un problema muy difícil.

La relativa brevedad de las listas de genes publicadas a partir de experimentos de perfilado de expresión limita el grado de concordancia entre experimentos realizados en distintos laboratorios. Al incluir los resultados del perfilado de expresión en una base de datos de microarrays de acceso público , los investigadores pueden evaluar patrones de expresión que van más allá del alcance de los resultados publicados, identificando posibles similitudes con sus propios trabajos.

Validación de mediciones de alto rendimiento

Tanto los microarrays de ADN como la PCR cuantitativa aprovechan la unión preferencial o el " apareamiento de bases " de secuencias de ácidos nucleicos complementarias , y ambos se utilizan en el análisis de la expresión génica, a menudo de forma secuencial. Si bien los microarrays de ADN de alto rendimiento carecen de la precisión cuantitativa de la qPCR, se tarda aproximadamente el mismo tiempo en medir la expresión génica de unas pocas docenas de genes mediante qPCR que en medir un genoma completo utilizando microarrays de ADN. Por lo tanto, suele ser conveniente realizar experimentos de análisis semicuantitativo de microarrays de ADN para identificar genes candidatos y, posteriormente, realizar qPCR en algunos de los genes candidatos más interesantes para validar los resultados de los microarrays. Otros experimentos, como un Western blot de algunos de los productos proteicos de genes con expresión diferencial, hacen que las conclusiones basadas en el perfil de expresión sean más convincentes, ya que los niveles de ARNm no se correlacionan necesariamente con la cantidad de proteína expresada.

Análisis estadístico

El análisis de datos de microarrays se ha convertido en un área de intensa investigación. [ 10 ] Afirmar simplemente que un grupo de genes se regula al menos dos veces, una práctica común en el pasado, carece de fundamento estadístico sólido. Con cinco o menos réplicas en cada grupo, lo cual es típico en los microarrays, una sola observación atípica puede generar una diferencia aparente mayor al doble. Además, establecer arbitrariamente el umbral en el doble no es biológicamente correcto, ya que excluye muchos genes con una importancia biológica evidente.

En lugar de identificar genes con expresión diferencial mediante un umbral de cambio de expresión, se pueden utilizar diversas pruebas estadísticas o pruebas ómnibus como el ANOVA , que consideran tanto el cambio de expresión como la variabilidad para generar un valor p , una estimación de la frecuencia con la que se observarían los datos por azar. La aplicación de valores p a los microarrays se complica por la gran cantidad de comparaciones múltiples (genes) involucradas. Por ejemplo, un valor p de 0,05 se suele considerar significativo, ya que estima una probabilidad del 5 % de observar los datos por azar. Sin embargo, con 10 000 genes en un microarray, 500 genes se identificarían como significativos con un valor p < 0,05, incluso si no hubiera diferencias entre los grupos experimentales. Una solución obvia es considerar significativos solo aquellos genes que cumplan un criterio de valor p mucho más estricto; por ejemplo, se podría aplicar una corrección de Bonferroni a los valores p o utilizar un cálculo de la tasa de falsos descubrimientos para ajustar los valores p en proporción al número de pruebas paralelas involucradas. Desafortunadamente, estos enfoques pueden reducir a cero el número de genes significativos, incluso cuando los genes se expresan diferencialmente. Las estadísticas actuales, como los productos Rank, buscan un equilibrio entre el descubrimiento falso de genes debido a la variación aleatoria y la no detección de genes con expresión diferencial. Entre los métodos más citados se encuentra el Análisis de Significancia de Microarrays (SAM) [ 11 ] , y existe una amplia variedad de métodos disponibles en Bioconductor y diversos paquetes de análisis de empresas de bioinformática .

Seleccionar una prueba diferente generalmente identifica una lista distinta de genes significativos [ 12 ], ya que cada prueba opera bajo un conjunto específico de supuestos y pone un énfasis diferente en ciertas características de los datos. Muchas pruebas parten del supuesto de una distribución normal en los datos, porque parece un punto de partida sensato y a menudo produce resultados que parecen más significativos. Algunas pruebas consideran la distribución conjunta de todas las observaciones genéticas para estimar la variabilidad general en las mediciones [ 13 ] , mientras que otras analizan cada gen de forma aislada. Muchas técnicas modernas de análisis de microarrays implican el remuestreo (estadística) , el aprendizaje automático o los métodos de Monte Carlo [ 14 ] .

A medida que aumenta el número de mediciones replicadas en un experimento de microarrays, los distintos enfoques estadísticos arrojan resultados cada vez más similares, pero la falta de concordancia entre los diferentes métodos estadísticos hace que los resultados de los microarrays parezcan menos fiables. El proyecto MAQC [ 15 ] formula recomendaciones para guiar a los investigadores en la selección de métodos más estandarizados (por ejemplo, utilizando el valor p y el cambio de expresión conjuntamente para seleccionar los genes con expresión diferencial) de modo que los experimentos realizados en diferentes laboratorios coincidan mejor.

A diferencia del análisis de genes individuales expresados ​​diferencialmente, otro tipo de análisis se centra en la expresión diferencial o perturbación de conjuntos de genes predefinidos y se denomina análisis de conjuntos de genes. [ 16 ] [ 17 ] El análisis de conjuntos de genes ha demostrado varias ventajas importantes sobre el análisis de expresión diferencial de genes individuales. [ 16 ] [ 17 ] Los conjuntos de genes son grupos de genes que están relacionados funcionalmente según el conocimiento actual. Por lo tanto, el análisis de conjuntos de genes se considera un enfoque de análisis basado en el conocimiento. [ 16 ] Los conjuntos de genes comúnmente utilizados incluyen aquellos derivados de las vías KEGG , términos de Gene Ontology , grupos de genes que comparten algunas otras anotaciones funcionales, como reguladores transcripcionales comunes, etc. Los métodos representativos de análisis de conjuntos de genes incluyen el Análisis de Enriquecimiento de Conjuntos de Genes (GSEA), [ 16 ] que estima la significancia de los conjuntos de genes basándose en la permutación de etiquetas de muestras, y el Enriquecimiento de Conjuntos de Genes de Aplicación General (GAGE), [ 17 ] que prueba la significancia de los conjuntos de genes basándose en la permutación de etiquetas de genes o una distribución paramétrica.

Anotación genética

Si bien las estadísticas pueden identificar qué productos génicos cambian bajo condiciones experimentales, la interpretación biológica del perfil de expresión se basa en conocer qué proteína produce cada producto génico y qué función desempeña esta proteína. La anotación génica proporciona información funcional y de otro tipo, por ejemplo, la ubicación de cada gen dentro de un cromosoma específico. Algunas anotaciones funcionales son más fiables que otras; algunas están ausentes. Las bases de datos de anotación génica cambian con regularidad, y diversas bases de datos se refieren a la misma proteína con nombres diferentes, lo que refleja una comprensión cambiante de la función proteica. El uso de una nomenclatura génica estandarizada ayuda a abordar el aspecto de la nomenclatura del problema, pero la correspondencia exacta de los transcritos con los genes [ 18 ] [ 19 ] sigue siendo una consideración importante.

Clasificación de genes regulados

Una vez identificado un conjunto de genes regulados, el siguiente paso en el análisis de la expresión génica consiste en buscar patrones dentro de dicho conjunto. ¿Las proteínas producidas por estos genes desempeñan funciones similares? ¿Son químicamente similares? ¿Se localizan en partes similares de la célula? El análisis de ontología génica proporciona una forma estandarizada de definir estas relaciones. Las ontologías génicas parten de categorías muy amplias, como el "proceso metabólico", y las subdividen en categorías más pequeñas, como el "proceso metabólico de carbohidratos", y finalmente en categorías bastante restrictivas como la " fosforilación de inositol y sus derivados".

Los genes poseen otros atributos además de su función biológica, propiedades químicas y localización celular. Es posible crear conjuntos de genes según su proximidad a otros genes, su asociación con una enfermedad y su relación con fármacos o toxinas. La Base de Datos de Firmas Moleculares [ 20 ] y la Base de Datos de Toxicogenómica Comparativa [ 21 ] son ​​ejemplos de recursos para categorizar genes de diversas maneras.

Encontrar patrones entre genes regulados

Diagrama de red genética de Ingenuity [ 22 ] que ensambla dinámicamente genes con relaciones conocidas. El verde indica expresión reducida, el rojo indica expresión aumentada. El algoritmo ha incluido genes no regulados, en blanco, para mejorar la conectividad.

Los genes regulados se clasifican según su naturaleza y función, y pueden surgir relaciones importantes entre ellos. [ 23 ] Por ejemplo, podríamos observar evidencia de que un gen determinado crea una proteína para producir una enzima que activa otra proteína para activar un segundo gen de nuestra lista. Este segundo gen podría ser un factor de transcripción que regula otro gen de nuestra lista. Al observar estos vínculos, podríamos empezar a sospechar que representan mucho más que asociaciones casuales en los resultados, y que todos están en nuestra lista debido a un proceso biológico subyacente. Por otro lado, podría ser que si se seleccionaran genes al azar, se encontraran muchos que parecen tener algo en común. En este sentido, necesitamos procedimientos estadísticos rigurosos para comprobar si los temas biológicos emergentes son significativos o no. Ahí es donde entra en juego el análisis de conjuntos de genes [ 16 ] [ 17 ] .

Relaciones de causa y efecto

Estadísticas bastante sencillas proporcionan estimaciones de si las asociaciones entre genes en listas son mayores de lo que cabría esperar por azar. Estas estadísticas son interesantes, incluso si representan una simplificación excesiva de lo que realmente sucede. He aquí un ejemplo. Supongamos que hay 10 000 genes en un experimento, de los cuales solo 50 (0,5 %) desempeñan un papel conocido en la producción de colesterol . El experimento identifica 200 genes regulados. De estos, 40 (20 %) resultan estar también en una lista de genes del colesterol. Basándonos en la prevalencia general de los genes del colesterol (0,5 %), se espera un promedio de 1 gen del colesterol por cada 200 genes regulados, es decir, 0,005 × 200. Esta expectativa es un promedio, por lo que se espera ver más de uno en algunas ocasiones. La pregunta es con qué frecuencia veríamos 40 en lugar de 1 debido al puro azar.

Según la distribución hipergeométrica , se esperaría realizar aproximadamente 10^57 intentos (10 seguido de 56 ceros) antes de seleccionar 39 o más genes de colesterol de un conjunto de 10 000, extrayendo 200 genes al azar. Independientemente de si se presta mucha atención a la probabilidad infinitesimalmente pequeña de observar esto por casualidad, se podría concluir que la lista de genes regulados está enriquecida [ 24 ] en genes con una asociación conocida con el colesterol.

Se podría hipotetizar además que el tratamiento experimental regula el colesterol, ya que parece regular selectivamente los genes asociados con él. Si bien esto podría ser cierto, existen varias razones por las que llegar a esta conclusión basándose únicamente en el enriquecimiento representa un salto de fe injustificado. Un problema mencionado anteriormente tiene que ver con la observación de que la regulación genética puede no tener un impacto directo en la regulación proteica: incluso si las proteínas codificadas por estos genes no hacen nada más que producir colesterol, demostrar que su ARNm está alterado no nos dice directamente qué sucede a nivel proteico. Es muy posible que la cantidad de estas proteínas relacionadas con el colesterol permanezca constante en las condiciones experimentales. En segundo lugar, incluso si los niveles de proteínas cambian, tal vez siempre haya suficientes para producir colesterol a la máxima velocidad posible; es decir, otra proteína, no incluida en nuestra lista, es el paso limitante en el proceso de producción de colesterol. Finalmente, las proteínas suelen desempeñar múltiples funciones, por lo que estos genes podrían estar regulados no por su asociación compartida con la producción de colesterol, sino por una función compartida en un proceso completamente independiente.

Teniendo en cuenta las advertencias anteriores, si bien los perfiles genéticos no demuestran por sí mismos relaciones causales entre los tratamientos y los efectos biológicos, sí ofrecen información biológica única que a menudo sería muy difícil obtener de otras maneras.

Utilizar patrones para encontrar genes regulados

Como se describió anteriormente, se pueden identificar primero los genes regulados significativamente y luego encontrar patrones comparando la lista de genes significativos con conjuntos de genes que se sabe que comparten ciertas asociaciones. También se puede abordar el problema en orden inverso. He aquí un ejemplo muy simple. Supongamos que hay 40 genes asociados con un proceso conocido, por ejemplo, una predisposición a la diabetes. Al observar dos grupos de perfiles de expresión, uno para ratones alimentados con una dieta alta en carbohidratos y otro para ratones alimentados con una dieta baja en carbohidratos, se observa que los 40 genes de la diabetes se expresan a un nivel más alto en el grupo de alto contenido en carbohidratos que en el grupo de bajo contenido en carbohidratos. Independientemente de si alguno de estos genes habría llegado a una lista de genes significativamente alterados, observar que los 40 aumentan y ninguno disminuye parece poco probable que sea el resultado de la pura casualidad: se predice que obtener 40 caras seguidas ocurre aproximadamente una vez en un billón de intentos con una moneda justa.

Para un tipo de célula, el grupo de genes cuyo patrón de expresión combinado es característico de una condición determinada constituye la firma genética de dicha condición. Idealmente, la firma genética puede utilizarse para seleccionar un grupo de pacientes en un estado específico de una enfermedad con una precisión que facilite la selección de tratamientos. [ 25 ] [ 26 ] El análisis de enriquecimiento de conjuntos de genes (GSEA) [ 16 ] y métodos similares [ 17 ] aprovechan este tipo de lógica, pero utilizan estadísticas más sofisticadas, ya que los genes componentes en procesos reales muestran un comportamiento más complejo que simplemente moverse hacia arriba o hacia abajo como grupo, y la magnitud de estos movimientos es significativa, no solo la dirección. En cualquier caso, estas estadísticas miden cuán diferente es el comportamiento de un pequeño conjunto de genes en comparación con genes que no pertenecen a ese conjunto.

GSEA utiliza una estadística de tipo Kolmogorov-Smirnov para determinar si algún conjunto de genes previamente definido mostró un comportamiento inusual en el perfil de expresión actual. Esto plantea un desafío de prueba de hipótesis múltiples, pero existen métodos razonables para abordarlo. [ 27 ]

Conclusiones

El análisis de la expresión génica proporciona información novedosa sobre la función de los genes en diversas condiciones. En general, la tecnología de microarrays genera perfiles de expresión fiables. [ 28 ] A partir de esta información, se pueden formular nuevas hipótesis sobre biología o poner a prueba las existentes. Sin embargo, el tamaño y la complejidad de estos experimentos suelen dar lugar a una amplia variedad de posibles interpretaciones. En muchos casos, analizar los resultados del análisis de la expresión génica requiere mucho más esfuerzo que realizar los experimentos iniciales.

La mayoría de los investigadores utilizan múltiples métodos estadísticos y análisis exploratorios de datos antes de publicar los resultados de sus perfiles de expresión, coordinando sus esfuerzos con un bioinformático u otro experto en microarrays de ADN , secuenciación de ARN y secuenciación de células individuales . Un buen diseño experimental, una replicación biológica adecuada y experimentos de seguimiento desempeñan un papel fundamental en el éxito de los experimentos de perfiles de expresión.

Véase también

Referencias

  1. "Hoja informativa sobre microarrays" . Archivado del original el 9 de abril de 2002. Consultado el 28 de diciembre de 2007 .
  2. Suter L, Babiss LE, Wheeldon EB (2004). "Toxicogenómica en toxicología predictiva en el desarrollo de fármacos" . Chem. Biol . 11 (2): 161– 71. doi : 10.1016/j.chembiol.2004.02.003 . PMID 15123278 . 
  3. Magic Z, Radulovic S, Brankovic-Magic M (2007). "Microarrays de ADNc: identificación de firmas genéticas y su aplicación en la práctica clínica". J BUON . 12 (Suppl 1): S39–44. PMID 17935276 . 
  4. Cheung AN (2007). "Objetivos moleculares en cánceres ginecológicos". Pathology . 39 (1): 26– 45. doi : 10.1080/00313020601153273 . PMID 17365821 . S2CID 40896577 .  
  5. Mirza SP, Olivier M (2007). " Métodos y enfoques para la caracterización y cuantificación integral de proteomas celulares mediante espectrometría de masas" . Physiol Genomics . 33 (1): 3– 11. doi : 10.1152/physiolgenomics.00292.2007 . PMC 2771641. PMID 18162499 .  
  6. Hebert AS, Richards AL, et al. (2014). "El proteoma de levadura de una hora" . Mol Cell Proteomics . 13 (1): 339– 347. doi : 10.1074/mcp.M113.034769 . PMC 3879625. PMID 24143002 .   
  7. Chen JJ (2007). "Aspectos clave del análisis de datos de expresión génica de microarrays" . Farmacogenómica . 8 (5): 473– 82. doi : 10.2217/14622416.8.5.473 . PMID 17465711 . 
  8. ^ van Dongen, Stijn (2000). Agrupación de gráficos mediante simulación de flujo . Universidad de Utrecht.
  9. Jaskowiak, Pablo A; Campello, Ricardo JGB; Costa, Ivan G (24 de enero de 2014). "Sobre la selección de distancias apropiadas para la agrupación de datos de expresión génica" . BMC Bioinformatics . 15 (Supl. 2): S2. doi : 10.1186/1471-2105-15-S2-S2 . PMC 4072854. PMID 24564555 .  
  10. Vardhanabhuti S, Blakemore SJ, Clark SM, Ghosh S, Stephens RJ, Rajagopalan D (2006). "Una comparación de pruebas estadísticas para detectar la expresión diferencial utilizando microarrays de oligonucleótidos de Affymetrix". OMICS . 10 (4): 555– 66. doi : 10.1089/omi.2006.10.555 . PMID 17233564 . 
  11. "Análisis de significancia de microarrays" . Archivado del original el 20 de enero de 2008. Consultado el 27 de diciembre de 2007 .
  12. Yauk CL, Berndt ML (2007). "Revisión de la literatura que examina la correlación entre las tecnologías de microarrays de ADN" . Environ . Mol. Mutagen . 48 (5): 380– 94. Bibcode : 2007EnvMM..48..380Y . doi : 10.1002/em.20290 . PMC 2682332. PMID 17370338 .  
  13. Breitling R (2006). "Interpretación de microarrays biológicos: las reglas de la interacción" ( PDF) . Biochim. Biophys. Acta . 1759 (7): 319– 27. doi : 10.1016/j.bbaexp.2006.06.003 . PMID 16904203. S2CID 1857997 .  
  14. Draminski M, Rada-Iglesias A, Enroth S, Wadelius C, Koronacki J, Komorowski J (2008). "Selección de características de Monte Carlo para clasificación supervisada" . Bioinformatics . 24 (1): 110–7 . doi : 10.1093/bioinformatics/btm486 . PMID 18048398 . 
  15. Dr. Leming Shi, Centro Nacional de Investigación Toxicológica. "Proyecto de Control de Calidad de Microarrays (MAQC)" . Administración de Alimentos y Medicamentos de EE . UU . Consultado el 26 de diciembre de 2007 .
  16. 1 2 3 4 5 6 Subramanian A, Tamayo P, Mootha VK, Mukherjee S, Ebert BL, Gillette MA, Paulovich A, Pomeroy SL, Golub TR, Lander ES, Mesirov JP (2005). "Análisis de enriquecimiento de conjuntos de genes: un enfoque basado en el conocimiento para interpretar perfiles de expresión de todo el genoma" . Proc . Natl. Acad. Sci. USA . 102 (43): 15545– 50. doi : 10.1073/pnas.0506580102 . PMC 1239896. PMID 16199517 .  
  17. 1 2 3 4 5 Luo W, Friedman M, Shedden K, Hankenson KD, Woolf JP (2009). "GAGE: enriquecimiento de conjuntos de genes de aplicación general para el análisis de vías" . BMC Bioinformatics . 10 : 161. doi : 10.1186/1471-2105-10-161 . PMC 2696452. PMID 19473525 .  
  18. Dai M, Wang P, Boyd AD, et al. (2005). "Las definiciones cambiantes de genes/transcripciones alteran significativamente la interpretación de los datos de GeneChip" . Nucleic Acids Res . 33 (20): e175. doi : 10.1093/nar/gni179 . PMC 1283542. PMID 16284200 .   
  19. Alberts R, Terpstra P, Hardonk M, et al. (2007). "Un protocolo de verificación para las secuencias de sondas de los microarrays genómicos de Affymetrix revela una alta precisión de las sondas para estudios en ratones, humanos y ratas" . BMC Bioinformatics . 8 : 132. doi : 10.1186/1471-2105-8-132 . PMC 1865557. PMID 17448222 .   
  20. "GSEA – MSigDB" . Consultado el 3 de enero de 2008 .
  21. "CTD: La base de datos de toxicogenómica comparativa" . Consultado el 3 de enero de 2008 .
  22. "Ingenuity Systems" . Consultado el 27 de diciembre de 2007 .
  23. Alekseev OM, Richardson RT, Alekseev O, O'Rand MG (2009). "Análisis de perfiles de expresión génica en células HeLa en respuesta a la sobreexpresión o el agotamiento de NASP mediado por siRNA" . Reprod . Biol. Endocrinol . 7 : 45. doi : 10.1186/1477-7827-7-45 . PMC 2686705. PMID 19439102 .  
  24. Curtis RK, Oresic M, Vidal-Puig A (2005). "Caminos hacia el análisis de datos de microarrays". Trends Biotechnol . 23 (8): 429–35 . doi : 10.1016/j.tibtech.2005.05.011 . PMID 15950303 . 
  25. Mook S, Van't Veer LJ, Rutgers EJ, Piccart-Gebhart MJ, Cardoso F (2007). "Individualización de la terapia mediante Mammaprint: del desarrollo al ensayo MINDACT". Cancer Genomics Proteomics . 4 (3): 147– 55. PMID 17878518 . 
  26. Corsello SM, Roti G, Ross KN, Chow KT, Galinsky I, DeAngelo DJ, Stone RM, Kung AL, Golub TR, Stegmaier K (junio de 2009). " Identificación de moduladores de AML1-ETO mediante genómica química" . Blood . 113 (24): 6193–205 . doi : 10.1182/blood-2008-07-166090 . PMC 2699238. PMID 19377049 .  
  27. "GSEA" . Consultado el 9 de enero de 2008 .
  28. Couzin J (2006). "Genómica. Datos de microarrays reproducidos, pero algunas preocupaciones persisten". Science . 313 (5793): 1559. doi : 10.1126/science.313.5793.1559a . PMID 16973852 . S2CID 58528299 .  
  • Análisis Transcriptómico Comparativo en el Módulo de Referencia de Ciencias de la Vida