Articulo de referencia

Warren Gish

[[Washington University in St. Louis]] Advanced Biocomputing LLC [[University of California, Berkeley]]"},"alma_mater":{"wt":"[[University of California, Berkeley]]"},"doctoral_...

Warren Richard Gish es el propietario de Advanced Biocomputing LLC. Se unió a la Facultad de Medicina de la Universidad de Washington como miembro adjunto del profesorado en 1994, y fue profesor asociado de investigación en genética de 2002 a 2007. [ 2 ]

Educación

Después de estudiar inicialmente física, Gish obtuvo una licenciatura en bioquímica de la Universidad de California, Berkeley , y completó su doctorado en biología molecular en la misma institución en 1988. [ 1 ]

Investigación

Gish es conocido principalmente por sus contribuciones a NCBI BLAST , [ 3 ] [ 4 ] incluyendo la creación y el soporte del Servicio de Red BLAST, el desarrollo y soporte de las bases de datos nr (cuasi-no redundantes) en febrero de 1991, la introducción de BLAST con huecos (WU-BLAST 2.0) en mayo de 1996, y su trabajo continuo en AB-BLAST. En la Universidad de Washington en St. Louis , Gish dirigió el grupo de análisis del genoma que anotó todos los datos del genoma humano, de ratón y de rata terminados producidos por el Centro de Secuenciación del Genoma de la universidad desde 1995 hasta 2002. Disponible por primera vez para usuarios internos en diciembre de 1989, el Servicio de Red NCBI BLAST se abrió al público en marzo de 1990, poco después de que el manuscrito de BLAST fuera aceptado para su publicación. Esto fue varios meses antes de que el artículo apareciera impreso, por lo que el director del NCBI solicitó que no se publicara la disponibilidad del servicio de red. Dado que el servicio utilizaba el software BLAST más reciente en hardware SMP de alta velocidad contra bases de datos de secuencias completas y actualizadas diariamente, la publicidad de boca en boca pronto consolidó al NCBI como una solución integral y práctica para la búsqueda de similitud de secuencias. Al igual que el Servicio de Red BLAST, los proyectos posteriores que Gish emprendió de forma independiente también se basarían en la publicidad de boca en boca.

En 1985, para abordar la frecuente necesidad de identificar rápidamente los sitios de reconocimiento de enzimas de restricción en el ADN, Gish desarrolló una biblioteca de funciones de autómata finito determinista en lenguaje C. La idea de aplicar una máquina de estados finitos a este problema fue sugerida por su compañero de posgrado y desarrollador de Berkeley Software Distribution, Michael J. Karels , quien señaló que las técnicas de autómatas de estados finitos utilizadas por grep podrían ser aplicables. La implementación del DFA de Gish utilizó una arquitectura de máquina de Mealy , que es más compacta que una máquina de Moore equivalente y, por lo tanto, más eficiente. Los autómatas resultantes podían escanear secuencias de referencia en busca de sitios de reconocimiento en una sola pasada sin retroceso. Aunque se desarrolló de forma independiente, posteriormente se observó que el método de construcción del DFA consolidaba eficazmente los algoritmos 3 y 4 descritos por Alfred Aho y Margaret J. Corasick . [ 5 ]

Mientras trabajaba en la Universidad de California, Berkeley , en diciembre de 1986, Gish aceleró el programa FASTP [ 6 ] (más tarde conocido como FASTA [ 7 ] ) de William R. Pearson y David J. Lipman entre dos y tres veces sin alterar los resultados. Cuando se comunicaron las modificaciones de rendimiento a Pearson y Lipman, Gish sugirió además reemplazar la tabla de búsqueda de k-tuplas de FASTP con un autómata finito determinista, estimando que esto podría mejorar el rendimiento general hasta en un 10 %. Los autores concluyeron que una ganancia tan modesta no justificaba la complejidad adicional del código. Casi al mismo tiempo, Gish concibió un servicio centralizado de búsqueda de secuencias en el que todas las secuencias de nucleótidos de GenBank se mantendrían en memoria, almacenadas en forma comprimida para ahorrar espacio, y se buscarían de forma remota a través de Internet, eliminando así los cuellos de botella de E/S de la base de datos y haciendo práctico que un único sistema de alto rendimiento diera servicio a una gran comunidad de usuarios.

Los primeros prototipos de BLAST se ejecutaban mucho más rápido que las versiones contemporáneas de FASTA. Para mejorar aún más el rendimiento, Gish adaptó su código DFA para la identificación de coincidencias de palabras en BLAST, reemplazando así las tablas de búsqueda. Otras contribuciones a BLAST incluyeron el uso de secuencias de nucleótidos comprimidas, tanto como formato de almacenamiento compacto como representación interna más rápida para la búsqueda de secuencias; el procesamiento paralelo; el uso de segmentos de memoria compartida bloqueados para mantener grandes bases de datos de secuencias en memoria; E/S mapeada en memoria; y el uso de bytes centinela al inicio y al final de las secuencias para mejorar la velocidad de la extensión de coincidencias de palabras.

Gish también desarrolló BLASTX, [ 8 ] TBLASTN, [ 3 ] y TBLASTX (este último no publicado), así como soporte transparente para programas externos como seg, xnu y dust para enmascarar regiones de baja complejidad en secuencias de consulta. Creó el Servicio de correo electrónico NCBI BLAST con comunicaciones opcionales cifradas con clave pública y el Servicio de red NCBI BLAST.

Las contribuciones adicionales incluyeron el desarrollo y el soporte continuo para las bases de datos de secuencias de proteínas y nucleótidos cuasi-no redundantes ( nr ) del NCBI, que generalmente se actualizan diariamente y están disponibles tanto a través del Servicio de Red BLAST como para descarga pública. Estas bases de datos integraban secuencias de GenBank (incluido GenPept), Swiss-Prot y el Recurso de Información de Proteínas . Gish también desarrolló la primera API de BLAST, que se utilizó en la anotación de EST [ 9 ] y la producción de datos Entrez , así como en el conjunto de aplicaciones NCBI BLAST versión 1.4 (Gish, no publicado), y diseñó el Dispatcher inicial del NCBI para servicios distribuidos (inspirado en el Agente de Solicitudes de Objetos de CORBA ).

En la Universidad de Washington en St. Louis, Gish desarrolló WU-BLAST 2.0, introduciendo un nuevo método X-drop para alineación de secuencias con huecos combinado con nuevas estadísticas para evaluar puntuaciones de alineación con huecos. Los programas resultantes fueron sustancialmente más sensibles pero solo marginalmente más lentos que BLAST sin huecos. La sensibilidad de las alineaciones con huecos se mejoró mediante la extensión novedosa de las estadísticas de suma de Karlin-Altschul [ 10 ] a la evaluación de puntuaciones de alineación con huecos. Las estadísticas de suma se habían desarrollado analíticamente para la evaluación de puntuaciones de alineación múltiples sin huecos, y su uso empírico para evaluar puntuaciones de alineación múltiples con huecos se validó en colaboración con Stephen Altschul . En mayo de 1996, se lanzó públicamente la versión 2.0 de WU-BLAST, que incluía alineaciones con huecos y estadísticas de suma en todos los modos de búsqueda (BLASTP, BLASTN, BLASTX, TBLASTN y TBLASTX), como una actualización directa para los usuarios existentes de NCBI BLAST y WU-BLAST sin huecos (ambos en la versión 1.4, tras su bifurcación en 1994). NCBI BLAST no admite ni alineaciones con huecos ni estadísticas de suma en todos los modos de búsqueda. En 1997, Gish implementó un algoritmo BLAST de dos coincidencias más rápido, con mayor eficiencia en memoria y ligeramente más sensible que el utilizado por el software de NCBI.

En 1999, Gish añadió soporte a WU-BLAST para el formato de base de datos extendida (XDF), el primer formato de base de datos BLAST capaz de representar con precisión la secuencia completa del genoma humano en objetos de secuencias cromosómicas completas. WU-BLAST introdujo XDF de forma transparente, conservando la compatibilidad con el formato de base de datos BLAST original a través de una capa de E/S de base de datos abstracta. WU-BLAST con XDF fue el primer conjunto de herramientas BLAST en admitir la recuperación indexada con identificadores de secuencia en formato FASTA estándar del NCBI como claves (incluida toda la gama de etiquetas de identificador del NCBI); el primero en permitir la recuperación de secuencias individuales, ya sea en parte o en su totalidad, y en su forma nativa, traducida o complementada inversamente; y el primero capaz de volcar todo el contenido de una base de datos BLAST de nuevo al formato FASTA legible por humanos .

En 2000, se añadió a WU-BLAST una función única para informar enlaces (conjuntos consistentes de HSP; también llamados cadenas por algunos paquetes de software posteriores), junto con la capacidad de los usuarios de limitar la distancia entre HSP permitida en el mismo conjunto a una longitud biológicamente relevante ( por ejemplo, la longitud del intrón más largo esperado en la especie de interés), con la limitación de distancia incorporada al cálculo de los valores E. Gish propuso la multiplexación de secuencias de consulta para acelerar las búsquedas BLAST en un orden de magnitud o más (MPBLAST) e implementó secuencias segmentadas con bytes centinela internos, en parte para facilitar la multiplexación con MPBLAST y en parte para evitar que las alineaciones se extendieran más allá de los límites de los segmentos al analizar secuencias de consulta segmentadas de ensamblajes de secuenciación de escopeta. También dirigió el uso de WU-BLAST como un motor de búsqueda rápido y flexible para identificar y enmascarar con precisión secuencias genómicas para elementos repetitivos y secuencias de baja complejidad (el paquete MaskerAid [ 11 ] para RepeatMasker). Junto con el estudiante de doctorado Miao Zhang, Gish dirigió el desarrollo de EXALIN [ 12 ] , que mejoró la precisión de las predicciones de alineación de empalmes mediante un enfoque novedoso que combinaba información de modelos de sitios de empalme donadores y aceptores con información de conservación de secuencias. Si bien EXALIN realizaba programación dinámica completa por defecto, podía utilizar opcionalmente la salida de WU-BLAST para inicializar la programación dinámica y acelerar el proceso aproximadamente 100 veces con poca pérdida de sensibilidad o precisión.

En 2008, Gish fundó Advanced Biocomputing, LLC, donde continúa desarrollando y brindando soporte al paquete AB-BLAST.

En 2024, después de que el NCBI interrumpiera la distribución de bases de datos de secuencias en el formato FASTA, simple y ampliamente compatible, Gish proporcionó scripts que aceleraron la conversión de las bases de datos BLAST del NCBI al formato FASTA varias veces. [ 13 ]

Referencias

  1. 1 2 Gish, Warren Richard (1988). I. Mutantes SV40 aislados de células humanas transformadas. II. Métodos para el análisis de secuencias (tesis doctoral). Universidad de California, Berkeley. ProQuest 303669506 . 
  2. Warren Gish en el servidor de bibliografía DBLP
  3. 1 2 Altschul, S. ; Gish, W. ; Miller, W. ; Myers, E. ; Lipman, D. (1990). "Herramienta básica de búsqueda de alineación local". Journal of Molecular Biology . 215 (3): 403– 410. doi : 10.1016/S0022-2836(05)80360-2 . PMID 2231712 . S2CID 14441902 .  
  4. Sentido a partir de secuencias: Stephen F. Altschul sobre cómo mejorar BLAST
  5. Aho, Alfred V. ; Corasick, Margaret J. (junio de 1975). "Coincidencia eficiente de cadenas: una ayuda para la búsqueda bibliográfica" . Communications of the ACM . 18 (6): 333– 340. doi : 10.1145/360825.360855 . S2CID 207735784 . 
  6. Lipman, DJ; Pearson, WR (1985). "Búsquedas rápidas y sensibles de similitud de proteínas". Science . 227 (4693): 1435– 41. Bibcode : 1985Sci...227.1435L . doi : 10.1126/science.2983426 . PMID 2983426 . 
  7. Pearson, WR; Lipman, DJ (1988). "Herramientas mejoradas para la comparación de secuencias biológicas" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 85 ( 8): 2444– 2448. Bibcode : 1988PNAS...85.2444P . doi : 10.1073/pnas.85.8.2444 . PMC 280013. PMID 3162770 .  
  8. Gish, W.; States, DJ (1993). "Identificación de regiones codificantes de proteínas mediante búsqueda de similitud en bases de datos". Nature Genetics . 3 (3): 266– 272. doi : 10.1038/ng0393-266 . PMID 8485583 . S2CID 15295142 .  
  9. Boguski, MS; Lowe, TM; Tolstoshev, CM (1993). "dbEST--base de datos para "etiquetas de secuencia expresada"" . Nature Genetics . 4 (4): 332– 333. doi : 10.1038/ng0893-332 . PMID 8401577 . S2CID 40138950 .  
  10. Karlin, S. ; Altschul, SF (1993). "Aplicaciones y estadísticas para múltiples segmentos de alta puntuación en secuencias moleculares" . Actas de la Academia Nacional de Ciencias de los Estados Unidos de América . 90 (12): 5873– 5877. Bibcode : 1993PNAS...90.5873K . doi : 10.1073/pnas.90.12.5873 . PMC 46825. PMID 8390686 .  
  11. Bedell, JA; Korf, I.; Gish, W. (2000). "MaskerAid : una mejora del rendimiento de RepeatMasker" . Bioinformatics . 16 (11): 1040– 1041. doi : 10.1093/bioinformatics/16.11.1040 . PMID 11159316 .  
  12. Zhang, M.; Gish, W. (2005). "Alineación de empalme mejorada desde un enfoque de teoría de la información". Bioinformatics . 22 (1): 13– 20. doi : 10.1093/bioinformatics/bti748 . PMID 16267086 . 
  13. "NCBI Helper" . blast.advbiocomp.com . Consultado el 30 de mayo de 2026 .
Obtenido de " https://en.wikipedia.org/w/index.php?title=Warren_Gish&oldid=1358493943 "