Articulo de referencia

Datos biológicos

Los datos biológicos se refieren a compuestos o información derivados de organismos vivos y sus productos. Un compuesto medicinal elaborado a partir de organismos vivos, como un...

Los datos biológicos se refieren a compuestos o información derivados de organismos vivos y sus productos. Un compuesto medicinal elaborado a partir de organismos vivos, como un suero o una vacuna, podría considerarse un dato biológico. Los datos biológicos son muy complejos en comparación con otros tipos de datos. Existen diversas formas de datos biológicos, como texto, secuencias de datos, estructuras proteicas, datos genómicos, aminoácidos y enlaces, entre otros.

La ARN polimerasa (en color púrpura) es una enzima compleja fundamental para la transcripción. Durante este proceso, la enzima desenrolla la doble hélice del ADN y utiliza una de las hebras (en color naranja oscuro) como plantilla para crear el ARN mensajero monocatenario (en color verde), que posteriormente es utilizado por los ribosomas para la síntesis de proteínas.

Datos biológicos y bioinformática

Los datos biológicos están estrechamente relacionados con la bioinformática , una disciplina reciente que se centra en abordar la necesidad de analizar e interpretar grandes cantidades de datos genómicos.

En las últimas décadas, los avances en la investigación genómica han generado enormes cantidades de datos biológicos. Como resultado, la bioinformática surgió como la convergencia de la genómica, la biotecnología y la tecnología de la información, centrándose en los datos biológicos.

Los datos biológicos también han sido difíciles de definir, dado que la bioinformática es un campo muy amplio. Además, la cuestión de qué constituye un organismo vivo ha sido controvertida, ya que "vivo" representa un término ambiguo que abarca la evolución molecular, el modelado biológico, la biofísica y la biología de sistemas . Desde la última década, la bioinformática y el análisis de datos biológicos han experimentado un gran auge gracias a los avances tecnológicos necesarios para gestionar e interpretar los datos. Actualmente, es un campo en pleno desarrollo, ya que la sociedad se ha centrado cada vez más en la adquisición, transferencia y explotación de datos bioinformáticos y biológicos.

Tipos de datos biológicos

Los datos biológicos pueden extraerse para su uso en los campos de la ómica , la bioimagen y la imagen médica . Los científicos de la vida valoran los datos biológicos para obtener detalles moleculares de los organismos vivos. Las herramientas para la secuenciación de ADN, la expresión génica (EG), la bioimagen, la neuroimagen y las interfaces cerebro-máquina son campos que utilizan datos biológicos y modelan sistemas biológicos de alta dimensionalidad. [ 1 ]

Además, los datos de secuencias biológicas sin procesar generalmente se refieren a ADN , ARN y aminoácidos . [ 1 ]

Los datos biológicos también pueden describirse como datos sobre entidades biológicas. [ 2 ] Por ejemplo, características como secuencias, gráficos, información geométrica, campos escalares y vectoriales, patrones, restricciones, imágenes e información espacial pueden considerarse datos biológicos, ya que describen características de los seres biológicos. En muchos casos, los datos biológicos se asocian con varias de estas categorías. Por ejemplo, como se describe en el informe del Instituto Nacional de Salud sobre la catalización de la investigación en la interfaz entre la informática y la biología, una estructura proteica puede asociarse con una secuencia unidimensional, una imagen bidimensional y una estructura tridimensional, entre otras. [ 2 ]

CATH - Base de datos de clasificación de la estructura de las proteínas

Bases de datos biomédicas

Las bases de datos biomédicas a menudo se han denominado bases de datos de registros electrónicos de salud (EHR) , datos genómicos en sistemas de bases de datos federales descentralizados y datos biológicos, incluidos los datos genómicos, recopilados de estudios clínicos a gran escala . [ 3 ] [ 4 ]

Biohacking y amenazas a la privacidad

Biohacking

Los ataques de bioinformática se han vuelto más comunes, ya que estudios recientes han demostrado que herramientas comunes pueden permitir a un atacante sintetizar información biológica que puede usarse para robar información de análisis de ADN. [ 5 ] La amenaza del biohacking se ha vuelto más evidente a medida que el análisis de ADN se vuelve más común en campos como la ciencia forense, la investigación clínica y la genómica.

El biohacking puede llevarse a cabo mediante la síntesis de ADN malicioso y su inserción en muestras biológicas. Los investigadores han establecido escenarios que demuestran la amenaza del biohacking, como el acceso de un hacker a una muestra biológica ocultando ADN malicioso en superficies comunes, como batas de laboratorio, mesas de trabajo o guantes de goma, lo que contaminaría los datos genéticos. [ 5 ]

Sin embargo, la amenaza del biohacking puede mitigarse mediante técnicas similares a las que se utilizan para prevenir ataques de inyección convencionales. Los médicos e investigadores pueden mitigar un biohacking extrayendo información genética de muestras biológicas y comparándolas para identificar materiales desconocidos. Los estudios han demostrado que la comparación de información genética con muestras biológicas para identificar código de biohacking ha tenido una eficacia de hasta el 95 % en la detección de inserciones de ADN maliciosas en ataques de biohacking. [ 5 ]

Muestras genéticas como datos personales

Las preocupaciones sobre la privacidad en la investigación genómica han surgido en torno a la noción de si las muestras genómicas contienen datos personales o si deben considerarse materia física. [ 6 ] Además, surgen preocupaciones porque algunos países reconocen los datos genómicos como datos personales (y aplican normas de protección de datos), mientras que otros países consideran las muestras como materia física y no aplican las mismas leyes de protección de datos a las muestras genómicas. El próximo Reglamento General de Protección de Datos ( RGPD ) se ha citado como un posible instrumento legal que podría mejorar la aplicación de las normas de privacidad en los biobancos y la investigación genómica. [ 6 ]

Sin embargo, la ambigüedad en torno a la definición de "datos personales" en el texto del RGPD, especialmente en lo que respecta a los datos biológicos, ha generado dudas sobre si la normativa se aplicará a las muestras genéticas. El artículo 4(1) establece que los datos personales se definen como "Toda información relativa a una persona física identificada o identificable ('interesado')" [ 7 ].

Aplicaciones del aprendizaje profundo a los datos biológicos

Como resultado de los rápidos avances en la ciencia de datos y la capacidad computacional, los científicos de la vida han podido aplicar métodos de aprendizaje automático intensivos en datos biológicos, como el aprendizaje profundo (DL), el aprendizaje por refuerzo (RL) y su combinación (RL profundo). Estos métodos, junto con el aumento en el almacenamiento de datos y la computación, han permitido a los científicos de la vida extraer datos biológicos y analizar conjuntos de datos que antes eran demasiado grandes o complejos. El aprendizaje profundo (DL) y el aprendizaje por refuerzo (RL) se han utilizado en el campo de la investigación ómica [ 1 ] (que incluye genómica, proteómica o metabolómica). Normalmente, se extraen datos de secuencias biológicas sin procesar (como ADN, ARN y aminoácidos) y se utilizan para analizar características, funciones, estructuras y dinámica molecular de los datos biológicos. A partir de ahí, se pueden realizar diferentes análisis, como la predicción de uniones de empalme y la evaluación de interacciones proteína-proteína. [ 1 ]

El aprendizaje por refuerzo, término que proviene de la psicología conductual, es un método de resolución de problemas que consiste en aprender mediante ensayo y error. Este método puede aplicarse a datos biológicos, en el campo de la ómica, utilizando el aprendizaje por refuerzo para predecir genomas bacterianos. [ 8 ]

Otros estudios han demostrado que el aprendizaje por refuerzo puede utilizarse para predecir con precisión la anotación de secuencias biológicas. [ 9 ]

Las arquitecturas de aprendizaje profundo (DL) también son útiles para el entrenamiento de datos biológicos. Por ejemplo, se han utilizado arquitecturas de DL que se dirigen a los niveles de píxeles de imágenes biológicas para identificar el proceso de mitosis en imágenes histológicas de mama. Asimismo, se han utilizado arquitecturas de DL para identificar núcleos en imágenes de células de cáncer de mama. [ 10 ]

Desafíos para la minería de datos en la informática biomédica

Complejidad

El principal problema al que se enfrentan los modelos de datos biomédicos ha sido tradicionalmente la complejidad, ya que los científicos de la vida en entornos clínicos y de investigación biomédica se enfrentan a la posibilidad de una sobrecarga de información. Sin embargo, la sobrecarga de información ha sido un fenómeno frecuentemente debatido en el ámbito médico. [ 11 ] Los avances computacionales han permitido la formación de comunidades separadas bajo diferentes filosofías. Por ejemplo, los investigadores de minería de datos y aprendizaje automático buscan patrones relevantes en datos biológicos, y la arquitectura no depende de la intervención humana. Sin embargo, existen riesgos al modelar artefactos cuando se reduce la intervención humana, como la comprensión y el control del usuario final. [ 12 ]

Los investigadores han señalado que, con el aumento de los costos de la atención médica y la enorme cantidad de datos subutilizados, las tecnologías de la información sanitaria pueden ser la clave para mejorar la eficiencia y la calidad de la atención médica. [ 11 ]

Errores y abusos en la base de datos

Los registros electrónicos de salud (EHR, por sus siglas en inglés) pueden contener datos genómicos de millones de pacientes, y la creación de estas bases de datos ha generado tanto elogios como preocupación. [ 4 ]

Los expertos en derecho han señalado tres preocupaciones principales respecto al aumento de litigios relacionados con bases de datos biomédicas. En primer lugar, los datos contenidos en dichas bases de datos pueden ser incorrectos o incompletos. En segundo lugar, los sesgos sistémicos, que pueden derivarse de los sesgos de los investigadores o de la naturaleza de los datos biológicos, pueden poner en peligro la validez de los resultados de la investigación. En tercer lugar, la presencia de minería de datos en las bases de datos biológicas puede facilitar que personas con intereses políticos, sociales o económicos manipulen los resultados de la investigación para influir en la opinión pública. [ 13 ] [ 4 ]

Un ejemplo de mal uso de bases de datos ocurrió en 2009 cuando el Journal of Psychiatric Research publicó un estudio que asociaba el aborto con trastornos psiquiátricos. [ 14 ] El propósito del estudio era analizar las asociaciones entre el historial de abortos y los trastornos psiquiátricos, como los trastornos de ansiedad (incluidos el trastorno de pánico, el TEPT y la agorafobia) junto con los trastornos por abuso de sustancias y los trastornos del estado de ánimo.

Sin embargo, el estudio fue desacreditado en 2012 cuando los científicos examinaron minuciosamente su metodología y la encontraron gravemente defectuosa. [ 15 ] Los investigadores habían utilizado "conjuntos de datos nacionales con historial reproductivo y variables de salud mental" [ 14 ] para obtener sus resultados. No obstante, no compararon a las mujeres (que tuvieron embarazos no planificados y se sometieron a abortos) con el grupo de mujeres que no se sometieron a abortos, centrándose en los problemas psiquiátricos que surgieron después de la interrupción del embarazo. Como resultado, los hallazgos, que aparentemente otorgaban credibilidad científica, llevaron a varios estados a promulgar leyes [ 16 ] que exigían a las mujeres buscar asesoramiento antes de abortar, debido a las posibles consecuencias a largo plazo para la salud mental.

Otro artículo, publicado en el New York Times, demostró cómo los sistemas de registros médicos electrónicos (EHR, por sus siglas en inglés) podían ser manipulados por los médicos para exagerar la cantidad de atención que brindaban con fines de reembolso de Medicare. [ 17 ] [ 4 ]

Un informe del Servicio de Investigación del Congreso sobre la seguridad de la información sanitaria según la HIPAA.

Intercambio de datos biomédicos

Compartir datos biomédicos se ha promocionado como una forma eficaz de mejorar la reproducibilidad de la investigación y el descubrimiento científico. [ 13 ] [ 18 ]

Si bien los investigadores se enfrentan a problemas tecnológicos para compartir datos, los problemas sociales también constituyen una barrera para compartir datos biológicos. Por ejemplo, los médicos e investigadores se enfrentan a desafíos únicos para compartir datos biológicos o de salud dentro de sus comunidades médicas, como las preocupaciones sobre la privacidad y las leyes de privacidad del paciente, como la HIPAA. [ 19 ]

Actitudes hacia el intercambio de datos

Según un estudio de 2015 [ 19 ] centrado en las actitudes y prácticas de los médicos y el personal de investigación científica, la mayoría de los encuestados consideró importante compartir datos para su trabajo, pero indicó que su experiencia en el tema era escasa. De los 190 encuestados, 135 se identificaron como científicos de investigación clínica o básica, y la población de la encuesta incluyó a científicos de investigación clínica y básica del Programa de Investigación Intramural del Instituto Nacional de Salud. El estudio también reveló que, entre los encuestados, compartir datos directamente con otros médicos era una práctica común, pero los participantes tenían poca experiencia en la carga de datos a un repositorio.

Dentro del campo de la investigación biomédica, el intercambio de datos se ha promovido [ 20 ] como una forma importante para que los investigadores compartan y reutilicen datos con el fin de capturar plenamente los beneficios hacia la medicina personalizada y de precisión . [ 19 ]

Desafíos para el intercambio de datos

El intercambio de datos en el sector sanitario sigue siendo un reto por diversas razones. A pesar de los avances en la investigación sobre el intercambio de datos en este ámbito, muchas organizaciones sanitarias siguen mostrándose reacias o poco dispuestas a divulgar datos médicos debido a leyes de privacidad como la Ley de Portabilidad y Responsabilidad del Seguro Médico (HIPAA) . Además, el intercambio de datos biológicos entre instituciones exige proteger la confidencialidad de los datos que pueden abarcar varias organizaciones. Lograr la heterogeneidad sintáctica y semántica de los datos, al tiempo que se cumplen los diversos requisitos de privacidad, son factores que suponen barreras para el intercambio de datos. [ 21 ]

Referencias

  1. 1 2 3 4 Mahmud, Mufti; Kaiser, Mohammed Shamim; Hussain, Amir; Vassanelli, Stefano (junio de 2018). "Aplicaciones del aprendizaje profundo y el aprendizaje por refuerzo a datos biológicos". IEEE Transactions on Neural Networks and Learning Systems . 29 (6): 2063– 2079. arXiv : 1711.03985 . doi : 10.1109 / tnnls.2018.2790388 . hdl : 1893/26814 . ISSN 2162-237X . PMID 29771663. S2CID 9823884 .   
  2. 1 2 Wooley, John C.; Lin, Herbert S.; Biología, Comité del Consejo Nacional de Investigación (EE. UU.) sobre Fronteras en la Interfaz de la Computación y (2005). Sobre la naturaleza de los datos biológicos . National Academies Press (EE. UU.).
  3. Nadkarni, PM; Brandt, C.; Frawley, S.; Sayward, FG; Einbinder, R.; Zelterman, D.; Schacter, L.; Miller, PL (1998-03-01). "Gestión de datos de ensayos clínicos de atributos y valores mediante el sistema de base de datos cliente-servidor ACT/DB" . Journal of the American Medical Informatics Association . 5 (2): 139– 151. doi : 10.1136/jamia.1998.0050139 . ISSN 1067-5027 . PMC 61285. PMID 9524347 .   
  4. 1 2 3 4 Hoffman, Sharona; Podgurski, Andy (2013). "El uso y el mal uso de los datos biomédicos: ¿es realmente mejor lo más grande?". American Journal of Law & Medicine . 39 (4): 497– 538. doi : 10.1177/009885881303900401 . ISSN 0098-8588 . PMID 24494442 . S2CID 35371353 .   
  5. 1 2 3 Islam, Mohd Siblee; Ivanov, S.; Robson, E.; Dooley-Cullinane, T.; Coffey, L.; Doolin, K.; Balasubramaniam, S. (2019). "Similitud genética de muestras biológicas para contrarrestar el biohacking de la funcionalidad de secuenciación de ADN" . Scientific Reports . 9 (1): 8684. Bibcode : 2019NatSR...9.8684I . doi : 10.1038 / s41598-019-44995-6 . PMC 6581904. PMID 31213619. S2CID 190652460 .   
  6. 1 2 Hallinan, Dara; De Hert, Paul (2016), "Muchos se equivocan: las muestras sí contienen datos personales: el Reglamento de Protección de Datos como marco superior para proteger los intereses de los donantes en la biobanca y la investigación genómica", en Mittelstadt, Brent Daniel; Floridi, Luciano (eds.), La ética de los macrodatos biomédicos , Serie Derecho, Gobernanza y Tecnología, vol. 29, Cham: Springer International Publishing, pp. 119–137 , doi : 10.1007/978-3-319-33525-4_6 , ISBN   978-3-319-33525-4
  7. "Statewatch.org" (PDF) . StateWatch.org . Consultado el 3 de julio de 2015 .
  8. Chuang, Li-Yeh; Tsai, Jui-Hung; Yang, Cheng-Hong (julio de 2010). "Optimización de enjambre de partículas binarias para la predicción de operones" . Nucleic Acids Research . 38 (12): e128. doi : 10.1093/nar/gkq204 . ISSN 0305-1048 . PMC 2896535. PMID 20385582 .   
  9. Ralha, CG; Schneider, HW; Walter, MEMT; Bazzan, AL (octubre de 2010). "Método de aprendizaje por refuerzo para bioagentes". Undécimo Simposio Brasileño de Redes Neuronales de 2010. págs. 109–114 . doi : 10.1109/SBRN.2010.27 . ISBN  978-1-4244-8391-4. S2CID 14685651 . 
  10. Xu, Jun; Xiang, Lei; Liu, Qingshan; Gilmore, Hannah; Wu, Jianzhong; Tang, Jinghai; Madabhushi, Anant (enero de 2016). "Autoencoder disperso apilado (SSAE) para la detección de núcleos en imágenes de histopatología de cáncer de mama" . IEEE Transactions on Medical Imaging . 35 (1): 119–130 . doi : 10.1109/TMI.2015.2458702 . ISSN 0278-0062 . PMC 4729702. PMID 26208307 .   
  11. 1 2 Holzinger, Andreas; Jurisica, Igor (2014), "Descubrimiento de conocimiento y minería de datos en bioinformática: el futuro está en soluciones de aprendizaje automático interactivas e integradoras", en Holzinger, Andreas; Jurisica, Igor (eds.), Descubrimiento interactivo de conocimiento y minería de datos en bioinformática: estado del arte y desafíos futuros , Lecture Notes in Computer Science, vol. 8401, Berlín, Heidelberg: Springer, pp. 1–18 , doi : 10.1007/978-3-662-43968-5_1 , ISBN   978-3-662-43968-5
  12. Shneiderman, Ben (marzo de 2002). "Inventando herramientas de descubrimiento: combinando visualización de información con minería de datos". Visualización de información . 1 (1): 5– 12. doi : 10.1057/palgrave.ivs.9500006 . hdl : 1903/6484 . ISSN 1473-8716 . S2CID 208272047 .  
  13. 1 2 Mittelstadt, Brent Daniel; Floridi, Luciano (abril de 2016). "La ética de los macrodatos: problemas actuales y previsibles en contextos biomédicos". Ética de la ciencia y la ingeniería . 22 (2): 303– 341. doi : 10.1007/s11948-015-9652-2 . ISSN 1471-5546 . PMID 26002496. S2CID 23142795 .   
  14. 1 2 Coleman, Priscilla K.; Coyle, Catherine T.; Shuping, Martha; Rue, Vincent M. (mayo de 2009). "Aborto inducido y trastornos de ansiedad, estado de ánimo y abuso de sustancias: aislamiento de los efectos del aborto en la encuesta nacional de comorbilidad". Journal of Psychiatric Research . 43 (8): 770– 776. doi : 10.1016/j.jpsychires.2008.10.009 . ISSN 1879-1379 . PMID 19046750 .  
  15. Kessler, Ronald C.; Schatzberg, Alan F. (marzo de 2012). "Comentario sobre los estudios de Steinberg y Finer sobre el aborto (Social Science & Medicine 2011; 72:72–82) y Coleman (Journal of Psychiatric Research 2009;43:770–6 y Journal of Psychiatric Research 2011;45:1133–4)" . Journal of Psychiatric Research . 46 (3): 410–411 . doi : 10.1016/j.jpsychires.2012.01.021 .
  16. "Asesoramiento y períodos de espera para el aborto" . Instituto Guttmacher . 14 de marzo de 2016. Consultado el 9 de diciembre de 2020 .
  17. Abelson, Reed; Creswell, Julie; Palmer, Griff (22 de septiembre de 2012). "Aumentan las facturas de Medicare a medida que los registros se vuelven electrónicos (Publicado en 2012)" . The New York Times . ISSN 0362-4331 . Consultado el 9 de diciembre de 2020 . 
  18. Kalkman, Shona; Mostert, Menno; Gerlinger, Christoph; van Delden, Johannes JM; van Thiel, Ghislaine JMW (28 de marzo de 2019). " Compartición responsable de datos en la investigación sanitaria internacional: una revisión sistemática de principios y normas" . BMC Medical Ethics . 20 (1): 21. doi : 10.1186/s12910-019-0359-9 . ISSN 1472-6939 . PMC 6437875. PMID 30922290 .   
  19. 1 2 3 Federer, Lisa M.; Lu, Ya-Ling; Joubert, Douglas J.; Welsh, Judith; Brandys, Barbara (2015-06-24). Kanungo, Jyotshna (ed.). "Compartición y reutilización de datos biomédicos: actitudes y prácticas del personal de investigación clínica y científica" . PLOS ONE . 10 (6) e0129506. Bibcode : 2015PLoSO..1029506F . doi : 10.1371/journal.pone.0129506 . ISSN 1932-6203 . PMC 4481309. PMID 26107811 .   
  20. Shneiderman, Ben (2016-07-21). "Inventando herramientas de descubrimiento: combinando visualización de información con minería de datos1" . Visualización de información . 1 : 5–12 . doi : 10.1057/palgrave.ivs.9500006 . hdl : 1903/6484 . S2CID 208272047 . 
  21. Wimmer, Hayden; Yoon, Victoria Y.; Sugumaran, Vijayan (2016-08-01). "Un sistema multiagente para apoyar la medicina basada en la evidencia y la toma de decisiones clínicas mediante el intercambio de datos y la privacidad de los datos" . Decision Support Systems . 88 : 51–66 . doi : 10.1016/j.dss.2016.05.008 . ISSN 0167-9236 . 
Obtenido de " https://en.wikipedia.org/w/index.php?title=Biological_data&oldid=1360619441 "