Articulo de referencia

Resolución de topónimos

En los sistemas de información geográfica , la resolución de topónimos es el proceso de relación entre un topónimo , es decir, la mención de un lugar, y una huella espacial ineq...

En los sistemas de información geográfica , la resolución de topónimos es el proceso de relación entre un topónimo , es decir, la mención de un lugar, y una huella espacial inequívoca de ese mismo lugar. [ 1 ]

Los lugares mencionados en colecciones de textos digitalizados constituyen una valiosa fuente de datos para investigadores de diversas disciplinas. Sin embargo, los topónimos en el lenguaje son ambiguos y resulta difícil asignarles un referente real preciso . Con el tiempo, los nombres geográficos establecidos pueden cambiar (como en "Bizancio" > "Constantinopla" > "Estambul"); o pueden reutilizarse textualmente ("Boston" en Inglaterra, Reino Unido frente a "Boston" en Massachusetts, EE. UU.), o con modificaciones (como en "York" frente a "Nueva York"). Para asignar un conjunto de nombres de lugares o topónimos que aparecen en un documento a sus coordenadas de latitud / longitud correspondientes , un polígono o cualquier otra huella espacial, es necesario un paso de desambiguación. Un algoritmo de resolución de topónimos es un método automático que realiza una asignación de un topónimo a una huella espacial.

Algunos métodos para la resolución de topónimos emplean un nomenclátor de posibles correspondencias entre nombres y huellas espaciales. [ 2 ]

Proceso de resolución

La "huella espacial inequívoca del mismo lugar" [ 1 ] de la definición puede ser, de hecho, inequívoca, o "no tan inequívoca". Existen diferentes contextos de incertidumbre en los que puede tener lugar el proceso de resolución:

  • Cuando la evidencia es geográfica y no presenta incertidumbre. Por ejemplo, para obtener el nombre del país de un lugar fotografiado, cuando dicho lugar es una posición GPS (con un margen de error de 10 metros), a 1000  km de las fronteras del país.
  • Cuando la evidencia es geográfica, pero con considerable incertidumbre. Imaginemos un escenario similar donde el error del GPS es de 100 metros y el lugar está cerca, a unos 100 metros, de las fronteras del país.
  • Cuando la evidencia es únicamente textual. Imaginemos una carta donde el narrador, un turista, cuenta su viaje tras regresar de vacaciones. La única evidencia es textual, presente en la narración.
  • Fuentes de evidencia mixtas: más de una evidencia, ninguna precisa.

A partir de evidencias geográficas

La resolución de topónimos a veces es una simple conversión de nombre a abreviatura, especialmente cuando la abreviatura se usa como geocódigo estándar . Por ejemplo, convertir el nombre oficial del país Afganistán en un código de paísAF ISO .

En la anotación de medios y metadatos , la conversión mediante un mapa y la evidencia geográfica (por ejemplo, GPS) es el método más habitual para obtener un topónimo o un geocódigo que lo represente.

A partir de evidencia textual

A diferencia de la geocodificación de direcciones postales, que normalmente se almacenan en registros de bases de datos estructuradas , la resolución de topónimos se aplica normalmente a grandes colecciones de documentos de texto no estructurados para asociar las ubicaciones mencionadas en ellos con mapas. Si algunos de esos documentos de texto están geoetiquetados —por ejemplo, porque son publicaciones de microblogs con latitud y longitud añadidas automáticamente— se pueden utilizar para inferir la especificidad geográfica variable de términos arbitrarios, por ejemplo, "teleférico" o "marea alta" [ 3 ] .

El proceso de anotar contenido multimedia (por ejemplo, imágenes, texto, vídeo) mediante información espacial se conoce como geoetiquetado . Para geoetiquetar automáticamente un documento de texto, se suelen seguir los siguientes pasos: reconocimiento de topónimos (es decir, identificar referencias textuales a ubicaciones geográficas) y resolución de topónimos (es decir, seleccionar una interpretación de ubicación adecuada para cada referencia geográfica).

El reconocimiento de topónimos puede considerarse un caso especial de reconocimiento de entidades nombradas, donde el objetivo es simplemente derivar entidades de ubicación. Sin embargo, el resultado del reconocimiento de entidades nombradas puede mejorarse aún más utilizando reglas diseñadas manualmente o reglas estadísticas. [ 4 ]

Para obtener interpretaciones de ubicaciones, los modelos de resolución suelen aprovechar los nomenclátores (es decir, enormes bases de datos de ubicaciones) como GeoNames y OpenStreetMap . Un enfoque ingenuo para resolver topónimos consiste en elegir la interpretación más poblada de la lista de candidatas. Por ejemplo, en el siguiente extracto:

Un hombre de Toronto que vive y trabaja en Londres se muestra inseguro sobre su futuro en el Reino Unido tras el Brexit.

— CBC

El enfoque ingenuo parece viable ya que los topónimos Toronto y Londres se refieren a su interpretación más común, ubicados en Canadá y Gran Bretaña respectivamente, mientras que en el siguiente fragmento de un artículo de noticias:

Tren de alta velocidad entre Toronto y Londres para 2025.

— CBC

Este enfoque no logra identificar el topónimo Londres como la ciudad ubicada en Ontario, Canadá . Por lo tanto, seleccionar la ciudad con mayor población no resulta eficaz para los topónimos en un contexto localizado.

Además, la resolución de topónimos no aborda la metonimia en general. No obstante, una técnica de resolución aún puede desambiguar una referencia metonimia siempre que se identifique como un topónimo en la fase de reconocimiento. Por ejemplo, en el siguiente fragmento:

Canadá también está adaptando sus leyes de tránsito para tener en cuenta los casos de conducción bajo los efectos del cannabis.

— Abogado

Canadá indica una metonimia y se refiere al "gobierno de Canadá". Sin embargo, un reconocedor genérico de entidades nombradas puede identificarlo como un lugar, por lo que un solucionador de topónimos puede desambiguarlo.

Aproches

Los métodos de resolución de topónimos se pueden dividir generalmente en modelos supervisados ​​y no supervisados . Los métodos supervisados ​​suelen plantear el problema como una tarea de aprendizaje en la que el modelo primero extrae características contextuales y no contextuales y luego, se entrena un clasificador en un conjunto de datos etiquetado. El modelo adaptativo [ 5 ] es uno de los modelos más destacados propuestos para la resolución de topónimos. Para cada interpretación de un topónimo, el modelo deriva características sensibles al contexto basadas en la proximidad geográfica y las relaciones de parentesco con otras interpretaciones. Además de las características relacionadas con el contexto, el modelo se beneficia de características independientes del contexto, como la población y la ubicación de la audiencia. Por otro lado, los modelos no supervisados ​​no requieren datos anotados. Son superiores a los modelos supervisados ​​cuando el corpus anotado no es suficientemente grande, y los modelos supervisados ​​pueden no generalizar bien. [ 6 ]

Los modelos no supervisados ​​tienden a aprovechar mejor la interacción de los topónimos mencionados en un documento. El modelo Context-Hierarchy Fusion [ 6 ] estima el alcance geográfico de los documentos y utiliza las conexiones entre nombres de lugares cercanos como evidencia para resolver los topónimos. Al mapear el problema a un problema de cobertura de conjuntos sin conflictos , este modelo logra una resolución coherente y robusta.

Además, se ha demostrado que la adopción de Wikipedia y bases de conocimiento es eficaz para la resolución de topónimos. TopoCluster [ 7 ] modela los sentidos geográficos de las palabras incorporando páginas de Wikipedia sobre lugares y desambigua los topónimos utilizando los sentidos espaciales de las palabras en el texto.

Análisis geográfico

El geoparsing es un proceso especial de resolución de topónimos que convierte descripciones de lugares en texto libre (como "veinte millas al noreste de Jalalabad") en identificadores geográficos inequívocos, como coordenadas geográficas expresadas como latitud y longitud . También se pueden geoparsear referencias de ubicación de otros tipos de medios, por ejemplo, contenido de audio en el que un hablante menciona un lugar. Con las coordenadas geográficas, los elementos se pueden mapear e ingresar en sistemas de información geográfica . Dos usos principales de las coordenadas geográficas derivadas de contenido no estructurado son representar partes del contenido en mapas y buscar en el contenido utilizando un mapa como filtro.

El análisis geográfico va más allá de la geocodificación . La geocodificación analiza referencias de ubicación estructuradas e inequívocas, como direcciones postales y coordenadas numéricas con formato riguroso. El análisis geográfico maneja referencias ambiguas en discursos no estructurados, como "Al Hamra", nombre de varios lugares, incluyendo ciudades en Siria y Yemen.

Un geoparser es un programa informático o un servicio (web) que ayuda en este proceso. Algunos ejemplos:

  • Georreferenciación automatizada de GEOLocate
  • BioGeomancer – Georreferenciación semiautomática
  • Servidor de nombres GEOnet : información SIG disponible gratuitamente para áreas fuera de los EE. UU. y la Antártida, actualizada mensualmente por la Agencia Nacional de Inteligencia Geoespacial (NGA) y la Junta de Nombres Geográficos de los EE. UU. (US BGN).
  • Sistema de Información de Nombres Geográficos (GNIS) : base de datos de acceso libre que contiene información sobre casi 2 millones de accidentes geográficos, lugares y puntos de referencia en los Estados Unidos.
  • CLAVIN – CLAVIN (Cartographic Location And Vicinity INdexer) es un paquete de software de código abierto para el geoetiquetado y el geoanálisis de documentos que emplea la resolución de entidades geográficas basada en el contexto.
  • Geocode.xyz – Geocode.xyz es un servicio web que identifica tanto nombres de lugares como direcciones postales mencionadas en texto. [ 8 ]
  • geoparsepy : geoparsepy es una biblioteca gratuita de Python para geoanálisis que permite la identificación y desambiguación de ubicaciones mediante texto libre utilizando la base de datos OpenStreetMap.

Referencias

  1. 1 2 Leidner, Jochen L. (2007). Resolución de topónimos en texto: anotación, evaluación y aplicaciones de la fundamentación espacial (PhD). Universidad de Edimburgo. hdl : 1842/1849 .
  2. Hill, Linda L. (2006). Georreferenciación: Las asociaciones geográficas de la información . The MIT Press. ISBN 978-0262083546.
  3. Berggren, Max; Karlgren, Jussi ; Östling, Robert; Parkvall, Mikael (2016). "Inferir la ubicación de los autores a partir de las palabras en sus textos". Actas de la Conferencia Nórdica sobre Lingüística Computacional . arXiv : 1612.06671 .
  4. Lieberman, Michael D.; Samet, Hanan (2011). Reconocimiento de topónimos multifacéticos para noticias en tiempo real (PDF) . Actas de la 34.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información. págs. 843–852 . doi : 10.1145/2009916.2010029 . 
  5. Lieberman, Michael D.; Samet, Hanan (2012). Características de contexto adaptativas para la resolución de topónimos en noticias en tiempo real (PDF) . Actas de la 35.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información. págs. 731–740 . doi : 10.1145/2348283.2348381 . 
  6. 1 2 Kamalloo, Ehsan; Rafiei, Davood (2018). Un modelo coherente no supervisado para la resolución de topónimos . Actas de la Conferencia Mundial de la Web de 2018. pp. 1287–1296 . arXiv : 1805.01952 . doi : 10.1145/3178876.3186027 . 
  7. DeLozier, Grant; Baldridge, Jason; London, Loretta (2015). Resolución de topónimos independiente del nomenclátor mediante perfiles geográficos de palabras . Actas de la Vigésimo Novena Conferencia AAAI sobre Inteligencia Artificial. págs. 2382–2388 . 
  8. "Calendario de Adviento Perl 2016: un analizador geográfico para grandes cantidades de texto" .

Véase también

Obtenido de " https://en.wikipedia.org/w/index.php?title=Toponym_resolution&oldid=1332593286 "