Articulo de referencia

Resolución de topónimos

En los sistemas de información geográfica , la resolución de topónimos es el proceso de relación entre un topónimo , es decir, la mención de un lugar, y una huella espacial ineq...

En los sistemas de información geográfica , la resolución de topónimos es el proceso de relación entre un topónimo , es decir, la mención de un lugar, y una huella espacial inequívoca de ese mismo lugar. [ 1 ]

Los lugares mencionados en colecciones de textos digitalizados constituyen una valiosa fuente de datos para investigadores de diversas disciplinas. Sin embargo, los topónimos en el lenguaje son ambiguos y resulta difícil asignarles un referente real preciso . Con el tiempo, los nombres geográficos establecidos pueden cambiar (como en "Bizancio" > "Constantinopla" > "Estambul"); o pueden reutilizarse textualmente ("Boston" en Inglaterra, Reino Unido frente a "Boston" en Massachusetts, EE. UU.), o con modificaciones (como en "York" frente a "Nueva York"). Para asignar un conjunto de nombres de lugares o topónimos que aparecen en un documento a sus coordenadas de latitud / longitud correspondientes , un polígono o cualquier otra huella espacial, es necesario un paso de desambiguación. Un algoritmo de resolución de topónimos es un método automático que realiza una asignación de un topónimo a una huella espacial.

Algunos métodos para la resolución de topónimos emplean un nomenclátor de posibles correspondencias entre nombres y huellas espaciales. [ 2 ]

Proceso de resolución

La "huella espacial inequívoca del mismo lugar" [ 1 ] de la definición puede ser, de hecho, inequívoca, o "no tan inequívoca". Existen diferentes contextos de incertidumbre en los que puede tener lugar el proceso de resolución:

  • Cuando la evidencia es geográfica y no presenta incertidumbre. Por ejemplo, para obtener el nombre del país de un lugar fotografiado, cuando dicho lugar es una posición GPS (con un margen de error de 10 metros), a 1000  km de las fronteras del país.
  • Cuando la evidencia es geográfica, pero con considerable incertidumbre. Imaginemos un escenario similar donde el error del GPS es de 100 metros y el lugar está cerca, a unos 100 metros, de las fronteras del país.
  • Cuando la evidencia es únicamente textual. Imaginemos una carta donde el narrador, un turista, cuenta su viaje tras regresar de vacaciones. La única evidencia es textual, presente en la narración.
  • Fuentes de evidencia mixtas: más de una evidencia, ninguna precisa.

A partir de evidencias geográficas

La resolución de topónimos a veces es una simple conversión de nombre a abreviatura, especialmente cuando la abreviatura se usa como geocódigo estándar . Por ejemplo, convertir el nombre oficial del país Afganistán en un código de paísAF ISO .

En la anotación de medios y metadatos , la conversión mediante un mapa y la evidencia geográfica (por ejemplo, GPS) es el método más habitual para obtener un topónimo o un geocódigo que lo represente.

A partir de evidencia textual

A diferencia de la geocodificación de direcciones postales, que normalmente se almacenan en registros de bases de datos estructuradas , la resolución de topónimos se aplica normalmente a grandes colecciones de documentos de texto no estructurados para asociar las ubicaciones mencionadas en ellos con mapas. Si algunos de esos documentos de texto están geoetiquetados —por ejemplo, porque son publicaciones de microblogs con latitud y longitud añadidas automáticamente— se pueden utilizar para inferir la especificidad geográfica variable de términos arbitrarios, por ejemplo, "teleférico" o "marea alta" [ 3 ] .

El proceso de anotar contenido multimedia (por ejemplo, imágenes, texto, vídeo) mediante información espacial se conoce como geoetiquetado . Para geoetiquetar automáticamente un documento de texto, se suelen seguir los siguientes pasos: reconocimiento de topónimos (es decir, identificar referencias textuales a ubicaciones geográficas) y resolución de topónimos (es decir, seleccionar una interpretación de ubicación adecuada para cada referencia geográfica).

El reconocimiento de topónimos puede considerarse un caso especial de reconocimiento de entidades nombradas, donde el objetivo es simplemente derivar entidades de ubicación. Sin embargo, el resultado del reconocimiento de entidades nombradas puede mejorarse aún más utilizando reglas diseñadas manualmente o reglas estadísticas. [ 4 ]

Para obtener interpretaciones de ubicaciones, los modelos de resolución suelen aprovechar los nomenclátores (es decir, enormes bases de datos de ubicaciones) como GeoNames y OpenStreetMap . Un enfoque ingenuo para resolver topónimos consiste en elegir la interpretación más poblada de la lista de candidatas. Por ejemplo, en el siguiente extracto:

Un hombre de Toronto que vive y trabaja en Londres se muestra inseguro sobre su futuro en el Reino Unido tras el Brexit.

— CBC

El enfoque ingenuo parece viable ya que los topónimos Toronto y Londres se refieren a su interpretación más común, ubicados en Canadá y Gran Bretaña respectivamente, mientras que en el siguiente fragmento de un artículo de noticias:

Tren de alta velocidad entre Toronto y Londres para 2025.

— CBC

Este enfoque no logra identificar el topónimo Londres como la ciudad ubicada en Ontario, Canadá . Por lo tanto, seleccionar la ciudad con mayor población no resulta eficaz para los topónimos en un contexto localizado.

Además, la resolución de topónimos no aborda la metonimia en general. No obstante, una técnica de resolución aún puede desambiguar una referencia metonimia siempre que se identifique como un topónimo en la fase de reconocimiento. Por ejemplo, en el siguiente fragmento:

Canadá también está adaptando sus leyes de tránsito para tener en cuenta los casos de conducción bajo los efectos del cannabis.

— Abogado

Canadá indica una metonimia y se refiere al "gobierno de Canadá". Sin embargo, un reconocedor genérico de entidades nombradas puede identificarlo como un lugar, por lo que un solucionador de topónimos puede desambiguarlo.

Aproches

Los métodos de resolución de topónimos se pueden dividir generalmente en modelos supervisados ​​y no supervisados . Los métodos supervisados ​​suelen plantear el problema como una tarea de aprendizaje en la que el modelo primero extrae características contextuales y no contextuales y luego, se entrena un clasificador en un conjunto de datos etiquetado. El modelo adaptativo [ 5 ] es uno de los modelos más destacados propuestos para la resolución de topónimos. Para cada interpretación de un topónimo, el modelo deriva características sensibles al contexto basadas en la proximidad geográfica y las relaciones de parentesco con otras interpretaciones. Además de las características relacionadas con el contexto, el modelo se beneficia de características independientes del contexto, como la población y la ubicación de la audiencia. Por otro lado, los modelos no supervisados ​​no requieren datos anotados. Son superiores a los modelos supervisados ​​cuando el corpus anotado no es suficientemente grande, y los modelos supervisados ​​pueden no generalizar bien. [ 6 ]

Los modelos no supervisados ​​tienden a aprovechar mejor la interacción de los topónimos mencionados en un documento. El modelo Context-Hierarchy Fusion [ 6 ] estima el alcance geográfico de los documentos y utiliza las conexiones entre nombres de lugares cercanos como evidencia para resolver los topónimos. Al mapear el problema a un problema de cobertura de conjuntos sin conflictos , este modelo logra una resolución coherente y robusta.

Además, se ha demostrado que la adopción de Wikipedia y bases de conocimiento es eficaz para la resolución de topónimos. TopoCluster [ 7 ] modela los sentidos geográficos de las palabras incorporando páginas de Wikipedia sobre lugares y desambigua los topónimos utilizando los sentidos espaciales de las palabras en el texto.

Análisis geográfico

Geoparsing is a special toponym resolution process of converting free-text descriptions of places (such as "twenty miles northeast of Jalalabad") into unambiguous geographic identifiers, such as geographic coordinates expressed as latitude-longitude. One can also geoparse location references from other forms of media, for examples audio content in which a speaker mentions a place. With geographic coordinates the features can be mapped and entered into Geographic information systems. Two primary uses of the geographic coordinates derived from unstructured content are to plot portions of the content on maps and to search the content using a map as a filter.

Geoparsing goes beyond geocoding. Geocoding analyzes unambiguous structured location references, such as postal addresses and rigorously formatted numerical coordinates. Geoparsing handles ambiguous references in unstructured discourse, such as "Al Hamra," which is the name of several places, including towns in both Syria and Yemen.

A geoparser is a piece of software or a (web) service that helps in this process. Some examples:

  • GEOLocate automated georeferencing
  • BioGeomancer – Semi-automatic georeferencing
  • GEOnet Names Server – Freely available GIS information for areas outside of the US and Antarctica, updated monthly by the National Geospatial-Intelligence Agency (NGA) and the U.S. Board on Geographic Names (US BGN)
  • Geographic Names Information System (GNIS) – Freely available database containing information on almost 2 million physical features, places, and landmarks in the U.S.A.
  • CLAVIN – CLAVIN (Cartographic Location And Vicinity INdexer) is an open source software package for document geotagging and geoparsing that employs context-based geographic entity resolution.
  • Geocode.xyz – Geocode.xyz is a web service that identifies both place names and street addresses mentioned in text.[8]
  • geoparsepy – geoparsepy is a free Python geoparsing library supporting free text location identification and disambiguation using the OpenStreetMap database

References

  1. 12Leidner, Jochen L. (2007). Toponym Resolution in Text: Annotation, Evaluation and Applications of Spatial Grounding (PhD). University of Edinburgh. hdl:1842/1849.
  2. Hill, Linda L. (2006). Georeferencing: The geographic associations of information. The MIT Press. ISBN 978-0262083546.
  3. Berggren, Max; Karlgren, Jussi ; Östling, Robert; Parkvall, Mikael (2016). "Inferir la ubicación de los autores a partir de las palabras en sus textos". Actas de la Conferencia Nórdica sobre Lingüística Computacional . arXiv : 1612.06671 .
  4. Lieberman, Michael D.; Samet, Hanan (2011). Reconocimiento de topónimos multifacéticos para noticias en tiempo real (PDF) . Actas de la 34.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información. págs. 843–852 . doi : 10.1145/2009916.2010029 . 
  5. Lieberman, Michael D.; Samet, Hanan (2012). Características de contexto adaptativas para la resolución de topónimos en noticias en tiempo real (PDF) . Actas de la 35.ª conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información. págs. 731–740 . doi : 10.1145/2348283.2348381 . 
  6. 1 2 Kamalloo, Ehsan; Rafiei, Davood (2018). Un modelo coherente no supervisado para la resolución de topónimos . Actas de la Conferencia Mundial de la Web de 2018. pp. 1287–1296 . arXiv : 1805.01952 . doi : 10.1145/3178876.3186027 . 
  7. DeLozier, Grant; Baldridge, Jason; London, Loretta (2015). Resolución de topónimos independiente del nomenclátor mediante perfiles geográficos de palabras . Actas de la Vigésimo Novena Conferencia AAAI sobre Inteligencia Artificial. págs. 2382–2388 . 
  8. "Calendario de Adviento Perl 2016: un analizador geográfico para grandes cantidades de texto" .

Véase también