Articulo de referencia

Frase estadísticamente improbable

Una frase estadísticamente improbable ( SIP ) es una frase o conjunto de palabras que aparece con mayor frecuencia en un documento (o colección de documentos) que en un corpus m...

Una frase estadísticamente improbable ( SIP ) es una frase o conjunto de palabras que aparece con mayor frecuencia en un documento (o colección de documentos) que en un corpus más grande . [1] [2] [3] Amazon.com utiliza este concepto para determinar palabras clave para un libro o capítulo determinado, ya que es probable que las palabras clave de un libro o capítulo aparezcan desproporcionadamente dentro de esa sección. [4] [5] Christian Rudder también ha utilizado este concepto con datos de perfiles de citas en línea y publicaciones de Twitter para determinar las frases más características de una raza o género determinado en su libro Dataclysm . [6] Las SIP con una densidad lingüística de dos o tres palabras, adjetivo, adjetivo, sustantivo o adverbio, adverbio, verbo, señalarán la actitud, premisa o conclusiones del autor al lector o expresarán una idea importante.

Otro uso de los SIP es como herramienta de detección de plagio. Se pueden buscar combinaciones (casi) únicas de palabras en línea y, si han aparecido en un texto publicado, la búsqueda identificará dónde. Este método solo verifica aquellos textos que se han publicado y que se han digitalizado en línea.

Por ejemplo, un trabajo presentado por, digamos, un estudiante que contenga la frase "estilo jardín, elogiando la irregularidad en el diseño", podría buscarse usando Google.com y arrojará el artículo original de Wikipedia sobre Sir William Temple , figura política y ensayista inglés.

Ejemplo

En un documento sobre computadoras, es probable que la palabra más común sea la palabra "the", pero como "the" es la palabra más utilizada en el idioma inglés, es probable que cualquier documento determinado utilice "the" con mucha frecuencia. Sin embargo, una frase como "algoritmo booleano explícito" podría aparecer en el documento con una frecuencia mucho mayor que su frecuencia promedio en el idioma inglés. Por lo tanto, es una frase que es poco probable que aparezca en cualquier documento determinado, pero que apareció en el documento en cuestión. "Algoritmo booleano explícito" sería una frase estadísticamente improbable.

Las frases estadísticamente improbables de El origen de las especies de Darwin podrían ser: producciones templadas, géneros descendientes, gradaciones transicionales, progenitor desconocido, formaciones fosilíferas, nuestras razas domésticas, descendencia modificada, formas dudosas, formas estrechamente afines, variaciones rentables, enormemente remoto, grados transicionales, especies muy distintas y descendencia mestiza . [7]

Véase también

  • Colocación : Cualquier serie de palabras que aparecen juntas con más frecuencia de lo que se esperaría por casualidad.
  • Googlewhack : un par de palabras que aparecen en una sola página web, tal como está indexada por Google.
  • tf-idf : una estadística utilizada en la recuperación de información y la minería de texto
  • Información específica compleja : un concepto utilizado para defender la teoría del "diseño inteligente"

Referencias

  1. ^ "SIPping Wikipedia" (PDF) . Courses.cms.caltech.edu . Consultado el 1 de enero de 2017 .
  2. ^ Jonathan Bailey (3 de julio de 2012). "¿Qué longitud debe tener una frase estadísticamente improbable?". Plagiarism Today .
  3. ^ Errami, Mounir; Sun, Zhaohui; George, Angela C.; Long, Tara C.; Skinner, Michael A.; Wren, Jonathan D.; Garner, Harold R. (1 de junio de 2010). "Identificación de contenido duplicado mediante frases estadísticamente improbables". Bioinformática . 26 (11): 1453–1457. doi :10.1093/bioinformatics/btq146. PMC 2872002 . PMID  20472545 – vía bioinformatics.oxfordjournals.org. 
  4. ^ "¿Qué son las frases estadísticamente improbables?". Amazon.com . Consultado el 18 de diciembre de 2007 .
  5. ^ Weeks, Linton (30 de agosto de 2005). «Las estadísticas vitales de Amazon muestran cómo se comparan los libros». The Washington Post . Consultado el 8 de septiembre de 2015 .
  6. ^ Rudder, Christian (2014). Dataclysm: Quiénes somos cuando pensamos que nadie nos está mirando . Nueva York: Crown Publishers. ISBN 978-0-385-34737-2.
  7. ^ Frases sociológicamente improbables Crooked Timber Abril 2005


Obtenido de "https://es.wikipedia.org/w/index.php?title=Frase_estadísticamente_improbable&oldid=1211876609"