Articulo de referencia

tf–idf

En la recuperación de información , tf–idf ( frecuencia de término–frecuencia inversa de documento , TF*IDF , TFIDF , TF–IDF o Tf–idf ) es una medida de la importancia de una pa...

En la recuperación de información , tf–idf ( frecuencia de término–frecuencia inversa de documento , TF*IDF , TFIDF , TF–IDF o Tf–idf ) es una medida de la importancia de una palabra para un documento en una colección o corpus , ajustada al hecho de que algunas palabras aparecen con mayor frecuencia en general. [ 1 ] Al igual que el modelo de bolsa de palabras , modela un documento como un multiconjunto de palabras, sin orden de palabras . Es un refinamiento del modelo simple de bolsa de palabras, al permitir que el peso de las palabras dependa del resto del corpus.

Se utilizaba frecuentemente como factor de ponderación en búsquedas de recuperación de información, minería de texto y modelado de usuarios . Una encuesta realizada en 2015 mostró que el 83 % de los sistemas de recomendación basados ​​en texto en bibliotecas digitales utilizaban tf-idf. [ 2 ] Los motores de búsqueda solían utilizar variaciones del esquema de ponderación tf-idf como herramienta central para puntuar y clasificar la relevancia de un documento en función de una consulta de usuario .

Una de las funciones de clasificación más sencillas se calcula sumando el tf–idf para cada término de la consulta; muchas funciones de clasificación más sofisticadas son variantes de este modelo simple.

Motivaciones

Karen Spärck Jones (1972) concibió una interpretación estadística de la especificidad de los términos llamada Frecuencia Inversa de Documentos (idf), que se convirtió en una piedra angular de la ponderación de términos: [ 3 ]

La especificidad de un término puede cuantificarse como una función inversa del número de documentos en los que aparece.

Por ejemplo, la frecuencia documental (df) y la frecuencia de aparición de documentos (idf) para algunas palabras en las 37 obras de Shakespeare podrían representarse de la siguiente manera:

Observamos que las palabras " Romeo ", " Falstaff " y "ensalada" aparecen en muy pocas obras, por lo que al verlas se puede intuir de qué obra se trata. En cambio, "bueno" y "dulce" aparecen en todas las obras y no aportan ninguna información sobre a qué obra pertenecen.

Definición

  1. El tf–idf es el producto de dos estadísticas: la frecuencia de términos y la frecuencia inversa de documentos . Existen diversas maneras de determinar los valores exactos de ambas estadísticas.
  2. Una fórmula que pretende definir la importancia de una palabra clave o frase dentro de un documento o una página web.

Frecuencia de términos

La frecuencia del término, tf( t , d ) , es la frecuencia relativa del término t dentro del documento d ,

tF(t,d)=Ft,dtdFt,d{\displaystyle \mathrm {tf} (t,d)={\frac {f_{t,d}}{\sum _{t'\in d}{f_{t',d}}}}},

donde f t , d es el recuento bruto de un término en un documento, es decir, el número de veces que ese término t aparece en el documento d . Nótese que el denominador es simplemente el número total de términos en el documento d (contando cada aparición del mismo término por separado). Existen otras formas de definir la frecuencia de un término: [ 4 ] : 128

  • el recuento bruto en sí: tf( t , d ) = f t , d
  • Frecuencias booleanas : tf( t , d ) = 1 si t aparece en d y 0 en caso contrario;
  • Frecuencia escalada logarítmicamente : tf( t , d ) = log (1 + f t , d ) ; [ 5 ]
  • frecuencia aumentada, para evitar un sesgo hacia documentos más largos, por ejemplo, frecuencia bruta dividida por la frecuencia bruta del término que aparece con mayor frecuencia en el documento:
tF(t,d)=0,5+0,5Ft,dmáximo{Ft,d:td}{\displaystyle \mathrm {tf} (t,d)=0.5+0.5\cdot {\frac {f_{t,d}}{\max\{f_{t',d}:t'\in d\}}}}

Frecuencia inversa de documentos

Gráfico de diferentes funciones de frecuencia inversa de documentos: estándar, suavizada y probabilística.

La frecuencia inversa de documentos es una medida de cuánta información proporciona una palabra, es decir, cuán común o rara es en todos los documentos. Es la fracción inversa en escala logarítmica de los documentos que contienen la palabra (obtenida dividiendo el número total de documentos por el número de documentos que contienen el término y luego calculando el logaritmo de ese cociente):

idF(t,D)=registronortenortet{\displaystyle \mathrm {idf} (t,D)=\log {\frac {N}{n_{t}}}}

con

  • D{\displaystyle D}: es el conjunto de todos los documentos del corpus
  • norte=|D|{\displaystyle N={|D|}}: número total de documentos en el corpus
  • nortet=|{dD:td}|{\displaystyle n_{t}=|\{d\in D:t\in d\}|} : número de documentos donde el términot{\displaystyle t}aparece (es decir,tF(t,d)0{\displaystyle \mathrm {tf} (t,d)\neq 0}). Si el término no está en el corpus, esto dará lugar a una división por cero. Por lo tanto, es común ajustar el numerador a1+norte{\displaystyle 1+N}y el denominador a1+nortet{\displaystyle 1+n_{t}}.

Frecuencia de términos – frecuencia inversa de documentos

Entonces, tf–idf se calcula como

tFidF(t,d,D)=tF(t,d)idF(t,D){\displaystyle \mathrm {tfidf} (t,d,D)=\mathrm {tf} (t,d)\cdot \mathrm {idf} (t,D)}

Un valor alto en tf–idf se alcanza con una alta frecuencia del término (en el documento dado) y una baja frecuencia del término en el conjunto de documentos; por lo tanto, los valores tienden a filtrar los términos comunes. Dado que la razón dentro de la función logarítmica de idf siempre es mayor o igual que 1, el valor de idf (y tf–idf) es mayor o igual que 0. A medida que un término aparece en más documentos, la razón dentro del logaritmo se aproxima a 1, acercando idf y tf–idf a 0.

Justificación de la FDI

El Idf fue introducido como "especificidad de término" por Karen Spärck Jones en un artículo de 1972. Si bien ha funcionado bien como heurística , sus fundamentos teóricos han sido problemáticos durante al menos tres décadas, y muchos investigadores han intentado encontrar justificaciones teóricas de la información para él. [ 6 ]

La propia explicación de Spärck Jones no propuso mucha teoría, aparte de una conexión con la ley de Zipf . [ 6 ] Se han hecho intentos de poner idf sobre una base probabilística , [ 7 ] estimando la probabilidad de que un documento dado d contenga un término t como la frecuencia relativa del documento,

PAG(t|D)=|{dD:td}|norte,{\displaystyle P(t|D)={\frac {|\{d\in D:t\in d\}|}{N}},}

para que podamos definir idf como

idF=registroPAG(t|D)=registro1PAG(t|D)=registronorte|{dD:td}|{\displaystyle {\begin{aligned}\mathrm {idf} &=-\log P(t|D)\\&=\log {\frac {1}{P(t|D)}}\\&=\log {\frac {N}{|\{d\in D:t\in d\}|}}\end{aligned}}}

Es decir, la frecuencia inversa de documentos es el logaritmo de la frecuencia relativa "inversa" de documentos.

Esta interpretación probabilística, a su vez, adopta la misma forma que la de la autoinformación . Sin embargo, aplicar tales nociones de la teoría de la información a problemas de recuperación de información genera dificultades al intentar definir los espacios de eventos apropiados para las distribuciones de probabilidad requeridas : no solo es necesario tener en cuenta los documentos, sino también las consultas y los términos. [ 6 ]

Tanto la frecuencia de términos como la frecuencia inversa de documentos pueden formularse en términos de teoría de la información ; esto ayuda a comprender por qué su producto tiene significado en términos del contenido informativo conjunto de un documento. Una suposición característica sobre la distribuciónpag(d,t){\displaystyle p(d,t)}es que:

pag(d|t)=1|{dD:td}|{\displaystyle p(d|t)={\frac {1}{|\{d\in D:t\in d\}|}}}

Esta suposición y sus implicaciones, según Aizawa: "representan la heurística que emplea tf–idf". [ 8 ]

La entropía condicional de un documento "elegido al azar" en el corpusD{\displaystyle D}, condicionado al hecho de que contiene un término específicot{\displaystyle t}(y suponiendo que todos los documentos tienen la misma probabilidad de ser elegidos) es:

H(D|T=t)=dpagd|tregistropagd|t=registro1|{dD:td}|=registro|{dD:td}||D|+registro|D|=idF(t)+registro|D|{\displaystyle H({\cal {D}}|{\cal {T}}=t)=-\sum _{d}p_{d|t}\log p_{d|t}=-\log {\frac {1}{|\{d\in D:t\in d\}|}}=\log {\frac {|\{d\in D:t\in d\}|}{|D|}}+\log |D|=-\mathrm {idf} (t)+\log |D|}

En términos de notación,D{\displaystyle {\cal {D}}}yT{\displaystyle {\cal {T}}}son "variables aleatorias" que corresponden respectivamente a extraer un documento o un término. La información mutua se puede expresar como

METRO(T;D)=H(D)H(D|T)=tpagt(H(D)H(D|W=t))=tpagtidF(t){\displaystyle M({\cal {T}};{\cal {D}})=H({\cal {D}})-H({\cal {D}}|{\cal {T}})=\sum _{t}p_{t}\cdot (H({\cal {D}})-H({\cal {D}}|W=t))=\sum _{t}p_{t}\cdot \mathrm {idf} (t)}

El último paso es expandirpagt{\displaystyle p_{t}}, la probabilidad incondicional de extraer un término, con respecto a la elección (aleatoria) de un documento, para obtener:

METRO(T;D)=t,dpagt|dpagdidF(t)=t,dtF(t,d)1|D|idF(t)=1|D|t,dtF(t,d)idF(t).{\displaystyle M({\cal {T}};{\cal {D}})=\sum _{t,d}p_{t|d}\cdot p_{d}\cdot \mathrm {idf} (t)=\sum _{t,d}\mathrm {tf} (t,d)\cdot {\frac {1}{|D|}}\cdot \mathrm {idf} (t)={\frac {1}{|D|}}\sum _{t,d}\mathrm {tf} (t,d)\cdot \mathrm {idf} (t).}

Esta expresión muestra que la suma del Tf–idf de todos los términos y documentos posibles recupera la información mutua entre documentos y términos, teniendo en cuenta todas las especificidades de su distribución conjunta. [ 8 ] Por lo tanto, cada Tf–idf contiene el "bit de información" asociado a un par término x documento.

Tf–idf está estrechamente relacionado con el valor p transformado logarítmicamente negativo de una formulación unilateral de la prueba exacta de Fisher cuando los documentos del corpus subyacente satisfacen ciertos supuestos idealizados. [ 9 ] Más recientemente, se demostró que las variantes de tf–idf surgen como componentes en el estadístico de prueba de una prueba de razón de verosimilitud penalizada para la ráfaga de palabras basada en un modelo estadístico de lenguaje beta-binomial. [ 10 ] En este marco, la hipótesis nula modela las ocurrencias de términos usando una distribución binomial , mientras que la hipótesis alternativa modela la ráfaga de palabras usando una distribución beta-binomial con un término de penalización con distribución gamma colocado en el parámetro de precisión beta-binomial. El estadístico de prueba resultante contiene las variantes de tf–idf frecuencia de término binaria-frecuencia de documento inversa (btf–idf) y frecuencia de término-frecuencia de colección inversa (tf–icf), estableciendo así una conexión directa entre los esquemas de ponderación de términos de la familia tf–idf y las pruebas de hipótesis estadísticas . [ 10 ]

Ejemplo de tf–idf

Supongamos que tenemos tablas de recuento de términos de un corpus que consta de solo dos documentos:

"Esta es una muestra A."
"Este es otro ejemplo, otro ejemplo, ejemplo."

El cálculo de tf–idf para el término "this" se realiza de la siguiente manera:

En su forma de frecuencia bruta, tf es simplemente la frecuencia de la palabra "this" en cada documento. En cada documento, la palabra "this" aparece una vez; pero como el documento 2 tiene más palabras, su frecuencia relativa es menor.

tF(this,d1)=15=0,2{\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{1})={\frac {1}{5}}=0.2}
tF(this,d2)=170,14{\displaystyle \mathrm {tf} ({\mathsf {''this''}},d_{2})={\frac {1}{7}}\approx 0.14}

El idf es una constante por corpus y representa la proporción de documentos que incluyen la palabra "this". En este caso, tenemos un corpus de dos documentos y todos ellos incluyen la palabra "this".

idF(this,D)=registro(22)=0{\displaystyle \mathrm {idf} ({\mathsf {''this''}},D)=\log \left({\frac {2}{2}}\right)=0}

Por lo tanto, tf–idf es cero para la palabra "this", lo que implica que la palabra no es muy informativa ya que aparece en todos los documentos.

tFidF(this,d1,D)=0,2×0=0{\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{1},D)=0.2\times 0=0}
tFidF(this,d2,D)=0,14×0=0{\displaystyle \mathrm {tfidf} ({\mathsf {''this''}},d_{2},D)=0.14\times 0=0}

La palabra "ejemplo" es más interesante: aparece tres veces, pero solo en el segundo documento:

tF(miincógnitaametropaglmi,d1)=05=0{\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{1})={\frac {0}{5}}=0}
tF(miincógnitaametropaglmi,d2)=370,429{\displaystyle \mathrm {tf} ({\mathsf {''example''}},d_{2})={\frac {3}{7}}\approx 0.429}
idF(miincógnitaametropaglmi,D)=registro(21)=0,301{\displaystyle \mathrm {idf} ({\mathsf {''example''}},D)=\log \left({\frac {2}{1}}\right)=0.301}

Finalmente,

tFidF(miincógnitaametropaglmi,d1,D)=tF(miincógnitaametropaglmi,d1)×idF(miincógnitaametropaglmi,D)=0×0,301=0{\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{1},D)=\mathrm {tf} ({\mathsf {''example''}},d_{1})\times \mathrm {idf} ({\mathsf {''example''}},D)=0\times 0.301=0}
tFidF(miincógnitaametropaglmi,d2,D)=tF(miincógnitaametropaglmi,d2)×idF(miincógnitaametropaglmi,D)=0,429×0,3010,129{\displaystyle \mathrm {tfidf} ({\mathsf {''example''}},d_{2},D)=\mathrm {tf} ({\mathsf {''example''}},d_{2})\times \mathrm {idf} ({\mathsf {''example''}},D)=0.429\times 0.301\approx 0.129}

(utilizando el logaritmo en base 10 ).

Más allá de los términos

La idea detrás de tf-idf también se aplica a entidades distintas de los términos. En 1998, el concepto de idf se aplicó a las citas. [ 11 ] Los autores argumentaron que "si una cita muy poco común es compartida por dos documentos, esta debería tener mayor peso que una cita hecha por un gran número de documentos". Además, tf-idf se aplicó a "palabras visuales" con el propósito de realizar la coincidencia de objetos en videos, [ 12 ] y oraciones completas. [ 13 ] Sin embargo, el concepto de tf-idf no demostró ser más efectivo en todos los casos que un esquema tf simple (sin idf). Cuando tf-idf se aplicó a las citas, los investigadores no pudieron encontrar ninguna mejora con respecto a un simple peso de recuento de citas que no tenía un componente idf. [ 14 ]

Derivados

Varios esquemas de ponderación de términos se han derivado de tf-idf. Uno de ellos es TF-PDF (frecuencia de término * frecuencia proporcional de documento). [ 15 ] TF-PDF se introdujo en 2001 en el contexto de la identificación de temas emergentes en los medios. El componente PDF mide la diferencia de la frecuencia con la que aparece un término en diferentes dominios. Otro derivado es TF-IDuF. En TF-IDuF, [ 16 ] idf no se calcula en función del corpus de documentos que se va a buscar o recomendar. En cambio, idf se calcula en las colecciones de documentos personales de los usuarios. Los autores informan que TF-IDuF fue igual de eficaz que tf-idf, pero también podría aplicarse en situaciones en las que, por ejemplo, un sistema de modelado de usuarios no tiene acceso a un corpus global de documentos. El derivado DELTA TF-IDF [ 17 ] utiliza la diferencia en la importancia de un término entre dos clases específicas, como el sentimiento positivo y negativo. Por ejemplo, puede asignar una puntuación alta a una palabra como "excelente" en reseñas positivas y una puntuación baja a la misma palabra en reseñas negativas. Esto ayuda a identificar palabras que indican claramente el sentimiento de un documento, lo que podría mejorar la precisión en las tareas de clasificación de texto.

Véase también

Referencias

  1. Rajaraman, A.; Ullman, JD (2011). "Minería de datos" (PDF) . Minería de conjuntos de datos masivos . págs. 1–17 . doi : 10.1017/CBO9781139058452.002 . ISBN  978-1-139-05845-2.
  2. Breitinger, Corinna; Gipp, Bela; Langer, Stefan (26 de julio de 2015). "Sistemas de recomendación de artículos de investigación: una revisión de la literatura" . International Journal on Digital Libraries . 17 (4): 305– 338. doi : 10.1007/s00799-015-0156-0 . ISSN 1432-5012 . S2CID 207035184 .  
  3. Spärck Jones, K. (1972). "Una interpretación estadística de la especificidad de los términos y su aplicación en la recuperación". Journal of Documentation . 28 (1): 11– 21. CiteSeerX 10.1.1.115.8343 . doi : 10.1108/eb026526 . S2CID 2996187 .  
  4. Manning, CD; Raghavan, P.; Schutze, H. (2008). "Scoring, term weighting, and the vector space model" (PDF) . Introducción a la recuperación de información . pág. 100. doi : 10.1017/CBO9780511809071.007 . ISBN  978-0-511-80907-1.
  5. "Estadísticas TFIDF | SAX-VSM" .
  6. 1 2 3 Robertson, S. (2004). "Understanding inverse document frequency: On theoretical arguments for IDF". Journal of Documentation . 60 (5): 503– 520. doi : 10.1108/00220410410560582 .
  7. Véase también Estimaciones de probabilidad en la práctica en Introducción a la recuperación de información .
  8. 1 2 Aizawa, Akiko (2003). "Una perspectiva de la teoría de la información sobre las medidas tf–idf". Procesamiento y gestión de la información . 39 (1): 45– 65. doi : 10.1016/S0306-4573(02)00021-3 . S2CID 45793141 . 
  9. Sheridan, Paul; Ahmed, Zeyad; Farooque, Aitazaz A. (2026). "Una justificación mediante la prueba exacta de Fisher del esquema de ponderación de términos TF-IDF" . The American Statistician . 80 (1): 146– 156. arXiv : 2507.15742 . doi : 10.1080/00031305.2025.2539241 .
  10. 1 2 Ahmed, Zeyad; Sheridan, Paul; McIsaac, Michael; Farooque, Aitazaz A. (2026). "Las variantes comunes de TF-IDF surgen como componentes clave en el estadístico de prueba de una prueba de razón de verosimilitud penalizada para la ráfaga de palabras" . Discover Computing . 29 (1): 274. arXiv : 2604.00672 . doi : 10.1007/s10791-026-10090-4 .
  11. Bollacker, Kurt D.; Lawrence, Steve; Giles, C. Lee (1998-01-01). "CiteSeer". Actas de la segunda conferencia internacional sobre agentes autónomos - AGENTS '98 . págs. 116–123 . doi : 10.1145/280765.280786 . ISBN  978-0-89791-983-8. S2CID 3526393 . 
  12. Sivic, Josef; Zisserman, Andrew (1 de enero de 2003). "Video Google: Un enfoque de recuperación de texto para la coincidencia de objetos en vídeos". Actas de la Novena Conferencia Internacional IEEE sobre Visión por Computadora . ICCV '03. págs. 1470–. doi : 10.1109/ICCV.2003.1238663 . ISBN  978-0-7695-1950-0. S2CID 14457153 . 
  13. Seki, Yohei. "Extracción de oraciones mediante tf/idf y ponderación de posición a partir de artículos periodísticos" (PDF) . Instituto Nacional de Informática.
  14. Beel, Joeran; Breitinger, Corinna (2017). "Evaluación del esquema de ponderación de citas CC-IDF: ¿Qué tan efectivamente se puede aplicar la 'Frecuencia Inversa de Documentos' (IDF) a las referencias?" (PDF) . Actas de la 12.ª IConference . Archivado del original (PDF) el 22 de septiembre de 2020. Recuperado el 29 de enero de 2017 .
  15. Khoo Khyou Bun; Bun, Khoo Khyou; Ishizuka, M. (2001). "Sistema de seguimiento de temas emergentes". Actas del Tercer Taller Internacional sobre Cuestiones Avanzadas de Comercio Electrónico y Sistemas de Información Basados ​​en la Web. WECWIS 2001. págs. 2–11 . CiteSeerX 10.1.1.16.7986 . doi : 10.1109/wecwis.2001.933900 . ISBN   978-0-7695-1224-2. S2CID 1049263 . 
  16. Langer, Stefan; Gipp, Bela (2017). "TF-IDuF: Un nuevo esquema de ponderación de términos para el modelado de usuarios basado en las colecciones de documentos personales de los usuarios" (PDF) . IConference .
  17. Martineau, Justin; Finin, Tim (2009). "Delta TFIDF: Un espacio de características mejorado para el análisis de sentimientos" . Actas de la Tercera Conferencia Internacional AAAI sobre Web y Medios Sociales . ICWSM. San José, CA: AAAI. doi : 10.1609/icwsm.v3i1.13979 .
  • Salton, G .; McGill, M.J. (1986). Introducción a la recuperación de información moderna . McGraw-Hill . ISBN 978-0-07-054484-0.
  • Salton, G.; Fox, EA; Wu, H. (1983). "Recuperación de información booleana extendida". Communications of the ACM . 26 (11): 1022– 1036. doi : 10.1145/182.358466 . hdl : 1813/6351 . S2CID 207180535 . 
  • Salton, G. ; Buckley, C. (1988). "Enfoques de ponderación de términos en la recuperación automática de texto" (PDF) . Information Processing & Management . 24 (5): 513– 523. doi : 10.1016/0306-4573(88)90021-0 . hdl : 1813/6721 . S2CID 7725217 . 
  • Wu, HC; Luk, RWP; Wong, KF; Kwok, KL (2008). "Interpretación de los pesos de los términos TF-IDF para tomar decisiones de relevancia". ACM Transactions on Information Systems . 26 (3): 1. doi : 10.1145/1361684.1361686 . hdl : 10397/10130 . S2CID 18303048 . 
  • Gensim es una biblioteca de Python para el modelado de espacios vectoriales e incluye ponderación tf-idf.
  • Anatomía de un motor de búsqueda. Archivado el 10 de marzo de 2009 en Wayback Machine.
  • tf–idf y definiciones relacionadas tal como se utilizan en Lucene
  • Transformador Tfidf en scikit-learn
  • Text to Matrix Generator (TMG) es una caja de herramientas de MATLAB que se puede utilizar para diversas tareas en minería de texto (TM), específicamente i) indexación, ii) recuperación, iii) reducción de dimensionalidad , iv) agrupamiento y v) clasificación. El paso de indexación ofrece al usuario la posibilidad de aplicar métodos de ponderación locales y globales, incluido tf-idf.
  • Explicación de la frecuencia de los términos