En el aprendizaje automático , el embedding es una técnica de aprendizaje de representación que mapea datos complejos de alta dimensión a un espacio vectorial de menor dimensión de vectores numéricos. [ 1 ]
Técnica
También denota la representación resultante, donde se conservan patrones o relaciones significativas. Como técnica, aprende estos vectores a partir de datos como palabras, imágenes o interacciones del usuario, a diferencia de los métodos diseñados manualmente, como la codificación one-hot . [ 2 ] Este proceso reduce la complejidad y captura características clave sin necesidad de conocimiento previo del dominio.
Semejanza
En el procesamiento del lenguaje natural , las palabras o conceptos pueden representarse como vectores de características , donde conceptos similares se asignan a vectores cercanos. Las incrustaciones resultantes varían según el tipo, incluyendo incrustaciones de palabras para texto (por ejemplo, Word2Vec ), incrustaciones de imágenes para datos visuales e incrustaciones de grafos de conocimiento para grafos de conocimiento , cada una adaptada a tareas como PLN, visión artificial o sistemas de recomendación . [ 3 ] Esta doble función mejora la eficiencia y precisión del modelo al automatizar la extracción de características y revelar similitudes latentes en diversas aplicaciones.
Para medir la distancia entre dos incrustaciones, se puede utilizar una medida de similitud para encontrar la similitud general de los conceptos representados por las incrustaciones. Si los vectores se normalizan para tener una magnitud de 1, entonces las medidas de similitud son proporcionales a. [ 4 ]
La similitud del coseno ignora la magnitud del vector al determinar la similitud, por lo que está menos sesgada hacia los datos de entrenamiento que aparecen con mucha frecuencia. El producto escalar incluye la magnitud inherentemente, por lo que tenderá a valorar los datos más populares. [ 4 ] En general, para espacios vectoriales de alta dimensión, los vectores tienden a converger en distancia, por lo que la distancia euclidiana se vuelve menos fiable para vectores de incrustación grandes. [ 5 ]
Véase también
Referencias
- ↑ Bengio, Yoshua; Ducharme, Réjean; Vincent, Pascal (2003). "Un modelo de lenguaje probabilístico neuronal". Journal of Machine Learning Research . 3 : 1137–1155 .
- ↑ Mikolov, Tomas; Chen, Kai; Corrado, Greg; Dean, Jeffrey (2013). Estimación eficiente de representaciones de palabras en el espacio vectorial . Conferencia internacional sobre aprendizaje de representaciones (ICLR).
- ↑ "¿Qué son los incrustamientos en el aprendizaje automático?" . GeeksforGeeks . 15-02-2024 . Consultado el 28-02-2025 .
- 1 2 "Medición de similitud a partir de incrustaciones" . Educación en aprendizaje automático de Google . Recuperado el 21 de septiembre de 2025 .
- ↑ Krantz, Tom; Jonker, Alexandra. "¿Qué es la similitud del coseno?" . IBM Think . Consultado el 21 de septiembre de 2025 .
- Aprendizaje automático
- Redes neuronales artificiales
- Procesamiento del lenguaje natural