Project Naptha es una extensión de navegador para Google Chrome que permite a los usuarios resaltar , copiar , editar y traducir texto dentro de las imágenes. [ 1 ] Fue creada por el desarrollador Kevin Kwok, [ 2 ] y lanzada en abril de 2014 como un complemento de Chrome. Este software inicialmente solo estaba disponible para Google Chrome, y se podía descargar desde la Chrome Web Store . Posteriormente, se hizo disponible para Mozilla Firefox , y se podía descargar desde el repositorio de complementos de Mozilla Firefox , pero pronto se eliminó. Se desconoce el motivo de su eliminación. [ 3 ]
La extensión del navegador web utiliza tecnología de imagen avanzada. [ 4 ] También se han empleado tecnologías similares para producir obras de arte impresas y para la identificación de estas obras. [ 5 ]
Al adoptar varios algoritmos de reconocimiento óptico de caracteres (OCR) , incluidas bibliotecas desarrolladas por Microsoft Research y Google , el texto se identifica automáticamente en las imágenes. El OCR permite construir un modelo de regiones de texto, palabras y letras a partir de todas las imágenes. [ 6 ]
La tecnología OCR que adopta Project Naptha es ligeramente diferente a la que utilizan programas como Google Drive y Microsoft OneNote para analizar texto en imágenes. Project Naptha también emplea un método llamado Stroke Width Transform (SWT) , [ 7 ] desarrollado por Microsoft Research en 2008 para la detección de texto.
Origen del nombre
El nombre Naptha deriva de Naphtha , un término general que se originó hace miles de años y que se refiere a un hidrocarburo líquido inflamable. El proceso de resaltar textos también inspiró la denominación del proyecto.
Dificultad en la traducción de palabras a partir de imágenes
Antes de la llegada de programas como Project Naptha, editar, copiar o citar texto dentro de imágenes era un proceso complicado. Anteriormente, la única forma de buscar o copiar una frase de una imagen era transcribir el texto manualmente.
Historia
En mayo de 2012, Kevin Kwok [ 2 ] estaba leyendo sobre el recorte de líneas , un algoritmo capaz de redimensionar imágenes sin distorsionarlas ni dañar su calidad. Kwok notó que tienden a converger y organizarse de forma que cortan los espacios entre las letras. Un cómic particularmente extenso lo inspiró a desarrollar un software que puede leer imágenes (con canvas ), determinar la posición de las líneas y las letras, y dibujar superposiciones de selección para mitigar el hábito generalizado de seleccionar texto.
Características técnicas
Antes de aplicar el reconocimiento óptico de caracteres (OCR), primero debe identificar si existen bloques de texto en una imagen. Una vez identificados, el OCR permite crear un modelo de regiones de texto, palabras y letras a partir de cualquier imagen. [ 6 ] Esta función ofrece a los usuarios la opción de copiar , traducir e incluso modificar texto directamente en cualquier imagen, en tiempo real y en su navegador Google Chrome . [ 8 ]
La característica principal del Proyecto Naptha es su función de detección de texto. Basándose en un algoritmo llamado «Stroke Width Transform», desarrollado por Microsoft Research en 2008, [ 7 ] permite identificar regiones de texto de forma independiente del idioma y detectar texto inclinado y texto en imágenes. Esto se logra utilizando el ancho de las líneas que componen las letras para identificar elementos que podrían ser texto, en lugar de intentar detectar características predeterminadas como marcadores de texto.
En este caso, el programa se vuelve altamente intuitivo , similar a los humanos, en los que no necesitamos entender un idioma para reconocer un texto escrito. [ 9 ]
El proyecto Naptha aplica automáticamente algoritmos de visión artificial de última generación a cada imagen disponible al navegar por la web, lo que permite a los usuarios resaltar, copiar y pegar, editar y traducir texto que antes estaba oculto dentro de una imagen.
Se adopta una técnica similar a la función "Relleno según el contenido" de Photoshop [ 10 ] , denominada " inpainting ". Este tipo de algoritmos son conocidos por formar parte de la función "Relleno según el contenido" de Adobe Photoshop . Consiste en utilizar un algoritmo que rellena automáticamente el espacio previamente ocupado por texto con colores del área circundante, igualando la fuente del texto traducido al estilo de la imagen original. Esto se logra, en primer lugar, detectando el texto y extrayendo los colores sólidos de las regiones que lo rodean. Posteriormente, los colores se extienden hacia el interior hasta que se rellena toda el área. Esta técnica permite reconstruir imágenes, así como editar y eliminar palabras de una imagen mediante la captura y el procesamiento de los colores independientes de las regiones que rodean el texto editado. [ 8 ]
Para brindar una experiencia fluida e intuitiva al usuario, la técnica de extensión rastrea los movimientos del cursor y extrapola continuamente un segundo hacia adelante en función de su posición y velocidad, prediciendo dónde podrían aparecer resaltados en una imagen. [ 1 ] El software Project Naptha luego escanea y ejecuta algoritmos de reconocimiento de caracteres que requieren un alto procesamiento, procesando con anticipación el texto potencial que los usuarios podrían querer extraer de una imagen. [ 11 ]
Solicitud
Project Naptha se puede usar en varias aplicaciones, permitiendo a los usuarios copiar textos de cualquier imagen que se muestre en el navegador. Esto incluye cómics, fotos, capturas de pantalla , imágenes con superposiciones de texto como memes de internet, GIF animados , escaneos, diagramas con etiquetas y traducciones. [ 12 ]
Historietas
En octubre de 2013 se lanzó el primer prototipo de la extensión para cómics. La necesidad de esta extensión se debía al uso de tipografías propias de los cómics, que suelen ser más informales. Los personajes a menudo se colocan muy juntos, como si estuvieran conectados, y si se intenta copiar y pegar texto de un cómic, el texto copiado generalmente aparece desordenado y poco legible.
Fotos
El algoritmo que utiliza Project Naptha para las fotos es la Transformación de Ancho de Trazo, diseñada específicamente para detectar texto en escenas naturales y fotografías. Esto se debe a que, por lo general, copiar texto de las fotografías resulta más complejo y técnicamente más difícil que copiar texto de la mayoría de las imágenes convencionales.
Capturas de pantalla
En el caso de las capturas de pantalla, Project Naptha transforma las imágenes estáticas en algo más parecido a una instantánea interactiva del ordenador tal como estaba en el momento de la captura. El cursor cambia al situarlo sobre diferentes partes y los bloques de texto se vuelven seleccionables.
Edición de texto en imágenes
Project Naptha permite borrar y editar textos en una imagen mediante tecnología de traducción. Esta tecnología de traducción utiliza esencialmente la técnica de " relleno de imágenes ".
Durante la modificación de un texto, se utiliza el mismo método que la traducción . El menú Traducir incluye la opción de traducir el texto de la imagen a muchos otros idiomas, como inglés, español, ruso, francés, chino simplificado, chino tradicional, japonés o alemán. [ 8 ]
Limitaciones técnicas
A pesar de las constantes mejoras realizadas en el software, el Proyecto Naptha aún enfrenta algunas dificultades técnicas.
La naturaleza independiente del idioma del algoritmo de transformación del ancho de trazo de Project Naptha le permite detectar los pequeños garabatos como texto. Si bien esto es una ventaja, ya que es capaz de detectar detalles menores, también puede considerarse un error al detectar e incluir demasiados detalles no deseados.
Cuando los colores del texto y del fondo de una imagen son similares, resulta difícil detectar las palabras, ya que estas se vuelven menos distintivas de la imagen. Esto genera imprecisiones en la detección y copia de textos. [ 12 ]
Debido a la segmentación de caracteres, la escritura a mano es especialmente difícil de detectar. Los caracteres suelen estar demasiado juntos, lo que dificulta su segmentación o la separación de las letras. Por lo tanto, copiar textos de este tipo de fuentes resultará en una alta imprecisión y letras desordenadas . [ 12 ]
Como parte de una mejora, Project Naptha comenzó a trabajar en la compatibilidad con texto rotado. Sin embargo, esta función solo permite una rotación de hasta 30 grados. Cualquier texto con una rotación superior a 30 grados podría no poder copiarse ni traducirse.
En el caso de las técnicas que utilizan el relleno de imágenes, una desventaja es que las imágenes rara vez sustituyen al original y pueden dejar rastros de edición. Sin embargo, desde la distancia, parecerá que las palabras se han eliminado perfectamente de la imagen.
Seguridad
Preocupaciones de seguridad
Para cualquier otro software utilizado en sitios web, una de las mayores preocupaciones se debe a los problemas que surgen en relación con el equilibrio entre la experiencia del usuario y la privacidad . Se entiende que los desarrolladores de Project Naptha están haciendo todo lo posible para permitir el procesamiento en el lado del cliente (es decir, dentro del navegador). Sin embargo, dado que el texto seleccionado por los usuarios para extraer de la imagen se procesa en la nube, esto significa que, para lograr una mayor precisión de traducción , todavía es necesario depender de un mayor procesamiento en la nube y, por lo tanto, comprometer la privacidad. [ 4 ]
Existe una configuración predeterminada que ayuda a lograr un equilibrio delicado entre ofrecer todas las funcionalidades y respetar la privacidad del usuario. Por defecto, cuando los usuarios comienzan a seleccionar un texto, se envía una solicitud HTTPS segura . Esta solo contiene la URL de la imagen específica y nada más: no se incluyen tokens de usuario , información del sitio web, cookies ni datos analíticos, y las solicitudes no se registran. El servidor responde con una lista de las traducciones existentes y los idiomas de OCR que se han procesado. Esto permite reconocer texto en una imagen con mucha más precisión que de otro modo.
Según las preferencias de los usuarios, esta función predeterminada se puede desactivar marcando la casilla "Desactivar búsqueda" en el menú Opciones.
Desarrollos futuros
Además del software actual que permite manipular textos dentro de las imágenes, existe una función experimental que busca ampliar sus capacidades. Mediante esta extensión experimental, el software pretende permitir a los usuarios buscar textos dentro de las imágenes de la página actual, lo que resultará muy útil para todos. [ 4 ]
El proyecto Naptha también ha estado explorando diferentes maneras de superar sus limitaciones. Actualmente, el texto solo puede tener un ángulo de rotación máximo de 30 grados [ 13 ], ya que de lo contrario su calidad sería inferior. El proyecto Naptha se propone mejorar la calidad en sus futuras versiones mediante el uso de modelos y algoritmos mejor entrenados. Asimismo, existe la posibilidad de incluir servicios de transcripción con asistencia humana.
Además, las técnicas de relleno de imágenes pueden dejar marcas en la imagen original, evidenciando que ha sido editada. Se espera que esta técnica mejore, especialmente con un método de detección de lógica que vaya más allá de la simple detección de fuentes. Actualmente, el relleno de imágenes lee las fuentes de esta manera: si son mayúsculas y súper negritas, usa la fuente Impact; si son mayúsculas en cualquier otro caso, usa la fuente XKCD; y para todo lo demás, usa Helvetica Neue .
Como reconoce Kwok, el Proyecto Naptha aún tiene margen de mejora en muchas de sus funcionalidades. La razón principal es que, en cuanto a sus diversos subcomponentes y algoritmos, el Proyecto Naptha está algo desfasado con respecto a la tecnología más avanzada . Sin embargo, cree firmemente que, con el tiempo, el reconocimiento, la traducción y la eliminación de texto podrán desarrollarse aún más, y este inmenso potencial sin duda resultará apasionante.
Véase también
- Copyfish : la extensión Copyfish para Google Chrome resuelve el mismo problema, pero utiliza un enfoque de interfaz de usuario diferente.
Referencias
- 1 2 Stu, Robarts (24 de abril de 2014). "Nueva extensión de Google Chrome permite copiar y eliminar texto en imágenes" . Gizmag . Recuperado el 7 de abril de 2015 .
- 1 2 Kwok, Kevin. "Perfil" . Google+ . Consultado el 7 de abril de 2015 .
- ↑ Brinkmann, Martin (26 de septiembre de 2014). "El texto del Proyecto Naptha sobre tecnología de reconocimiento de imágenes llega a Firefox" . ghacks.net . Recuperado el 2 de abril de 2015 .
- 1 2 3 Hoffman, Chris (26 de junio de 2014). "Editar texto de imágenes con Project Naptha de Chrome: qué es y cómo usarlo" . Makeuseof . Recuperado el 7 de abril de 2015 .
- ↑ Narelle, Jarry (1996). "Tecnología de imágenes por computadora: El proceso de identificación" . The Book and Paper Group . The American Institute for Conservation . Recuperado el 2 de abril de 2015 .
- 1 2 Brian, Matt (23 de abril de 2014). "Este complemento de Chrome te permite copiar y borrar texto dentro de cualquier imagen en la web" . Engadget . Recuperado el 7 de abril de 2015 .
- 1 2 "Transformación del ancho del trazo" . Transformación del ancho del trazo . Consultado el 7 de abril de 2015 .
- 1 2 3 Chacos, Brad. "Conoce Project Naptha, una increíble extensión de Chrome para modificar texto en imágenes web" . PCWorld . Consultado el 7 de abril de 2015 .
- ↑ Starr, Michelle. "Una extensión de Chrome permite copiar texto de imágenes" . CNET . Consultado el 2 de abril de 2015 .
- ↑ Wollman, Dana (22 de marzo de 2012). "Adobe presenta la versión beta de Photoshop CS6 con una interfaz de usuario rediseñada y 65 nuevas funciones; descárgala gratis hoy mismo" . Engadget . Consultado el 30 de marzo de 2015 .
- ↑ Chan, Norman. "En resumen: Project Naptha OCRs Web Images" . Probado . Consultado el 2 de abril de 2015 .
- 1 2 3 "Proyecto Naptha" . Proyecto Naptha . Consultado el 7 de abril de 2015 .
- ↑ Khaw, Cassandra (23 de abril de 2014). "Edita el texto de las imágenes con la útil extensión de Chrome" . TheVerge . Consultado el 2 de abril de 2015 .
- Software de 2013
- Extensiones de Google Chrome
- Reconocimiento óptico de caracteres