
El reconocimiento de escritura a mano ( HWR ), también conocido como reconocimiento de texto manuscrito ( HTR ), es la capacidad de una computadora para recibir e interpretar texto manuscrito inteligible de fuentes como documentos en papel , fotografías , pantallas táctiles y otros dispositivos. [ 1 ] [ 2 ] La imagen del texto escrito puede detectarse "fuera de línea" de una hoja de papel mediante escaneo óptico ( reconocimiento óptico de caracteres ) o reconocimiento inteligente de palabras . Alternativamente, los movimientos de la punta del lápiz pueden detectarse "en línea", por ejemplo, mediante la superficie de una pantalla de computadora basada en lápiz, una tarea generalmente más fácil ya que hay más pistas disponibles. Un sistema de reconocimiento de escritura a mano maneja el formato, realiza la segmentación correcta en caracteres y encuentra la mayor cantidad de palabras posibles.
Reconocimiento fuera de línea
El reconocimiento de escritura a mano sin conexión implica la conversión automática del texto de una imagen en códigos de letras utilizables en aplicaciones informáticas y de procesamiento de texto. Los datos obtenidos mediante este método se consideran una representación estática de la escritura. El reconocimiento de escritura a mano sin conexión es relativamente difícil, ya que cada persona tiene un estilo de escritura diferente. Actualmente, los motores OCR se centran principalmente en texto impreso, mientras que los ICR se centran en texto manuscrito (escrito en mayúsculas).
Técnicas tradicionales
Extracción de caracteres
El reconocimiento de caracteres sin conexión suele implicar el escaneo de un formulario o documento. Esto significa que será necesario extraer los caracteres individuales contenidos en la imagen escaneada. Existen herramientas capaces de realizar este paso. [ 3 ] Sin embargo, este proceso presenta varias imperfecciones comunes. La más frecuente es cuando los caracteres conectados se devuelven como una única subimagen que contiene ambos caracteres. Esto causa un problema importante en la etapa de reconocimiento. No obstante, existen muchos algoritmos disponibles que reducen el riesgo de caracteres conectados.
Reconocimiento de caracteres
Una vez extraídos los caracteres individuales, se utiliza un motor de reconocimiento para identificar el carácter informático correspondiente. Actualmente existen diversas técnicas de reconocimiento.
Extracción de características
La extracción de características funciona de forma similar a los reconocedores de redes neuronales. Sin embargo, los programadores deben determinar manualmente las propiedades que consideran importantes. Este enfoque otorga al reconocedor mayor control sobre las propiedades utilizadas en la identificación. No obstante, cualquier sistema que utilice este método requiere mucho más tiempo de desarrollo que una red neuronal, ya que las propiedades no se aprenden automáticamente.
Técnicas modernas
Mientras que las técnicas tradicionales se centran en segmentar caracteres individuales para su reconocimiento, las técnicas modernas se centran en reconocer todos los caracteres de una línea de texto segmentada. En particular, se centran en técnicas de aprendizaje automático capaces de aprender características visuales, evitando la limitación de la ingeniería de características utilizada anteriormente. Los métodos de vanguardia utilizan redes neuronales convolucionales para extraer características visuales en varias ventanas superpuestas de una imagen de línea de texto, que una red neuronal recurrente utiliza para generar probabilidades de caracteres. [ 4 ]
Reconocimiento en línea
El reconocimiento de escritura a mano en línea implica la conversión automática del texto escrito en un digitalizador o PDA especial , donde un sensor registra los movimientos de la punta del lápiz, así como los cambios de posición (al levantar o bajar el lápiz). Este tipo de datos se conoce como tinta digital y puede considerarse una representación digital de la escritura a mano. La señal obtenida se convierte en códigos de letras que se pueden utilizar en aplicaciones informáticas y de procesamiento de texto.
Los elementos típicos de una interfaz de reconocimiento de escritura a mano en línea incluyen:
- un bolígrafo o lápiz óptico para que el usuario escriba
- una superficie sensible al tacto, que puede estar integrada con una pantalla de salida o situada junto a ella.
- una aplicación informática que interpreta los movimientos del lápiz óptico sobre la superficie de escritura, traduciendo los trazos resultantes a texto digital.
El proceso de reconocimiento de escritura a mano en línea se puede dividir en unos pocos pasos generales:
- preprocesamiento,
- extracción de características y
- clasificación
El propósito del preprocesamiento es descartar información irrelevante en los datos de entrada, que puede afectar negativamente el reconocimiento. [ 5 ] Esto concierne a la velocidad y la precisión. El preprocesamiento generalmente consiste en binarización, normalización, muestreo, suavizado y eliminación de ruido. [ 6 ] El segundo paso es la extracción de características. A partir del campo vectorial de dos o más dimensiones recibido de los algoritmos de preprocesamiento, se extraen datos de mayor dimensión. El propósito de este paso es resaltar información importante para el modelo de reconocimiento. Estos datos pueden incluir información como la presión del lápiz, la velocidad o los cambios de dirección de escritura. El último gran paso es la clasificación. En este paso, se utilizan varios modelos para asignar las características extraídas a diferentes clases y así identificar los caracteres o palabras que representan las características.
Hardware
A principios de la década de 1980 se introdujeron productos comerciales que incorporaban el reconocimiento de escritura a mano como sustituto de la entrada de teclado. Algunos ejemplos son los terminales de escritura a mano como el Pencept Penpad [ 7 ] y el terminal de punto de venta Inforite [ 8 ] . Con la llegada del gran mercado de consumo de ordenadores personales, se introdujeron varios productos comerciales para sustituir el teclado y el ratón de un ordenador personal por un único sistema de puntero/escritura a mano, como los de Pencept [9], CIC [ 10 ] y otros . El primer ordenador portátil tipo tableta disponible comercialmente fue el Write-Top de Linus Technologies, lanzado en julio de 1988. Su sistema operativo se basaba en MS-DOS [ 11 ] [ 12 ] .
A principios de la década de 1990, fabricantes de hardware como NCR , IBM y EO lanzaron tabletas con el sistema operativo PenPoint , desarrollado por GO Corp. PenPoint utilizaba reconocimiento de escritura a mano y gestos, y ofrecía estas funcionalidades para software de terceros. La tableta de IBM fue la primera en usar el nombre ThinkPad y empleó el sistema de reconocimiento de escritura a mano de IBM. Este sistema de reconocimiento se adaptó posteriormente a Microsoft Windows para Pen Computing y a IBM Pen para OS/2 . Ninguna de estas tabletas tuvo éxito comercial.
Los avances en electrónica permitieron que la potencia de cálculo necesaria para el reconocimiento de escritura a mano se adaptara a un formato más pequeño que el de las tabletas, y el reconocimiento de escritura a mano se utiliza a menudo como método de entrada para las PDA portátiles . La primera PDA en ofrecer entrada escrita fue la Apple Newton , que mostró al público la ventaja de una interfaz de usuario optimizada. Sin embargo, el dispositivo no tuvo éxito comercial debido a la poca fiabilidad del software, que intentaba aprender los patrones de escritura del usuario. Para cuando se lanzó Newton OS 2.0, en el que el reconocimiento de escritura a mano se mejoró notablemente, incluyendo características únicas que aún no se encuentran en los sistemas de reconocimiento actuales, como la corrección de errores sin modelo, la primera impresión, en general negativa, ya estaba consolidada. Tras la descontinuación de Apple Newton , la función se incorporó en Mac OS X 10.2 y posteriormente como Inkwell .
Posteriormente, Palm lanzó una exitosa serie de PDAs basadas en el sistema de reconocimiento Graffiti . Graffiti mejoró la usabilidad al definir un conjunto de "trazos únicos" para cada carácter. Esto redujo la posibilidad de errores de entrada, aunque memorizar los patrones de trazos sí incrementó la curva de aprendizaje para el usuario. Se determinó que el sistema de reconocimiento de escritura Graffiti infringía una patente de Xerox, por lo que Palm lo reemplazó con una versión con licencia del sistema de reconocimiento de escritura CIC que, si bien también admitía trazos únicos, era anterior a la patente de Xerox. La sentencia que declaraba la infracción fue revocada en apelación, y posteriormente revocada de nuevo en una apelación posterior. Las partes involucradas negociaron posteriormente un acuerdo sobre esta y otras patentes.
Una tableta es un ordenador portátil con una tableta digitalizadora y un lápiz óptico, que permite al usuario escribir a mano en la pantalla. El sistema operativo reconoce la escritura y la convierte en texto. Windows Vista y Windows 7 incluyen funciones de personalización que aprenden los patrones de escritura o el vocabulario del usuario en inglés, japonés, chino tradicional, chino simplificado y coreano. Estas funciones incluyen un asistente de personalización que solicita muestras de la escritura del usuario y las utiliza para reentrenar el sistema y lograr un reconocimiento más preciso. Este sistema es distinto del sistema de reconocimiento de escritura menos avanzado empleado en Windows Mobile para PDA.
Aunque el reconocimiento de escritura a mano es una forma de entrada a la que el público se ha acostumbrado, no ha alcanzado un uso generalizado ni en ordenadores de sobremesa ni en portátiles. Todavía se acepta generalmente que la entrada mediante teclado es más rápida y fiable. A partir de 2006Muchas PDA ofrecen la opción de introducir texto a mano, e incluso a veces aceptan escritura cursiva natural, pero la precisión sigue siendo un problema, y algunas personas todavía encuentran más eficiente incluso un simple teclado en pantalla .
Software
Los primeros programas informáticos podían comprender la escritura impresa con caracteres separados; sin embargo, la escritura cursiva con caracteres conectados presentaba la paradoja de Sayre , una dificultad relacionada con la segmentación de caracteres. En 1962, Shelia Guberman , entonces en Moscú, escribió el primer programa aplicado de reconocimiento de patrones. [ 13 ] Ejemplos comerciales provinieron de empresas como Communications Intelligence Corporation e IBM.
A principios de la década de 1990, dos empresas —ParaGraph International y Lexicus— desarrollaron sistemas capaces de reconocer la escritura cursiva. ParaGraph, con sede en Rusia, fue fundada por el científico informático Stepan Pachikov, mientras que Lexicus fue fundada por Ronjon Nag y Chris Kortge, estudiantes de la Universidad de Stanford. El sistema CalliGrapher de ParaGraph se implementó en los sistemas Apple Newton, y el sistema Longhand de Lexicus se comercializó para PenPoint y el sistema operativo Windows. Lexicus fue adquirida por Motorola en 1993 y posteriormente desarrolló sistemas de reconocimiento de escritura china y texto predictivo para Motorola. ParaGraph fue adquirida en 1997 por SGI, y su equipo de reconocimiento de escritura formó la división P&I, que más tarde fue adquirida a SGI por Vadem . Microsoft adquirió el sistema de reconocimiento de escritura CalliGrapher y otras tecnologías de tinta digital desarrolladas por P&I a Vadem en 1999.
Wolfram Mathematica (versión 8.0 o posterior) también ofrece una función de reconocimiento de escritura a mano o texto llamada TextRecognize.
Investigación

El reconocimiento de escritura a mano cuenta con una activa comunidad académica dedicada a su estudio. Las conferencias más importantes sobre reconocimiento de escritura a mano son la Conferencia Internacional sobre Fronteras en el Reconocimiento de Escritura a Mano (ICFHR), que se celebra en años pares, y la Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (ICDAR), que se celebra en años impares. Ambas conferencias cuentan con el respaldo del IEEE y la IAPR . En 2021, las actas de la ICDAR serán publicadas por LNCS , Springer.
Las áreas de investigación activas incluyen:
- Reconocimiento en línea
- Reconocimiento fuera de línea
- Verificación de firma
- Interpretación de direcciones postales
- Procesamiento de cheques bancarios
- Reconocimiento del escritor
Resultados desde 2009
Desde 2009, las redes neuronales recurrentes y las redes neuronales de alimentación directa profunda desarrolladas en el grupo de investigación de Jürgen Schmidhuber en el Swiss AI Lab IDSIA han ganado varias competiciones internacionales de escritura a mano. [ 15 ] En particular, la memoria a largo y corto plazo (LSTM) bidireccional y multidimensional [ 16 ] [ 17 ] de Alex Graves et al. ganó tres competiciones de reconocimiento de escritura a mano conectada en la Conferencia Internacional de Análisis y Reconocimiento de Documentos (ICDAR) de 2009, sin ningún conocimiento previo sobre los tres idiomas diferentes (francés, árabe, persa ) que debían aprenderse. Los recientes métodos de aprendizaje profundo basados en GPU para redes de alimentación directa de Dan Ciresan y colegas en IDSIA ganaron el concurso de reconocimiento de escritura a mano china fuera de línea ICDAR 2011; sus redes neuronales también fueron los primeros reconocedores de patrones artificiales en lograr un rendimiento competitivo con los humanos [ 18 ] en el famoso problema de dígitos escritos a mano MNIST [ 19 ] de Yann LeCun y colegas en NYU .
Benjamin Graham, de la Universidad de Warwick, ganó un concurso de reconocimiento de escritura a mano en chino en 2013, con una tasa de error de tan solo el 2,61 %, utilizando un enfoque de redes neuronales convolucionales que evolucionó (para 2017) hacia las "redes neuronales convolucionales dispersas". [ 20 ] [ 21 ]
Véase también
- efecto de la IA
- Aplicaciones de la inteligencia artificial
- Firma electrónica
- eScriptorium
- Análisis del movimiento de la escritura a mano
- Reconocimiento inteligente de caracteres
- Solución de reconocimiento de caracteres de tinta en vivo
- Neocognitrón
- Reconocimiento óptico de caracteres
- Computación con lápiz
- Reconocimiento de bocetos
- Lápiz óptico (informática)
- Tablet PC
Liza
Referencias
- ↑ Förstner, Wolfgang (1999). Mustererkennung 1999 : 21. Simposio DAGM Bonn, 15-17. Septiembre de 1999 . Joachim M. Buhmann, Annett Faber, Petko Faber. Berlín, Heidelberg: Springer Berlín Heidelberg. ISBN 978-3-642-60243-6OCLC 913706869
- ^ Schenk, Joaquín (2010). Mensch-maschine-kommunikation : grundlagen von sprach- und bildbasierten benutzerschnittstellen . Gerhard Rigoll. Heidelberg: Springer. ISBN 978-3-642-05457-0OCLC 609418875
- ↑ Java OCR, 5 de junio de 2010. Consultado el 5 de junio de 2010.
- ↑ Puigcerver, Joan. "¿Son realmente necesarias las capas recurrentes multidimensionales para el reconocimiento de texto manuscrito?". Conferencia Internacional IAPR sobre Análisis y Reconocimiento de Documentos (ICDAR), 2017. Vol. 1. IEEE, 2017.
- ↑ Huang, B.; Zhang, Y. y Kechadi, M.; Técnicas de preprocesamiento para el reconocimiento de escritura a mano en línea. Categorización y agrupamiento inteligente de texto , Springer Berlin Heidelberg, 2009, vol. 164, "Estudios en inteligencia computacional", págs. 25-45.
- ↑ Holzinger, A.; Stocker, C.; Peischl, B. y Simonic, K.-M.; Sobre el uso de la entropía para mejorar el preprocesamiento de la escritura a mano , Entropy 2012, 14, pp. 2324–2350.
- ↑ Documentación del producto Pencept Penpad (TM) 200 , Pencept, Inc., 15 de agosto de 1982
- ↑ Terminal de reconocimiento de caracteres manuales Inforite , Cadre Systems Limited, Inglaterra, 15 de agosto de 1982
- ↑ Manual de usuario de Penpad 320 , Pencept, Inc., 15 de junio de 1984
- ↑ Sistema de escritura a mano GrafText™ Modelo GT-5000 , Communication Intelligence Corporation, 15 de enero de 1985
- ^ Atkinson, Paul (2010). Computadora . Libros de reacción. págs. 115-116 . ISBN 9781861897374– vía Google Libros.
- ↑ Delbourg-Delphis, Marylène (2024). Más allá del ¡Eureka!: Los difíciles caminos hacia la innovación . Georgetown University Press. pág. 168. ISBN 9781647124229– vía Google Libros.
- ↑ Guberman es el inventor de la tecnología de reconocimiento de escritura a mano que Microsoft utiliza actualmente en Windows CE. Fuente: Comunicación de In-Q-Tel, 3 de junio de 2003.
- ↑ SN Srihari y EJ Keubert, "Integración de la tecnología de interpretación de direcciones manuscritas en el sistema de lectura remota por computadora del Servicio Postal de los Estados Unidos", Actas de la Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (ICDAR) de 1997, IEEE-CS Press, págs. 892–896
- ↑ Entrevista de Kurzweil AI de 2012, archivada el 31 de agosto de 2018 en Wayback Machine , con Jürgen Schmidhuber sobre las ocho competiciones ganadas por su equipo de aprendizaje profundo entre 2009 y 2012.
- ↑ Graves, Alex; y Schmidhuber, Jürgen; Reconocimiento de escritura a mano fuera de línea con redes neuronales recurrentes multidimensionales , en Bengio, Yoshua; Schuurmans, Dale; Lafferty, John; Williams, Chris KI; y Culotta, Aron (eds.), Avances en sistemas de procesamiento de información neuronal 22 (NIPS'22), del 7 al 10 de diciembre de 2009, Vancouver, BC , Fundación de Sistemas de Procesamiento de Información Neuronal (NIPS), 2009, págs. 545-552
- ↑ A. Graves, M. Liwicki, S. Fernandez, R. Bertolami, H. Bunke, J. Schmidhuber . Un novedoso sistema conexionista para el reconocimiento mejorado de escritura a mano sin restricciones. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 31, n.º 5, 2009.
- ↑ DC Ciresan, U. Meier, J. Schmidhuber . Redes neuronales profundas de múltiples columnas para la clasificación de imágenes. Conferencia IEEE sobre visión por computadora y reconocimiento de patrones CVPR 2012.
- ↑ LeCun, Y. , Bottou, L., Bengio, Y., & Haffner, P. (1998). Aprendizaje basado en gradientes aplicado al reconocimiento de documentos. Proc. IEEE, 86, pp. 2278–2324.
- ↑ "Las redes dispersas acuden en ayuda de la física a gran escala" . Quanta Magazine . Junio de 2023. Consultado el 17 de junio de 2023 .
- ↑ Graham, Benjamin. "Redes neuronales convolucionales espacialmente dispersas." Preimpresión de arXiv arXiv:1409.6070 (2014).
Enlaces externos
- Bibliografía comentada de referencias sobre gestos y computación con lápiz óptico
- Notas sobre la historia de la informática con lápiz óptico – vídeo en YouTube
- Reconocimiento de escritura a mano
- Entrada de texto mediante dispositivo señalador
- tarea de aprendizaje automático
- Lingüística computacional