Presentamos el Robot de OCR para extraer texto fácilmente
«Una imagen vale más que mil palabras» es un dicho en muchos idiomas, y por una buena razón. Nuestra corteza visual es posiblemente la parte más poderosa del cerebro, y aprovecharla para transmitir significado es igual de poderoso. Con la introducción de nuestro Robot /image/describe, permitimos que los programadores desbloqueen la corteza visual de modelos de IA entrenados por destacados proveedores de nube. Hoy vamos un paso más allá: no solo reconocemos objetos en las imágenes, sino que también leemos cualquier palabra presente.
Supongamos que tienes una foto de una señal de tráfico o de un menú. Casi cualquier persona sería capaz de entender estos objetos, pero su significado siempre ha sido opaco para las máquinas, hasta la llegada de nuevos y potentes modelos de OCR que pueden leer, prácticamente, texto a partir de un conjunto de píxeles.
Te presentamos el Robot /image/ocr. El miembro más
reciente de nuestra familia de Robots de IA. Puede usar AWS o GCP en el backend, y
cada proveedor se puede intercambiar fácilmente mediante el parámetro provider. Esto significa
que, si un proveedor produce resultados desfavorables, puedes cambiar al otro sin más cambios de
configuración ni de precios. Siéntete libre de cambiar de proveedor según lo consideres oportuno.
Además, a medida que avanza el modelo de la API de IA de cada backend, nuestro servicio aprovechará
automáticamente las mejoras en el reconocimiento.

Extraer texto de imágenes
Para demostrar lo sencillo que es usar este nuevo Robot, recorreremos el Template que aparece a continuación:
{
"steps": {
":original": {
"robot": "/upload/handle"
},
"image-ocr": {
"use": ":original",
"robot": "/image/ocr",
"format": "text",
"provider": "aws"
},
"exported": {
"use": ["image-ocr", ":original"],
"robot": "/s3/store",
"credentials": "YOUR_AWS_CREDENTIALS"
}
}
}
Existen muchas opciones para enviar archivos a Transloadit, pero usaremos
el Robot /upload/handle en nuestro primer
Step, :original.
Nuestro reconocimiento de imágenes ocurre en el siguiente Step, image-ocr. Aquí pasamos
:original a nuestro Robot /image/ocr y especificamos su
parámetro format para que devuelva el resultado como un archivo de texto. Si esto no está habilitado, el Robot
generará JSON de forma predeterminada. Además, hemos especificado que queremos usar aws como
proveedor de IA en el backend. Como se indicó, escribir gcp aquí aprovecharía Google Cloud
Platform, sin cambios en la interfaz ni en la estructura de los datos devueltos. Solo los datos en sí
(es decir, el texto leído) pueden variar, ya que cada plataforma de IA se entrenó de forma
independiente y sigue evolucionando de forma igualmente independiente.
Después de que el texto se ha extraído y devuelto, exportamos los resultados a nuestro bucket de S3.
YOUR_AWS_CREDENTIALS hace referencia a la credencial de Template que puedes configurar en
la pestaña de credenciales de tu Transloadit Console.
Haz clic (aquí) para configurar tu propio bucket de Amazon S3, si aún no lo has hecho.
Pruebas
Ahora, probemos nuestro Template con la imagen que aparece a continuación:
Una vez que nuestra Assembly haya terminado el encoding, obtendremos el siguiente resultado:
Transloadit
Conclusión
Como puedes ver, la Assembly fue un éxito. Esperamos haber demostrado, en esta breve introducción, que extraer texto de una imagen no es difícil ni lleva mucho tiempo cuando usas nuestro Robot /image/ocr.
Es más, gracias a la componibilidad de Transloadit, todas nuestras 95 funciones tremendamente distintas se pueden encadenar para crear flujos de trabajo únicos para tu caso de uso. En otras palabras, el Step de OCR podría ser solo uno de los muchos engranajes que componen tu compleja maquinaria. Como se ha mostrado, basta con una receta JSON escrita de forma declarativa para configurarlo, lo que lo convierte en un método infalible y a prueba de balas para añadir un gran valor a tu negocio.
Como este Robot es miembro de nuestra familia de IA, solo está disponible para nuestros clientes de pago. Consulta nuestra página de precios para conocer los planes actuales y el volumen de encoding incluido.
