Automatización de flujos de trabajo

# Análisis automatizado de imágenes: flujos de trabajo observables

Convierte el análisis de imágenes en un flujo de trabajo asíncrono y repetible, en lugar de una solicitud que bloquee la aplicación.

Publicado el 11 de agosto de 2026

## Conclusiones clave

* Usa la señal menos compleja que sustente la decisión de manera confiable.
* Conserva las relaciones entre las fuentes y los resultados para poder repetir el análisis con un método más reciente.
* Establece plazos para el análisis de terceros y define el comportamiento ante fallos parciales.

El análisis automatizado de imágenes debe comenzar por la decisión que sustentará. Las dimensiones pueden dirigir un redimensionamiento, los rostros pueden influir en un recorte, el OCR puede permitir búsquedas y la moderación puede detener la publicación.

## En esta guía

1. [Comienza por la decisión, no por el modelo](#automated-image-analysis-section-1)
2. [Define un contrato de resultados legible por máquinas](#automated-image-analysis-section-2)
3. [Prepara las entradas sin destruir pruebas útiles](#automated-image-analysis-section-3)
4. [Selecciona la función de análisis adecuada](#automated-image-analysis-section-4)
5. [Orquesta el análisis de forma asíncrona](#automated-image-analysis-section-5)
6. [Evalúa la calidad semántica, no solo el éxito de la API](#automated-image-analysis-section-6)
7. [Controla la privacidad, la accesibilidad, el costo y las operaciones](#automated-image-analysis-section-7)

## Lo más importante

* No expongas a los usuarios finales los errores sin procesar del proveedor ni los resultados sensibles del modelo.

## Comienza por la decisión, no por el modelo

El análisis automatizado de imágenes convierte los píxeles y los metadatos técnicos en señales estructuradas que una aplicación puede utilizar. Se diferencia de la transformación de imágenes, que modifica los píxeles o la representación del archivo. Un cambio de tamaño produce una imagen nueva, mientras que las etiquetas de objetos, las coordenadas de rostros, el texto de OCR o las mediciones de calidad describen una imagen. Algunos flujos de trabajo usan el análisis para elegir una transformación posterior, pero los resultados deben permanecer separados conceptualmente.

Define la decisión antes de seleccionar un servicio. Una regla de enrutamiento puede necesitar solo las dimensiones y la transparencia; la búsqueda puede requerir etiquetas o texto; un recorte, coordenadas de rostros; y la moderación, puntuaciones específicas de la política. Usar la señal adecuada menos compleja reduce la latencia, el costo, la exposición de datos privados y los modos de fallo. También permite definir criterios de aceptación más claros que una solicitud general para comprender una imagen.

### Enrutamiento

Usa metadatos deterministas para seleccionar una rama, variante o destino.

### Enriquecimiento

Asocia etiquetas que permitan realizar búsquedas, texto detectado u otros datos estructurados al registro de un recurso.

### Asistencia

Sugiere un recorte, pie de imagen o categoría para que una persona lo confirme.

### Control

Detén la publicación o solicita una revisión cuando el análisis supere un umbral documentado de la política.

## Define un contrato de resultados legible por máquinas

Diseña el esquema de resultados de la aplicación independientemente de la respuesta de un proveedor. Incluye la versión y la suma de comprobación de la fuente, el tipo de tarea, el estado, el analizador y su versión, la hora de creación, la variante de entrada y la salida normalizada. Las coordenadas necesitan un origen explícito, unidades, el ancho y el alto de la imagen, y la indicación de si se aplicó la orientación. El texto necesita el idioma y la ubicación en la página o región. Las etiquetas necesitan un nivel de confianza y un vocabulario interno estable.

Representa explícitamente los estados en cola, en ejecución, parcialmente completado, completado, fallido, con tiempo de espera agotado y sustituido. El éxito parcial puede ser útil cuando finalizan tareas independientes, pero los sistemas consumidores deben saber qué campos faltan y por qué. Evita colocar todos los resultados en una única descripción en prosa que no pueda consultarse ni validarse. Valida las respuestas externas en el límite y almacena los detalles saneados de los fallos por separado de los mensajes dirigidos a los usuarios.

Aplica control de versiones al contrato y a la capa de asignación. Los modelos de los proveedores y las estructuras de sus respuestas pueden cambiar incluso si la llamada a la API continúa realizándose correctamente. Conservar la referencia sin procesar del proveedor, el resultado normalizado, la información del modelo cuando esté disponible y la versión de la asignación permite que los equipos comparen el comportamiento anterior y el nuevo, o repitan el análisis sin sobrescribir el historial.

## Prepara las entradas sin destruir pruebas útiles

Inspecciona el formato real del original, sus dimensiones, los metadatos de orientación, la cantidad de fotogramas, las características de color y el tamaño. Aplica la orientación de forma coherente antes de las tareas basadas en coordenadas y registra las dimensiones de la variante de entrada exacta enviada para su análisis. Un cuadro calculado sobre una copia reducida y rotada no puede aplicarse de forma segura al original a menos que se conozca la transformación de coordenadas.

La normalización puede reducir el tiempo de transferencia y hacer más coherente el comportamiento del modelo, pero una reducción de escala excesiva puede borrar texto pequeño, rostros lejanos, productos pequeños o indicios de manipulación. Elige límites específicos para cada tarea en lugar de una única miniatura universal. Conserva la fuente sin cambios y crea un derivado de análisis con nombre cuando se requiera compresión, rasterización o conversión de formato.

Rechaza cuanto antes las entradas dañadas o no compatibles. Limita las dimensiones decodificadas y la cantidad de páginas, además de los bytes comprimidos, porque los archivos compactos pueden expandirse y generar cargas de trabajo costosas. Elimina o restringe los metadatos innecesarios antes de enviar archivos a modelos externos cuando la privacidad lo requiera, pero conserva el original con acceso controlado si importan la procedencia o el reprocesamiento posterior.

## Selecciona la función de análisis adecuada

Los metadatos técnicos deben responder de forma confiable las preguntas que puedan resolver antes de incorporar la IA. El ancho, el alto, la duración, la cantidad de páginas, el tipo MIME y la transparencia pueden impulsar muchas decisiones de enrutamiento. El OCR extrae texto visible, pero no establece que ese texto sea verdadero. La detección de rostros localiza posibles rostros, pero no identifica a una persona. Las etiquetas de objetos describen contenido probable, pero por sí solas no determinan la moderación ni la calidad de la accesibilidad.

Para las tareas compatibles, las Assemblies de Transloadit pueden coordinar `/image/describe`, `/image/facedetect`, `/image/ocr` y `/document/ocr`. `/image/describe` puede devolver etiquetas con toda la información de confianza o como una lista, y puede solicitar descripciones explícitas compatibles con el proveedor. `/image/facedetect` puede adjuntar las coordenadas de los rostros a los metadatos del archivo cuando el recorte está desactivado, o generar los recortes de rostros seleccionados cuando está activado. `/image/ocr` reconoce texto en imágenes, mientras que `/document/ocr` reconoce texto en archivos PDF, por lo que otros formatos de documento primero requieren una conversión con `/document/convert`.

Usa `/ai/chat` o un servicio externo especializado solo cuando su comportamiento admitido de entrada y salida se ajuste a la tarea. Dado que `/ai/chat` es un Robot en etapa inicial y se aplica un recargo de facturación al uso del proveedor mediante sus claves, confirma su estado y precios actuales antes de crear una dependencia de producción basada en él. La clasificación, los embeddings, la identificación, el OCR especializado o la detección específica del dominio pueden requerir otro proveedor. Transloadit puede preparar entradas acotadas y orquestar los Robots disponibles, pero la aplicación debe agregar todos los resultados en su propio registro de análisis persistente.

### Extracción de metadatos

Dale preferencia para propiedades deterministas de archivos y enrutamiento con bajo costo de procesamiento.

### Robot especializado

Usa un Robot de análisis documentado cuando su contrato abarque la tarea y los medios compatibles.

### Modelo externo

Usa un proveedor especializado cuando la tarea o el nivel de calidad requeridos queden fuera de las capacidades de los Robots disponibles.

### Verificación humana

Exige una revisión cuando las pruebas no sean suficientes para evaluar el contexto, los derechos, la identidad, la seguridad o una decisión de gran impacto.

## Orquesta el análisis de forma asíncrona

Las subidas grandes, los archivos PDF, los lotes y los modelos de terceros no deben mantener abierta una solicitud de la aplicación. Crea un registro de análisis, pon en cola o inicia la ejecución del procesamiento y devuelve una referencia de estado estable. Una Assembly de Transloadit puede ramificar Steps independientes a partir de una entrada preparada, mientras que las dependencias garantizan que una tarea espere la normalización requerida. La aplicación puede recibir una notificación firmada cuando finalice la Assembly.

Verifica las firmas de las notificaciones y asocia el ID de la Assembly con el origen esperado antes de aplicar los resultados. Gestiona de forma idempotente los eventos duplicados y reordenados. Si los analizadores externos se ejecutan por separado, usa un ID de correlación para cada tarea y permite que un único agregador decida cuándo se ha completado el trabajo requerido. No permitas que el primer callback exitoso marque como completo todo el registro.

Establece plazos y reintentos limitados para cada analizador. Una tarea no esencial de etiquetado puede agotar su tiempo de espera, mientras que una tarea de OCR obligatoria puede hacer que falle todo el flujo de trabajo o que permanezca pendiente. Incluye esa distinción en el esquema. Una ruta de mensajes no procesables necesita un responsable y un procedimiento seguro para volver a procesarlos, especialmente cuando hacerlo invocaría modelos de pago o sobrescribiría análisis más recientes.

## Evalúa la calidad semántica, no solo el éxito de la API

Una respuesta válida solo demuestra que el servicio terminó. Crea conjuntos de prueba revisados que reflejen los tipos reales de imágenes, la iluminación, la resolución, los idiomas, los diseños de documentos y los casos límite. Define medidas específicas para cada tarea, como campos de texto omitidos, superposición de coordenadas, aceptación de búsquedas, detecciones falsas de rostros o tasas de corrección por parte de revisores. La exactitud general puede ocultar un rendimiento deficiente para un grupo de entradas pequeño pero importante.

Haz que las aserciones sobre la IA de terceros toleren el no determinismo. Prueba la validez del esquema, los campos obligatorios, los límites de las coordenadas, la lógica de asignación y el comportamiento de las políticas con datos de prueba registrados. Evalúa los resultados semánticos exactos mediante muestras periódicas revisadas o comparaciones controladas de modelos. Cuando cambies la normalización, el proveedor, el prompt o los umbrales, ejecuta las versiones anterior y nueva en paralelo antes de reemplazar los resultados de producción.

Supervisa las distribuciones de resultados y los efectos en los procesos posteriores. Una caída repentina en las etiquetas, un cambio en el idioma del OCR, un aumento de los resultados vacíos o un incremento de las correcciones manuales pueden indicar deriva aunque las tasas de error se mantengan estables. Cuando se realice un nuevo análisis, conserva los resultados anteriores como registros reemplazados para que los sistemas consumidores puedan migrar de forma deliberada y las auditorías puedan explicar qué versión sirvió de base para una decisión anterior.

## Controla la privacidad, la accesibilidad, el costo y las operaciones

Las imágenes pueden revelar rostros, direcciones, documentos, información de salud o metadatos de ubicación. Envía solo las entradas necesarias a cada analizador, usa credenciales con permisos restringidos y transporte cifrado, restringe el acceso a los resultados y establece períodos de retención para los datos del proveedor y los derivados del análisis. Evita registrar texto de OCR, cargas útiles de imágenes, URL firmadas o respuestas sin procesar de los modelos. Sanea los errores externos antes de mostrárselos a los usuarios.

El análisis puede favorecer la accesibilidad, pero las etiquetas generadas no son automáticamente adecuadas como texto alternativo. Un buen texto alternativo depende del propósito de la imagen y del contenido que la rodea, mientras que las imágenes decorativas suelen requerir una alternativa vacía. Trata las descripciones generadas como borradores que deben someterse a una revisión adecuada y no infieras rasgos personales sensibles a partir de la detección de rostros ni de las etiquetas de objetos.

Registra la latencia, la antigüedad de la cola, los fallos, los reintentos, los bytes procesados, las invocaciones de modelos y la aceptación posterior por tarea y versión del flujo de trabajo. El procesamiento por lotes puede mejorar el rendimiento, pero retrasa el primer resultado y complica los fallos parciales. Aplica límites de concurrencia y contrapresión durante los picos. Las previsiones de costos deben incluir la normalización, el almacenamiento, los reintentos, los nuevos análisis tras cambios en los modelos y la validación humana, no solo la llamada de inferencia anunciada.

## Detalles técnicos que conviene conocer

* El análisis debe ser asíncrono para subidas grandes y lotes, con estados que distingan entre resultados en cola, en ejecución, parcialmente completos, fallidos y reemplazados.
* Los resultados estructurados son más fáciles de consultar cuando las unidades, los espacios de coordenadas, la confianza, el idioma y la versión del modelo son explícitos en lugar de estar integrados en el texto.
* La observabilidad debe medir la latencia y los fallos por modelo, tipo y tamaño de entrada, además de señales sobre la calidad de los resultados, como los cambios realizados durante la revisión y la aceptación posterior.
* El procesamiento por lotes puede mejorar el rendimiento del modelo, pero aumenta el tiempo de espera del primer elemento y complica los fallos parciales, por lo que el tamaño del lote supone un equilibrio entre latencia y rendimiento.
* La normalización de las entradas no debe borrar las pruebas que necesita la tarea; una reducción excesiva de la resolución puede eliminar texto, objetos pequeños o artefactos de manipulación.
* El monitoreo de la calidad requiere muestras revisadas y resultados posteriores, porque una respuesta de la API técnicamente exitosa no aporta información sobre la corrección semántica.

## Un enfoque práctico

1. 1\
   Define el esquema de salida y la decisión antes de seleccionar Robots o modelos.
2. 2\
   Prepara las entradas una sola vez y ramifica los pasos de análisis independientes donde resulte útil.
3. 3\
   Agrega los resultados en la aplicación dentro de un único registro de análisis con control de versiones.
4. 4\
   Supervisa la exactitud, el tiempo de ejecución, los grupos de fallos y el costo del proveedor.

Un flujo de trabajo multimedia de cuatro etapas

## Cuándo resulta útil Transloadit

Las Assemblies pueden inspeccionar metadatos, etiquetar imágenes con /image/describe, detectar rostros con /image/facedetect, extraer texto con /image/ocr y preparar entradas acotadas para /ai/chat o modelos externos. Ten en cuenta que /ai/chat aún se encuentra en una etapa inicial, por lo que debes verificar su estado y sus precios actuales antes de convertirlo en una dependencia de producción. El código de la aplicación debe combinar los resultados en un único registro persistente de análisis.

## Límite de la arquitectura

Transloadit ofrece determinadas funciones de análisis y orquestación de imágenes, no todas las tareas de visión artificial. Usa un servicio especializado cuando un Robot no ofrezca la clasificación, el OCR, el embedding o la detección requeridos.

## Preguntas frecuentes

### ¿Cuál es la diferencia entre el análisis y la transformación de imágenes?

El análisis de imágenes genera información sobre una imagen, como sus dimensiones, etiquetas, texto detectado o coordenadas. La transformación de imágenes modifica la imagen o su codificación, por ejemplo, al cambiar su tamaño, recortarla o convertir su formato. El análisis puede seleccionar parámetros de transformación, pero los datos resultantes y el derivado deben registrarse por separado.

### ¿El análisis de imágenes debe ejecutarse durante la subida o bajo demanda?

Ejecuta el análisis durante la recepción cuando cada recurso necesite el resultado antes del enrutamiento, la revisión o la publicación. Usa el análisis bajo demanda o en segundo plano para el enriquecimiento opcional, las costosas tareas especializadas, el procesamiento del catálogo histórico o las actualizaciones de modelos. En ambos casos, identifica la versión exacta de la fuente y almacena un estado asíncrono.

### ¿La detección de rostros puede identificar a una persona?

No. La detección de rostros localiza regiones que probablemente contengan rostros y puede devolver la confianza o recortes. Identificar o verificar a una persona es una tarea diferente y de mayor riesgo, con consideraciones adicionales sobre exactitud, consentimiento, privacidad y aspectos legales.

### ¿Cómo deben aplicarse a la imagen original las coordenadas obtenidas de una imagen redimensionada para el análisis?

Registra el ancho, la altura, la orientación, el recorte y la escala de la imagen analizada. Convierte las coordenadas mediante esa transformación conocida antes de aplicarlas a la imagen de origen. Si el preprocesamiento cambió la relación de aspecto o eliminó regiones sin una asignación reversible, las coordenadas no podrán transferirse de forma confiable.

### ¿Cómo puede una aplicación gestionar resultados cambiantes de la IA?

Almacena los resultados junto con el analizador, la información del modelo cuando esté disponible, la variante de entrada, la versión de la asignación y la marca de tiempo. Añade los resultados nuevos como una versión y marca los anteriores como reemplazados, en lugar de sobrescribirlos. Prueba los contratos estructurales de forma determinista y evalúa los cambios semánticos con muestras representativas revisadas.

## Crea el flujo de trabajo

Pasa del concepto a una Assembly probada con documentación de Robots y demos funcionales.

### Robots relevantes

* [/image/describe](/es/docs/robots/image-describe.md)
* [/image/facedetect](/es/docs/robots/image-facedetect.md)
* [/image/ocr](/es/docs/robots/image-ocr.md)
* [/ai/chat EN (English)](/docs/robots/ai-chat.md)
* [Lee la documentación de la API](/es/docs.md)
* [Explora demos funcionales EN (English)](/demos.md)
* [Crea un Workspace gratuito](/c/signup/)

Automatización de flujos de trabajo

## Continúa con guías relacionadas

* [Guía completa de flujos de trabajo de recursos digitales](/es/guides/digital-asset-workflows.md)\
  Diseña un flujo de trabajo de recursos digitales desde la recepción y el procesamiento hasta la revisión, publicación, retención y eliminación.
* [Moderación de contenido con IA en un flujo de trabajo de subidas](/es/guides/ai-content-moderation-workflows.md)\
  Integra la moderación con IA en un flujo de trabajo controlado de subidas, con umbrales de confianza y revisión humana.
* [Moderación automatizada de contenido: diseño y gestión de fallos](/es/guides/automated-content-moderation.md)\
  Crea una moderación automatizada por capas con comprobaciones de archivos, clasificadores, decisiones de política y colas de revisión.
* [Automatización de medios: de la subida a resultados confiables](/es/guides/media-automation.md)\
  Automatiza la recepción, transformación, validación y exportación repetibles de medios, a la vez que preservas la observabilidad y el control.
* [Cómo convertir HTML a PDF a gran escala](/es/guides/convert-html-to-pdf.md)\
  Genera facturas, informes y recibos en PDF desde una URL o un HTML subido, y permite obtener el mismo resultado de forma reproducible.
