IA y medios generados

# Análisis de imágenes con IA: tareas, arquitectura y salvaguardas

Comprende clasificación, detección, OCR, generación de descripciones, embeddings y moderación como tareas diferentes dentro del análisis de imágenes.

Publicado el 11 de agosto de 2026

## Conclusiones clave

* Elige una tarea y un contrato de salida antes de elegir un modelo.
* El preprocesamiento puede mejorar la consistencia, pero también puede eliminar texto pequeño o detalles que el modelo necesita.
* Evalúa los falsos positivos y los falsos negativos según su impacto en el producto.

«Analiza esta imagen» oculta varios problemas distintos. Un clasificador elige etiquetas, un detector localiza regiones, el OCR extrae texto, un generador de descripciones describe el contenido y un embedding representa la similitud.

## En esta guía

1. [Empieza por el contrato de salida, no por el modelo](#ai-image-analysis-section-1)
2. [Asocia la tarea con un Robot específico de Transloadit](#ai-image-analysis-section-2)
3. [Prepara las entradas sin destruir las evidencias](#ai-image-analysis-section-3)
4. [Interpreta las puntuaciones y establece umbrales de manera responsable](#ai-image-analysis-section-4)
5. [Maneja con cuidado los resultados de OCR, embeddings y modelos multimodales](#ai-image-analysis-section-5)
6. [Diseña salvaguardas para las personas y las decisiones sensibles](#ai-image-analysis-section-6)
7. [Crea pruebas específicas para cada tarea](#ai-image-analysis-section-7)
8. [Ejecuta el análisis como un servicio asíncrono con control de versiones](#ai-image-analysis-section-8)

## Lo más importante

* Registra las versiones del modelo y del prompt para poder reproducir y migrar los resultados.
* Aplica revisión humana y mecanismos de apelación para la moderación o las decisiones que afecten a personas.

## Empieza por el contrato de salida, no por el modelo

El análisis de imágenes con IA abarca una familia de tareas que producen distintos tipos de resultados. La clasificación asigna etiquetas a una imagen completa. La detección localiza objetos mediante recuadros o regiones. La segmentación etiqueta píxeles. El OCR extrae texto, la generación de descripciones produce lenguaje y los embeddings codifican la similitud como vectores numéricos. Un campo genérico `analysis` oculta estas diferencias importantes y dificulta validar el comportamiento posterior.

Define primero la pregunta de negocio y el esquema de salida. Especifica si se permiten varias respuestas, cómo se representan las ubicaciones, qué idiomas son relevantes, qué significa la incertidumbre y cuándo se requiere una revisión. Un etiquetador de catálogos, un lector de documentos, un asistente de recorte y un filtro de seguridad pueden inspeccionar la misma imagen, pero cada uno necesita datos, umbrales, conjuntos de evaluación y manejo de errores diferentes.

### Clasificación

Devuelve una o más etiquetas para la imagen en su conjunto sin indicar su ubicación.

### Detección y segmentación

Localizan contenido mediante geometría que permanece vinculada a una variante de entrada específica.

### OCR y generación de descripciones

Producen texto, pero el OCR transcribe caracteres visibles, mientras que la generación de descripciones resume el contenido visual.

### Embeddings vectoriales

Representan la similitud dentro del espacio de un modelo compatible, en lugar de explicar una imagen con palabras.

## Asocia la tarea con un Robot específico de Transloadit

Usa `/image/describe` cuando las etiquetas de objetos en inglés o las categorías admitidas de contenido explícito cumplan el requisito. Puede devolver una lista de etiquetas o una salida más completa que incluya niveles de confianza. Usa `/image/facedetect` cuando se requieran regiones faciales o recortes de rostros. La detección facial encuentra regiones que parecen rostros; no determina la identidad y no debe presentarse como identificación biométrica.

Usa `/image/ocr` para extraer texto de imágenes y `/document/ocr` para extraer texto de archivos PDF. Ambos pueden devolver JSON, metadatos o texto sin formato, con resultados más completos que incluyen coordenadas cuando se solicitan. Convierte otros formatos de documento a PDF con `/document/convert` antes de ejecutar `/document/ocr`. Usa un modelo `/ai/chat` con capacidad para procesar imágenes para preguntas contextuales, guiadas por esquemas, que los Robots especializados no cubren. Es un Robot en fase inicial, y las solicitudes que usan claves del proveedor se facturan con un recargo, así que revisa su estado actual y sus precios antes de usarlo en producción. Sus respuestas siguen siendo probabilísticas y requieren una evaluación específica para cada tarea.

## Prepara las entradas sin destruir las evidencias

Crea un derivado de análisis determinista con el tipo de medio validado, la orientación corregida, dimensiones limitadas y un encoding compatible. Esto reduce la variabilidad, la transferencia y el costo. Registra su suma de comprobación, ancho, alto, recorte, rotación y relación con el archivo de origen. Conserva el archivo de origen para que, más adelante, modelos mejorados o cambios en las políticas puedan producir un resultado nuevo.

Toda transformación implica una compensación. Reducir la escala puede borrar texto pequeño, detalles relevantes para la seguridad u objetos distantes. El recorte puede eliminar contexto. Los artefactos de compresión pueden parecer bordes o caracteres. Si se devuelven coordenadas o máscaras, pertenecen al derivado exacto que se analizó. Después, rota, recorta o cambia el tamaño solo si la aplicación también transforma esa geometría al nuevo sistema de coordenadas.

### Origen de coordenadas

Documenta dónde se originan x e y, y si los valores son píxeles o fracciones normalizadas.

### Identidad de la variante

Almacena la suma de comprobación y las dimensiones de la imagen utilizada para la inferencia junto con cada resultado geométrico.

### Historial de transformaciones

Conserva la información de recorte, rotación y escala necesaria para trasladar los resultados a otra variante.

## Interpreta las puntuaciones y establece umbrales de manera responsable

La puntuación de confianza de un modelo no es una probabilidad universal de que una etiqueta sea verdadera. Las puntuaciones pueden calibrarse de forma diferente según los modelos, las clases, los idiomas y los segmentos de imagen. Elige los umbrales mediante datos etiquetados representativos y, luego, evalúa la precisión, la exhaustividad y el costo de los errores para cada categoría importante. Revisa de nuevo los umbrales después de cambiar un modelo, proveedor, paso de preprocesamiento o población de entrada.

Los falsos positivos y los falsos negativos rara vez tienen el mismo impacto. Un falso rechazo por motivos de seguridad puede bloquear a usuarios legítimos, mientras que no detectar una imagen insegura puede exponer a quienes la vean. Usa umbrales y colas de revisión independientes cuando la política lo permita. Conserva el resultado sin procesar del modelo y la decisión basada en la política como registros distintos, de modo que un cambio posterior en la política no exija fingir que la inferencia original fue diferente.

## Maneja con cuidado los resultados de OCR, embeddings y modelos multimodales

La calidad del OCR varía según el sistema de escritura, el idioma, la resolución, la perspectiva, la iluminación, el diseño y la tipografía. Las frases extraídas como texto sin formato pueden bastar para las búsquedas, mientras que las facturas y los formularios suelen requerir coordenadas, números de página, orden de lectura y validación específica del dominio. Nunca supongas que una fecha, un total o un número de cuenta plausibles son correctos. Valida los formatos y deriva los campos con consecuencias importantes para que una persona los confirme.

Los embeddings son útiles para la búsqueda de vecinos más cercanos, la detección de duplicados y el agrupamiento, pero la distancia solo tiene significado dentro de un espacio compatible de modelo y preprocesamiento. Guarda la versión del modelo de embeddings junto con el vector y reconstruye o separa los índices cuando cambien los modelos. Un modelo de lenguaje multimodal puede explicar o combinar observaciones, pero su respuesta fluida no debe sustituir los datos subyacentes de OCR, las etiquetas, la geometría ni la procedencia.

## Diseña salvaguardas para las personas y las decisiones sensibles

Detectar un rostro es sustancialmente distinto de identificar a una persona. La comparación de identidades introduce cuestiones biométricas, de consentimiento, seguridad y legales que la detección ordinaria de regiones faciales no resuelve. Minimiza la recopilación, protege los resultados con controles de acceso estrictos, establece periodos de retención y proporciona avisos y mecanismos de revisión cuando sea obligatorio. No infieras rasgos protegidos, condiciones de salud, intenciones ni conductas delictivas a partir de la apariencia.

La moderación y otras decisiones que afecten a los usuarios necesitan una política documentada, revisión humana para los casos ambiguos o con consecuencias importantes y una vía de apelación. Evita que una única respuesta del modelo suspenda automáticamente una cuenta o denuncie a una persona. Quienes revisen los casos deben ver las pruebas adecuadas sin recibir datos privados innecesarios, y el sistema debe registrar qué resultado del modelo y qué versión de la política respaldaron la decisión.

### Minimización de datos

Analiza y conserva únicamente la información necesaria para el propósito declarado.

### Separación de funciones

Mantén la inferencia, la evaluación de la política y la acción humana final como etapas distintas.

### Apelaciones

Permite que los usuarios afectados impugnen las decisiones automatizadas o asistidas importantes.

## Crea pruebas específicas para cada tarea

Crea un conjunto de evaluación etiquetado que se asemeje al entorno de producción e incluya fallos poco frecuentes pero costosos. Segméntalo por dispositivo, iluminación, idioma, tipo de imagen, categoría de contenido y cualquier población en la que el rendimiento pueda diferir. Para la detección, evalúa tanto la localización como la precisión de clase. Para OCR, evalúa la precisión de caracteres y la corrección a nivel de campo. Para la recuperación, evalúa si los elementos relevantes aparecen en posiciones útiles del ranking.

Los sistemas probabilísticos no deben probarse únicamente con cadenas esperadas exactas. Valida los esquemas, las etiquetas permitidas, los límites de las coordenadas, las inferencias prohibidas y las métricas de las tareas. Mantén un conjunto fijo de regresión junto con una muestra que se actualice periódicamente y detecte la deriva. Cuando sea posible, pide a los revisores que etiqueten sin ver las respuestas del modelo, registra los desacuerdos y vuelve a ejecutar el conjunto de pruebas antes de cambiar de proveedor, modelo, prompt, umbral o preprocesamiento.

## Ejecuta el análisis como un servicio asíncrono con control de versiones

Almacena el ID de origen, el derivado del análisis, el tipo de tarea, el Robot, el proveedor, el modelo o la configuración, la versión del prompt, la versión de la política, las marcas de tiempo, el resultado sin procesar, el resultado normalizado y el estado de revisión. Usa como clave de caché la suma de comprobación del origen y la configuración completa del análisis. Una solicitud con la misma clave puede reutilizar un resultado, mientras que un modelo o una política nuevos generan una versión independiente en lugar de reescribir silenciosamente el historial.

Ejecuta la inferencia con colas, plazos, reintentos limitados y alternativas explícitas. Supervisa la latencia, la antigüedad de la cola, los fallos de esquema, los errores del proveedor, las correcciones de quienes revisan los resultados, los resultados de los umbrales y el costo por tarea y segmento de contenido. Protege las URL de origen y las credenciales en los registros. Si un proveedor no está disponible, decide con antelación si se debe retrasar el procesamiento, usar una alternativa validada, devolver un estado desconocido o exigir una revisión manual.

### Controles de costos

Limita la resolución de entrada, procesa por lotes las tareas adecuadas, almacena en caché los resultados estables y reserva el análisis multimodal amplio para los casos que lo requieran.

### Accesibilidad

No reutilices automáticamente etiquetas genéricas como texto alternativo; las descripciones de accesibilidad requieren el contexto de la página y reglas de redacción.

### Reprocesamiento

Vuelve a procesar selectivamente los recursos según las versiones almacenadas del modelo y de la política cuando cambie el sistema.

## Detalles técnicos que conviene conocer

* La clasificación, la detección de objetos, la segmentación, el OCR, la detección de rostros y la generación de embeddings producen estructuras de datos diferentes y no deberían ocultarse tras un único campo genérico de análisis.
* Una puntuación de confianza es específica del modelo, no una probabilidad universal. Los umbrales deberían calibrarse con datos representativos y revisarse cuando cambien el modelo o la combinación de entradas.
* Los resultados del análisis necesitan control de versiones de los modelos y las políticas para que los equipos puedan explicar por qué cambiaron los metadatos y volver a procesar selectivamente los recursos cuando esté disponible un modelo mejor.
* La precisión del OCR varía según el idioma, el sistema de escritura, la resolución, la perspectiva, la iluminación y la tipografía. Para muchos usos, el texto extraído necesita información sobre el orden de lectura y las coordenadas.
* Los embeddings permiten la búsqueda por similitud y la recuperación, pero no ofrecen una explicación legible para las personas, y las distancias solo tienen significado dentro del espacio de un modelo compatible.
* La identificación biométrica y la detección ordinaria de rostros son capacidades sustancialmente diferentes, con distintas implicaciones para la privacidad, el consentimiento, la seguridad y el ámbito legal.

## Un enfoque práctico

1. 1\
   Recopila un conjunto etiquetado representativo y define métricas de aceptación por segmento.
2. 2\
   Crea derivados de entrada deterministas y conserva las relaciones con las fuentes.
3. 3\
   Ejecuta la inferencia de forma asíncrona con plazos límite, reintentos y almacenamiento idempotente de resultados.
4. 4\
   Supervisa la deriva, las correcciones, la latencia y el costo después del lanzamiento.

Un flujo de trabajo multimedia de cuatro etapas

## Cuándo resulta útil Transloadit

Usa /image/describe para etiquetas o categorías de contenido explícito, /image/facedetect para regiones faciales y /image/ocr cuando la tarea sea extraer texto de imágenes. Los modelos /ai/chat con capacidad para imágenes pueden procesar prompts más contextuales, aunque /ai/chat es un Robot en fase inicial, así que confirma su estado actual y sus precios antes de utilizarlo en producción. Conserva la procedencia del proveedor, el modelo y la revisión en los metadatos de la aplicación.

## Límite de la arquitectura

El análisis con IA es probabilístico y específico para cada tarea. Transloadit no convierte la respuesta de un modelo general en una decisión empresarial correcta de forma automática, y las acciones sensibles requieren políticas y revisión.

## Preguntas frecuentes

### ¿Cuál es la diferencia entre clasificación y detección?

La clasificación asigna etiquetas a una imagen en su conjunto. La detección también devuelve ubicaciones, generalmente recuadros o regiones, para instancias individuales.

### ¿`/image/facedetect` identifica a una persona?

No. Detecta regiones faciales y puede devolver coordenadas o recortes. El reconocimiento de identidad es una capacidad biométrica diferente, con requisitos adicionales de precisión, consentimiento, seguridad y cumplimiento legal.

### ¿Puedo comparar embeddings de modelos diferentes?

No de manera confiable. Las dimensiones de los vectores y la geometría de las distancias son específicas de cada modelo. Guarda las versiones de los modelos junto con los vectores y usa índices compatibles o una migración controlada.

### ¿Cómo debo seleccionar un umbral de confianza?

Calíbralo con datos etiquetados representativos y considera el costo de los falsos positivos y los falsos negativos. Vuelve a evaluarlo cuando cambien el modelo, el preprocesamiento, la política o la combinación de entradas.

### ¿Un error de análisis debe bloquear una subida?

Solo si la política del producto realmente exige un resultado satisfactorio antes de aceptar la subida. De lo contrario, conserva la subida, marca el análisis como pendiente o desconocido, y vuelve a intentarlo o envíalo a revisión sin inventar un resultado seguro.

## Crea el flujo de trabajo

Pasa del concepto a una Assembly probada con la documentación de Robots y Demos funcionales.

### Robots relevantes

* [/image/describe](/es/docs/robots/image-describe.md)
* [/image/facedetect](/es/docs/robots/image-facedetect.md)
* [/image/ocr](/es/docs/robots/image-ocr.md)
* [/ai/chat EN (English)](/docs/robots/ai-chat.md)
* [Lee la documentación de la API](/es/docs.md)
* [Explora Demos funcionales EN (English)](/demos.md)
* [Crea un Workspace gratuito](/c/signup/)

IA y medios generados

## Continúa con guías relacionadas

* [Flujo de revisión para metadatos de imagen asistidos por IA](/es/guides/ai-for-media-seo.md)\
  Usa la IA para el SEO multimedia donde realmente ayude: inventario, sugerencias de metadatos, borradores accesibles y optimización medible de recursos.
* [Generación de imágenes de producto con IA y salvaguardas por SKU](/es/guides/ai-product-image-generation.md)\
  Genera imágenes de productos sin inventar características, colores, empaques ni afirmaciones que los clientes confundan con el artículo real.
* [Reemplazo de imágenes con IA: máscaras, inpainting y revisión](/es/guides/ai-image-replacement.md)\
  Reemplaza regiones de imágenes con IA y mantén visibles las máscaras de selección, la fuente de referencia, la continuidad visual y la revisión editorial.
* [IA generativa en el comercio electrónico: cinco ejemplos prácticos](/es/guides/generative-ai-in-ecommerce.md)\
  Usa IA generativa en cinco tareas de comercio electrónico y protege datos verificados del catálogo, requisitos del canal, aprobaciones y entregas deterministas.
* [Analítica de video basada en IA: señales, métricas y arquitectura](/es/guides/ai-video-analytics.md)\
  Diseña analítica de video con IA: separa señales de contenido, telemetría de reproducción, eventos de negocio, evaluación y evidencia sincronizada en el tiempo.
