IA y medios generados

# Detección de objetos con IA: recuadros, umbrales, evaluación real

Elige deliberadamente la detección de objetos, interpreta bien los recuadros y umbrales, y evalúa los errores relevantes para la aplicación.

Publicado el 13 de agosto de 2026

## Conclusiones clave

* La detección de objetos predice clases y ubicaciones; no demuestra que un objeto no detectado esté ausente.
* Guarda la convención de coordenadas y la transformación de preprocesamiento para que cada recuadro se corresponda correctamente con los píxeles de origen.
* Ajusta e informa los umbrales por clase y costo del error, en lugar de ocultarlos tras un único límite de confianza.

La detección de objetos permite consultar imágenes por clase y posición, pero la fiabilidad en producción depende de los umbrales, el manejo de coordenadas y el costo de una omisión. Un recuadro que parece correcto en una demostración puede resultar inutilizable para la automatización.

## En esta guía

1. [Distingue los recuadros de las etiquetas y las máscaras de píxeles](#ai-object-detection-section-1)
2. [Conserva las coordenadas en cada transformación de imagen](#ai-object-detection-section-2)
3. [Calibra los detectores para las clases y acciones requeridas](#ai-object-detection-section-3)
4. [Guarda los recuadros sin procesar antes de normalizarlos para la aplicación](#ai-object-detection-section-4)
5. [Mide la precisión, el recall y la superposición por clase](#ai-object-detection-section-5)
6. [Trata la falta de un recuadro como incertidumbre, no como ausencia](#ai-object-detection-section-6)
7. [Versiona los umbrales de clase y las correcciones de revisión](#ai-object-detection-section-7)

## Distingue los recuadros de las etiquetas y las máscaras de píxeles

La detección de objetos devuelve observaciones de clases asociadas a regiones, generalmente rectángulos. La clasificación etiqueta una imagen completa, mientras que la segmentación proporciona regiones a nivel de píxel. Elige la detección solo cuando el producto necesite ubicaciones aproximadas o recuentos y un recuadro sea lo bastante preciso para la decisión posterior.

Define la lista de clases, si las instancias superpuestas se consideran independientes, cómo se cuentan los objetos parcialmente visibles y qué significa un resultado vacío. Es posible que un modelo entrenado con etiquetas generales no distinga las variantes de productos ni los objetos específicos del dominio que una aplicación necesita, aunque su demo parezca visualmente eficaz.

## Conserva las coordenadas en cada transformación de imagen

Registra con cada recuadro la convención de coordenadas, el ancho y la altura de origen, la orientación y el derivado de entrada exacto. La rotación, el recorte, el relleno y el cambio de tamaño modifican la geometría. Transforma las esquinas en cada operación o muestra los recuadros únicamente sobre la imagen en la que realmente se ejecutó la detección.

Usa coordenadas normalizadas cuando simplifiquen la visualización entre distintos tamaños, pero conserva la identidad de la fuente y las reglas de redondeo. Valida que el valor izquierdo sea menor que el derecho, que el superior sea menor que el inferior, que los valores permanezcan dentro de los límites y que los recuadros tengan un área significativa. Rechaza la geometría incorrecta antes de que llegue a una herramienta de recorte o una interfaz.

## Calibra los detectores para las clases y acciones requeridas

Compara los modelos con un conjunto etiquetado representativo que use la misma asignación de clases y política de supresión de no máximos. Revisa las condiciones del proveedor, las regiones compatibles, los límites de entrada, la latencia y el ciclo de vida del modelo. Los umbrales corresponden a clases individuales y acciones del producto, no a una configuración universal de confianza.

Una sugerencia de búsqueda interna de bajo riesgo puede tolerar más recuadros falsos que el recorte automatizado o el recuento de inventario. Elige los umbrales según los equilibrios entre precisión y recall y el costo de los errores posteriores; reserva para revisión los casos inciertos o con consecuencias importantes. Las puntuaciones del modelo son señales de ranking, no probabilidades transferibles.

## Guarda los recuadros sin procesar antes de normalizarlos para la aplicación

Transloadit no ofrece un Robot general de detección de objetos. Usa un especialista evaluado para obtener los recuadros y Transloadit para preparar imágenes con límites definidos, crear derivados deterministas y exportar resultados revisados. Mantén la inferencia del proveedor y las transformaciones multimedia como etapas separadas con reintentos independientes.

Conserva los siguientes datos sin procesar antes de asignarlos a las clases de la aplicación: clase, puntuación, recuadro, proveedor, modelo, suma de comprobación de la entrada y hora. Agrega un registro normalizado solo después de validarlos. Así se conserva la evidencia cuando cambia una taxonomía y se evita que un error de asignación de la aplicación borre lo que devolvió el proveedor.

## Mide la precisión, el recall y la superposición por clase

Empareja los recuadros predichos y de referencia mediante una regla documentada de intersección sobre unión; luego informa la precisión, el recall y la precisión media por clase y tamaño del objeto. Las métricas agregadas pueden ocultar fallos en objetos pequeños, ocluidos o poco comunes. Incluye escenas concurridas y clases cercanas que puedan confundirse.

Mide también el resultado posterior: aceptación del recorte, error de recuento, corrección del revisor o éxito de la recuperación. Un recuadro más ajustado no es automáticamente mejor si recorta el sujeto requerido, y una buena puntuación de referencia podría no trasladarse a las cámaras, los empaques o la iluminación del entorno de producción.

## Trata la falta de un recuadro como incertidumbre, no como ausencia

Que no se devuelva ningún recuadro puede significar que el objeto está ausente, por debajo del umbral, es demasiado pequeño, está ocluido, no forma parte del vocabulario del modelo, se perdió durante el preprocesamiento o no está disponible porque falló la inferencia. Representa esos estados por separado cuando la ausencia desencadene una acción empresarial. Nunca conviertas un tiempo de espera agotado en una observación negativa.

Conserva la fuente y elige entre un reintento limitado, un método alternativo, una cola de revisión o un resultado sin acción. Evita inferir identidades y rasgos sensibles mediante la detección ordinaria de objetos. Los usos con consecuencias importantes para la seguridad, la propiedad o las personas necesitan evidencia específica del dominio, además de un detector genérico.

## Versiona los umbrales de clase y las correcciones de revisión

Versiona conjuntamente el modelo, la política de entrada, la asignación de clases, la configuración de supresión, los umbrales y las transformaciones de coordenadas. Ejecuta las versiones anterior y nueva con casos de prueba fijos y tráfico sombra antes de cambiar las acciones automatizadas. Mantén disponible la ruta anterior hasta comprender las regresiones de geometría y clases.

Supervisa las distribuciones de clases, los motivos de resultados vacíos, las correcciones de recuadros, la latencia, los errores del proveedor y el costo por segmento de origen. Los cambios de los revisores pueden enriquecer los datos de evaluación, pero documenta la adjudicación y el sesgo de selección en lugar de tratar cada recuadro editado como datos de referencia igualmente fiables.

## Detalles técnicos que conviene conocer

* Límite de la tarea: la detección de objetos con IA predice qué clases conocidas de objetos son visibles y dónde aparecen sus regiones delimitadoras en una imagen o fotograma. La detección de objetos devuelve clases y ubicaciones, la clasificación etiqueta una imagen completa y la segmentación produce regiones a nivel de píxel.
* Contrato de entrada: conserva la relación de aspecto y las transformaciones de coordenadas para que los recuadros puedan vincularse de nuevo con la fuente; incluye dominios representativos de escala, oclusión, iluminación y cámara. La preparación de la entrada debe evaluarse junto con el modelo, porque el preprocesamiento puede eliminar tanto evidencia como ruido.
* Contrato de salida: devuelve recuadros relativos a la fuente, identificadores de clase, confianza, convención de coordenadas, versión del modelo y estado de revisión, incluidos resultados vacíos explícitos. Una respuesta válida no demuestra que una etiqueta predicha, una región predicha o un píxel generado sean correctos.
* Elección del método: selecciona un detector entrenado y licenciado para las clases y el entorno de despliegue requeridos; luego calibra los umbrales específicos de cada clase con datos representativos. Los nombres de los modelos por sí solos no describen los datos de entrenamiento, los umbrales, la latencia, las licencias ni el comportamiento ante fallos de un sistema desplegado.
* Evaluación: mide la precisión y el recall, así como la precisión media con los umbrales de superposición declarados; luego examina los objetos pequeños, las escenas concurridas, el desequilibrio entre clases y el costo posterior de los errores. Las puntuaciones agregadas deben segmentarse por tipo de contenido para evitar que los ejemplos comunes y sencillos oculten fallos en casos límite importantes.
* Fallos y seguridad: la ausencia de detecciones no demuestra que un objeto esté ausente; los resultados inciertos o críticos para la seguridad requieren revisión o un respaldo conservador del producto. No equipares la detección de rostros con la identidad o la intención, ni uses únicamente un detector genérico para tomar decisiones de seguridad, empleo, aplicación de la ley o elegibilidad.
* Operaciones: almacena las detecciones sin procesar y las transformaciones, supervisa la deriva por clase, controla las versiones de los umbrales de forma independiente y toma muestras de los resultados aceptados y rechazados para revisarlos.

## Un enfoque práctico

1. 1\
   Documenta la decisión, el esquema de salida y los criterios de rechazo para la detección de objetos con IA.
2. 2\
   Crea un conjunto de evaluación representativo para la detección de objetos con IA y conserva cada fuente, decisión de preprocesamiento y registro de procedencia.
3. 3\
   Evalúa el flujo de trabajo completo con evidencia representativa y compara el resultado con criterios de aceptación predefinidos y específicos de la tarea.
4. 4\
   Implementa la detección de objetos con IA mediante rutas explícitas de revisión y respaldo; después, supervisa las señales operativas que determinan si sigue siendo útil.

Un flujo de trabajo multimedia de cuatro etapas

## Cuándo resulta útil Transloadit

Usa /image/resize para crear entradas acotadas para el modelo, /image/facedetect para la tarea más específica de localizar rostros y etapas de almacenamiento o webhooks en torno a un detector externo.

## Límite de la arquitectura

Con /image/describe, Transloadit puede proporcionar etiquetas, pero esta función no está documentada como detector general de objetos mediante recuadros. /image/facedetect localiza rostros específicamente; otras formas de detección espacial requieren un modelo externo.

## Preguntas frecuentes

### ¿La detección de objetos es lo mismo que la segmentación de imágenes?

No. La detección suele devolver recuadros aproximados para las instancias de objetos, mientras que la segmentación devuelve regiones a nivel de píxel. Usa la salida menos detallada que la aplicación realmente necesite.

### ¿Se pueden reutilizar los recuadros después de recortar una imagen?

Solo después de transformarlos mediante las operaciones exactas de recorte, cambio de tamaño, relleno y orientación. De lo contrario, represéntalos sobre la entrada original de la detección o vuelve a ejecutar la detección.

### ¿Transloadit ofrece detección general de objetos?

No. Usa un detector especializado para obtener los recuadros. Transloadit puede preparar derivados de entrada y crear o exportar contenido multimedia revisado en torno a esa etapa de inferencia.

### ¿Por qué la ausencia de un recuadro detectado no demuestra que un objeto esté ausente?

El objeto puede estar por debajo del umbral, no ser compatible, estar ocluido, ser demasiado pequeño, haber sido eliminado durante el preprocesamiento o estar oculto por un fallo técnico. Conserva estas explicaciones como estados distintos.

## Crea el flujo de trabajo

Pasa del concepto a una Assembly probada con la documentación de Robots y Demos funcionales.

### Robots relevantes

* [/image/resize](/es/docs/robots/image-resize.md)
* [/image/facedetect](/es/docs/robots/image-facedetect.md)
* [Lee la documentación de la API](/es/docs.md)
* [Explora Demos funcionales EN (English)](/demos.md)
* [Crea un Workspace gratuito](/c/signup/)

IA y medios generados

## Continúa con guías relacionadas

* [Análisis de imágenes con IA: tareas, arquitectura y salvaguardas](/es/guides/ai-image-analysis.md)\
  Comprende clasificación, detección, OCR, generación de descripciones, embeddings y moderación como tareas diferentes dentro del análisis de imágenes.
* [Segmentación de imágenes con IA: métodos, métricas y producción](/es/guides/ai-image-segmentation.md)\
  Comprende la segmentación semántica, por instancias y panóptica de imágenes; diseña un flujo para producción con máscaras medibles y alternativas seguras.
* [Mapa de capacidades de IA para imágenes: elegir la tarea correcta](/es/guides/ai-image-processing-guide.md)\
  Elige técnicas de procesamiento de imágenes con IA según la tarea, la evidencia y el costo de los fallos, en vez de ensamblar un pipeline impreciso «con IA».
* [Flujo de revisión para metadatos de imagen asistidos por IA](/es/guides/ai-for-media-seo.md)\
  Usa la IA para el SEO multimedia donde realmente ayude: inventario, sugerencias de metadatos, borradores accesibles y optimización medible de recursos.
* [Generación de imágenes de producto con IA y salvaguardas por SKU](/es/guides/ai-product-image-generation.md)\
  Genera imágenes de productos sin inventar características, colores, empaques ni afirmaciones que los clientes confundan con el artículo real.
* [Reemplazo de imágenes con IA: máscaras, inpainting y revisión](/es/guides/ai-image-replacement.md)\
  Reemplaza regiones de imágenes con IA y mantén visibles las máscaras de selección, la fuente de referencia, la continuidad visual y la revisión editorial.
