Conclusiones clave
- El análisis directo es lo más sencillo cuando las fuentes ya son pequeñas, válidas y tienen una codificación consistente.
- El preprocesamiento controla la orientación, las dimensiones, el formato y el costo de transferencia antes de la inferencia del modelo.
- El texto alternativo debería comunicar el propósito en su contexto, no enumerar cada objeto detectado.
La descripción de imágenes puede servir para el texto alternativo, la búsqueda, la moderación o el enriquecimiento del catálogo, pero esas tareas requieren prompts y niveles de detalle distintos. Separar la preparación determinista de los archivos de la interpretación probabilística mantiene acotadas las entradas del modelo y permite atribuir los fallos.
Lo más importante
- Guarda el modelo, la versión del prompt, la confianza o el estado de revisión, y la relación con la fuente.
Define qué debe lograr una descripción
La descripción de imágenes no es una sola tarea. El texto de accesibilidad explica el propósito de la imagen en una página concreta, los metadatos del catálogo facilitan el filtrado y la recuperación, la moderación busca categorías de políticas y un inventario interno registra hechos visibles. Antes de elegir un modelo, define la audiencia, la longitud máxima, los campos obligatorios, las inferencias prohibidas y qué debería ocurrir cuando la evidencia es ambigua.
Una sola frase generada no debería servir para todos los consumidores. Un índice de búsqueda de comercio electrónico puede necesitar etiquetas de objetos, colores y tipo de producto, mientras que el texto alternativo quizá solo deba indicar qué aporta la imagen junto a su pie de foto. La moderación necesita categorías específicas de políticas y estados de revisión en lugar de prosa pulida. Separa estas salidas para que un cambio posterior de prompt o de políticas no altere de forma silenciosa el comportamiento de otras partes del producto.
Accesibilidad
Describe la información o la función que aporta la imagen en el contexto que la rodea.
Búsqueda
Captura términos normalizados y objetivos que mejoren la recuperación sin convertir suposiciones inciertas en hechos.
Moderación
Devuelve categorías de políticas, evidencia y una ruta de revisión en lugar de un juicio final automático.
Elige etiquetas o lenguaje contextual
Usa el Robot /image/describe de Transloadit cuando la salida deseada sean etiquetas de objetos. Puede devolver una lista plana o una respuesta más completa con valores de confianza, y los resultados se pueden escribir como JSON o incluirse en los metadatos del archivo para Steps posteriores. También puede solicitar descripciones de contenido explícito, pero las categorías de los proveedores difieren y deberían asignarse a tu propia política de moderación.
Usa un modelo con capacidad para imágenes a través de /ai/chat cuando la salida requiera contexto, relaciones o una respuesta en lenguaje natural específica de la tarea. Proporciona una instrucción concreta y un JSON Schema cuando el código posterior necesite campos estructurados. /ai/chat es un Robot en etapa temprana. Tanto las solicitudes que usan tus propias claves de proveedor (por ejemplo, suministradas mediante credenciales de Template) como las que usan credenciales de prueba proporcionadas por Transloadit se facturan con un margen, así que confirma su estado y precios actuales antes de convertirlo en una dependencia de producción. El soporte de modelos y su comportamiento pueden evolucionar, así que registra el modelo seleccionado, la versión del prompt y el derivado de la fuente. No consideres que una respuesta JSON válida demuestre que sus afirmaciones son correctas.
Prepara un derivado de análisis acotado
El preprocesamiento determinista hace que las entradas del modelo sean más consistentes. Corrige la orientación, rechaza los archivos no válidos, convierte las codificaciones poco comunes y redimensiona dentro de un presupuesto de píxeles documentado. Un derivado más pequeño reduce el tiempo de transferencia y el costo de inferencia, mientras que un formato fijo facilita la reproducción de los fallos. Mantén el archivo original vinculado al derivado para que el análisis pueda repetirse cuando cambien los requisitos.
Un preprocesamiento agresivo puede eliminar la evidencia que el modelo necesita. Los carteles pequeños, las etiquetas de producto, los diagramas y las personas lejanas pueden volverse ilegibles tras reducir la escala. Recortar puede excluir contexto que cambia el significado de una escena. Prueba varios tamaños con imágenes representativas y conserva la relación de aspecto salvo que la tarea requiera explícitamente un recorte. Nunca sobrescribas la fuente con el derivado usado para el análisis.
Orientación
Aplica la orientación de la cámara de forma consistente para que las personas, el texto y los objetos aparezcan en la orientación correcta.
Resolución
Establece un máximo que controle el costo y conserve a la vez los detalles importantes más pequeños del conjunto de evaluación.
Color y transparencia
Comprueba si aplanar la transparencia o convertir los espacios de color modifica contenido relevante.
Escribe prompts que separen la evidencia de la inferencia
Pide primero los detalles observables y, después, las interpretaciones opcionales en campos separados. Por ejemplo, un esquema de catálogo podría incluir visible_objects, visible_text, uncertainties y suggested_alt_text. Indica al modelo que omita la identidad, el estado médico, las emociones y los rasgos protegidos salvo que la tarea tenga una base legítima y un proceso de revisión aprobado. Incluye restricciones de longitud y vocabulario acordes con el destino.
Trata los nombres de archivo, el texto cercano de la página, los campos EXIF y los pies de foto proporcionados por el usuario como contexto no confiable. Pueden ser inexactos o contener instrucciones con forma de prompt. Etiqueta con claridad los datos contextuales e indica al modelo que no pueden anular las instrucciones de la tarea ni la evidencia visible. Si el contexto de la página es necesario para el texto alternativo, proporciona solo el encabezado, el pie de foto y el propósito del enlace pertinentes, en lugar de un documento entero no confiable.
Escribe texto alternativo útil, incluida la ausencia de texto
Un buen texto alternativo comunica la función de la imagen sin narrar cada píxel. Normalmente evita rellenos como «imagen de», no repite un pie de foto cercano e incluye palabras visibles solo cuando esas palabras importan. Un logotipo enlazado puede necesitar el nombre de la organización y el propósito del enlace, mientras que un gráfico requiere su conclusión principal o una tabla de datos adyacente en lugar de una lista de formas y colores.
Las imágenes decorativas deberían usar normalmente un texto alternativo vacío para que los lectores de pantalla las omitan. Un sistema de IA no puede decidir de forma fiable a partir de los píxeles si una imagen es decorativa, porque esa decisión depende del contexto de la página. Haz que lo decorativo sea una elección explícita de quien crea el contenido. Las imágenes complejas, las capturas de pantalla, los mapas y los diagramas pueden necesitar un atributo alt corto más una explicación más larga mantenida por una persona.
Imágenes funcionales
Describe la acción o el destino cuando una imagen funciona como botón o enlace.
Texto en imágenes
Incluye el texto visible que sea significativo y ofrece contenido equivalente en otro lugar cuando sea extenso.
Imágenes decorativas
Usa un texto alternativo vacío en lugar de generar una descripción que añada ruido.
Gestiona las alucinaciones y el contenido sensible
Los modelos de visión pueden inventar texto, objetos, identidades, relaciones e intenciones. Los valores de confianza de un modelo no son probabilidades universales, y una redacción fluida puede ocultar la incertidumbre. Almacena por separado las observaciones inciertas y envía a revisión los resultados de alto impacto. Nunca uses una descripción generada por sí sola para tomar decisiones sobre empleo, elegibilidad, salud, identidad o aplicación de la ley.
Las descripciones de personas requieren reglas especialmente conservadoras. Evita adivinar nombres, etnia, identidad de género, discapacidad, salud, religión o estado emocional a partir de la apariencia. La detección de rostros no es identificación, y una escena que se parece a un evento no demuestra qué ocurrió. Ofrece una vía de corrección para las personas afectadas por los metadatos publicados y elimina los análisis sensibles cuando su retención ya no esté justificada.
Evalúa la calidad por tarea y segmento de contenido
Crea un conjunto de evaluación a partir de las imágenes que el producto recibe realmente. Incluye poca luz, archivos rotados, capturas de pantalla, ilustraciones, texto denso, escenas ambiguas, varios idiomas, temas sensibles y recursos decorativos. Pide a revisores calificados que puntúen la exactitud factual, los detalles críticos ausentes, las afirmaciones sin respaldo, la legibilidad, el cumplimiento de las políticas y la utilidad en contexto. Mide cada segmento de contenido por separado para que los buenos resultados en fotos sencillas no oculten los fallos en los diagramas.
Evita pruebas que esperen una frase exacta de un modelo probabilístico. En su lugar, prueba la validez del esquema, las afirmaciones prohibidas, los conceptos requeridos, la longitud y las valoraciones humanas. Fija las versiones del prompt y de la aplicación, registra el modelo seleccionado para cada resultado y vuelve a ejecutar la evaluación antes de cambiar de modelo o de preprocesamiento. Realiza revisiones con lector de pantalla en páginas reales, porque una descripción exacta aún puede generar una mala experiencia cuando se repite o se coloca de forma incorrecta.
Opera un flujo de trabajo de producción revisable
Ejecuta el análisis de forma asíncrona con plazos claros y reintentos acotados. Almacena el identificador de origen, la suma de comprobación del derivado, el tipo de tarea, el modelo, la versión del prompt, el resultado estructurado en bruto, la decisión del revisor y el estado de publicación. Usa caché según la suma de comprobación del origen y la configuración de análisis para no enviar repetidamente la misma imagen a inferencia. Invalida la caché cuando cambien el origen, el modelo, el prompt o la política.
Supervisa la latencia, el costo de inferencia, los fallos de esquema, las tasas de rechazo, las correcciones de los revisores y la deriva por categoría de imagen. Un tiempo de espera agotado debería dejar la fuente disponible y marcar la generación de la descripción como pendiente o no disponible, en lugar de publicar una suposición vacía. Protege las imágenes privadas con acceso al almacenamiento de mínimo privilegio, retención breve para los derivados temporales, registros con los datos sensibles enmascarados y controles explícitos sobre qué proveedor puede recibir entradas sensibles.
Respaldo ante fallos
Pon en cola un reintento o una descripción humana en lugar de presentar como un hecho un texto de marcador de posición sin revisar.
Control de costos
Redimensiona de forma adecuada, guarda los resultados en caché, limita los reintentos y reserva los modelos contextuales costosos para las tareas que los necesiten.
Procedencia
Mantén separados los estados generado por máquina, revisado, editado y publicado para que los cambios sigan siendo auditables.
Detalles técnicos que conviene conocer
- Un inventario factual, una descripción alternativa de accesibilidad y un texto de marketing son resultados diferentes. La misma imagen debería describirse de forma distinta según el contexto y la audiencia.
- Los modelos de visión pueden inferir texto, objetos, identidades o relaciones que no existen. Los metadatos de alto impacto deberían conservar la confianza y permitir la revisión en lugar de convertirse en un hecho incuestionable.
- Los metadatos externos a los píxeles, incluidos los nombres de archivo y el texto cercano, pueden mejorar el contexto, pero también pueden introducir instrucciones engañosas y no deberían anular automáticamente la evidencia visible.
- Un texto alternativo útil normalmente omite frases como «imagen de», evita la especulación e incluye el texto visible en la imagen cuando ese texto es relevante para la página.
- Una imagen decorativa normalmente debería tener un texto alternativo vacío en lugar de una descripción generada por IA que crea ruido para los usuarios de lectores de pantalla.
- Las descripciones de personas exigen una precaución especial en torno a la identidad, la salud, las emociones, los rasgos protegidos y otras inferencias sensibles que los píxeles no establecen de forma fiable.
Un enfoque práctico
- 1
Define si la salida sirve para accesibilidad, búsqueda, moderación o análisis interno.
- 2
Prepara un derivado acotado sin destruir los detalles que la tarea necesita.
- 3
Evalúa los prompts y los modelos con contenido representativo, incluidas imágenes ambiguas y sensibles.
- 4
Exige revisión cuando una descripción incorrecta pueda inducir a error, ofender o bloquear el acceso.
Cuándo resulta útil Transloadit
Usa /image/describe cuando basten las etiquetas de objetos y las puntuaciones de confianza. Para una descripción contextual en lenguaje natural, envía una imagen acotada a un modelo /ai/chat con capacidad para imágenes, con un prompt específico de la tarea y un esquema de salida. Trata /ai/chat como una función en etapa temprana y confirma su estado y precios actuales antes de usarlo en producción. En ambos casos, conserva la fuente, el modelo y el estado de revisión.
Límite de la arquitectura
Tanto /image/describe como los modelos /ai/chat con capacidad de imagen son probabilísticos, y su salida puede cambiar a medida que evolucionan los proveedores. Las descripciones generadas requieren una revisión de accesibilidad y de exactitud antes de su publicación.
Preguntas frecuentes
¿Deberían usarse los pies de foto generados por IA directamente como texto alternativo?
No de forma predeterminada. El texto alternativo depende del propósito de la página y del contenido circundante, por lo que el texto generado debería superar reglas contextuales y una revisión humana cuando un error podría dificultar el acceso o inducir a error a los usuarios.
¿Cuándo debería usar /image/describe en lugar de /ai/chat?
Usa /image/describe para etiquetas de objetos, salidas de etiquetas con puntuación de confianza o categorías de contenido explícito compatibles. Usa un modelo /ai/chat con capacidad de imagen cuando necesites prosa contextual o una interpretación estructurada para una tarea específica.
¿Cuánto se debe redimensionar una imagen antes del análisis?
No existe un tamaño universal. Elige el derivado más pequeño que conserve los detalles que exige la tarea y luego valídalo con ejemplos de tu propio contenido que tengan mucho texto, estén tomados a distancia y sean ambiguos.
¿Puede una puntuación de confianza eliminar la revisión humana?
No. La confianza es específica de cada modelo y puede estar mal calibrada para tus entradas. Usa umbrales para dirigir el trabajo, pero mantén la revisión de los resultados sensibles, con consecuencias importantes o inciertos.
¿Qué debería ocurrir con una imagen decorativa?
El sistema de autoría debería marcarla como decorativa y proporcionar un texto alternativo vacío. Generar una descripción añadiría salida innecesaria en los lectores de pantalla.