Automatización de flujos de trabajo

# Moderación de contenido con IA en un flujo de trabajo de subidas

Integra la moderación con IA en un flujo de trabajo controlado de subidas, con umbrales de confianza y revisión humana.

Publicado el 11 de agosto de 2026

## Conclusiones clave

* Define las categorías y acciones de la política con independencia de las etiquetas de un proveedor específico.
* Usa umbrales diferentes para las decisiones de permitir, bloquear y someter a revisión humana.
* Conserva la evidencia y la procedencia del modelo conforme a una política adecuada de privacidad y retención.

La moderación de contenido con IA estima si un texto, una imagen, un audio o un video coincide con categorías de riesgo definidas. La política de producto sigue determinando qué significan esas categorías, qué nivel de confianza debe tener el sistema y qué sucede después.

## En esta guía

1. [Convierte la política en una taxonomía aplicable](#ai-content-moderation-workflows-section-1)
2. [Comprende qué significa y qué no significa la puntuación de un modelo](#ai-content-moderation-workflows-section-2)
3. [Usa señales específicas de cada modalidad](#ai-content-moderation-workflows-section-3)
4. [Mantén las subidas en cuarentena hasta que la decisión sea persistente](#ai-content-moderation-workflows-section-4)
5. [Elige los umbrales según las consecuencias](#ai-content-moderation-workflows-section-5)
6. [Diseña la revisión humana y las apelaciones como controles de seguridad](#ai-content-moderation-workflows-section-6)
7. [Protege el contenido sensible y los datos de moderación](#ai-content-moderation-workflows-section-7)
8. [Prueba la calidad, la deriva, los fallos y el costo](#ai-content-moderation-workflows-section-8)

## Lo más importante

* Mide el rendimiento por idioma, tipo de contenido y grupo de usuarios afectado.

## Convierte la política en una taxonomía aplicable

La moderación con IA comienza con la política del producto, no con la lista de etiquetas de un modelo. Define las categorías de contenido relevantes, las áreas del producto donde se aplican, la gravedad del daño y la acción disponible para el sistema. Cada categoría debe incluir ejemplos, contraejemplos y reglas para las excepciones contextuales. Mantén la taxonomía independiente de la terminología del proveedor para que el cambio de nombre o la división de una etiqueta del modelo no modifiquen silenciosamente la aplicación de la política.

Una matriz de decisiones puede asignar cada categoría interna y nivel de gravedad a una acción de permitir, restringir, revisar o bloquear. Incluye la audiencia afectada, la jurisdicción, el historial de la cuenta y la consecuencia cuando estos factores modifiquen legítimamente la regla. Registra una versión de la política con cada decisión. Esto permite realizar auditorías y reevaluaciones posteriores cuando cambie la política, sin fingir que la decisión original se tomó conforme a las reglas actuales.

### Permitir

Las señales requeridas se completaron y no superaron ningún umbral de la política correspondiente al área del producto aplicable.

### Restringir

El contenido puede seguir disponible con controles como una restricción de edad, una distribución reducida o una advertencia.

### Revisar

La evidencia es ambigua, contradictoria, de gran impacto o se encuentra dentro de un rango de puntuaciones deliberadamente incierto.

### Bloquear

La evidencia disponible supera un umbral documentado para una acción que la política permite automatizar.

## Comprende qué significa y qué no significa la puntuación de un modelo

Un clasificador estima en qué medida una entrada coincide con las categorías aprendidas. Su puntuación no es una probabilidad universal de que el contenido infrinja la política, y las puntuaciones de distintos modelos rara vez son intercambiables. La calibración varía según el idioma, el estilo de la imagen, la calidad de los medios y la versión del proveedor. Trata el resultado como una señal con procedencia, no como un valor de verdad definitivo.

El contexto suele determinar la acción adecuada. Un mismo material visual o verbal puede aparecer en educación médica, periodismo, documentación de abusos, sátira o acoso. Los modelos que inspeccionan un fotograma aislado o un fragmento de texto pueden no detectar ese propósito. Conserva el texto descriptivo que lo acompaña, el estado de la conversación, el contexto de la cuenta y el ámbito de publicación para que una persona autorizada pueda revisarlos, sin enviar indiscriminadamente datos privados a todos los clasificadores.

## Usa señales específicas de cada modalidad

La moderación de texto puede analizar insultos, amenazas, solicitudes indebidas, datos personales o patrones de spam, mientras que el análisis de imágenes puede etiquetar desnudez, violencia u otras categorías visuales. El audio suele requerir análisis acústico o transcripción, y el video añade una dimensión temporal. La validación de archivos y la detección de malware son controles de seguridad, no evaluaciones del contenido, aunque formen parte del mismo flujo de trabajo de recepción.

Para videos y animaciones, define una estrategia de muestreo basada en el riesgo. Los intervalos regulares entre fotogramas tienen un costo bajo, pero pueden omitir un evento breve. Los cambios de escena, las miniaturas, la transcripción de audio y el muestreo posterior dirigido aportan evidencias más amplias a un costo mayor. Conserva las marcas de tiempo de cada señal para que un revisor pueda inspeccionar el segmento pertinente. Al combinar los resultados, conserva la puntuación y la fuente de cada modelo en lugar de reducirlo todo a un máximo sin explicación.

### Comprobaciones deterministas

Valida el tipo, el tamaño, la estructura y la presencia de malware antes de invocar modelos probabilísticos.

### Clasificadores especializados

Usa modelos diseñados para el medio, el idioma y la categoría de políticas relevantes.

### Señales de contexto

Aplica el contexto de la cuenta, la audiencia y la publicación únicamente mediante reglas de políticas documentadas.

## Mantén las subidas en cuarentena hasta que la decisión sea persistente

Coloca el contenido recién enviado en un almacenamiento desde el que no pueda entregarse públicamente. Crea un registro de moderación que contenga el ID de origen, las comprobaciones requeridas, la versión de la política y un estado pendiente. Ejecuta comprobaciones independientes de forma asíncrona y deja que un servicio de políticas evalúe sus resultados normalizados. La publicación debe basarse únicamente en una decisión persistente de permitir o restringir, nunca en la mera existencia de un derivado completado.

Para las imágenes compatibles, una Assembly de Transloadit puede ejecutar `/file/virusscan` y usar `/image/describe` con `explicit_descriptions` habilitado para obtener etiquetas de moderación admitidas por el proveedor. La aplicación debe asignar esas etiquetas a su propia taxonomía y sus propios umbrales. Transloadit no proporciona la política completa del producto ni todos los clasificadores especializados, por lo que debes dirigir los medios y las categorías no compatibles a servicios externos adecuados antes de registrar la decisión final.

Guarda en el registro de moderación los identificadores de la Assembly y de las tareas externas. Verifica las notificaciones de finalización firmadas, rechaza los identificadores de origen que no coincidan y haz que la agregación sea idempotente, ya que los reintentos pueden entregar el mismo resultado más de una vez. Exporta o publica únicamente después de que todas las comprobaciones obligatorias alcancen un estado terminal aceptado. Las comprobaciones opcionales deben tener un comportamiento explícito ante tiempos de espera agotados, en lugar de omitirse silenciosamente.

## Elige los umbrales según las consecuencias

Usa umbrales separados para permitir automáticamente, realizar una revisión humana y bloquear automáticamente. Una franja de revisión amplia reduce las decisiones automáticas riesgosas, pero aumenta el volumen de la cola y la demora. Una franja estrecha reduce el costo operativo, pero deposita más confianza en la calibración del modelo. Las acciones de gran impacto, como las sanciones de cuentas o los informes a las autoridades, necesitan evidencias más sólidas y autorización adicional que limitar una sola subida.

Ajusta los umbrales a partir de muestras representativas revisadas, no de una referencia genérica. Mide los falsos positivos, los falsos negativos, las revocaciones de decisiones por parte de revisores, los resultados de las apelaciones y la cobertura para cada idioma, tipo de contenido, grupo de usuarios y área del producto. No optimices únicamente la exactitud general cuando los errores tengan consecuencias desiguales. Una clase pequeña que implique daños graves puede requerir su propio umbral y proceso de escalamiento.

Cuando un modelo no esté disponible, elige deliberadamente para cada área del producto entre el modo cerrado ante fallos, el modo abierto ante fallos o la publicación demorada. El modo cerrado ante fallos protege contra la exposición de contenido no evaluado, pero puede suprimir contenido legítimo durante una interrupción. El modo abierto ante fallos preserva la disponibilidad, pero acepta un riesgo para la seguridad. Un estado pendiente con reintentos limitados suele ser adecuado, siempre que los usuarios reciban información veraz sobre el estado y los equipos de operaciones puedan procesar el trabajo acumulado.

## Diseña la revisión humana y las apelaciones como controles de seguridad

Proporciona a los revisores el contenido original, el fotograma o fragmento de texto pertinente, las versiones del modelo y de la política, las definiciones de las categorías y el contexto necesario de la cuenta. Evita exponer información personal no relacionada. Coloca en colas separadas los casos de mayor riesgo o urgencia, asigna el trabajo según la experiencia y exige un segundo revisor para determinadas acciones irreversibles. Los códigos de motivo estructurados mejoran la consistencia, mientras que las notas de texto libre permiten registrar contextos excepcionales.

Una apelación debe crear una nueva decisión vinculada a la original, no sobrescribir el historial. El revisor de la apelación necesita el motivo de la medida aplicada, las evidencias, la política vigente al momento de la decisión y cualquier cambio posterior en la política. Las revocaciones pueden revelar problemas en los umbrales o la taxonomía, pero los datos de apelaciones no constituyen una muestra de evaluación aleatoria y deben analizarse teniendo en cuenta ese sesgo de selección.

Las herramientas de revisión deben admitir navegación mediante teclado, transcripciones legibles, subtítulos, zoom, controles de reproducción e indicadores de estado que no dependan del color. Las advertencias sobre contenido sensible y las acciones de revelación controlada reducen la exposición innecesaria. El bienestar del personal de moderación también requiere límites de carga de trabajo, rotaciones, opciones de escalamiento y acceso a soporte. Estos son requisitos de seguridad operativa, no simples mejoras estéticas de la interfaz.

## Protege el contenido sensible y los datos de moderación

Aplica el principio de privilegio mínimo al acceso a los archivos en cuarentena, los resultados del clasificador, las notas de los revisores y las apelaciones. Cifra los datos en tránsito y en reposo, usa enlaces de acceso de corta duración y audita el acceso al material de alto riesgo. Los registros deben contener identificadores y códigos de motivo, no copias de imágenes, transcripciones ni respuestas de proveedores. Sanea los errores antes de mostrarlos a quienes enviaron el contenido.

Define la retención por separado para el contenido que se permite, el contenido bloqueado, las evidencias y la telemetría del modelo. Conservar todo indefinidamente genera riesgos para la privacidad y en caso de vulneración, mientras que eliminar de inmediato las evidencias puede impedir las apelaciones y la investigación de incidentes. Documenta la finalidad y el vencimiento de cada clase de datos. Elimina los datos de los proveedores externos de análisis conforme a los controles contractuales y técnicos cuando dichos proveedores lo permitan.

Trata los prompts de los modelos, los payloads de callbacks, los nombres de archivo, el texto de OCR y los textos descriptivos aportados por usuarios como entradas no confiables. Impide que se conviertan en comandos en sistemas posteriores, en HTML dentro de las herramientas de los revisores o en campos sin sanear de los registros. Almacena las credenciales de los proveedores fuera del código del cliente, restringe su alcance, rótalas y verifica la autenticidad de los webhooks antes de que cualquier resultado cambie el estado de moderación.

## Prueba la calidad, la deriva, los fallos y el costo

Crea un conjunto de evaluación con control de versiones a partir de ejemplos obtenidos con consentimiento o sujetos a una gobernanza adecuada, que incluya casos límite, elementos benignos de apariencia similar, contenido ofuscado, varios idiomas y distintos niveles de calidad de los medios. Mantén aislados los datos de prueba peligrosos. Prueba la asignación de políticas por separado de las respuestas del modelo para que un cambio de proveedor no oculte un error de la aplicación. Evita aserciones que exijan que un servicio de IA de terceros devuelva para siempre etiquetas idénticas.

En producción, supervisa por modelo y tipo de medio el volumen de decisiones, las distribuciones de puntuaciones, las tasas de revisión, las revocaciones, las apelaciones, la latencia, los tiempos de espera agotados y el costo. Una tasa de error estable aún puede ocultar deriva si cambian las distribuciones de puntuaciones o las poblaciones de usuarios. Toma muestras de los resultados permitidos y bloqueados para su revisión autorizada, y compara las nuevas versiones del modelo o de los umbrales en modo sombra antes de cambiar la aplicación de las políticas.

Establece presupuestos para el muestreo de fotogramas, la transcripción, la inferencia repetida, el almacenamiento y la revisión humana. Una validación con bajo consumo de recursos debe evitar llamadas innecesarias al modelo; los resultados almacenados en caché solo pueden reutilizarse para los mismos bytes de origen, supuestos de política y versión válida del modelo. Los manuales operativos deben cubrir interrupciones del proveedor, aumentos repentinos de la cola, credenciales comprometidas, bloqueos masivos erróneos y la reversión a una configuración de política conocida.

## Detalles técnicos que conviene conocer

* La moderación de videos e imágenes animadas debe considerar el tiempo: un muestreo disperso de fotogramas puede omitir material breve, mientras que el análisis exhaustivo aumenta el costo y las detecciones duplicadas.
* Los umbrales de las políticas varían según el área del producto, el grupo etario, la jurisdicción y la consecuencia. Una sola puntuación del modelo no debe codificar directamente la decisión de publicación de todos los productos.
* La revisión humana necesita las evidencias que la activaron, la versión de la política, la versión del modelo, el contexto y un historial persistente de apelaciones, no solo una etiqueta binaria generada por una máquina.
* El contexto puede cambiar una clasificación: el material documental, médico, noticioso, artístico o educativo puede contener las mismas señales visuales que el contenido prohibido.
* La salida del modelo debe asignarse a una taxonomía explícita de políticas para que un cambio en una etiqueta del proveedor no altere silenciosamente la aplicación de las políticas del producto.
* Los resultados de las apelaciones son datos de evaluación valiosos, pero requieren controles de privacidad y un muestreo cuidadoso antes de usarse para ajustar umbrales o modelos.

## Un enfoque práctico

1. 1\
   Crea una matriz de políticas con categorías, gravedad, umbrales, acciones y vías de apelación.
2. 2\
   Prepara entradas acotadas sin descartar los detalles necesarios para la revisión.
3. 3\
   Mantén las subidas en cuarentena hasta que la decisión de la política sea persistente.
4. 4\
   Supervisa las revocaciones de decisiones, los falsos positivos, los falsos negativos, la latencia y los cambios en el modelo.

Un flujo de trabajo multimedia de cuatro etapas

## Cuándo resulta útil Transloadit

Usa /file/virusscan para comprobar si hay malware y /image/describe con explicit\_descriptions habilitado para las etiquetas compatibles de moderación de imágenes. Mantén los archivos sin publicar hasta que la aplicación haya asignado esas señales, y las de cualquier clasificador externo, a una decisión de permitir, bloquear o revisar.

## Límite de la arquitectura

Ningún modelo de moderación tiene exactitud universal ni comprende todos los contextos. Los resultados automatizados deben alimentar un motor de políticas con vías de revisión, apelación y auditoría, en lugar de tomar silenciosamente todas las decisiones.

## Preguntas frecuentes

### ¿Puede usarse directamente una puntuación de moderación con IA como decisión de publicación?

No. Una puntuación del modelo debe procesarse mediante una política documentada del producto que tenga en cuenta la categoría, el umbral, el área del producto, la audiencia y la consecuencia. Almacena la señal sin procesar y la versión de la asignación para que la decisión pueda explicarse y reevaluarse.

### ¿Debe permitirse o bloquearse el contenido incierto?

Crea una franja explícita de revisión entre los umbrales automáticos para permitir y bloquear. Durante las interrupciones del clasificador, elige para cada área del producto entre demorar el procesamiento, aplicar el modo abierto ante fallos o aplicar el modo cerrado ante fallos, según el daño que puedan causar tanto la exposición como la supresión de contenido legítimo. No permitas que un tiempo de espera agotado seleccione la política por accidente.

### ¿Con qué frecuencia deben revisarse los umbrales de moderación?

Revísalos después de cambios importantes en el modelo, la política, la audiencia o el producto, y según un calendario operativo regular. Usa muestras de evaluación representativas, revocaciones de decisiones por parte de revisores, apelaciones, distribuciones de puntuaciones e incidentes observados. Un umbral no debe cambiar únicamente porque el volumen total de la cola resulte inconveniente.

### ¿El análisis de malware reemplaza la moderación de contenido?

No. El análisis de malware detecta patrones conocidos de archivos maliciosos, mientras que la moderación de contenido evalúa categorías de políticas, como violencia o desnudez. La validación de archivos, el análisis de malware, la clasificación y la evaluación de políticas son controles independientes que pueden compartir un mismo pipeline de recepción.

### ¿Puede eliminarse la revisión humana una vez que el modelo alcance suficiente exactitud?

La revisión humana sigue siendo necesaria para contextos ambiguos, apelaciones, cambios de políticas, evaluación de calidad y decisiones de gran impacto. La automatización puede reducir el trabajo repetitivo, pero ningún nivel fijo de exactitud elimina el juicio contextual ni la necesidad de monitorear los cambios en los modelos y las poblaciones.

## Crea el flujo de trabajo

Pasa del concepto a una Assembly probada con documentación de Robots y demos funcionales.

### Robots relevantes

* [/file/virusscan](/es/docs/robots/file-virusscan.md)
* [/image/describe](/es/docs/robots/image-describe.md)
* [Lee la documentación de la API](/es/docs.md)
* [Explora demos funcionales EN (English)](/demos.md)
* [Crea un Workspace gratuito](/c/signup/)

Automatización de flujos de trabajo

## Continúa con guías relacionadas

* [Guía completa de flujos de trabajo de recursos digitales](/es/guides/digital-asset-workflows.md)\
  Diseña un flujo de trabajo de recursos digitales desde la recepción y el procesamiento hasta la revisión, publicación, retención y eliminación.
* [Moderación automatizada de contenido: diseño y gestión de fallos](/es/guides/automated-content-moderation.md)\
  Crea una moderación automatizada por capas con comprobaciones de archivos, clasificadores, decisiones de política y colas de revisión.
* [Análisis automatizado de imágenes: flujos de trabajo observables](/es/guides/automated-image-analysis.md)\
  Convierte el análisis de imágenes en un flujo de trabajo asíncrono y repetible, en lugar de una solicitud que bloquee la aplicación.
* [Automatización de medios: de la subida a resultados confiables](/es/guides/media-automation.md)\
  Automatiza la recepción, transformación, validación y exportación repetibles de medios, a la vez que preservas la observabilidad y el control.
* [Cómo convertir HTML a PDF a gran escala](/es/guides/convert-html-to-pdf.md)\
  Genera facturas, informes y recibos en PDF desde una URL o un HTML subido, y permite obtener el mismo resultado de forma reproducible.
