Transcribir voz en archivos de audio o video
🤖/speech/transcribe transcribe voz en archivos de audio o video.

Puedes usar en tu aplicación el texto que devolvemos o pasarlo a otros Robots para filtrar archivos de audio o video que contengan (o no contengan) determinado contenido o, por ejemplo, incrustar el texto en imágenes o videos.
Otro caso de uso habitual es agregar subtítulos automáticamente a los videos o permitir búsquedas en el contenido de audio.
Establece speaker_labels en true cuando quieras que la salida de transcripción JSON o de metadatos distinga a los hablantes recurrentes:
{
"steps": {
"transcribed": {
"use": ":original",
"robot": "/speech/transcribe",
"provider": "aws",
"format": "json",
"speaker_labels": true,
"max_speakers": 3
}
}
}
Actualmente, los proveedores aws y gcp admiten etiquetas de hablantes. Si habilitas
speaker_labels sin establecer provider, Transloadit usa aws para ese Step. Las etiquetas
se normalizan como speaker_1, speaker_2 y así sucesivamente:
{
"text": "Hello there. Hi!",
"words": [
{ "text": "Hello", "startTime": 0, "endTime": 0.5, "speaker": "speaker_1" },
{ "text": "there", "startTime": 0.6, "endTime": 1, "speaker": "speaker_1" },
{ "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
],
"segments": [
{ "text": "Hello there", "startTime": 0, "endTime": 1, "speaker": "speaker_1" },
{ "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
]
}
Ejemplo de uso
Transcribe el habla en francés del audio o video subido y guarda la transcripción en un archivo de texto:
{
"steps": {
"transcribed": {
"robot": "/speech/transcribe",
"use": ":original",
"provider": "replicate",
"target_language": "french",
"format": "text"
}
}
}Parámetros
interpolateboolean | Record<string, boolean>Controla si las Assembly Variables se interpolan en campos de instrucciones individuales.
De forma predeterminada, la mayoría de los campos de instrucciones de los Robots interpolan Assembly Variables. Establece esta opción en
falsepara tratar todos los campos de instrucciones como texto literal, o establece la ruta de un campo individual enfalsepara tratar únicamente ese campo como texto literal. En el caso de los campos específicos de un Robot que son literales de forma predeterminada, establece esta opción entrueo la ruta de ese campo entruepara volver a habilitar la interpolación.Usa nombres de campos como
patho rutas con puntos comoffmpeg.vfpara los objetos anidados.output_metaRecord<string, boolean> | boolean | Array<string>Te permite especificar un conjunto de metadatos cuyo cálculo requiere más recursos de CPU y que, por lo tanto, está desactivado de forma predeterminada para que tus Assemblies se procesen rápidamente.
Para imágenes, puedes añadir
"has_transparency": truea este objeto para determinar si la imagen contiene partes transparentes y"dominant_colors": truepara extraer un array de códigos de color hexadecimales de la imagen.Para imágenes, también puedes añadir
"blurhash": truepara extraer una cadena BlurHash, una representación compacta de un marcador de posición para la imagen que resulta útil para mostrar una vista previa desenfocada mientras se carga la imagen completa.Para videos, puedes añadir el parámetro
"colorspace": truepara extraer el espacio de color del video de salida.Para videos, también puedes añadir
"interlaced": truepara detectar si el video está entrelazado. Esto combina el indicadorfield_orderde ffprobe, cuyo costo en recursos de procesamiento es bajo, con una pasada de muestreo limitada medianteidetsobre los primeros fotogramas de la fuente, y exponeinterlaced,field_ordery un objeto de diagnósticointerlace_detectionenfile.meta. Esto requiere muchos recursos computacionales y se factura en consecuencia.Para audio, puedes añadir
"mean_volume": truepara obtener un único valor que represente el volumen promedio del archivo de audio.También puedes establecerlo en
falsepara omitir la extracción de metadatos y acelerar la transcodificación.user_metaRecord<string, any>(valor predeterminado:{})Añade metadatos personalizados a cada archivo emitido por este Robot sin modificar el contenido del archivo.
Los valores se combinan con los
user_metaexistentes en el archivo de entrada. Si ambos objetos contienen la misma clave, el valor de este Robot tiene prioridad. Se admiten Assembly Variables, por ejemplo{ "internal_file_id": "${file.id}" }.resultboolean(valor predeterminado:false)Indica si los resultados de este Step deben aparecer en el Assembly Status JSON
queuebatchEstablecer la cola en «batch» reduce manualmente la prioridad de los Jobs de este Step para evitar consumir cupos prioritarios con Jobs que no necesitan un tiempo de espera cero en la cola
force_acceptboolean(valor predeterminado:false)Forzar a un Robot a aceptar un tipo de archivo que habría ignorado.
De forma predeterminada, los Robots ignoran los archivos que no reconocen. 🤖/video/encode, por ejemplo, ignorará sin problemas las imágenes de entrada.
Si configuras el parámetro
force_acceptcomotrue, puedes forzar a los Robots a aceptar todos los archivos que reciban. Esto normalmente provocará errores y solo debe usarse para depuración o para abordar casos extremos.ignore_errorsboolean | Array<meta | execute>(valor predeterminado:[])Ignorar errores durante fases específicas del procesamiento.
Establecer este parámetro en
["meta"]hará que el Robot ignore los errores durante la extracción de metadatos.Establecer este parámetro en
["execute"]hará que el Robot ignore los errores durante la fase principal de ejecución.Configurar este parámetro como
trueequivale a["meta", "execute"]y hará que se ignoren los errores en ambas fases.usestring | Array<string> | Array<object> | objectEspecifica qué Step o Steps se usarán como entrada.
- Puedes elegir cualquier nombre para los Steps, excepto
":original"(reservado para las subidas de usuarios gestionadas por Transloadit) - Puedes proporcionar varios Steps como entrada mediante arrays:
{ "use": [ ":original", "encoded", "resized" ] } - También puedes etiquetar los Steps de entrada con
aspara comunicar la intención semántica a los Robots:{ "use": [ { "name": ":original", "as": "image" }, { "name": ":original", "as": "mask" } ] }
ConsejoProbablemente eso sea todo lo que necesitas saber sobre
use, pero puedes consultar los casos de uso avanzados.- Puedes elegir cualquier nombre para los Steps, excepto
providerauto | aws | gcp | replicate(valor predeterminado:"auto")Se selecciona automáticamente el mejor proveedor según tu solicitud.
Configura este parámetro con
"aws","gcp"o"replicate"para forzar un proveedor específico. Cuando se establece en"auto", Transloadit usa"replicate"de forma predeterminada y usa"aws"cuandospeaker_labelsestá habilitado.granularityfull | list(valor predeterminado:"full")Actualmente, tanto
"full"como"list"devuelven la misma respuesta de transcripción completa."list"sigue aceptándose por compatibilidad con versiones anteriores.formatjson | meta | srt | text | webvtt(valor predeterminado:"json")Formato de salida de la transcripción.
"text"genera un archivo de texto sin formato que puedes almacenar y procesar."json"genera un archivo JSON que contiene palabras con marcas de tiempo. Cuandospeaker_labelsestá habilitado, las palabras pueden incluir etiquetasspeakery el JSON también puede incluirsegmentsagrupados por hablante."srt"y"webvtt"generan archivos de subtítulos de sus respectivos tipos, que pueden almacenarse por separado o utilizarse en otros Steps de encoding."meta"no devuelve un archivo, sino que almacena los datos dentro del objeto de archivo de Transloadit (en${file.meta.transcription.text},${file.meta.transcription.words}y, cuando hay etiquetas de hablantes disponibles,${file.meta.transcription.segments}) que se transfiere entre Steps de encoding, para que puedas usar los valores a fin de incrustar los datos en videos, filtrarlos, etc.
speaker_labelsboolean(valor predeterminado:false)Cuando está habilitado, Transloadit solicita al proveedor de transcripción que distinga a los diferentes hablantes. Las salidas JSON y de metadatos pueden incluir etiquetas
speaker, como"speaker_1", en palabras individuales, además desegmentsagrupados por hablante. El comportamiento de las salidas de texto, SRT y WebVTT no cambia.Las etiquetas de hablantes identifican voces recurrentes, no nombres de personas reales. La precisión depende de la calidad del audio, el ruido de fondo, el habla superpuesta y la cantidad de hablantes.
max_speakersstring | number(valor predeterminado:10)La cantidad máxima de hablantes que se detectarán cuando
speaker_labelsesté habilitado.source_languagestring(valor predeterminado:"en-US")Establece el idioma hablado para los proveedores
"aws"y"gcp". La transcripción permanece en el idioma hablado; este parámetro no traduce el habla.El idioma debe especificarse en el formato BCP-47, como
"en-GB","de-DE"o"fr-FR". Consulta también la lista de idiomas compatibles con el proveedorgcpy el proveedoraws.target_languagestringEstablece una indicación del idioma hablado para el proveedor
"replicate". Omite este parámetro para detectar automáticamente el idioma hablado. Cuando conozcas el idioma, configúralo con su nombre completo en inglés y en minúsculas, como"french". A pesar de su nombre, este parámetro no traduce el habla.Para los proveedores
"aws"y"gcp", usasource_languageen su lugar.
Demos
Publicaciones relacionadas del blog
- Tech preview: new AI Robots for enhanced media processing (English)
- New feature: auto-transcribe videos with subtitles (English)
- Building a screen reader plugin with /text/speak Robot (English)
- Building an AI-powered video dubber with Transloadit (English)
- Celebrating transloadit’s 2021 milestones and progress (English)
- Build a Reddit video subtitling bot with Transloadit (English)
- Creating engaging audio visualizations with Transloadit (English)