Extraer texto e imágenes incrustadas
🤖/document/extract extrae texto e imágenes incrustadas de documentos PDF.

Extrae texto nativo o seleccionable y recursos de imagen ráster incrustados de documentos PDF.
Este Robot no renderiza páginas completas. Si necesitas imágenes de las páginas, usa /document/thumbs. Los gráficos vectoriales, los diagramas y los fondos de página no siempre son imágenes ráster incrustadas, por lo que es posible que este Robot no los devuelva.
Ejemplo de uso
Extrae texto nativo e imágenes ráster incrustadas de un documento PDF:
{
"steps": {
"extracted": {
"robot": "/document/extract",
"use": ":original",
"extract": [
"text",
"images"
],
"text_method": "native"
}
}
}Parámetros
interpolateboolean | Record<string, boolean>Controla si las Assembly Variables se interpolan en campos de instrucciones individuales.
De forma predeterminada, la mayoría de los campos de instrucciones de los Robots interpolan Assembly Variables. Establece esta opción en
falsepara tratar todos los campos de instrucciones como texto literal, o establece la ruta de un campo individual enfalsepara tratar únicamente ese campo como texto literal. En el caso de los campos específicos de un Robot que son literales de forma predeterminada, establece esta opción entrueo la ruta de ese campo entruepara volver a habilitar la interpolación.Usa nombres de campos como
patho rutas con puntos comoffmpeg.vfpara los objetos anidados.output_metaRecord<string, boolean> | boolean | Array<string>Te permite especificar un conjunto de metadatos cuyo cálculo requiere más recursos de CPU y que, por lo tanto, está desactivado de forma predeterminada para que tus Assemblies se procesen rápidamente.
Para imágenes, puedes añadir
"has_transparency": truea este objeto para determinar si la imagen contiene partes transparentes y"dominant_colors": truepara extraer un array de códigos de color hexadecimales de la imagen.Para imágenes, también puedes añadir
"blurhash": truepara extraer una cadena BlurHash, una representación compacta de un marcador de posición para la imagen que resulta útil para mostrar una vista previa desenfocada mientras se carga la imagen completa.Para videos, puedes añadir el parámetro
"colorspace": truepara extraer el espacio de color del video de salida.Para videos, también puedes añadir
"interlaced": truepara detectar si el video está entrelazado. Esto combina el indicadorfield_orderde ffprobe, cuyo costo en recursos de procesamiento es bajo, con una pasada de muestreo limitada medianteidetsobre los primeros fotogramas de la fuente, y exponeinterlaced,field_ordery un objeto de diagnósticointerlace_detectionenfile.meta. Esto requiere muchos recursos computacionales y se factura en consecuencia.Para audio, puedes añadir
"mean_volume": truepara obtener un único valor que represente el volumen promedio del archivo de audio.También puedes establecerlo en
falsepara omitir la extracción de metadatos y acelerar la transcodificación.user_metaRecord<string, any>(valor predeterminado:{})Añade metadatos personalizados a cada archivo emitido por este Robot sin modificar el contenido del archivo.
Los valores se combinan con los
user_metaexistentes en el archivo de entrada. Si ambos objetos contienen la misma clave, el valor de este Robot tiene prioridad. Se admiten Assembly Variables, por ejemplo{ "internal_file_id": "${file.id}" }.resultboolean(valor predeterminado:false)Indica si los resultados de este Step deben aparecer en el Assembly Status JSON
queuebatchEstablecer la cola en «batch» reduce manualmente la prioridad de los Jobs de este Step para evitar consumir cupos prioritarios con Jobs que no necesitan un tiempo de espera cero en la cola
force_acceptboolean(valor predeterminado:false)Forzar a un Robot a aceptar un tipo de archivo que habría ignorado.
De forma predeterminada, los Robots ignoran los archivos que no reconocen. 🤖/video/encode, por ejemplo, ignorará sin problemas las imágenes de entrada.
Si configuras el parámetro
force_acceptcomotrue, puedes forzar a los Robots a aceptar todos los archivos que reciban. Esto normalmente provocará errores y solo debe usarse para depuración o para abordar casos extremos.ignore_errorsboolean | Array<meta | execute>(valor predeterminado:[])Ignorar errores durante fases específicas del procesamiento.
Establecer este parámetro en
["meta"]hará que el Robot ignore los errores durante la extracción de metadatos.Establecer este parámetro en
["execute"]hará que el Robot ignore los errores durante la fase principal de ejecución.Configurar este parámetro como
trueequivale a["meta", "execute"]y hará que se ignoren los errores en ambas fases.usestring | Array<string> | Array<object> | objectEspecifica qué Step o Steps se usarán como entrada.
- Puedes elegir cualquier nombre para los Steps, excepto
":original"(reservado para las subidas de usuarios gestionadas por Transloadit) - Puedes proporcionar varios Steps como entrada mediante arrays:
{ "use": [ ":original", "encoded", "resized" ] } - También puedes etiquetar los Steps de entrada con
aspara comunicar la intención semántica a los Robots:{ "use": [ { "name": ":original", "as": "image" }, { "name": ":original", "as": "mask" } ] }
ConsejoProbablemente eso sea todo lo que necesitas saber sobre
use, pero puedes consultar los casos de uso avanzados.- Puedes elegir cualquier nombre para los Steps, excepto
extracttext | images | Array<text | images>(valor predeterminado:["text","images"])Selecciona qué recursos se extraen. Usa
["text"],["images"]o["text", "images"].page_rangestringSelección opcional de páginas separadas por comas, como
"1","1-3"o"1,3-5". Los números de página empiezan en 1. Los rangos se limitan al número de páginas detectado.Se permiten como máximo 1.000 páginas seleccionadas por Job.
Esto es compatible con la extracción de texto nativo y con la extracción de imágenes incrustadas. La extracción por OCR funciona actualmente sobre el documento completo.
passwordstringContraseña que se usa para desbloquear PDF cifrados en la extracción de texto nativo y en la extracción de imágenes incrustadas. La extracción por OCR actualmente no admite PDF cifrados, así que no combines esto con
text_method: "ocr"ni context_method: "auto".text_methodnative | ocr | auto(valor predeterminado:"native")Controla cómo se extrae el texto.
"native"extrae localmente el texto seleccionable del PDF con Poppler. Es rápido, pero devuelve poco texto o ninguno en los PDF escaneados."ocr"delega en/document/ocry requiereocr_provider."auto"intenta primero la extracción nativa y luego recurre al OCR cuando no se encuentra texto nativo. Esto también requiereocr_provider.
Actualmente, los modos de OCR no se pueden combinar con
password.ocr_provideraws | gcpProveedor de OCR que se usará cuando
text_methodsea"ocr"o"auto". Los valores válidos son"aws"y"gcp".text_formattxt | json(valor predeterminado:"txt")Formato de salida del texto extraído. Usa
"txt"para texto plano o"json"para una salida estructurada.text_granularitydocument | page(valor predeterminado:"document")Controla la agrupación de la salida de texto en la extracción nativa.
"document"crea un único resultado de texto para las páginas seleccionadas."page"crea un resultado de texto por cada página seleccionada.
Actualmente, la granularidad por página solo es compatible con
text_method: "native".image_formatauto | original | png | jpg(valor predeterminado:"auto")Formato de salida de las imágenes ráster incrustadas que se extraen.
"auto"y"original"conservan el formato de la imagen incrustada siempre que sea posible."png"pide a Poppler que decodifique las imágenes como PNG."jpg"convierte mediante/image/resizelas imágenes extraídas que no son JPEG.
min_image_widthstring | number(valor predeterminado:0)Ancho mínimo en píxeles de las imágenes extraídas. Las imágenes más pequeñas se ignoran. Establece el valor en
0para desactivar este filtro.min_image_heightstring | number(valor predeterminado:0)Alto mínimo en píxeles de las imágenes extraídas. Las imágenes más pequeñas se ignoran. Establece el valor en
0para desactivar este filtro.min_image_bytesstring | number(valor predeterminado:0)Tamaño mínimo de archivo en bytes para las imágenes extraídas. Las imágenes más pequeñas se ignoran.
dedupe_imagesboolean(valor predeterminado:true)Cuando está habilitado, los archivos de imagen extraídos que son idénticos se emiten una sola vez.
include_image_masksboolean(valor predeterminado:false)Cuando está habilitado, el Robot también conserva los archivos de máscara de imagen cuando Poppler los expone como archivos separados.