Text und eingebettete Bilder extrahieren
🤖/document/extract extrahiert Text und eingebettete Bilder aus PDF-Dokumenten.

Extrahiert nativen bzw. auswählbaren Text und eingebettete Rasterbilder aus PDF-Dokumenten.
Dieser Robot rendert keine vollständigen Seiten. Wenn Sie Seitenbilder benötigen, verwenden Sie /document/thumbs. Vektorgrafiken, Diagramme und Seitenhintergründe sind nicht immer eingebettete Rasterbilder und werden daher von diesem Robot möglicherweise nicht zurückgegeben.
Anwendungsbeispiel
Nativen Text und eingebettete Rasterbilder aus einem PDF-Dokument extrahieren:
{
"steps": {
"extracted": {
"robot": "/document/extract",
"use": ":original",
"extract": [
"text",
"images"
],
"text_method": "native"
}
}
}Parameter
interpolateboolean | Record<string, boolean>Steuert, ob einzelne Robot-Anweisungsfelder Assembly Variables interpolieren.
Standardmäßig interpolieren die meisten Robot-Anweisungsfelder Assembly Variables. Mit dem Wert
falsebehandeln Sie alle Anweisungsfelder als Literaltext. Wenn Sie stattdessen einen einzelnen Feldpfad auffalsesetzen, wird nur dieses Feld als Literaltext behandelt. Bei Feldern eines bestimmten Robots, die standardmäßig als Literaltext behandelt werden, aktivieren Sie die Interpolation wieder, indem Sie hierfürtruefestlegen oder für den jeweiligen Feldpfad den Werttrueverwenden.Verwenden Sie Feldnamen wie
pathoder für verschachtelte Objekte Punktpfade wieffmpeg.vfals Pfadangabe.output_metaRecord<string, boolean> | boolean | Array<string>Damit können Sie eine Reihe von Metadaten festlegen, deren Berechnung mehr CPU-Ressourcen beansprucht. Sie sind daher standardmäßig deaktiviert, damit Ihre Assemblies schnell verarbeitet werden.
Für Bilder können Sie diesem Objekt den Eintrag
"has_transparency": truehinzufügen, um zu ermitteln, ob das Bild transparente Bereiche enthält. Mit dem Eintrag"dominant_colors": truekönnen Sie außerdem ein Array mit hexadezimalen Farbcodes aus dem Bild extrahieren.Für Bilder können Sie auch den Eintrag
"blurhash": truehinzufügen, um einen BlurHash zu extrahieren – eine kompakte Darstellung eines Platzhalters für das Bild, mit der Sie eine unscharfe Vorschau anzeigen können, während das vollständige Bild geladen wird.Für Videos können Sie den Parameter
"colorspace": truehinzufügen, um den Farbraum des Ausgabevideos zu extrahieren.Für Videos können Sie außerdem den Eintrag
"interlaced": truehinzufügen, um zu erkennen, ob das Video im Zeilensprungverfahren vorliegt. Dazu wird die ressourcenschonende ffprobe-Optionfield_ordermit einem begrenzten Stichprobendurchlauf mithilfe vonidetüber die ersten Frames der Quelle kombiniert. Die Ergebnisseinterlacedundfield_ordersowie das Diagnoseobjektinterlace_detectionwerden dabei unterfile.metaausgegeben. Dies ist rechenintensiv und wird entsprechend abgerechnet.Für Audio können Sie den Eintrag
"mean_volume": truehinzufügen, um einen einzelnen Wert für die durchschnittliche Lautstärke der Audiodatei zu erhalten.Sie können diesen Parameter auch auf
falsesetzen, um die Metadatenextraktion zu überspringen und das Transcoding zu beschleunigen.user_metaRecord<string, any>(Standard:{})Fügt jeder von diesem Robot ausgegebenen Datei benutzerdefinierte Metadaten hinzu, ohne den Dateiinhalt zu verändern.
Die Werte werden mit allen bereits in der Eingabedatei enthaltenen
user_metazusammengeführt. Wenn beide Objekte denselben Schlüssel enthalten, hat der Wert dieses Robots Vorrang. Assembly Variables werden unterstützt, zum Beispiel{ "internal_file_id": "${file.id}" }.resultboolean(Standard:false)Ob die Ergebnisse dieses Steps im Assembly Status JSON enthalten sein sollen
queuebatchWenn Sie die Queue auf „batch“ setzen, wird die Priorität der Jobs für diesen Step manuell herabgestuft. So vermeiden Sie, Priority Job Slots für Jobs zu belegen, die keine Wartezeit von null in der Queue benötigen.
force_acceptboolean(Standard:false)Erzwingt, dass ein Robot einen Dateityp akzeptiert, den er sonst ignorieren würde.
Standardmäßig ignorieren Robots Dateien, deren Typ sie nicht kennen. 🤖/video/encode ignoriert beispielsweise problemlos Eingabebilder.
Wenn Sie den Parameter
force_acceptauftruesetzen, können Sie erzwingen, dass Robots alle übergebenen Dateien akzeptieren. Dies führt in der Regel zu Fehlern und sollte nur zur Fehlersuche oder zur Behandlung von Grenzfällen verwendet werden.ignore_errorsboolean | Array<meta | execute>(Standard:[])Fehler in bestimmten Verarbeitungsphasen ignorieren.
Wenn Sie hierfür
["meta"]festlegen, ignoriert der Robot Fehler bei der Metadatenextraktion.Wenn Sie hierfür
["execute"]festlegen, ignoriert der Robot Fehler während der Hauptausführungsphase.Wenn Sie hierfür
truefestlegen, entspricht dies["meta", "execute"]und Fehler in beiden Phasen werden ignoriert.usestring | Array<string> | Array<object> | objectGibt an, welche Steps als Eingabe verwendet werden sollen.
- Sie können beliebige Namen für Steps wählen, außer
":original"(reserviert für von Transloadit verarbeitete Benutzer-Uploads) - Sie können mehrere Steps mithilfe von Arrays als Eingabe angeben:
{ "use": [ ":original", "encoded", "resized" ] } - Sie können Eingabe-Steps außerdem mit
askennzeichnen, um Robots die semantische Funktion zu übermitteln:{ "use": [ { "name": ":original", "as": "image" }, { "name": ":original", "as": "mask" } ] }
TippDas ist wahrscheinlich alles, was Sie über
usewissen müssen. Sie können sich jedoch auch die erweiterten Anwendungsfälle ansehen.- Sie können beliebige Namen für Steps wählen, außer
extracttext | images | Array<text | images>(Standard:["text","images"])Legt fest, welche Assets extrahiert werden. Verwenden Sie
["text"],["images"]oder["text", "images"].page_rangestringOptionale, kommagetrennte Seitenauswahl, etwa
"1","1-3"oder"1,3-5". Die Seitennummerierung beginnt bei 1. Bereiche werden auf die erkannte Seitenzahl begrenzt.Pro Job sind höchstens 1.000 ausgewählte Seiten zulässig.
Dies wird für die native Textextraktion und die Extraktion eingebetteter Bilder unterstützt. Die OCR-Extraktion arbeitet derzeit auf dem vollständigen Dokument.
passwordstringPasswort, mit dem verschlüsselte PDFs für die native Textextraktion und die Extraktion eingebetteter Bilder entsperrt werden. Die OCR-Extraktion unterstützt derzeit keine verschlüsselten PDFs; kombinieren Sie dies daher nicht mit
text_method: "ocr"odertext_method: "auto".text_methodnative | ocr | auto(Standard:"native")Steuert, wie Text extrahiert wird.
"native"extrahiert auswählbaren PDF-Text lokal mit Poppler. Das ist schnell, liefert bei gescannten PDFs aber wenig oder gar keinen Text."ocr"delegiert an/document/ocrund erfordertocr_provider."auto"versucht zuerst die native Extraktion und weicht auf OCR aus, wenn kein nativer Text gefunden wird. Dies erfordert ebenfallsocr_provider.
OCR-Modi können derzeit nicht mit
passwordkombiniert werden.ocr_provideraws | gcpZu verwendender OCR-Anbieter, wenn
text_method"ocr"oder"auto"ist. Gültige Werte sind"aws"und"gcp".text_formattxt | json(Standard:"txt")Ausgabeformat für den extrahierten Text. Verwenden Sie
"txt"für reinen Text oder"json"für strukturierte Ausgabe.text_granularitydocument | page(Standard:"document")Steuert die Gruppierung der Textausgabe bei der nativen Extraktion.
"document"erzeugt ein Textergebnis für die ausgewählten Seiten."page"erzeugt ein Textergebnis pro ausgewählter Seite.
Seitengranularität wird derzeit nur mit
text_method: "native"unterstützt.image_formatauto | original | png | jpg(Standard:"auto")Ausgabeformat für extrahierte eingebettete Rasterbilder.
"auto"und"original"behalten das eingebettete Bildformat nach Möglichkeit bei."png"weist Poppler an, Bilder als PNG zu decodieren."jpg"konvertiert extrahierte Bilder, die nicht im JPEG-Format vorliegen, mit/image/resize.
min_image_widthstring | number(Standard:0)Mindestbreite in Pixeln für extrahierte Bilder. Kleinere Bilder werden ignoriert. Setzen Sie diesen Wert auf
0, um diesen Filter zu deaktivieren.min_image_heightstring | number(Standard:0)Mindesthöhe in Pixeln für extrahierte Bilder. Kleinere Bilder werden ignoriert. Setzen Sie diesen Wert auf
0, um diesen Filter zu deaktivieren.min_image_bytesstring | number(Standard:0)Mindestdateigröße in Bytes für extrahierte Bilder. Kleinere Bilder werden ignoriert.
dedupe_imagesboolean(Standard:true)Wenn aktiviert, werden identische extrahierte Bilddateien nur einmal ausgegeben.
include_image_masksboolean(Standard:false)Wenn aktiviert, behält der Robot auch Bildmaskendateien, sofern Poppler sie als separate Dateien bereitstellt.