Wir stellen vor: der OCR Robot für einfache Textextraktion
„Ein Bild sagt mehr als tausend Worte“ ist eine Redewendung in vielen Sprachen – und das aus gutem Grund. Unser visueller Cortex ist wohl der leistungsfähigste Teil des Gehirns, und ihn zu nutzen, um Bedeutung zu vermitteln, ist ebenso wirkungsvoll. Seit wir den Robot /image/describe eingeführt haben, ermöglichen wir Programmierern, den visuellen Cortex von KI-Modellen zu erschließen, die von führenden Cloud-Anbietern trainiert wurden. Heute gehen wir noch einen Schritt weiter: Wir erkennen nicht nur Objekte in Bildern, sondern lesen auch alle darin enthaltenen Wörter.
Angenommen, Sie hätten das Bild eines Verkehrsschilds oder einer Speisekarte. Nahezu jeder Mensch könnte diese Objekte deuten, doch für Maschinen blieb ihre Bedeutung stets undurchsichtig – bis zur Einführung leistungsstarker neuer OCR-Modelle, die Text – praktisch – aus einer Ansammlung von Pixeln lesen können.
Wir stellen den Robot /image/ocr vor. Er ist der neueste Robot in unserer
KI-Familie. Er kann im Backend wahlweise AWS oder GCP nutzen, wobei sich beide Anbieter mühelos
über den Parameter provider austauschen lassen. Das bedeutet: Wenn ein Anbieter unbefriedigende
Ergebnisse liefert, können Sie ohne weitere Konfigurations- oder Preisänderungen zum anderen
wechseln. Wechseln Sie den Anbieter also gern, wann immer es Ihnen sinnvoll erscheint. Und da sich
die KI-API-Modelle im Backend stetig weiterentwickeln, nutzt unser Service die verbesserte
Erkennungsleistung automatisch.

Text aus Bildern extrahieren
Um zu zeigen, wie einfach sich dieser neue Robot einsetzen lässt, gehen wir das folgende Template gemeinsam durch:
{
"steps": {
":original": {
"robot": "/upload/handle"
},
"image-ocr": {
"use": ":original",
"robot": "/image/ocr",
"format": "text",
"provider": "aws"
},
"exported": {
"use": ["image-ocr", ":original"],
"robot": "/s3/store",
"credentials": "YOUR_AWS_CREDENTIALS"
}
}
}
Es gibt viele Möglichkeiten, Dateien zu Transloadit zu bringen, doch wir verwenden
den Robot /upload/handle in unserem ersten
Step, :original.
Unsere Bilderkennung findet im folgenden Step statt, image-ocr. Hier übergeben wir
:original an den Robot /image/ocr und setzen dessen Parameter
format, damit das Ergebnis als Textdatei zurückgegeben wird. Ist dies nicht aktiviert, gibt der Robot
standardmäßig JSON aus. Zusätzlich haben wir festgelegt, dass wir aws als KI-Anbieter im
Backend verwenden möchten. Wie angegeben, würden Sie hier mit gcp die Google Cloud Platform
nutzen, ohne Änderungen an der Schnittstelle oder an der Struktur der zurückgegebenen Daten. Nur
die Daten selbst (also der gelesene Text) können variieren, da jede KI-Plattform unabhängig
trainiert wurde und sich ebenso unabhängig weiterentwickelt.
Nachdem der Text extrahiert und zurückgegeben wurde, exportieren wir die Ergebnisse in unseren
S3-Bucket. YOUR_AWS_CREDENTIALS verweist auf die Template-Zugangsdaten, die Sie im
Zugangsdaten-Tab Ihrer Transloadit Console einrichten können.
Klicken Sie (hier), um Ihren eigenen Amazon-S3-Bucket einzurichten, falls Sie das noch nicht getan haben.
Testen
Testen wir nun unser Template mit dem folgenden Bild:
Sobald unsere Assembly das Encoding abgeschlossen hat, erhalten wir folgendes Ergebnis:
Transloadit
Fazit
Wie Sie sehen, war die Assembly ein Erfolg. Wir hoffen, in dieser kurzen Einführung gezeigt zu haben, dass das Extrahieren von Text aus einem Bild weder schwierig noch zeitaufwendig ist, wenn Sie unseren Robot /image/ocr verwenden.
Dank der Kombinierbarkeit von Transloadit lassen sich zudem alle unsere 95 völlig unterschiedlichen Funktionen aneinanderreihen, um Workflows zu erstellen, die genau zu Ihrem Anwendungsfall passen. Mit anderen Worten: Der Step für OCR könnte nur eines von vielen Zahnrädern in Ihrer komplexen Maschine sein. Wie gezeigt, genügt dafür ein deklarativ geschriebenes JSON-Rezept, was es zu einer denkbar einfachen und absolut zuverlässigen Methode macht, um Ihrem Unternehmen großen Mehrwert zu verschaffen.
Da dieser Robot zu unserer KI-Familie gehört, steht er ausschließlich unseren zahlenden Kundinnen und Kunden zur Verfügung. Auf unserer Preisseite finden Sie die aktuellen Tarife und das enthaltene Encoding-Volumen.
