Workflow-Automatisierung

# Automatisierte Bildanalyse mit beobachtbaren Workflows

Gestalten Sie die Bildanalyse als wiederholbaren, asynchronen Workflow statt als blockierende Anfrage Ihrer Anwendung.

Veröffentlicht am 11. August 2026

## Wichtigste Erkenntnisse

* Verwenden Sie das am wenigsten komplexe Signal, das die Entscheidung zuverlässig unterstützt.
* Bewahren Sie die Beziehungen zwischen Quelle und Ergebnis, damit sich die Analyse mit einer neueren Methode wiederholen lässt.
* Legen Sie Zeitlimits für Analysen durch Drittanbieter und das Verhalten bei Teilausfällen fest.

Automatisierte Bildanalyse sollte bei der Entscheidung beginnen, die sie unterstützt. Abmessungen können die Weiterleitung zu einer Größenänderung bestimmen, Gesichter einen Zuschnitt beeinflussen, OCR die Suche ermöglichen und Moderation eine Veröffentlichung zurückhalten.

## In diesem Leitfaden

1. [Mit der Entscheidung statt mit dem Modell beginnen](#automated-image-analysis-section-1)
2. [Maschinenlesbares Ergebnisschema definieren](#automated-image-analysis-section-2)
3. [Eingaben vorbereiten, ohne nützliche Nachweise zu zerstören](#automated-image-analysis-section-3)
4. [Geeignete Analysefunktion auswählen](#automated-image-analysis-section-4)
5. [Analyse asynchron orchestrieren](#automated-image-analysis-section-5)
6. [Semantische Qualität statt nur den API-Erfolg evaluieren](#automated-image-analysis-section-6)
7. [Datenschutz, Barrierefreiheit, Kosten und Betrieb kontrollieren](#automated-image-analysis-section-7)

## Worauf es besonders ankommt

* Legen Sie Nutzern weder unverarbeitete Anbieterfehler noch sensible Modellausgaben offen.

## Mit der Entscheidung statt mit dem Modell beginnen

Automatisierte Bildanalyse wandelt Pixel und technische Metadaten in strukturierte Signale um, die eine Anwendung nutzen kann. Sie unterscheidet sich von der Bildtransformation, bei der Pixel oder die Dateidarstellung verändert werden. Eine Größenänderung erzeugt ein neues Bild, während Objekt-Labels, Gesichtskoordinaten, OCR-Text oder Qualitätsmesswerte ein Bild beschreiben. Manche Workflows nutzen die Analyse, um eine spätere Transformation auszuwählen, doch die Ausgaben sollten konzeptionell getrennt bleiben.

Legen Sie die Entscheidung fest, bevor Sie einen Dienst auswählen. Für eine Routingregel genügen möglicherweise Abmessungen und Transparenz, eine Suche kann Labels oder Text erfordern, ein Zuschnitt ist unter Umständen auf Gesichtskoordinaten angewiesen und für die Moderation können richtlinienspezifische Scores erforderlich sein. Wenn Sie das am wenigsten komplexe, aber ausreichende Signal verwenden, reduzieren Sie Latenz, Kosten, Datenschutzrisiken und Fehlermöglichkeiten. Zudem werden die Akzeptanzkriterien dadurch klarer als bei der allgemeinen Anforderung, ein Bild zu verstehen.

### Weiterleitung

Verwenden Sie deterministische Metadaten, um einen Zweig, eine Variante oder ein Ziel auszuwählen.

### Anreicherung

Fügen Sie einem Asset-Datensatz durchsuchbare Labels, erkannten Text oder andere strukturierte Fakten hinzu.

### Unterstützung

Schlagen Sie einen Zuschnitt, eine Bildunterschrift oder eine Kategorie zur Bestätigung durch eine Person vor.

### Kontrolle

Halten Sie die Veröffentlichung zurück oder fordern Sie eine Prüfung an, wenn die Analyse einen dokumentierten Richtlinienschwellenwert überschreitet.

## Maschinenlesbares Ergebnisschema definieren

Entwerfen Sie das Ergebnisschema der Anwendung unabhängig von der Antwort eines Anbieters. Nehmen Sie die Quellversion und Prüfsumme, den Aufgabentyp, den Status, das Analysewerkzeug und dessen Version, den Erstellungszeitpunkt, die Eingabevariante und die normalisierte Ausgabe auf. Für Koordinaten müssen Ursprung, Einheiten, Bildbreite und Bildhöhe sowie die Information, ob die Ausrichtung angewendet wurde, explizit angegeben sein. Text benötigt Angaben zur Sprache und zur Position auf der Seite oder in der Region. Labels benötigen einen Konfidenzwert und ein stabiles internes Vokabular.

Bilden Sie die Zustände „in der Warteschlange“, „in Ausführung“, „teilweise abgeschlossen“, „abgeschlossen“, „fehlgeschlagen“, „Zeitüberschreitung“ und „abgelöst“ explizit ab. Ein Teilerfolg kann nützlich sein, wenn unabhängige Aufgaben abgeschlossen sind. Die konsumierenden Systeme müssen jedoch wissen, welche Felder fehlen und warum. Vermeiden Sie es, alle Ergebnisse in einer einzigen Prosabeschreibung abzulegen, die weder abgefragt noch validiert werden kann. Validieren Sie externe Antworten an der Systemgrenze und speichern Sie bereinigte Fehlerdetails getrennt von Meldungen für Nutzer.

Versionieren Sie das Ergebnisschema und die Zuordnungsschicht. Modelle und Antwortstrukturen von Anbietern können sich ändern, selbst wenn der API-Aufruf weiterhin erfolgreich ist. Wenn Sie die ursprüngliche Anbieterreferenz, das normalisierte Ergebnis, die verfügbaren Modellinformationen und die Zuordnungsversion aufbewahren, können Teams altes und neues Verhalten vergleichen oder die Analyse wiederholen, ohne den Verlauf zu überschreiben.

## Eingaben vorbereiten, ohne nützliche Nachweise zu zerstören

Prüfen Sie das tatsächliche Format, die Abmessungen, die Ausrichtungsmetadaten, die Anzahl der Frames, die Farbeigenschaften und die Größe des Originals. Wenden Sie die Ausrichtung vor koordinatenbasierten Aufgaben einheitlich an und erfassen Sie die Abmessungen genau der Eingabevariante, die zur Analyse gesendet wurde. Ein Begrenzungsrahmen, der anhand einer verkleinerten und gedrehten Kopie berechnet wurde, kann nur dann sicher auf das Original angewendet werden, wenn die Koordinatentransformation bekannt ist.

Eine Normalisierung kann die Übertragungszeit verkürzen und das Modellverhalten konsistenter machen. Eine starke Verkleinerung kann jedoch feinen Text, weit entfernte Gesichter, kleine Produkte oder Hinweise auf Manipulationen entfernen. Wählen Sie aufgabenspezifische Grenzen statt eines universellen Thumbnails. Bewahren Sie die Quelle unverändert auf und erstellen Sie ein benanntes Analysederivat, wenn Komprimierung, Rasterung oder Formatkonvertierung erforderlich ist.

Lehnen Sie fehlerhafte oder nicht unterstützte Eingaben frühzeitig ab. Begrenzen Sie neben den komprimierten Bytes auch die decodierten Abmessungen und die Seitenanzahl, da kompakte Dateien zu kostspieligen Workloads anwachsen können. Entfernen oder beschränken Sie unnötige Metadaten, bevor Sie Dateien an externe Modelle senden, wenn der Datenschutz dies erfordert. Bewahren Sie das Original jedoch unter kontrolliertem Zugriff auf, falls Herkunftsnachweise oder eine spätere erneute Verarbeitung relevant sind.

## Geeignete Analysefunktion auswählen

Technische Metadaten sollten zuverlässig beantwortbare Fragen klären, bevor KI eingesetzt wird. Breite, Höhe, Dauer, Seitenzahl, MIME-Typ und Transparenz können viele Routing-Entscheidungen steuern. OCR extrahiert sichtbaren Text, belegt aber nicht, dass dieser wahr ist. Die Gesichtsdetektion lokalisiert wahrscheinliche Gesichter, identifiziert jedoch keine Person. Objekt-Labels beschreiben wahrscheinliche Inhalte, entscheiden aber nicht eigenständig über Moderation oder die Qualität der Barrierefreiheit.

Für unterstützte Aufgaben können Assemblies von Transloadit `/image/describe`, `/image/facedetect`, `/image/ocr` und `/document/ocr` koordinieren. `/image/describe` kann Labels mit vollständigen Konfidenzinformationen oder als Liste zurückgeben und explizite Beschreibungen anfordern, die der Anbieter unterstützt. `/image/facedetect` kann bei deaktiviertem Zuschneiden Gesichtskoordinaten an die Dateimetadaten anhängen oder bei aktiviertem Zuschneiden ausgewählte Gesichtsausschnitte ausgeben. `/image/ocr` erkennt Text in Bildern, während `/document/ocr` Text in PDFs erkennt. Andere Dokumentformate erfordern daher zunächst eine Konvertierung mit `/document/convert`.

Verwenden Sie `/ai/chat` oder einen spezialisierten externen Dienst nur, wenn dessen unterstütztes Ein- und Ausgabeverhalten zur Aufgabe passt. Da `/ai/chat` ein Robot in einer frühen Entwicklungsphase ist und bei Anbieterschlüsseln eine Aufschlagsabrechnung gilt, sollten Sie den aktuellen Status und die Preise prüfen, bevor Sie eine Produktionsabhängigkeit davon aufbauen. Klassifikation, Embeddings, Identifikation, spezialisierte OCR oder domänenspezifische Detektion können einen anderen Anbieter erfordern. Transloadit kann begrenzte Eingaben vorbereiten und verfügbare Robots orchestrieren, die Anwendung sollte jedoch jedes Ergebnis in einem eigenen dauerhaften Analysedatensatz zusammenführen.

### Metadatenextraktion

Bevorzugen Sie sie für deterministische Dateieigenschaften und ressourcenschonendes Routing.

### Spezialisierter Robot

Verwenden Sie einen dokumentierten Analyse-Robot, wenn dessen Schnittstellenspezifikation die Aufgabe und die unterstützten Medien abdeckt.

### Externes Modell

Verwenden Sie einen spezialisierten Anbieter, wenn die benötigte Aufgabe oder Qualitätsstufe nicht von den verfügbaren Robots abgedeckt wird.

### Menschliche Überprüfung

Verlangen Sie eine Prüfung, wenn Kontext, Rechte, Identität, Sicherheit oder eine folgenschwere Entscheidung über die Beleglage hinausgehen.

## Analyse asynchron orchestrieren

Große Uploads, PDFs, Batches und Modelle von Drittanbietern sollten eine Anwendungsanfrage nicht offen halten. Erstellen Sie einen Analysedatensatz, stellen Sie den Verarbeitungslauf in die Warteschlange oder starten Sie ihn und geben Sie eine stabile Statusreferenz zurück. Eine Transloadit Assembly kann für unabhängige Steps aus einer vorbereiteten Eingabe Fan-out nutzen, während Abhängigkeiten sicherstellen, dass eine Aufgabe auf die erforderliche Normalisierung wartet. Die Anwendung kann eine signierte Benachrichtigung erhalten, wenn die Assembly endet.

Prüfen Sie die Signaturen von Benachrichtigungen und ordnen Sie die Assembly-ID der erwarteten Quelle zu, bevor Sie Ergebnisse anwenden. Verarbeiten Sie doppelte und in geänderter Reihenfolge eintreffende Ereignisse idempotent. Wenn externe Analysewerkzeuge separat ausgeführt werden, verwenden Sie für jede Aufgabe eine Korrelations-ID und lassen Sie einen zentralen Aggregator entscheiden, wann die erforderlichen Arbeiten abgeschlossen sind. Der erste erfolgreiche Callback darf nicht den gesamten Datensatz als abgeschlossen markieren.

Legen Sie für jedes Analysewerkzeug Fristen und eine begrenzte Anzahl von Retries fest. Bei einer nicht wesentlichen Label-Aufgabe kann ein Timeout auftreten, während ein Fehlschlag der erforderlichen OCR den gesamten Workflow scheitern lässt oder im Status „ausstehend“ hält. Bilden Sie diesen Unterschied im Schema ab. Ein Dead-Letter-Pfad benötigt eine verantwortliche Person und ein sicheres Verfahren zur erneuten Ausführung, insbesondere wenn dadurch kostenpflichtige Modelle aufgerufen oder neuere Analysen überschrieben würden.

## Semantische Qualität statt nur den API-Erfolg evaluieren

Eine gültige Antwort belegt lediglich, dass der Dienst den Vorgang abgeschlossen hat. Erstellen Sie geprüfte Testsätze, die tatsächliche Bildtypen, Lichtverhältnisse, Auflösungen, Sprachen, Dokumentlayouts und Grenzfälle abbilden. Definieren Sie aufgabenspezifische Messgrößen, etwa übersehene Textfelder, Koordinatenüberschneidungen, Suchakzeptanz, fälschliche Gesichtsdetektionen oder Korrekturraten bei der Prüfung. Die Gesamtgenauigkeit kann eine schwache Leistung bei einer kleinen, aber wichtigen Eingabegruppe verbergen.

Gestalten Sie Assertions für KI-Dienste von Drittanbietern tolerant gegenüber Nichtdeterminismus. Testen Sie die Gültigkeit des Schemas, erforderliche Felder, Koordinatengrenzen, die Zuordnungslogik und das Richtlinienverhalten mit aufgezeichneten Fixtures. Evaluieren Sie exakte semantische Ergebnisse anhand regelmäßig geprüfter Stichproben oder kontrollierter Modellvergleiche. Führen Sie bei Änderungen an Normalisierung, Anbieter, Prompt oder Schwellenwerten die alte und die neue Version im direkten Vergleich aus, bevor Sie die Produktionsergebnisse ersetzen.

Überwachen Sie Ausgabeverteilungen und nachgelagerte Ergebnisse. Ein plötzlicher Rückgang von Labels, eine Verschiebung der OCR-Sprache, mehr leere Ergebnisse oder zunehmende manuelle Korrekturen können auf Drift hinweisen, selbst wenn die Fehlerraten unverändert bleiben. Bewahren Sie alte Ergebnisse bei einer erneuten Analyse als abgelöste Datensätze auf, damit nachgelagerte Systeme bewusst migriert werden können und Audits nachvollziehen können, welche Version einer früheren Entscheidung zugrunde lag.

## Datenschutz, Barrierefreiheit, Kosten und Betrieb kontrollieren

Bilder können Gesichter, Adressen, Dokumente, Gesundheitsinformationen oder Standortmetadaten offenlegen. Senden Sie jedem Analysewerkzeug nur die erforderlichen Eingaben, verwenden Sie Zugangsdaten mit begrenzten Rechten und eine verschlüsselte Übertragung, beschränken Sie den Zugriff auf Ergebnisse und legen Sie Aufbewahrungsfristen für Anbieterdaten und Analysederivate fest. Vermeiden Sie es, OCR-Text, Bild-Payloads, signierte URLs oder unverarbeitete Modellantworten zu protokollieren. Bereinigen Sie externe Fehler, bevor Sie sie Nutzern anzeigen.

Analysen können die Barrierefreiheit unterstützen, doch generierte Labels eignen sich nicht automatisch als Alternativtext. Ein guter Alternativtext hängt vom Zweck des Bildes und vom umgebenden Inhalt ab, während dekorative Bilder üblicherweise eine leere Alternative benötigen. Behandeln Sie generierte Beschreibungen als Entwürfe, die angemessen geprüft werden müssen, und leiten Sie aus Gesichtsdetektion oder Objekt-Labels keine sensiblen persönlichen Merkmale ab.

Erfassen Sie nach Aufgabe und Workflow-Version die Latenz, das Alter der Warteschlange, Fehler, Wiederholungen, verarbeitete Bytes, Modellaufrufe und die nachgelagerte Annahme. Batch-Verarbeitung kann den Durchsatz verbessern, verzögert jedoch das erste Ergebnis und erschwert den Umgang mit Teilausfällen. Wenden Sie bei Lastspitzen Gleichzeitigkeitslimits und Backpressure an. Kostenprognosen sollten Normalisierung, Speicher, Wiederholungen, erneute Analysen nach Modelländerungen und menschliche Validierung umfassen, nicht nur den beworbenen Inferenzaufruf.

## Wissenswerte technische Details

* Bei großen Uploads und Batches sollte die Analyse asynchron erfolgen. Der Status sollte unterscheiden, ob Ergebnisse in der Warteschlange stehen, verarbeitet werden, teilweise abgeschlossen, fehlgeschlagen oder abgelöst sind.
* Strukturierte Ergebnisse lassen sich leichter abfragen, wenn Einheiten, Koordinatenräume, Konfidenz, Sprache und Modellversion explizit angegeben und nicht in Fließtext eingebettet sind.
* Die Beobachtbarkeit sollte Latenz und Fehlschläge nach Modell, Eingabetyp und Größe sowie Qualitätssignale der Ausgabe messen, etwa Änderungen bei der Prüfung und die Akzeptanz in nachgelagerten Systemen.
* Batching kann den Modelldurchsatz erhöhen, verlängert aber die Wartezeit auf das erste Element und erschwert die Behandlung teilweiser Fehlschläge. Die Batch-Größe erfordert daher eine Abwägung zwischen Latenz und Durchsatz.
* Die Eingabenormalisierung darf keine für die Aufgabe erforderlichen Belege entfernen. Eine aggressive Verkleinerung kann Text, kleine Objekte oder Manipulationsartefakte beseitigen.
* Die Qualitätsüberwachung benötigt geprüfte Stichproben und nachgelagerte Ergebnisse, da eine technisch erfolgreiche API-Antwort nichts über die semantische Korrektheit aussagt.

## Ein praxisnaher Ansatz

1. 1\
   Definieren Sie das Ausgabeschema und die Entscheidung, bevor Sie Robots oder Modelle auswählen.
2. 2\
   Bereiten Sie Eingaben einmal vor und nutzen Sie, wo sinnvoll, Fan-out für unabhängige Analyseschritte.
3. 3\
   Fassen Sie die Ergebnisse in der Anwendung unter einem einzigen versionierten Analysedatensatz zusammen.
4. 4\
   Überwachen Sie Genauigkeit, Ausführungszeit, Fehlercluster und Anbieterkosten.

Ein vierstufiger Medien-Workflow

## Wann Transloadit hilfreich ist

Assemblies können Metadaten prüfen, mit /image/describe Labels für Bilder erzeugen, mit /image/facedetect Gesichter detektieren, mit /image/ocr Text extrahieren und Eingaben mit festgelegten Grenzen für /ai/chat oder externe Modelle vorbereiten. Beachten Sie, dass sich /ai/chat noch in einem frühen Stadium befindet. Überprüfen Sie daher den aktuellen Status und die Preise, bevor Sie es als Produktionsabhängigkeit einsetzen. Der Anwendungscode sollte die Ergebnisse in einem einzigen dauerhaft gespeicherten Analysedatensatz zusammenführen.

## Architekturgrenze

Transloadit bietet ausgewählte Funktionen für Bildanalyse und Orchestrierung, jedoch nicht für jede Aufgabe des maschinellen Sehens. Nutzen Sie einen spezialisierten Dienst, wenn kein Robot die benötigte Funktion für Klassifikation, OCR, Embedding oder Detektion anbietet.

## Häufig gestellte Fragen

### Was ist der Unterschied zwischen Bildanalyse und Bildtransformation?

Die Bildanalyse liefert Informationen über ein Bild, etwa Abmessungen, Labels, erkannten Text oder Koordinaten. Die Bildtransformation verändert das Bild oder dessen Encoding, beispielsweise durch Größenänderung, Zuschneiden oder Formatkonvertierung. Die Analyse kann Transformationsparameter auswählen, doch die resultierenden Daten und das Derivat sollten getrennt erfasst werden.

### Sollte die Bildanalyse beim Upload oder bei Bedarf ausgeführt werden?

Führen Sie die Analyse bei der Erfassung durch, wenn das Ergebnis für jedes Asset vor der Weiterleitung, Prüfung oder Veröffentlichung vorliegen muss. Verwenden Sie On-Demand- oder Hintergrundanalysen für optionale Anreicherungen, aufwendige Spezialaufgaben, die Verarbeitung von Bestandskatalogen oder Modell-Upgrades. Ermitteln Sie in beiden Fällen die genaue Quellversion und speichern Sie einen asynchronen Status.

### Kann die Gesichtsdetektion eine Person identifizieren?

Nein. Die Gesichtsdetektion lokalisiert Bereiche, die wahrscheinlich Gesichter enthalten, und kann Konfidenzwerte oder Bildausschnitte zurückgeben. Eine Person zu identifizieren oder ihre Identität zu verifizieren, ist eine andere Aufgabe mit höherem Risiko und zusätzlichen Anforderungen an Genauigkeit, Einwilligung, Datenschutz und rechtliche Aspekte.

### Wie sollten Koordinaten aus einem für die Analyse verkleinerten Bild auf das Original angewendet werden?

Erfassen Sie Breite, Höhe, Ausrichtung, Zuschnitt und Skalierung des analysierten Bildes. Rechnen Sie die Koordinaten anhand dieser bekannten Transformation um, bevor Sie sie auf das Original anwenden. Wenn die Vorverarbeitung das Seitenverhältnis geändert oder Bereiche ohne umkehrbare Zuordnung entfernt hat, lassen sich die Koordinaten nicht zuverlässig übertragen.

### Wie kann eine Anwendung mit veränderlichen KI-Ergebnissen umgehen?

Speichern Sie Ergebnisse zusammen mit dem Analysewerkzeug, falls verfügbar den Modellinformationen, der Eingabevariante, der Zuordnungsversion und dem Zeitstempel. Fügen Sie neue Ergebnisse als Version hinzu und markieren Sie ältere als abgelöst, statt sie zu überschreiben. Testen Sie strukturelle Schnittstellenschemata deterministisch und evaluieren Sie semantische Änderungen anhand geprüfter repräsentativer Stichproben.

## Erstellen Sie den Workflow

Entwickeln Sie das Konzept mithilfe der Robot-Dokumentation und funktionsfähiger Demos zu einer getesteten Assembly weiter.

### Relevante Robots

* [/image/describe](/de/docs/robots/image-describe.md)
* [/image/facedetect](/de/docs/robots/image-facedetect.md)
* [/image/ocr](/de/docs/robots/image-ocr.md)
* [/ai/chat EN (English)](/docs/robots/ai-chat.md)
* [Lesen Sie die API-Dokumentation](/de/docs.md)
* [Entdecken Sie funktionsfähige Demos EN (English)](/demos.md)
* [Kostenlosen Workspace erstellen](/c/signup/)

Workflow-Automatisierung

## Mit verwandten Leitfäden fortfahren

* [Vollständiger Leitfaden für Digital-Asset-Workflows](/de/guides/digital-asset-workflows.md)\
  Gestalten Sie einen Digital-Asset-Workflow von Aufnahme und Verarbeitung über Prüfung und Veröffentlichung bis zu Aufbewahrung und Löschung.
* [KI-Inhaltsmoderation in einem Upload-Workflow](/de/guides/ai-content-moderation-workflows.md)\
  Integrieren Sie KI-Moderation mit Konfidenzschwellen und menschlicher Prüfung in einen kontrollierten Upload-Workflow.
* [Automatisierte Inhaltsmoderation: Aufbau und Fehlerbehandlung](/de/guides/automated-content-moderation.md)\
  Erstellen Sie automatisierte Moderation als mehrschichtiges System aus Dateiprüfungen, Klassifikatoren, Richtlinienentscheidungen und Prüfwarteschlangen.
* [Medienautomatisierung: vom Upload zur zuverlässigen Ausgabe](/de/guides/media-automation.md)\
  Automatisieren Sie wiederholbare Medienaufnahme, Transformation, Validierung und Export, ohne Beobachtbarkeit und Kontrolle einzuschränken.
* [HTML skalierbar zu PDF konvertieren](/de/guides/convert-html-to-pdf.md)\
  Erstellen Sie aus einer URL oder hochgeladenem HTML PDFs von Rechnungen, Berichten und Belegen, und sorgen Sie für reproduzierbare Ausgaben.
