Reconhecer objetos em imagens
🤖/image/describe reconhece objetos em imagens e os retorna como palavras em inglês.

Você pode usar os rótulos que retornamos na sua aplicação para classificar imagens automaticamente. Também pode repassar os rótulos a outros Robots para filtrar imagens que contenham (ou não contenham) determinado conteúdo.
Exemplo de uso
Reconheça objetos em uma imagem enviada por upload e armazene os rótulos em um arquivo JSON:
{
"steps": {
"described": {
"provider": "aws",
"robot": "/image/describe",
"use": ":original"
}
}
}Parâmetros
interpolateboolean | Record<string, boolean>Controla se as Assembly Variables são interpoladas em campos individuais de instruções.
Por padrão, a maioria dos campos de instruções dos Robots interpola Assembly Variables. Defina isso como
falsepara tratar todos os campos de instruções como texto literal, ou defina o caminho de um campo individual comofalsepara tratar apenas esse campo como texto literal. Para campos específicos de um Robot que são literais por padrão, defina isso comotrueou defina o caminho desse campo comotruepara voltar a usar a interpolação.Use nomes de campos como
pathou caminhos com pontos comoffmpeg.vfpara objetos aninhados.output_metaRecord<string, boolean> | boolean | Array<string>Permite especificar um conjunto de metadados cujo cálculo exige mais CPU e que, por isso, vem desativado por padrão para manter o processamento das suas Assemblies rápido.
Para imagens, você pode adicionar
"has_transparency": trueneste objeto para extrair se a imagem contém partes transparentes e"dominant_colors": truepara extrair um array de códigos de cores hexadecimais da imagem.Para imagens, você também pode adicionar
"blurhash": truepara extrair uma string BlurHash — uma representação compacta de um placeholder da imagem, útil para exibir uma prévia desfocada enquanto a imagem completa carrega.Para vídeos, você pode adicionar o parâmetro
"colorspace": truepara extrair o espaço de cores do vídeo de saída.Para vídeos, você também pode adicionar
"interlaced": truepara detectar se o vídeo é entrelaçado. Isso combina a flag computacionalmente baratafield_orderdo ffprobe com uma passagem de amostragemidetlimitada sobre os primeiros quadros da origem, expondointerlaced,field_ordere um objeto de diagnósticointerlace_detectionemfile.meta. Isso é computacionalmente caro e cobrado de acordo.Para áudio, você pode adicionar
"mean_volume": truepara obter um único valor que representa o volume médio do arquivo de áudio.Você também pode definir isso como
falsepara pular a extração de metadados e acelerar a transcodificação.user_metaRecord<string, any>(padrão:{})Adiciona metadados JSON personalizados a cada arquivo emitido sem modificar seu conteúdo. Objetos e arrays aninhados são suportados.
A herança depende do Robot. Os valores são mesclados com o
user_metaexistente no arquivo de saída; o Step atual substitui as chaves de nível superior com o mesmo nome. Atribua explicitamente as chaves necessárias quando um Robot criar novas saídas.Nos Steps de processamento,
${file.*}se refere à primeira entrada e${result.*}ao arquivo emitido. Os valores são avaliados para cada saída após a execução do Robot, antes da extração subsequente de metadados e do armazenamento temporário. Em:original, os valores são avaliados para cada upload antes da extração de metadados.Os Steps subsequentes leem
${file.user_meta.key}. Consulte Metadados personalizados para ver um exemplo completo e as regras de herança.resultboolean(padrão:false)Se os resultados deste Step devem estar presentes no Assembly Status JSON
queuebatchDefinir a fila como “batch” rebaixa manualmente a prioridade dos Jobs deste Step, para evitar o consumo de vagas prioritárias de Jobs em Jobs que não precisam de tempo zero de espera na fila
force_acceptboolean(padrão:false)Forçar um Robot a aceitar um tipo de arquivo que ele teria ignorado.
Por padrão, os Robots ignoram arquivos que não conhecem. O 🤖/video/encode, por exemplo, ignora tranquilamente imagens de entrada.
Com o parâmetro
force_acceptdefinido comotrue, você pode forçar os Robots a aceitar todos os arquivos enviados a eles. Isso normalmente leva a erros e só deve ser usado para depuração ou para lidar com casos extremos.ignore_errorsboolean | Array<meta | execute>(padrão:[])Ignorar erros durante fases específicas do processamento.
Definir isso como
["meta"]fará com que o Robot ignore erros durante a extração de metadados.Definir isso como
["execute"]fará com que o Robot ignore erros durante a fase principal de execução.Definir isso como
trueequivale a["meta", "execute"]e fará com que erros sejam ignorados nas duas fases.usestring | Array<string> | Array<object> | objectEspecifica quais Steps usar como entrada.
- Você pode escolher qualquer nome para os Steps, exceto
":original"(reservado para uploads de usuários tratados pela Transloadit) - Você pode fornecer vários Steps como entrada usando arrays:
{ "use": [ ":original", "encoded", "resized" ] } - Você também pode marcar os Steps de entrada com
aspara transmitir intenção semântica aos Robots:{ "use": [ { "name": ":original", "as": "image" }, { "name": ":original", "as": "mask" } ] }
DicaProvavelmente é tudo o que você precisa saber sobre
use, mas você pode ver os casos de uso avançados.- Você pode escolher qualquer nome para os Steps, exceto
providerauto | aws | gcp(padrão:"auto")Escolhe o melhor provedor com base na sua solicitação.
Selecione um provedor específico para substituir a seleção automática.
granularityfull | list(padrão:"full")Define se deve retornar uma resposta completa (
"full"), incluindo percentuais de confiança para cada rótulo encontrado, ou apenas uma lista simples de rótulos ("list").formatjson | meta | text(padrão:"json")Formato em que as descrições devem ser retornadas.
"json"retorna um arquivo JSON."meta"não retorna um arquivo, mas armazena os dados no objeto de arquivo da Transloadit (em${file.meta.descriptions}), que é passado entre os Steps de codificação, para que você possa usar os valores para gravar os dados nos vídeos, filtrar com base neles etc.
explicit_descriptionsboolean(padrão:false)Define se devem ser retornadas apenas descrições explícitas ou apenas não explícitas da imagem fornecida. As descrições explícitas incluem rótulos para conteúdo NSFW (nudez, violência etc.). Se definido como
false, serão retornadas apenas descrições não explícitas (como pessoa ou cadeira). Se definido comotrue, serão retornadas apenas descrições explícitas.As descrições possíveis dependem do provedor escolhido. A lista de rótulos da AWS pode ser encontrada na sua documentação. O GCP rotula a imagem com base em cinco categorias, conforme descrito na sua documentação.
Para ver um exemplo de como rejeitar automaticamente conteúdo NSFW e malware, confira este post do blog (English).
Demonstrações
Publicações relacionadas no blog
- Tech preview: new AI Robots for enhanced media processing (English)
- Introducing the OCR Robot for easy text extraction (English)
- Transloadit’s 2021 milestones and progress (English)
- Building an alt-text to speech generator with Transloadit (English)
- How to automate content moderation using Transloadit (NSFW) (English)
- Use Transloadit to automatically filter NSFW images (English)