Transloadit
Preços
  • Uploads de arquivos
  • Importação de arquivos
  • Processamento em lote (English)
  • Codificação de vídeo
  • Codificação de áudio
  • Processamento de imagens
  • Processamento de documentos
  • Inteligência artificial
  • Filtragem de arquivos e segurança
  • Catalogação de mídia
  • Compressão de arquivos
  • Avaliação de código
  • Exportação de arquivos
  • Smart CDN
  • Ver todos os serviços
  • Explore integrações (English)
  • Explore demos ao vivo (English)
  • Uppy
  • TransloaditKit
  • Android SDK
  • Node.js SDK
  • Python SDK
  • Ruby SDK
  • Go SDK
  • Java SDK
  • PHP SDK
  • Zapier
  • MCP Server
  • Transloadit CLI (English)
  • Terraform
  • Essenciais
  • Boas práticas
  • Perguntas frequentes (English)
  • Robots
  • API
  • Formatos (English)
  • Crie seu primeiro app
  • Sobre (English)
  • Comparações (English)
  • Código aberto (English)
  • Depoimentos (English)
  • Vagas (English)
  • Segurança (English)
  • Publicações (English)
  • Notícias para devs (English)
  • Dicas para devs (English)
  • Imprensa (English)
  • Pesquisa (English)
  • Estudos de caso (English)
  • Soluções (English)
  • Guias (English)
  • Glossário (English)
  • Jurídico (English)
  • Ferramentas (English)
  • Ajudando a Coursera a levar educação a milhões de pessoas no mundo todo (English)
  • Suporte da Transloadit
  • Suporte a código aberto (English)
  • Acordo de nível de serviço (English)
EssenciaisRobotsPerguntas frequentesEN (English)APIFormatosEN (English)Boas práticas
Uploads de arquivos
  • /upload/handle
    Gerenciar uploads
Importação de arquivos
  • /azure/import
    Importar arquivos do Azure
  • /backblaze/import
    Importar arquivos do Backblaze
  • /box/import
    Importar arquivos do Box
  • /mega/import
    Importar arquivos do MEGA S4 Object Storage
  • /cloudfiles/import
    Importar arquivos do Rackspace Cloud Files
  • /cloudflare/import
    Importar arquivos do Cloudflare R2
  • /digitalocean/import
    Importar arquivos do DigitalOcean Spaces
  • /dropbox/import
    Importar arquivos do Dropbox
  • /ftp/import
    Importar arquivos de servidores FTP
  • /google/import
    Importar arquivos do Google Cloud Storage
  • /http/import
    Importar arquivos de servidores web
  • /minio/import
    Importar arquivos do MinIO
  • /s3/import
    Importar arquivos do Amazon S3
  • /sftp/import
    Importar arquivos de servidores SFTP
  • /supabase/import
    Importar arquivos do Supabase Storage
  • /swift/import
    Importar arquivos do OpenStack Swift
  • /tigris/import
    Importar arquivos do Tigris
  • /transloadit/import
    Importar arquivos do Transloadit Storage
    EN (English)
  • /vimeo/import
    Importar vídeos do Vimeo
  • /wasabi/import
    Importar arquivos do Wasabi
Codificação de vídeo
  • /video/adaptive
    Converter vídeos para HLS, MPEG-Dash e CMAF
  • /video/artwork
    Extrair ou inserir arte de capa de vídeos
  • /video/concat
    Concatenar vídeos
  • /video/encode
    Transcodificar, redimensionar ou aplicar marca-d’água em vídeos
  • /video/merge
    Mesclar vídeo, áudio e imagens em um único vídeo
  • /video/ondemand
    Transmitir vídeos com codificação sob demanda
  • /video/split
    Dividir vídeo
  • /video/subtitle
    Adicionar legendas a vídeos
  • /video/thumbs
    Extrair miniaturas de vídeos
  • Predefinições de vídeoEN (English)
Codificação de áudio
  • /audio/artwork
    Extrair ou inserir arte de capa de áudios
  • /audio/concat
    Concatenar áudio
  • /audio/split
    Dividir áudio
  • /audio/encode
    Codificar áudio
  • /audio/loop
    Criar loop de áudio
  • /audio/merge
    Mesclar arquivos de áudio em um só
  • /audio/waveform
    Gerar imagens de forma de onda a partir de áudio
  • Predefinições de áudioEN (English)
Processamento de imagens
  • /image/bgremove
    Remover o fundo de imagens
  • /image/enhance
    Aprimorar imagens
    EN (English)
  • /image/merge
    Mesclar várias imagens em uma única imagem
  • /image/optimize
    Otimizar imagens sem perda de qualidade
  • /image/resize
    Converter, redimensionar ou aplicar marca-d’água em imagens
Processamento de documentos
  • /document/autorotate
    Girar documentos automaticamente
  • /document/convert
    Converter documentos para formatos diferentes
  • /document/extract
    Extrair texto e imagens incorporadas
  • /document/merge
    Mesclar documentos em um só
  • /document/optimize
    Otimizar o tamanho de arquivos PDF
    EN (English)
  • /file/read
    Ler o conteúdo de arquivos
  • /document/split
    Extrair páginas
  • /document/thumbs
    Extrair imagens em miniatura de documentos
  • /html/convert
    Fazer capturas de tela de páginas web ou arquivos HTML
Inteligência artificial
  • /document/ocr
    Reconhecer texto em documentos (OCR)
  • /image/describe
    Reconhecer objetos em imagens
  • /image/facedetect
    Detectar rostos em imagens
  • /image/generate
    Gerar imagens a partir de prompts de texto
  • /image/upscale
    Aumentar a resolução de imagens
    EN (English)
  • /image/ocr
    Reconhecer texto em imagens (OCR)
  • /speech/transcribe
    Transcrever fala em arquivos de áudio ou vídeo
  • /text/speak
    Sintetizar fala em documentos
  • /text/translate
    Traduzir texto em documentos
  • /ai/chat
    Gerar respostas de chat com IA
    EN (English)
  • /video/generate
    Gerar vídeos a partir de prompts de texto
Filtragem de arquivos e segurança
  • /file/filter
    Filtrar arquivos
  • /file/verify
    Verificar o tipo de arquivo
  • /file/virusscan
    Analisar arquivos em busca de vírus
Catalogação de mídia
  • /file/hash
    Gerar hash de arquivos
  • /file/preview
    Gerar uma miniatura de pré-visualização
    EN (English)
  • /meta/write
    Gravar metadados em mídias
Compressão de arquivos
  • /file/compress
    Comprimir arquivos
  • /file/decompress
    Descompactar arquivos compactados
Avaliação de código
  • /http/request
    Chamar endpoints HTTP
    EN (English)
  • /script/run
    Executar scripts em Assemblies
Exportação de arquivos
  • DownloadsEN (English)
  • /azure/store
    Exportar arquivos para o Microsoft Azure
  • /backblaze/store
    Exportar arquivos para o Backblaze
  • /box/store
    Exportar arquivos para o Box
  • /mega/store
    Exportar arquivos para o MEGA S4 Object Storage
  • /cloudfiles/store
    Exportar arquivos para o Rackspace Cloud Files
  • /cloudflare/store
    Exportar arquivos para o Cloudflare R2
  • /digitalocean/store
    Exportar arquivos para o DigitalOcean Spaces
  • /dropbox/store
    Exportar arquivos para o Dropbox
  • /ftp/store
    Exportar arquivos para servidores FTP
  • /google/store
    Exportar arquivos para o Google Cloud Storage
  • /minio/store
    Exportar arquivos para o MinIO
  • /s3/store
    Exportar arquivos para o Amazon S3
  • /sftp/store
    Exportar arquivos para servidores SFTP
  • /supabase/store
    Exportar arquivos para o Supabase Storage
  • /swift/store
    Exportar arquivos para o OpenStack Swift
  • /tigris/store
    Exportar arquivos para o Tigris
  • /transloadit/store
    Armazenar arquivos no Transloadit Storage
    EN (English)
  • /tus/store
    Exportar arquivos para servidores compatíveis com tus
  • /vimeo/store
    Exportar arquivos para o Vimeo
  • /wasabi/store
    Exportar arquivos para o Wasabi
  • /youtube/store
    Exportar arquivos para o YouTube
Smart CDN
  • /file/serve
    Servir arquivos para navegadores web
  • /tlcdn/deliver
    Armazenar em cache e entregar arquivos globalmente
  • Preços

Transcrever fala em arquivos de áudio ou vídeo

🤖/speech/transcribe transcreve a fala em arquivos de áudio ou vídeo.

/speech/transcribe Robot

Você pode usar o texto que retornamos na sua aplicação ou passá-lo para outros Robots para filtrar arquivos de áudio ou vídeo que contenham (ou não contenham) determinado conteúdo, ou gravar o texto em imagens ou vídeos, por exemplo.

Outro caso de uso comum é legendar vídeos automaticamente ou permitir pesquisas no conteúdo de áudios.

Defina speaker_labels como true quando quiser que a saída da transcrição em JSON ou meta diferencie falantes recorrentes:

{
  "steps": {
    "transcribed": {
      "use": ":original",
      "robot": "/speech/transcribe",
      "provider": "aws",
      "format": "json",
      "speaker_labels": true,
      "max_speakers": 3
    }
  }
}

Atualmente, os provedores aws e gcp oferecem suporte a rótulos de falantes. Se você habilitar speaker_labels sem definir provider, a Transloadit usará aws nesse Step. Os rótulos são normalizados como speaker_1, speaker_2 e assim por diante:

{
  "text": "Hello there. Hi!",
  "words": [
    { "text": "Hello", "startTime": 0, "endTime": 0.5, "speaker": "speaker_1" },
    { "text": "there", "startTime": 0.6, "endTime": 1, "speaker": "speaker_1" },
    { "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
  ],
  "segments": [
    { "text": "Hello there", "startTime": 0, "endTime": 1, "speaker": "speaker_1" },
    { "text": "Hi!", "startTime": 1.2, "endTime": 1.8, "speaker": "speaker_2" }
  ]
}

Exemplo de uso

Transcreva a fala em francês de áudio ou vídeo carregado por upload e salve a transcrição em um arquivo de texto:

{
  "steps": {
    "transcribed": {
      "format": "text",
      "provider": "replicate",
      "robot": "/speech/transcribe",
      "target_language": "french",
      "use": ":original"
    }
  }
}

Parâmetros

  • interpolate

    boolean | Record<string, boolean>

    Controla se as Assembly Variables são interpoladas em campos individuais de instruções.

    Por padrão, a maioria dos campos de instruções dos Robots interpola Assembly Variables. Defina isso como false para tratar todos os campos de instruções como texto literal, ou defina o caminho de um campo individual como false para tratar apenas esse campo como texto literal. Para campos específicos de um Robot que são literais por padrão, defina isso como true ou defina o caminho desse campo como true para voltar a usar a interpolação.

    Use nomes de campos como path ou caminhos com pontos como ffmpeg.vf para objetos aninhados.

  • output_meta

    Record<string, boolean> | boolean | Array<string>

    Permite especificar um conjunto de metadados cujo cálculo exige mais CPU e que, por isso, vem desativado por padrão para manter o processamento das suas Assemblies rápido.

    Para imagens, você pode adicionar "has_transparency": true neste objeto para extrair se a imagem contém partes transparentes e "dominant_colors": true para extrair um array de códigos de cores hexadecimais da imagem.

    Para imagens, você também pode adicionar "blurhash": true para extrair uma string BlurHash⁠ — uma representação compacta de um placeholder da imagem, útil para exibir uma prévia desfocada enquanto a imagem completa carrega.

    Para vídeos, você pode adicionar o parâmetro "colorspace": true para extrair o espaço de cores do vídeo de saída.

    Para vídeos, você também pode adicionar "interlaced": true para detectar se o vídeo é entrelaçado. Isso combina a flag computacionalmente barata field_order do ffprobe com uma passagem de amostragem idet limitada sobre os primeiros quadros da origem, expondo interlaced, field_order e um objeto de diagnóstico interlace_detection em file.meta. Isso é computacionalmente caro e cobrado de acordo.

    Para áudio, você pode adicionar "mean_volume": true para obter um único valor que representa o volume médio do arquivo de áudio.

    Você também pode definir isso como false para pular a extração de metadados e acelerar a transcodificação.

  • user_meta

    Record<string, any>(padrão: {})

    Adiciona metadados JSON personalizados a cada arquivo emitido sem modificar seu conteúdo. Objetos e arrays aninhados são suportados.

    A herança depende do Robot. Os valores são mesclados com o user_meta existente no arquivo de saída; o Step atual substitui as chaves de nível superior com o mesmo nome. Atribua explicitamente as chaves necessárias quando um Robot criar novas saídas.

    Nos Steps de processamento, ${file.*} se refere à primeira entrada e ${result.*} ao arquivo emitido. Os valores são avaliados para cada saída após a execução do Robot, antes da extração subsequente de metadados e do armazenamento temporário. Em :original, os valores são avaliados para cada upload antes da extração de metadados.

    Os Steps subsequentes leem ${file.user_meta.key}. Consulte Metadados personalizados para ver um exemplo completo e as regras de herança.

  • result

    boolean(padrão: false)

    Se os resultados deste Step devem estar presentes no Assembly Status JSON

  • queue

    batch

    Definir a fila como “batch” rebaixa manualmente a prioridade dos Jobs deste Step, para evitar o consumo de vagas prioritárias de Jobs em Jobs que não precisam de tempo zero de espera na fila

  • force_accept

    boolean(padrão: false)

    Forçar um Robot a aceitar um tipo de arquivo que ele teria ignorado.

    Por padrão, os Robots ignoram arquivos que não conhecem. O 🤖/video/encode, por exemplo, ignora tranquilamente imagens de entrada.

    Com o parâmetro force_accept definido como true, você pode forçar os Robots a aceitar todos os arquivos enviados a eles. Isso normalmente leva a erros e só deve ser usado para depuração ou para lidar com casos extremos.

  • ignore_errors

    boolean | Array<meta | execute>(padrão: [])

    Ignorar erros durante fases específicas do processamento.

    Definir isso como ["meta"] fará com que o Robot ignore erros durante a extração de metadados.

    Definir isso como ["execute"] fará com que o Robot ignore erros durante a fase principal de execução.

    Definir isso como true equivale a ["meta", "execute"] e fará com que erros sejam ignorados nas duas fases.

  • use

    string | Array<string> | Array<object> | object

    Especifica quais Steps usar como entrada.

    • Você pode escolher qualquer nome para os Steps, exceto ":original" (reservado para uploads de usuários tratados pela Transloadit)
    • Você pode fornecer vários Steps como entrada usando arrays:
      {
        "use": [
          ":original",
          "encoded",
          "resized"
        ]
      }
      
    • Você também pode marcar os Steps de entrada com as para transmitir intenção semântica aos Robots:
      {
        "use": [
          {
            "name": ":original",
            "as": "image"
          },
          {
            "name": ":original",
            "as": "mask"
          }
        ]
      }
      
    Dica

    Provavelmente é tudo o que você precisa saber sobre use, mas você pode ver os casos de uso avançados.

  • provider

    auto | aws | gcp | replicate(padrão: "auto")

    Escolhe o melhor provedor com base na sua solicitação.

    Defina isso como "aws", "gcp" ou "replicate" para forçar um provedor específico. Quando definido como "auto", a Transloadit usa "replicate" por padrão e usa "aws" quando speaker_labels está ativado.

  • granularity

    full | list(padrão: "full")

    Atualmente, tanto "full" quanto "list" retornam a mesma resposta completa de transcrição. "list" continua sendo aceito para manter a compatibilidade com versões anteriores.

  • format

    json | meta | srt | text | webvtt(padrão: "json")

    Formato de saída da transcrição.

    • "text" gera um arquivo de texto simples que você pode armazenar e processar.
    • "json" gera um arquivo JSON com palavras acompanhadas de marcações de tempo. Quando speaker_labels está habilitado, as palavras podem incluir rótulos speaker e o JSON também pode incluir segments agrupados por falante.
    • "srt" e "webvtt" geram arquivos de legendas desses respectivos tipos, que podem ser armazenados separadamente ou usados em outros Steps de codificação.
    • "meta" não retorna um arquivo, mas armazena os dados no objeto de arquivo da Transloadit (em ${file.meta.transcription.text}, ${file.meta.transcription.words} e, quando há rótulos de falantes disponíveis, ${file.meta.transcription.segments}), que é passado entre os Steps de codificação, para que você possa usar os valores para gravar os dados em vídeos, filtrar com base neles etc.
  • speaker_labels

    boolean(padrão: false)

    Quando habilitado, a Transloadit solicita ao provedor de transcrição que diferencie os falantes. As saídas JSON e meta podem então incluir rótulos speaker, como "speaker_1", em palavras individuais, além de segments agrupados por falante. O comportamento das saídas de texto, SRT e WebVTT permanece inalterado.

    Os rótulos de falantes identificam vozes recorrentes, não nomes reais de pessoas. A precisão depende da qualidade do áudio, do ruído de fundo, da sobreposição de falas e do número de falantes.

  • max_speakers

    string | number(padrão: 10)

    O número máximo de falantes a detectar quando speaker_labels está habilitado.

  • source_language

    string(padrão: "en-US")

    Define o idioma falado para os provedores "aws" e "gcp". A transcrição permanece no idioma falado; este parâmetro não traduz a fala.

    O idioma deve ser especificado no formato BCP-47⁠, como "en-GB", "de-DE" ou "fr-FR". Consulte também a lista de idiomas compatíveis com o provedor gcp⁠ e o provedor aws⁠.

  • target_language

    string

    Define uma indicação do idioma falado para o provedor "replicate". Omita este parâmetro para detectar o idioma falado automaticamente. Quando o idioma falado for conhecido, defina o parâmetro com o nome completo do idioma em inglês e em letras minúsculas, como "french". Apesar do nome, este parâmetro não traduz a fala.

    Para os provedores "aws" e "gcp", use source_language em vez deste parâmetro.

Demonstrações

  • Produce a SRT file from audio or video files EN (English)
  • Automatic speech transcription service EN (English)

Publicações relacionadas no blog

  • Tech preview: new AI Robots for enhanced media processing EN (English) 17 de fevereiro de 2020
  • New feature: auto-transcribe videos with subtitles EN (English) 8 de março de 2021
  • Building a screen reader plugin with /text/speak Robot EN (English) 3 de junho de 2021
  • Building an AI-powered video dubber with Transloadit EN (English) 9 de julho de 2021
  • Transloadit’s 2021 milestones and progress EN (English) 31 de janeiro de 2022
  • Build a Reddit video subtitling bot with Transloadit EN (English) 10 de fevereiro de 2022
  • Creating engaging audio visualizations with Transloadit EN (English) 2 de abril de 2023
Página anterior ← /image/ocrPróxima página /text/speak →
Falar com o suporte⁠

TransloaditVerificando status…

Produto

  • Serviços
  • Preços
  • Demonstrações EN (English)
  • Ferramentas EN (English)
  • Segurança EN (English)
  • Suporte

Empresa

  • Sobre EN (English)/Imprensa EN (English)
  • Blog EN (English)/Vagas EN (English)
  • Comparações EN (English)/Matriz de conformidade EN (English)
  • Pesquisa EN (English)
  • Código aberto EN (English)
  • Soluções EN (English)

Documentação

  • Primeiros passos
  • Transcodificação
  • Perguntas frequentes EN (English)
  • API
  • Guias EN (English)/Dicas para devs EN (English)
  • Formatos suportados EN (English)

Mais

  • Status da plataforma⁠
  • Fórum da comunidade⁠
  • StackOverflow⁠
  • Uppy EN (English)
  • tus⁠

© 2009–2026 Transloadit-II GmbH

Privacidade EN (English)Termos EN (English)Aviso legal EN (English)
EnglishDeutschEspañolPortuguês (Brasil)