Para onde seu arquivo realmente vai quando você o envia a um conversor online

Quando você envia um arquivo a um conversor baseado em servidor, ele é copiado pela rede para uma máquina que você não possui, gravado em um diretório temporário, processado por software que roda nesse servidor e oferecido de volta a você como download. A partir do primeiro byte, o arquivo está nas mãos de outra pessoa.

O fluxo é comum e bastante consistente entre os serviços. Seu navegador envia uma requisição POST com o arquivo codificado como multipart/form-data; o servidor o salva com um nome aleatório em uma pasta temporária; um processo worker o entrega a uma ferramenta de linha de comando como Ghostscript, FFmpeg ou ImageMagick; a saída final é armazenada e um link é devolvido; uma tarefa agendada exclui os arquivos antigos. Cada etapa após o upload acontece em hardware que você não tem visibilidade, e a etapa de exclusão é uma política que o provedor controla, e não uma garantia que a tecnologia impõe.

A pergunta que as pessoas realmente fazem não é como um conversor funciona, é se o arquivo desapareceu depois. Essa pergunta tem duas partes: a mecânica de um upload é pública e fácil de observar, enquanto o que uma empresa específica faz com seu armazenamento depois não é.

Compressor de imagem

A arquitetura oposta. O arquivo é lido para dentro da aba do navegador, redimensionado na sua própria CPU e devolvido como download. Nada é transmitido.

Abrir o compressor

O fluxo por trás de um botão de upload

Quase todo conversor baseado em servidor segue as mesmas seis etapas, e cada etapa é um lugar onde uma cópia pode existir.

EtapaO que acontece
1. EnvioO navegador envia o arquivo como uma requisição POST multipart/form-data por HTTPS.
2. RecebimentoO servidor grava o arquivo em um diretório temporário, muitas vezes no mesmo disco que atende outros usuários.
3. FilaUma tarefa é criada e um worker a pega, às vezes segundos depois, às vezes só quando a fila esvazia.
4. ConversãoUm mecanismo de linha de comando como Ghostscript, FFmpeg, ImageMagick, qpdf ou LibreOffice faz o trabalho.
5. EntregaA saída é armazenada e um link ou uma resposta em streaming é devolvida ao seu navegador.
6. LimpezaUma tarefa agendada remove os arquivos de entrada e de saída quando a janela de retenção expira.

O HTTPS protege as etapas um e cinco. Ele impede que um observador de rede leia o arquivo em trânsito, e não faz nada nas etapas dois, três, quatro e seis, porque ali o arquivo fica em forma legível em uma máquina que pertence a outra pessoa.

O que uma promessa de exclusão realmente é

Quando um site diz que os arquivos são excluídos após uma hora, ele está descrevendo um estado pretendido do seu armazenamento, e não uma propriedade técnica do upload. A distinção importa mais do que parece.

Uma ferramenta local que nunca transmite o arquivo tem uma garantia estrutural: não há cópia remota a excluir, então não há nada a dar errado. Uma ferramenta baseada em servidor tem uma promessa processual: uma tarefa será executada, a tarefa encontrará o arquivo e a exclusão terá sucesso. Essa promessa pode falhar de formas comuns. Um worker que travou pode deixar um arquivo para trás sem registro para limpar. Uma conversão que falhou pode estacionar o arquivo em uma fila de erro que a tarefa de limpeza não varre. Uma camada de cache na frente do endpoint de download pode guardar uma cópia por mais tempo que a origem, e os backups podem capturar um instantâneo no momento errado. Nenhuma dessas situações exige que alguém seja desonesto, e nenhuma é visível para você.

Há também um problema de escopo. As declarações de retenção normalmente descrevem o arquivo enviado e a saída convertida, e raramente enumeram derivados: miniaturas de pré-visualização, texto extraído para busca, resultados de varredura de vírus, logs com nomes de arquivo originais, ou eventos de analytics que registram um hash de arquivo. Uma janela curta no objeto principal não cobre todos eles.

Como ler uma política de retenção

Você não precisa de formação jurídica para ler uma página de privacidade de forma útil. Separe as frases que descrevem um mecanismo das frases que descrevem uma intenção.

  • Texto mecanístico. Os arquivos são armazenados em um bucket criptografado e destruídos automaticamente após 60 minutos por uma tarefa agendada. Isso informa onde o arquivo fica, por quanto tempo e o que o remove.
  • Texto intencional. Respeitamos sua privacidade e levamos a proteção de dados a sério. Isso é verdade para quase todo provedor e não diz nada sobre o que você pode agir.
  • Texto de permissão. Podemos reter arquivos para melhorar nossos serviços, para cumprir obrigações legais ou para compartilhar com parceiros de confiança. Essa é a frase que decide o risco, e normalmente está na seção que as pessoas pulam.
  • Texto ausente. Sem seção de retenção, sem detalhe de processamento de dados, sem contato para pedidos de privacidade. Trate o silêncio como a opção menos protetora disponível.

Vale procurar duas frases. As palavras pode reter marcam uma decisão discricionária, e não um período fixo, e os nomes dos subprocessadores também importam, porque um arquivo encaminhado a um terceiro para varredura ou armazenamento também está sujeito à política desse terceiro.

O que o processamento local remove do cenário

Uma ferramenta baseada em navegador executa o mesmo tipo de mecanismo, FFmpeg ou Tesseract ou um pipeline de canvas, mas compilado para WebAssembly e executado dentro da sua aba. É assim que Comprimir PDF e PDF para texto funcionam, e a arquitetura muda quais etapas existem.

Ferramenta baseada em navegadorConversor baseado em servidor
Cópias que saem do seu dispositivoNenhumPelo menos uma, geralmente duas
RetençãoNão aplicávelRegido pela política deles
Pode ser auditado por vocêSim, no painel de redeNão
Sobrevive a um vazamento do provedorSim, não há nada para vazarDepende do que foi armazenado
VelocidadeLimitado pelo seu dispositivoLimitado pela fila deles
Arquivos grandesLimitado pela memória do navegadorLimitado pelos limites do plano deles

Esse último par de linhas é a troca honesta. Um servidor com hardware dedicado termina um trabalho pesado mais rápido que um notebook e aceita arquivos que um navegador não consegue manter na memória. Para um vídeo de 200 MB que você encontrou online e precisa como MP3, enviar é uma decisão de engenharia razoável. Para uma digitalização de um acordo assinado, é muito mais difícil justificar.

Quando enviar é uma escolha razoável

Enviar não é um erro em si, e tratar todo servidor como hostil é um tipo de falha por si só, porque empurra as pessoas para soluções piores. A questão é o que está no arquivo e quem é afetado se ele for lido.

ArquivoEnviá-lo
Uma foto de banco de imagens ou uma captura de tela de uma página públicaSem problema. Não há nada nele que já não seja público.
Um folheto, cardápio ou lista de preços publicadoSem problema. É um ativo de marketing que você já distribui.
Sua própria foto pessoal de uma paisagemRisco baixo, embora o arquivo carregue metadados de localização.
Um PDF que já circula publicamenteRisco baixo, desde que a cópia que você tem não tenha anotações.

Note o qualificador nessa última linha. Um arquivo ser público não significa que a versão nas suas mãos seja pública. Comentários, alterações controladas e marcas de revisão viajam com o arquivo, e eles frequentemente contêm reflexões que nunca deveriam ser compartilhadas. Limpar um documento é um trabalho separado de convertê-lo.

Quando não é

Essas categorias não devem ir para um conversor de uso geral, por melhor que pareça sua página de privacidade.

  • Documentos de identidade. Passaportes, carteiras de motorista, documentos de identidade nacionais, autorizações de residência. Uma digitalização basta para tentar fraude de identidade, e o arquivo não pode ser desvazado.
  • Contratos e petições legais. Qualquer coisa não assinada, não tarjada ou em negociação, incluindo os rascunhos anotados que circulam dentro de um negócio.
  • Prontuários médicos. Resultados de exames, cartas de encaminhamento, pedidos de seguro, documentação de deficiência. Esses identificam uma pessoa e descrevem sua saúde ao mesmo tempo.
  • Dados de funcionários e candidatos. Cartas de oferta, avaliações de desempenho, anotações disciplinares, arquivos de folha de pagamento, resultados de verificação de antecedentes. A organização tem deveres em relação a essas pessoas que um site conversor nunca assumiu.
  • Dados de clientes. Listas de contatos, faturas, anexos de suporte, qualquer coisa que associe um nome a uma compra ou a uma reclamação.
  • Material não lançado. Designs de produto, capturas de tela não lançadas, demonstrações financeiras antes da publicação, documentos de origem por trás de um lançamento.

Se um arquivo dessa lista realmente precisa ser convertido, converta-o localmente, ou converta uma versão tarjada. O mesmo trabalho normalmente pode ser feito sem que o arquivo saia da máquina em que está.

Como verificar um site específico por conta própria

A explicação geral acima importa menos do que o que um site específico faz, e você pode descobrir isso em cerca de dois minutos sem confiar na palavra de ninguém.

  1. Observe o painel de rede. Adicione um pequeno arquivo de teste e procure uma requisição POST. Se o corpo de uma requisição carrega seu arquivo, o arquivo foi para um servidor, diga o que disser a página de marketing.
  2. Desconecte e tente de novo. Desligue sua rede e repita a operação. Uma ferramenta local continua funcionando; uma ferramenta de servidor falha ou trava.
  3. Leia a página de privacidade na seção de retenção. Observe se ele dá uma duração e um mecanismo, ou apenas uma intenção.
  4. Verifique o que a ferramenta envia após a tarefa. Requisições de analytics, relatórios de erros e de fontes são normais. Uma requisição que carrega o conteúdo do arquivo uma segunda vez não é.

Há um passo a passo mais longo dessas verificações, incluindo o que cada resultado significa e os casos em que a resposta é genuinamente ambígua, em como saber se um site envia seus arquivos.

Onde esta explicação para

Esta página descreve como a arquitetura comum funciona e como raciocinar sobre ela. Ela não pode dizer o que qualquer empresa nomeada realmente faz com um arquivo, e nada em uma página pública substitui a inspeção da ferramenta por você mesmo ou a posição que a sua própria organização adotou sobre processamento por terceiros.

Vale dizer três limites de forma clara. Uma ferramenta local não é automaticamente livre de risco: uma extensão de navegador com permissões amplas, uma dependência comprometida ou um computador compartilhado podem expor um arquivo que nunca saiu do dispositivo. Um upload também pode ser aceitável e ainda assim ser a escolha errada, por exemplo quando envia um documento para um fluxo de trabalho sem trilha de auditoria. E este artigo não faz nenhuma afirmação sobre exigências legais de qualquer jurisdição, então decisões que carregam consequências reais pertencem às suas próprias equipes jurídica e de segurança.


Perguntas frequentes

Normalmente não, mas a resposta honesta é que você não consegue verificar isso de fora. Um conversor que diz que exclui arquivos após uma hora está descrevendo uma política, e não uma propriedade da tecnologia, então a única suposição segura é que uma cópia existiu. Entre o momento em que seu upload termina e o momento em que o cronômetro expira, uma cópia completa do seu arquivo fica no armazenamento do provedor. Se ela é removida no prazo depende de o código deles rodar corretamente, dos logs, dos backups e da equipe. Alguns serviços mantêm derivados como miniaturas, pré-visualizações, logs de conversão ou cópias em cache por mais tempo que o original, e raramente são mencionados no número principal de retenção. Arquivos também podem persistir em uma fila após uma conversão que falhou, onde nada aciona a tarefa de limpeza. Trate a promessa de exclusão como uma declaração de intenção e planeje com a suposição de que o arquivo existiu no disco de outra pessoa, porque existiu.
Às vezes, e depende inteiramente do que está no documento, e não de a ferramenta ter boa reputação. Um cardápio público, um comunicado de imprensa já publicado ou uma foto de banco que você possui carregam muito pouco risco, porque o pior resultado é que uma cópia permaneça em algum lugar que você não controla. Um contrato assinado, uma digitalização de passaporte, um contracheque, uma carta médica ou uma lista de nomes de clientes é uma situação diferente, porque o dano de um vazamento não desaparece quando o arquivo é excluído. A criptografia de transporte protege o arquivo no caminho até o servidor, não do servidor. Ela também não impede que o provedor escaneie o conteúdo para detecção de abuso, o indexe para busca ou o processe com sistemas automatizados. Antes de arrastar um arquivo para um conversor, pergunte quanto o arquivo vale se acabar nas mãos erradas, e se a conversão poderia ter sido feita localmente em vez disso.
Você normalmente consegue perceber por três sinais que são visíveis antes de você enviar qualquer coisa. Abra as ferramentas de desenvolvedor do navegador, mude para o painel de rede e observe o que acontece quando você adiciona um arquivo. Uma ferramenta que roda localmente carregará arquivos JavaScript e WebAssembly, e a única requisição grande durante o processamento é o código do mecanismo, e não o seu documento. Uma ferramenta baseada em servidor mostrará uma requisição POST carregando o próprio arquivo, normalmente com um tipo de conteúdo multipart/form-data, e a resposta que volta é o arquivo convertido. Segundo, uma ferramenta local continua funcionando depois que você se desconecta da internet, o que é trivial de testar. Terceiro, leia o texto: o processamento acontece no seu dispositivo é uma afirmação diferente de excluímos os arquivos após uma hora. Um site que descreve uma janela de retenção está dizendo que o arquivo chega aos servidores dele, porque um arquivo que nunca saiu da sua máquina não precisaria de um cronograma de exclusão.
Não. Remover o arquivo da sua pasta de downloads, fechar a aba ou limpar os dados do navegador não tem efeito sobre a cópia que foi enviada ao servidor. Essas ações só tocam na sua própria máquina, e quando você as toma o upload já foi concluído. O provedor exclui a cópia remota conforme o próprio cronograma, a própria fila de tarefas e as próprias configurações de retenção, nenhum dos quais você consegue ver ou acionar. Essa é a parte que surpreende as pessoas: o botão de excluir em uma interface web muitas vezes remove o arquivo da sua lista de sessão enquanto o objeto subjacente permanece no armazenamento até um processo de limpeza rodar. Se o documento era sensível o bastante para você querer vê-lo desaparecer imediatamente, a exclusão tem que acontecer antes do upload, não enviando de forma alguma. Assim que os bytes estão no disco de outra pessoa, suas opções se estreitam a pedir que ela o exclua.
Qualquer coisa que identifique uma pessoa, tenha peso legal ou pertença a outra pessoa deve ficar fora de servidores de terceiros: documentos de identidade, contratos assinados, prontuários médicos, contracheques e declarações de impostos, arquivos de funcionários, listas de clientes e trabalho criativo não lançado. O risco não é que todo provedor seja mal-intencionado, é que a cópia existe em algum lugar que você não controla, regido por uma política que você não pode auditar. Se a conversão precisa acontecer e o arquivo é de fato sensível, as opções são tarjá-lo primeiro, dividir a tarefa para enviar apenas a parte inofensiva, ou usar uma ferramenta que roda no navegador. O material público tem o perfil oposto: uma imagem de banco, um folheto publicado ou uma captura de tela de uma página pública podem ser enviados para quase qualquer lugar. Pergunte quem é prejudicado se este arquivo específico for lido por um estranho.

Mantenha o arquivo onde ele já está

Grátis, privado e ilimitado. Não precisa de conta.

Abrir o Compressor de imagem