Lorsque vous téléversez un fichier vers un convertisseur basé sur un serveur, il est copié sur le réseau vers une machine qui ne vous appartient pas, écrit dans un répertoire temporaire, traité par un logiciel exécuté sur ce serveur et vous est rendu sous forme de téléchargement. Dès le premier octet, le fichier est entre les mains de quelqu'un d'autre.
Le pipeline est banal et assez constant d'un service à l'autre. Votre navigateur envoie une requête POST avec le fichier encodé en multipart/form-data ; le serveur l'enregistre sous un nom aléatoire dans un dossier temporaire ; un processus worker le confie à un outil en ligne de commande tel que Ghostscript, FFmpeg ou ImageMagick ; la sortie finie est stockée et un lien est renvoyé ; une tâche planifiée supprime les anciens fichiers. Chaque étape après le téléversement se déroule sur du matériel sur lequel vous n'avez aucune visibilité, et l'étape de suppression est une politique que le fournisseur contrôle plutôt qu'une garantie que la technologie impose.
La question que les gens posent réellement n'est pas de savoir comment fonctionne un convertisseur, mais si le fichier a disparu ensuite. Cette question comporte deux volets : la mécanique d'un téléversement est publique et facile à observer, tandis que ce qu'une entreprise précise fait ensuite de son stockage ne l'est pas.
Compresseur d'image
L'architecture inverse. Le fichier est lu dans l'onglet du navigateur, redimensionné sur votre propre CPU et rendu sous forme de téléchargement. Rien n'est transmis.
Le pipeline derrière un bouton de téléversement
Presque tous les convertisseurs basés sur un serveur suivent les mêmes six étapes, et chaque étape est un endroit où une copie peut exister.
| Étape | Ce qui se passe |
|---|---|
| 1. Téléversement | Le navigateur envoie le fichier sous forme de requête POST multipart/form-data via HTTPS. |
| 2. Réception | Le serveur écrit le fichier dans un répertoire temporaire, souvent sur le même disque qui sert d'autres utilisateurs. |
| 3. File d'attente | Une tâche est créée et un worker la prend en charge, parfois quelques secondes plus tard, parfois seulement quand la file se vide. |
| 4. Conversion | Un moteur en ligne de commande tel que Ghostscript, FFmpeg, ImageMagick, qpdf ou LibreOffice fait le travail. |
| 5. Livraison | La sortie est stockée et un lien ou une réponse en streaming est renvoyé à votre navigateur. |
| 6. Nettoyage | Une tâche planifiée supprime les fichiers d'entrée et de sortie lorsque la fenêtre de conservation expire. |
HTTPS protège les étapes un et cinq. Il empêche un observateur du réseau de lire le fichier en transit, et il ne fait rien aux étapes deux, trois, quatre et six, car là le fichier repose sous forme lisible sur une machine qui appartient à quelqu'un d'autre.
Ce qu'est réellement une promesse de suppression
Quand un site affirme que les fichiers sont supprimés après une heure, il décrit un état souhaité de son stockage, pas une propriété technique du téléversement. La distinction compte plus qu'elle n'en a l'air.
Un outil local qui ne transmet jamais le fichier offre une garantie structurelle : il n'y a aucune copie distante à supprimer, donc rien qui puisse mal tourner. Un outil basé sur un serveur repose sur une promesse procédurale : une tâche s'exécutera, la tâche trouvera le fichier et la suppression réussira. Cette promesse peut échouer de façons banales. Un worker planté peut laisser un fichier derrière lui sans enregistrement pour le nettoyer. Une conversion échouée peut parquer le fichier dans une file d'erreurs que le nettoyage ne balaie pas. Une couche de cache devant le point de téléchargement peut conserver une copie plus longtemps que l'origine, et les sauvegardes peuvent capturer un instantané au mauvais moment. Rien de tout cela n'exige que quelqu'un soit malhonnête, et rien de tout cela ne vous est visible.
Il y a aussi un problème de périmètre. Les déclarations de conservation décrivent généralement le fichier téléversé et la sortie convertie, et énumèrent rarement les dérivés : vignettes d'aperçu, texte extrait pour la recherche, résultats d'analyse antivirus, journaux contenant les noms de fichiers d'origine ou événements d'analyse qui enregistrent une empreinte de fichier. Une fenêtre courte sur l'objet principal ne les couvre pas tous.
Comment lire une politique de conservation
Vous n'avez pas besoin d'une formation juridique pour lire utilement une page de confidentialité. Séparez les phrases qui décrivent un mécanisme de celles qui décrivent une intention.
- Formulation mécaniste. Les fichiers sont stockés dans un compartiment chiffré et détruits automatiquement après 60 minutes par une tâche planifiée. Cela vous indique où vit le fichier, pendant combien de temps et ce qui le supprime.
- Formulation d'intention. Nous respectons votre vie privée et prenons la protection des données au sérieux. C'est vrai de presque tous les fournisseurs et ne vous dit rien sur quoi agir.
- Formulation de permission. Nous pouvons conserver les fichiers pour améliorer nos services, pour respecter des obligations légales ou pour les partager avec des partenaires de confiance. C'est la phrase qui décide du risque, et elle se trouve généralement dans la section que les gens sautent.
- Formulation absente. Aucune section sur la conservation, aucun détail sur le traitement des données, aucun contact pour les demandes liées à la vie privée. Traitez le silence comme l'option la moins protectrice disponible.
Deux formulations valent la peine d'être traquées. Les mots "peut conserver" marquent une décision discrétionnaire plutôt qu'une durée fixe, et les noms des sous-traitants comptent aussi, car un fichier transmis à un tiers pour analyse ou stockage est également soumis à la politique de ce tiers.
Ce que le traitement local retire de l'équation
Un outil dans le navigateur exécute le même type de moteur, FFmpeg ou Tesseract ou un pipeline canvas, mais compilé en WebAssembly et exécuté dans votre onglet. C'est ainsi que Compresser un PDF et PDF en texte fonctionnent, et l'architecture change quelles étapes existent tout court.
| Outil dans le navigateur | Convertisseur basé sur un serveur | |
|---|---|---|
| Copies qui quittent votre appareil | Aucun | Au moins une, généralement deux |
| Conservation | Non applicable | Régi par leur politique |
| Vérifiable par vous | Oui, dans le panneau réseau | Non |
| Survit à une violation chez le fournisseur | Oui, il n'y a rien à violer | Dépend de ce qui a été stocké |
| Vitesse | Limité par votre appareil | Limité par leur file d'attente |
| Fichiers volumineux | Limité par la mémoire du navigateur | Limité par les plafonds de leur formule |
Cette dernière paire de lignes est le compromis honnête. Un serveur doté de matériel dédié termine une tâche lourde plus vite qu'un ordinateur portable et accepte des fichiers qu'un navigateur ne peut pas garder en mémoire. Pour une vidéo de 200 MB trouvée en ligne dont vous avez besoin en MP3, le téléversement est une décision d'ingénierie raisonnable. Pour un scan d'un accord signé, c'est bien plus difficile à justifier.
Quand le téléversement est un choix raisonnable
Téléverser n'est pas une erreur en soi, et traiter chaque serveur comme hostile est une autre forme d'échec, car cela pousse les gens vers de pires contournements. La question est de savoir ce que contient le fichier et qui est touché s'il est lu.
| Fichier | Le téléverser |
|---|---|
| Une photo de banque d'images ou une capture d'écran d'une page publique | C'est acceptable. Il ne contient rien qui ne soit déjà public. |
| Une brochure, un menu ou une liste de prix publiés | C'est acceptable. C'est un support marketing que vous diffusez déjà. |
| Votre propre photo personnelle d'un paysage | Risque faible, bien que le fichier porte des métadonnées de localisation. |
| Un PDF qui circule déjà publiquement | Risque faible, à condition que la copie que vous avez ne soit pas annotée. |
Notez la nuance de cette dernière ligne. Qu'un fichier soit public ne signifie pas que la version entre vos mains l'est. Les commentaires, les modifications suivies et les marques de révision voyagent avec le fichier, et ceux-ci contiennent souvent des réflexions qui n'étaient pas destinées à être partagées. Nettoyer un document est une tâche distincte de sa conversion.
Quand ce n'est pas le cas
Ces catégories ne devraient pas aller vers un convertisseur généraliste, quelle que soit la qualité apparente de sa page de confidentialité.
- Documents d'identité. Passeports, permis de conduire, cartes d'identité nationales, titres de séjour. Un scan suffit pour tenter une fraude à l'identité, et le fichier ne peut pas être dé-fuité.
- Contrats et documents juridiques. Tout ce qui n'est pas signé, non caviardé ou en cours de négociation, y compris les brouillons annotés qui circulent au sein d'une transaction.
- Dossiers médicaux. Résultats d'analyses, lettres d'orientation, déclarations d'assurance, documents d'invalidité. Ceux-ci identifient une personne et décrivent en même temps son état de santé.
- Données des employés et des candidats. Lettres d'embauche, évaluations de performance, notes disciplinaires, fichiers de paie, résultats de vérifications d'antécédents. L'organisation a des devoirs envers ces personnes qu'un site de conversion n'a jamais acceptés.
- Données clients. Listes de contacts, factures, pièces jointes du support, tout ce qui associe un nom à un achat ou à une réclamation.
- Contenu non publié. Designs de produits, captures d'écran non publiées, états financiers avant publication, documents sources derrière un lancement.
Si un fichier de cette liste doit réellement être converti, convertissez-le localement, ou convertissez une version caviardée. Le même travail peut généralement se faire sans que le fichier quitte la machine sur laquelle il se trouve.
Comment vérifier vous-même un site précis
L'explication générale ci-dessus compte moins que ce que fait un site particulier, et vous pouvez le découvrir en environ deux minutes sans croire personne sur parole.
- Observez le panneau réseau. Ajoutez un petit fichier de test et cherchez une requête POST. Si le corps d'une requête transporte votre fichier, le fichier est parti vers un serveur, quoi qu'en dise la page marketing.
- Déconnectez-vous et réessayez. Coupez votre réseau et répétez l'opération. Un outil local fonctionne toujours ; un outil serveur échoue ou se bloque.
- Lisez la page de confidentialité pour la section sur la conservation. Notez si elle donne une durée et un mécanisme, ou seulement une intention.
- Vérifiez ce que l'outil envoie après la tâche. Les requêtes d'analyse, de signalement d'erreurs et de polices sont normales. Une requête qui transporte une seconde fois le contenu du fichier ne l'est pas.
Il existe un parcours plus détaillé de ces vérifications, incluant ce que signifie chaque résultat et les cas où la réponse est réellement ambiguë, dans comment savoir si un site web téléverse vos fichiers.
Où s'arrête cette explication
Cette page décrit comment fonctionne l'architecture courante et comment raisonner à son sujet. Elle ne peut pas vous dire ce qu'une entreprise nommée fait réellement d'un fichier, et rien sur une page publique ne remplace l'inspection d'un outil par vous-même ni la position que votre propre organisation a adoptée sur le traitement par des tiers.
Trois limites valent la peine d'être énoncées clairement. Un outil local n'est pas automatiquement sans risque : une extension de navigateur aux larges permissions, une dépendance compromise ou un ordinateur partagé peuvent exposer un fichier qui n'a jamais quitté l'appareil. Un téléversement peut aussi être acceptable et rester le mauvais choix, par exemple lorsqu'il envoie un document dans un flux de travail sans piste d'audit. Et cet article n'affirme rien sur les exigences légales d'une quelconque juridiction, donc les décisions qui ont de vraies conséquences relèvent de vos propres équipes juridiques et de sécurité.