Extraire le texte d'un PDF en toute confidentialité — tout s'exécute dans votre navigateur
Sélectionnez un PDF : la couche de texte de chaque page est extraite localement dans votre navigateur et proposée sous forme de fichier texte téléchargeable — sans envoi.
Quick answer
What it does
Sélectionnez un PDF : la couche de texte de chaque page est extraite localement dans votre navigateur et proposée sous forme de fichier texte téléchargeable — sans envoi.
Free?
Yes — 100% free, no account or sign-up.
Files uploaded?
No — everything is processed in your browser.
Works offline?
Yes — once the page has loaded.
Best for
Copier les clauses d'un contrat depuis un PDF à mise en page fixe vers un éditeur de texte pour révision ou comparaison.
Good to know
Cet outil ne peut extraire que le texte présent sous forme de couche de texte dans le PDF. Les PDF numérisés et les PDF composés uniquement d'images n'ont pas de couche de texte : aucun texte ne sera donc extrait.
How it works
Sélectionnez un fichier PDF sur votre appareil à l'aide du sélecteur de fichiers.
Le fichier est chargé en mémoire du navigateur — aucune donnée ne quitte votre navigateur.
pdf.js charge le document dans un Web Worker et appelle getTextContent() pour chaque page afin de récupérer la couche de texte intégrée.
Le texte extrait de toutes les pages est assemblé dans l'ordre et proposé sous forme de fichier .txt téléchargeable.
Toutes les données temporaires sont libérées de la mémoire une fois le téléchargement terminé.
When to use this tool
Copier les clauses d'un contrat depuis un PDF à mise en page fixe vers un éditeur de texte pour révision ou comparaison.
Extraire le texte principal d'un article de recherche PDF pour le coller dans un outil de traduction ou de synthèse.
Extraire les données ligne par ligne d'une facture PDF comme première étape avant l'importation dans un tableur.
Remarque : fonctionne uniquement avec les PDF comportant une couche de texte intégrée — les PDF numérisés ou uniquement image n'ont pas de texte à extraire.
Frequently asked questions
En quoi cet outil diffère-t-il des autres outils PDF en ligne ?
La plupart des outils PDF en ligne envoient vos fichiers vers un serveur distant pour les traiter. Cet outil traite tout localement dans votre navigateur, en JavaScript côté client. Vos fichiers ne sont transmis à aucun serveur, ce qui veut dire que le contenu de vos documents reste sous votre contrôle.
Mes fichiers PDF sont-ils envoyés sur un serveur ?
Non. Vos fichiers sont lus directement par votre navigateur. Vos fichiers ne sont jamais transmis sur le réseau. L'outil fonctionne entièrement dans l'onglet de navigateur que vous avez ouvert.
Puis-je vérifier que les fichiers ne sont pas envoyés ?
Oui. Ouvrez les outils de développement de votre navigateur (F12), allez dans l'onglet Réseau, puis surveillez les requêtes sortantes pendant que vous utilisez l'outil. Vous verrez qu'aucune donnée de fichier ne quitte votre navigateur. Le site peut enregistrer un comptage anonyme des pages vues, qui n'inclut jamais vos fichiers et peut être désactivé.
Cet outil fonctionne-t-il hors ligne ?
Oui. Une fois la page chargée, l'outil traite vos fichiers entièrement dans votre navigateur ; les fonctionnalités de l'outil ne nécessitent aucune connexion réseau. Vous pouvez vous déconnecter d'Internet et continuer à l'utiliser.
Que se passe-t-il si j'actualise la page ?
Comme rien n'est stocké sur un serveur, actualiser la page réinitialise votre session en cours. Les fichiers que vous aviez sélectionnés devront l'être à nouveau.
Cet outil conserve-t-il mes fichiers ?
Non. Les fichiers ne restent en mémoire du navigateur que tant que la page est ouverte. Fermer ou actualiser la page les supprime. L'outil n'écrit rien sur le disque et n'envoie rien à un serveur.
Cet outil peut-il déverrouiller les PDF protégés par mot de passe ?
Non. Cet outil ne tente pas de retirer ni de contourner la protection par mot de passe d'un PDF. Si vous connaissez le mot de passe, l'outil Déverrouiller un PDF de ce site peut le retirer localement ; cet outil pourra ensuite traiter le fichier.
Quelles technologies cet outil utilise-t-il ?
Cet outil utilise pdf.js (le moteur PDF côté client de Mozilla) dans un Web Worker pour lire la couche de texte intégrée de chaque page du PDF, dans votre navigateur. Vos fichiers ne quittent jamais votre navigateur.
Cet outil utilise-t-il WebAssembly ?
Non. pdf.js est une bibliothèque JavaScript classique — elle n'utilise pas WebAssembly. Toute l'extraction de texte PDF s'effectue en JavaScript côté client dans votre navigateur.
Comment extraire le texte de mon PDF ?
Sélectionnez un PDF avec le sélecteur de fichiers, puis cliquez sur le bouton d'extraction. Le texte de chaque page est lu localement dans votre navigateur, affiché dans une zone d'aperçu, et vous pouvez l'enregistrer sous forme de fichier .txt.
Pourquoi mon PDF numérisé est-il revenu sans texte ?
Cet outil lit la couche de texte intégrée qu'un PDF stocke, et les documents numérisés ou composés uniquement d'images n'ont pas une telle couche, donc rien ne peut en être extrait. Lorsque cela se produit, vous voyez un avis et aucun fichier texte n'est proposé, car il n'y a aucune donnée de caractères à récupérer sans OCR.
Pourquoi le texte extrait ne correspond-il pas à la mise en page visuelle de la page ?
L'outil parcourt les éléments de texte que pdf.js signale pour chaque page et conserve leurs sauts de ligne, mais il ne réagence pas les colonnes, donc les pages multicolonnes, les tableaux et les mises en page complexes peuvent ne pas s'aligner avec ce que vous voyez à l'écran. Les pages sont jointes par des lignes vides, et les PDF aux encodages de police inhabituels ou personnalisés peuvent aussi produire des caractères illisibles même lorsque la page semble correcte.
Extract Text from PDF est-il gratuit ?
Extract Text from PDF est entièrement gratuit — aucun compte, aucune inscription, et aucun plafond sur le nombre de PDF que vous traitez, et ce sera toujours le cas. Votre PDF est lu directement par votre navigateur grâce à pdf.js, qui extrait la couche de texte intégrée page par page et vous remet un fichier .txt brut ; le fichier reste en mémoire de votre navigateur tout au long du processus et n'est jamais transmis nulle part.