Comment extraire des données de plusieurs PDF vers Excel (2026)
Pour extraire les mêmes données de plusieurs PDF vers un seul tableau Excel, il faut une méthode qui retrouve chaque valeur par son étiquette ou son format (le montant après « Total TTC », la date après « Date de facture ») et non par sa position sur la page. Power Query, dans Excel, convient quand tous les PDF ont la même mise en page ; quand elle change d'un émetteur à l'autre, passez par un script, un service d'extraction par modèles ou un outil qui lit le texte de chaque PDF et produit une ligne par fichier. Un PDF scanné, sans texte sélectionnable, doit d'abord passer par une reconnaissance de caractères (OCR).
Le besoin type
Trente factures fournisseurs du mois, douze relevés, cent bulletins ou rapports : on veut un tableau avec une ligne par document et des colonnes comme nom du fichier, numéro, date, montant HT, TVA, TTC, SIRET du fournisseur. Les valeurs sont dans chaque PDF, mais pas au même endroit, ni avec le même libellé (« Total TTC », « Net à payer », « Montant dû »).
Les méthodes comparées
| Méthode | Mises en page différentes | Dates et montants reconnus par Excel | Mise en place | Où vont les PDF |
|---|---|---|---|---|
| Copier-coller | Oui | Seulement si la saisie est propre | Aucune, mais ne passe pas à l'échelle | Restent sur le poste |
| Power Query (Obtenir des données > À partir d'un PDF ou d'un dossier) | Mal : importe les tableaux détectés, étapes construites sur un fichier exemple | Oui, après conversion des types | Moyenne (requêtes, code M) | Restent sur le poste |
| Acrobat, export vers Excel, puis formules | Un fichier à la fois | En partie | Lourde pour beaucoup de fichiers | Selon votre configuration Acrobat |
| Script Python (pdfplumber ou pypdf + expressions régulières) | Oui, avec une règle par champ | Oui | Forte (code, maintenance) | Restent sur le poste |
| Services en ligne (Docparser, Parseur, Nanonets) | Oui, modèles ou IA | Oui | Moyenne | Envoyés chez le prestataire |
| Outil dans le navigateur, extraction par étiquette | Oui | Oui | Faible | Restent dans le navigateur |
Power Query : quand ça marche, quand ça casse
Le connecteur PDF de Power Query renvoie les tableaux trouvés dans un PDF. Pour plusieurs fichiers, Microsoft renvoie vers le connecteur Dossier et la combinaison de fichiers, qui construit ses étapes à partir d'un fichier exemple (par défaut le premier de la liste) et suppose que les fichiers ont la même structure, avec les mêmes colonnes.
Cela convient à des relevés d'une même banque, tous générés par le même système. Avec des factures de fournisseurs différents, les tableaux détectés changent d'un fichier à l'autre, et les champs d'en-tête (numéro, date) sont souvent hors de tout tableau. Des réponses sur Microsoft Q&A indiquent par ailleurs que ce connecteur n'existe pas dans Excel pour Mac.
Les formats français à surveiller
- Montants : 1 234,56 (espace pour les milliers, virgule décimale). Un export CSV avec virgule comme séparateur de colonnes casse ces montants ; en France, Excel attend le point-virgule.
- Dates : 03/04/2026 est le 3 avril en France et le 4 mars aux États-Unis. Une date stockée en texte ne se trie pas et ne se filtre pas par mois.
- Identifiants : SIREN (9 chiffres) et SIRET (14 chiffres) ont une clé de contrôle (algorithme de Luhn), le numéro de TVA intracommunautaire français aussi (FR + 2 caractères + SIREN). Vérifier la clé détecte une erreur de lecture.
L'extraction par étiquette dans le navigateur
L'outil Extraire les données de PDF lit le texte de chaque PDF dans le navigateur et produit une ligne par fichier. Chaque colonne est un champ : une étiquette (valeur sur la même ligne ou sur la ligne suivante), une expression régulière, ou un détecteur prêt à l'emploi (date, total TTC, HT, TVA, numéro de facture, numéro de TVA, SIREN et SIRET avec contrôle de Luhn, IBAN avec contrôle modulo 97, e-mail, téléphone). Il propose les paires « étiquette : valeur » trouvées dans le premier PDF, signale les cellules vides en orange et les laisse corriger, puis exporte en XLSX (vraies dates, vrais nombres) ou en CSV point-virgule. L'aperçu est complet ; l'export est gratuit jusqu'à 5 PDF, puis 2,99 € TTC pour 24 h. Les réglages s'enregistrent comme modèle pour le mois suivant.
Contrôles avant d'utiliser le tableau
| Contrôle | Ce qu'il révèle |
|---|---|
| Une ligne par PDF | Fichier illisible, protégé par mot de passe ou scanné |
| Aucune cellule vide | Champ introuvable : libellé différent ou valeur sur une autre ligne |
| HT + TVA = TTC sur chaque ligne | Mauvaise ligne lue pour un des trois montants |
| Pas de numéro de facture en double | Même facture déposée deux fois |
| Somme des TTC comparée au grand livre ou aux paiements | Factures manquantes |
FAQ
Excel peut-il le faire sans complément ? Oui si les PDF ont la même mise en page : Données > Obtenir des données > À partir d'un fichier > À partir d'un dossier, puis combiner. Sinon la requête combinée décale ou perd des colonnes.
Que faire des factures scannées ? Toutes les méthodes fondées sur le texte ont besoin d'une couche texte. Passez les scans dans un logiciel d'OCR, puis extrayez.
Les données de mes factures partent-elles sur un serveur ? Avec un service en ligne, oui : vérifiez la durée de conservation et l'accord de sous-traitance au sens du RGPD. Un script local ou un outil qui fonctionne dans le navigateur ne transmet pas les fichiers.
Et avec la facturation électronique ? La généralisation commence le 1er septembre 2026 pour les grandes entreprises et les ETI, et s'étend aux PME et micro-entreprises à partir du 1er septembre 2027 (service-public.gouv.fr). Les factures électroniques transportent leurs données sous forme structurée ; l'extraction depuis le PDF reste utile pour les factures reçues en PDF simple et pour les archives.