Guide des outils JSON : convertir des documents et des données vers JSON et inversement
Ce guide explique comment les outils JSON lisent et écrivent les fichiers, le format de document commun, et quel outil choisir pour chaque tâche.
Pourquoi JSON
JSON est le format de données que les programmes, les services web et les modèles d'IA lisent le plus facilement : des objets à champs nommés, des listes, des nombres, du texte, true, false et null, rien d'autre. Les documents et les feuilles de calcul ne sont pas stockés ainsi. Les outils de cette famille comblent l'écart dans les deux sens : ils transforment les PDF, les fichiers Word, les feuilles de calcul, le CSV, le YAML et le XML en JSON, et ils transforment le JSON en fichiers que les personnes peuvent lire, tels que PDF, Word, Excel, CSV et HTML.
Chaque outil s'exécute sur nos serveurs via une connexion sécurisée et supprime le fichier téléchargé dans les 60 minutes. Le texte peut être collé directement plutôt que téléchargé.
Quel outil pour quelle tâche
| Vous avez | Vous voulez | Utilisez |
|---|---|---|
| Un PDF | Le texte, les tableaux et les métadonnées sous forme de données | PDF en JSON |
| Un document Word | Les titres, paragraphes, listes et tableaux sous forme de données | Word en JSON |
| Un classeur Excel | Des enregistrements, des lignes ou des colonnes | Excel en JSON |
| Un fichier CSV ou TSV | Un tableau JSON à valeurs typées | CSV en JSON |
| Un fichier YAML | Les mêmes données en JSON | YAML en JSON |
| Un fichier XML | Des objets, des attributs et des tableaux | XML en JSON |
| Du JSON | Un PDF à lire ou à imprimer | JSON en PDF |
| Du JSON | Un classeur Excel | JSON en Excel |
| Du JSON | Un fichier CSV | JSON en CSV |
| Du JSON | Un document Word modifiable | JSON en Word |
| Du JSON | Une page web | JSON en HTML |
| Du JSON | Du YAML pour un fichier de configuration | JSON en YAML |
| Du JSON | Du XML pour un autre système | JSON en XML |
| Du JSON désordonné ou invalide | Du JSON propre et valide | Formateur JSON |
| Deux fichiers JSON | La liste de ce qui a changé | Comparer JSON |
Markdown a sa propre paire : Markdown vers JSON exporte un arbre de document et JSON vers Markdown transforme du JSON en plan ou en tableau Markdown.
Le format de document
PDF en JSON et Word en JSON écrivent la même forme, si bien qu'un seul morceau de code traite les deux. Le niveau supérieur comporte toujours ces champs :
{
"format": "acepdfmd-document",
"version": 1,
"source": {"type": "pdf", "filename": "report.pdf", "title": "Q3 Report", "pages": 12},
"pages": [{"number": 1, "width": 612, "height": 792, "words": 380, "text": "..."}],
"blocks": [
{"type": "heading", "level": 1, "text": "Q3 Report"},
{"type": "paragraph", "text": "Revenue grew..."},
{"type": "list", "ordered": false, "items": [{"level": 0, "text": "Europe"}]},
{"type": "table", "header": ["Region", "Q3"], "rows": [["Europe", 1200.5]]}
],
"tables": [{"index": 1, "page": 3, "rows": [["Region", "Q3"], ["Europe", 1200.5]]}],
"form_fields": [{"name": "email", "type": "text", "value": "[email protected]"}],
"extraction": {"engine": "pdf_to_markdown/layout", "mode": "structure", "ocr": false, "warnings": []}
}
Les champs signifient ce qui suit :
- source : ce qu'était le fichier, avec les métadonnées qu'il portait (titre, auteur, sujet, mots-clés, dates de création et de modification, nombre de pages). Les fichiers Word ajoutent le nombre de mots, de tableaux et d'images.
- pages : une entrée par page de PDF avec sa taille en points, sa rotation, un nombre de mots et son texte. Les fichiers Word n'ont pas de pages, car Word ne met en page qu'au moment de l'impression.
- blocks : le document dans l'ordre de lecture. Les types sont heading (avec un niveau de 1 à 6), paragraph (avec un nom de style optionnel provenant de Word), list (ordonnée ou non, éléments avec un niveau d'imbrication), table (en-tête plus lignes typées), code, blockquote, rule et image.
- tables : pour les PDF, chaque tableau détecté avec la page où il a été trouvé et, pour un tableau qui se poursuit, la page où il se termine. Les cellules qui ressemblent à des nombres sont des nombres.
- form_fields : présent uniquement lorsque le PDF comporte un formulaire. Chaque champ a son nom, son type (text, choice, button ou signature) et sa valeur actuelle.
- extraction : quel convertisseur a été exécuté, le mode choisi, si l'OCR a été nécessaire, et tout avertissement, tel qu'un tableau qui n'a pas pu être détecté.
La version 1 de ce format ne fait que gagner des champs ; les champs existants conservent leur nom et leur signification.
Données tabulaires et imbrication
Le CSV et Excel sont plats, le JSON ne l'est pas. Lorsque le JSON passe vers CSV ou Excel, les objets imbriqués sont aplatis en noms de colonnes à points et les tableaux en colonnes indexées, si bien qu'un enregistrement de commande avec un objet client et un tableau d'articles devient des colonnes telles que customer.name, items[0].sku et items[1].sku. Lorsque le CSV ou Excel revient vers JSON, les en-têtes écrits ainsi sont reconstruits en objets et tableaux imbriqués. Un en-tête comportant un point ordinaire, comme un numéro de version ou une abréviation, est laissé tel quel.
Les valeurs sont typées à l'entrée : les nombres deviennent des nombres, true et false deviennent des booléens, une cellule vide devient null, et tout le reste reste une chaîne. Les dates issues d'Excel sont écrites sous forme de chaînes ISO 8601, car JSON ne possède pas de type date. Basculez l'option des types de valeurs sur texte lorsque des identifiants comportant des zéros en tête doivent rester exactement tels qu'écrits.
Validation et réparation
Chaque outil JSON valide son entrée de la même manière. Un fichier invalide est refusé avec la ligne et la colonne de la première erreur, et un court extrait de cette ligne. Le Formateur JSON peut aussi réparer les erreurs les plus fréquemment collées : commentaires, virgules superflues, chaînes entre guillemets simples, clés non entre guillemets, True, False et None avec majuscule, NaN et Infinity, et blocs de code autour du texte. Lorsqu'une réparation a été appliquée, le résultat vous le précise, afin que rien ne change silencieusement en coulisses.
Confidentialité
Les fichiers téléchargés et le texte collé sont traités sur nos serveurs et supprimés dans les 60 minutes ; consultez le guide de confidentialité pour les détails. Rien n'est conservé au-delà de ce délai et rien n'est utilisé pour un quelconque autre usage.