JSON टूल गाइड: दस्तावेज़ों और डेटा को JSON में और वापस बदलें
यह गाइड बताती है कि JSON टूल फ़ाइलें कैसे पढ़ते और लिखते हैं, वह दस्तावेज़ फ़ॉर्मेट जो PDF से JSON और Word से JSON बनाते हैं, और हर काम के लिए कौन-सा टूल उपयोग करें।
JSON क्यों
JSON वह डेटा फ़ॉर्मेट है जिसे प्रोग्राम, वेब सेवाएं और AI मॉडल सबसे आसानी से पढ़ते हैं: नामित फ़ील्ड वाले ऑब्जेक्ट, सूचियाँ, संख्याएं, टेक्स्ट, true, false और null, और कुछ नहीं। दस्तावेज़ और स्प्रेडशीट उस तरह संग्रहित नहीं होते। इस परिवार के टूल दोनों दिशाओं में यह अंतर पाटते हैं: वे PDF, Word फ़ाइलें, स्प्रेडशीट, CSV, YAML और XML को JSON में बदलते हैं, और वे JSON को वापस उन फ़ाइलों में बदलते हैं जो लोग पढ़ते हैं, जैसे PDF, Word, Excel, CSV और HTML।
हर टूल हमारे सर्वर पर एक सुरक्षित कनेक्शन के ज़रिए चलता है और अपलोड की गई फ़ाइल को 60 मिनट के भीतर हटा देता है। टेक्स्ट इनपुट को अपलोड करने की बजाय सीधे पेस्ट किया जा सकता है।
किस काम के लिए कौन-सा टूल
| आपके पास है | आपको चाहिए | उपयोग करें |
|---|---|---|
| एक PDF | डेटा के रूप में टेक्स्ट, टेबल और मेटाडेटा | PDF से JSON |
| एक Word दस्तावेज़ | डेटा के रूप में हेडिंग, पैराग्राफ, सूचियाँ और टेबल | Word से JSON |
| एक Excel वर्कबुक | रिकॉर्ड, रो या कॉलम | Excel से JSON |
| एक CSV या TSV फ़ाइल | टाइप की गई वैल्यू वाली JSON एरे | CSV से JSON |
| एक YAML फ़ाइल | JSON के रूप में वही डेटा | YAML से JSON |
| एक XML फ़ाइल | ऑब्जेक्ट, एट्रिब्यूट्स और एरे | XML से JSON |
| JSON | पढ़ने या प्रिंट करने के लिए एक PDF | JSON से PDF |
| JSON | एक Excel वर्कबुक | JSON से Excel |
| JSON | एक CSV फ़ाइल | JSON से CSV |
| JSON | एक संपादन-योग्य Word दस्तावेज़ | JSON से Word |
| JSON | एक वेब पेज | JSON से HTML |
| JSON | कॉन्फ़िगरेशन फ़ाइल के लिए YAML | JSON से YAML |
| JSON | दूसरे सिस्टम के लिए XML | JSON से XML |
| ऐसा JSON जो गड़बड़ या अमान्य है | साफ़, वैध JSON | JSON फॉर्मैटर |
| दो JSON फ़ाइलें | बदलावों की एक सूची | JSON की तुलना करें |
Markdown की अपनी जोड़ी है: Markdown से JSON एक दस्तावेज़ ट्री एक्सपोर्ट करता है और JSON से Markdown JSON को Markdown आउटलाइन या टेबल में बदल देता है।
दस्तावेज़ फ़ॉर्मेट
PDF से JSON और Word से JSON एक ही आकार लिखते हैं, इसलिए एक ही कोड दोनों को संभालता है। शीर्ष स्तर पर हमेशा ये फ़ील्ड होते हैं:
{
"format": "acepdfmd-document",
"version": 1,
"source": {"type": "pdf", "filename": "report.pdf", "title": "Q3 Report", "pages": 12},
"pages": [{"number": 1, "width": 612, "height": 792, "words": 380, "text": "..."}],
"blocks": [
{"type": "heading", "level": 1, "text": "Q3 Report"},
{"type": "paragraph", "text": "Revenue grew..."},
{"type": "list", "ordered": false, "items": [{"level": 0, "text": "Europe"}]},
{"type": "table", "header": ["Region", "Q3"], "rows": [["Europe", 1200.5]]}
],
"tables": [{"index": 1, "page": 3, "rows": [["Region", "Q3"], ["Europe", 1200.5]]}],
"form_fields": [{"name": "email", "type": "text", "value": "[email protected]"}],
"extraction": {"engine": "pdf_to_markdown/layout", "mode": "structure", "ocr": false, "warnings": []}
}
फ़ील्ड का मतलब इस प्रकार है:
- source: फ़ाइल क्या थी, उसके साथ आए मेटाडेटा के साथ (शीर्षक, लेखक, विषय, कीवर्ड, बनने और बदलने की तारीखें, पेज संख्या)। Word फ़ाइलें शब्द, टेबल और इमेज गणना भी जोड़ती हैं।
- pages: हर PDF पेज के लिए एक एंट्री, उसके पॉइंट में आकार, उसके घुमाव, एक शब्द गणना और उसके टेक्स्ट के साथ। Word फ़ाइलों में कोई पेज नहीं होते, क्योंकि Word पेज लेआउट केवल प्रिंट करते समय बनाता है।
- blocks: पढ़ने के क्रम में दस्तावेज़। प्रकार हैं heading (स्तर 1 से 6 के साथ), paragraph (Word की एक वैकल्पिक स्टाइल नाम के साथ), list (क्रमबद्ध या नहीं, नेस्टिंग स्तर वाले आइटम के साथ), table (हेडर के साथ टाइप की गई रो), code, blockquote, rule और image।
- tables: PDF के लिए, हर पहचानी गई टेबल उस पेज के साथ जिस पर वह मिली और, आगे जारी रहने वाली टेबल के लिए, जिस पेज पर वह समाप्त होती है। संख्या जैसी दिखने वाली सेल संख्याएं होती हैं।
- form_fields: केवल तब मौजूद जब PDF में कोई फॉर्म हो। हर फ़ील्ड का अपना नाम, प्रकार (text, choice, button या signature) और मौजूदा वैल्यू होती है।
- extraction: कौन-सा कन्वर्टर चला, आपने कौन-सा मोड चुना, क्या OCR ज़रूरी था, और कोई भी चेतावनी, जैसे कोई टेबल जिसे पहचाना नहीं जा सका।
इस फ़ॉर्मेट का वर्शन 1 केवल फ़ील्ड जोड़ता है; मौजूदा फ़ील्ड अपने नाम और अर्थ बनाए रखते हैं।
टेबुलर डेटा और नेस्टिंग
CSV और Excel फ्लैट होते हैं, JSON नहीं। जब JSON को CSV या Excel में बदला जाता है, तो नेस्टेड ऑब्जेक्ट डॉट वाले कॉलम नामों में और एरे इंडेक्स वाले नामों में फ्लैटन हो जाते हैं, इसलिए ग्राहक ऑब्जेक्ट और आइटम एरे वाला कोई ऑर्डर रिकॉर्ड customer.name, items[0].sku और items[1].sku जैसे कॉलम बन जाता है। जब CSV या Excel वापस JSON में जाता है, तो उस तरह लिखे गए हेडर नेस्टेड ऑब्जेक्ट और एरे में फिर से बनाए जाते हैं। सामान्य डॉट वाला हेडर, जैसे कोई वर्शन नंबर या संक्षिप्तीकरण, को ऐसे ही छोड़ दिया जाता है।
आने के रास्ते पर वैल्यू टाइप की जाती हैं: संख्याएं संख्याएं बन जाती हैं, true और false बूलियन बन जाते हैं, खाली सेल null बन जाता है, और बाकी सब स्ट्रिंग रहता है। Excel से निकलने वाली तारीखें ISO 8601 स्ट्रिंग के रूप में लिखी जाती हैं, क्योंकि JSON में कोई तारीख प्रकार नहीं है। वैल्यू प्रकार को टेक्स्ट पर बदलें जब आगे-पीछे शून्य वाले आइडेंटिफ़ायर को ठीक वैसे ही रहना ज़रूरी हो जैसे लिखे गए हैं।
वैलिडेशन और रिपेयर
हर JSON टूल अपने इनपुट को एक ही तरीके से वैलिडेट करता है। अमान्य फ़ाइल को पहली गलती की लाइन और कॉलम के साथ, और उस लाइन के एक छोटे अंश के साथ मना कर दिया जाता है। JSON फॉर्मैटर उन गलतियों को भी ठीक कर सकता है जो लोग सबसे ज़्यादा पेस्ट करते हैं: कमेंट, ट्रेलिंग कॉमा, सिंगल-कोटेड स्ट्रिंग, अनकोटेड कीज़, कैपिटलाइज़ किए गए True, False और None, NaN और Infinity, और टेक्स्ट के चारों ओर कोड फ़ेंस। जब कोई रिपेयर लागू किया गया हो तो परिणाम आपको बता देता है, इसलिए कुछ भी आपकी जानकारी के बिना बदलता नहीं।
प्राइवेसी
अपलोड की गई फ़ाइलें और पेस्ट किया गया टेक्स्ट हमारे सर्वर पर प्रोसेस किया जाता है और 60 मिनट के भीतर हटा दिया जाता है; विवरण के लिए प्राइवेसी गाइड देखें। इस समय के बाद कुछ भी संग्रहित नहीं रहता और किसी अन्य उद्देश्य के लिए उपयोग नहीं किया जाता।