คู่มือเครื่องมือ JSON: แปลงเอกสารและข้อมูลเป็น JSON และกลับคืน
คู่มือนี้อธิบายวิธีที่เครื่องมือ JSON อ่านและเขียนไฟล์ รูปแบบเอกสารที่ PDF เป็น JSON และ Word เป็น JSON สร้างขึ้น และเครื่องมือใดที่ควรใช้กับงานแต่ละประเภท
เหตุใดต้องใช้ JSON
JSON คือรูปแบบข้อมูลที่โปรแกรม บริการเว็บ และโมเดล AI อ่านได้ง่ายที่สุด คือ อ็อบเจกต์ที่มีฟิลด์ที่ตั้งชื่อไว้ รายการ ตัวเลข ข้อความ true, false และ null ไม่มีอะไรอื่นนอกจากนี้ เอกสารและสเปรดชีตไม่ได้ถูกจัดเก็บในรูปแบบนั้น เครื่องมือในกลุ่มนี้เชื่อมช่องว่างนั้นทั้งสองทาง โดยเปลี่ยน PDF ไฟล์ Word สเปรดชีต CSV, YAML และ XML เป็น JSON และเปลี่ยน JSON กลับเป็นไฟล์ที่คนอ่านได้ เช่น PDF, Word, Excel, CSV และ HTML
เครื่องมือทุกตัวทำงานบนเซิร์ฟเวอร์ของเราผ่านการเชื่อมต่อที่ปลอดภัย และลบไฟล์ที่อัปโหลดภายใน 60 นาที ข้อความอินพุตสามารถวางลงไปได้โดยตรงแทนการอัปโหลด
เครื่องมือใดสำหรับงานใด
| คุณมี | คุณต้องการ | ใช้ |
|---|---|---|
| ข้อความ ตาราง และข้อมูลเมตาในรูปแบบข้อมูล | PDF เป็น JSON | |
| เอกสาร Word | หัวข้อ ย่อหน้า รายการ และตารางในรูปแบบข้อมูล | Word เป็น JSON |
| เวิร์กบุ๊ก Excel | ระเบียนข้อมูล แถว หรือคอลัมน์ | Excel เป็น JSON |
| ไฟล์ CSV หรือ TSV | อาร์เรย์ JSON ที่มีค่าตามชนิดข้อมูล | CSV เป็น JSON |
| ไฟล์ YAML | ข้อมูลเดียวกันในรูปแบบ JSON | YAML เป็น JSON |
| ไฟล์ XML | อ็อบเจกต์ แอตทริบิวต์ และอาร์เรย์ | XML เป็น JSON |
| JSON | PDF สำหรับอ่านหรือพิมพ์ | JSON เป็น PDF |
| JSON | เวิร์กบุ๊ก Excel | JSON เป็น Excel |
| JSON | ไฟล์ CSV | JSON เป็น CSV |
| JSON | เอกสาร Word ที่แก้ไขได้ | JSON เป็น Word |
| JSON | หน้าเว็บ | JSON เป็น HTML |
| JSON | YAML สำหรับไฟล์การตั้งค่า | JSON เป็น YAML |
| JSON | XML สำหรับระบบอื่น | JSON เป็น XML |
| JSON ที่ยุ่งเหยิงหรือไม่ถูกต้อง | JSON ที่สะอาดและถูกต้อง | ตัวจัดรูปแบบ JSON |
| ไฟล์ JSON สองไฟล์ | รายการสิ่งที่เปลี่ยนไป | เปรียบเทียบ JSON |
Markdown มีคู่ของตัวเองคือ Markdown เป็น JSON ที่ส่งออกโครงสร้างเอกสาร และ JSON เป็น Markdown ที่เปลี่ยน JSON เป็นเค้าโครงหรือตาราง Markdown
รูปแบบเอกสาร
PDF เป็น JSON และ Word เป็น JSON เขียนโครงสร้างเดียวกัน ดังนั้นโค้ดชุดเดียวจึงจัดการไฟล์ทั้งสองประเภทได้ ระดับบนสุดจะมีฟิลด์เหล่านี้เสมอ
{
"format": "acepdfmd-document",
"version": 1,
"source": {"type": "pdf", "filename": "report.pdf", "title": "Q3 Report", "pages": 12},
"pages": [{"number": 1, "width": 612, "height": 792, "words": 380, "text": "..."}],
"blocks": [
{"type": "heading", "level": 1, "text": "Q3 Report"},
{"type": "paragraph", "text": "Revenue grew..."},
{"type": "list", "ordered": false, "items": [{"level": 0, "text": "Europe"}]},
{"type": "table", "header": ["Region", "Q3"], "rows": [["Europe", 1200.5]]}
],
"tables": [{"index": 1, "page": 3, "rows": [["Region", "Q3"], ["Europe", 1200.5]]}],
"form_fields": [{"name": "email", "type": "text", "value": "[email protected]"}],
"extraction": {"engine": "pdf_to_markdown/layout", "mode": "structure", "ocr": false, "warnings": []}
}
ฟิลด์ต่าง ๆ มีความหมายดังนี้
- source: ไฟล์ต้นฉบับคืออะไร พร้อมข้อมูลเมตาที่มีอยู่ (ชื่อเรื่อง ผู้เขียน หัวข้อ คำสำคัญ วันที่สร้างและแก้ไข จำนวนหน้า) ไฟล์ Word จะเพิ่มจำนวนคำ จำนวนตาราง และจำนวนรูปภาพ
- pages: หนึ่งรายการต่อหนึ่งหน้าของ PDF พร้อมขนาดเป็นพอยต์ การหมุนหน้า จำนวนคำ และข้อความ ไฟล์ Word ไม่มีหน้า เพราะ Word จะจัดหน้าก็ต่อเมื่อสั่งพิมพ์เท่านั้น
- blocks: เอกสารตามลำดับการอ่าน ประเภทได้แก่ heading (ระดับ 1 ถึง 6) paragraph (มีชื่อสไตล์เสริมจาก Word) list (มีลำดับหรือไม่มี รายการมีระดับการซ้อน) table (แถวส่วนหัวและแถวข้อมูลที่มีชนิด) code, blockquote, rule และ image
- tables: สำหรับ PDF คือทุกตารางที่ตรวจพบ พร้อมหน้าที่พบ และสำหรับตารางที่ต่อเนื่องหลายหน้า หน้าที่ตารางนั้นสิ้นสุด เซลล์ที่ดูเหมือนตัวเลขจะเป็นตัวเลข
- form_fields: มีเฉพาะเมื่อ PDF มีฟอร์ม แต่ละฟิลด์มีชื่อ ประเภท (text, choice, button หรือ signature) และค่าปัจจุบัน
- extraction: ตัวแปลงใดที่ทำงาน โหมดที่คุณเลือก ว่าจำเป็นต้องใช้ OCR หรือไม่ และคำเตือนใด ๆ เช่น ตารางที่ตรวจไม่พบ
เวอร์ชัน 1 ของรูปแบบนี้จะได้รับฟิลด์เพิ่มเติมเท่านั้น ฟิลด์ที่มีอยู่แล้วจะคงชื่อและความหมายเดิมไว้เสมอ
ข้อมูลแบบตารางและการซ้อน
CSV และ Excel เป็นแบบแบน แต่ JSON ไม่ใช่ เมื่อ JSON ถูกแปลงไปเป็น CSV หรือ Excel อ็อบเจกต์แบบซ้อนจะถูกทำให้แบนเป็นชื่อคอลัมน์แบบจุด และอาร์เรย์จะกลายเป็นคอลัมน์ที่มีลำดับเลข ดังนั้นระเบียนคำสั่งซื้อที่มีอ็อบเจกต์ลูกค้าและอาร์เรย์รายการสินค้าจะกลายเป็นคอลัมน์อย่าง customer.name, items[0].sku และ items[1].sku เมื่อ CSV หรือ Excel ถูกแปลงกลับเป็น JSON หัวข้อที่เขียนในรูปแบบนี้จะถูกสร้างขึ้นใหม่เป็นอ็อบเจกต์และอาร์เรย์แบบซ้อน หัวข้อที่มีจุดธรรมดา เช่น เลขรุ่นหรือคำย่อ จะถูกปล่อยไว้ตามเดิม
ค่าต่าง ๆ จะถูกกำหนดชนิดข้อมูลขณะนำเข้า ตัวเลขจะกลายเป็นตัวเลข true และ false จะกลายเป็นบูลีน เซลล์ที่ว่างจะกลายเป็น null และสิ่งอื่น ๆ จะยังคงเป็นสตริง วันที่ที่มาจาก Excel จะถูกเขียนเป็นสตริง ISO 8601 เพราะ JSON ไม่มีชนิดข้อมูลวันที่ ให้เปลี่ยนตัวเลือกชนิดของค่าเป็นข้อความเมื่อตัวระบุที่มีเลขศูนย์นำหน้าต้องคงอยู่ตามที่เขียนไว้ทุกตัวอักษร
การตรวจสอบและการซ่อมแซม
เครื่องมือ JSON ทุกตัวตรวจสอบอินพุตด้วยวิธีเดียวกัน ไฟล์ที่ไม่ถูกต้องจะถูกปฏิเสธพร้อมบรรทัดและคอลัมน์ของข้อผิดพลาดแรก และตัวอย่างสั้น ๆ ของบรรทัดนั้น ตัวจัดรูปแบบ JSON ยังสามารถซ่อมแซมข้อผิดพลาดที่คนวางลงไปบ่อยที่สุดได้ เช่น คอมเมนต์ จุลภาคท้ายรายการ สตริงที่ครอบด้วยเครื่องหมายคำพูดเดี่ยว คีย์ที่ไม่มีเครื่องหมายคำพูด True, False และ None ที่พิมพ์ตัวใหญ่ NaN และ Infinity และเครื่องหมายโค้ดบล็อกที่ล้อมรอบข้อความ เมื่อมีการซ่อมแซมเกิดขึ้น ผลลัพธ์จะบอกให้คุณทราบ เพื่อไม่ให้มีอะไรเปลี่ยนแปลงไปโดยไม่รู้ตัว
ความเป็นส่วนตัว
ไฟล์ที่อัปโหลดและข้อความที่วางลงไปจะถูกประมวลผลบนเซิร์ฟเวอร์ของเราและถูกลบภายใน 60 นาที ดูรายละเอียดได้ที่ คู่มือความเป็นส่วนตัว ไม่มีสิ่งใดถูกจัดเก็บไว้เกินกว่าเวลานั้น และไม่มีสิ่งใดถูกนำไปใช้เพื่อจุดประสงค์อื่น