दस्तावेज और आरेख समझ
Type: Build
Languages: Python (stdlib, layout-aware document parser skeleton)
Prerequisites: Phase 12 · 05 (LLaVA), Phase 5 (NLP)
Time: ~180 minutes
सीखने के लक्ष्य
- दस्तावेज़ एआई के तीन युगों को समझाएंः ओसीआर पाइपलाइन, ओसीआर मुक्त, वीएलएम-नेटिव।
- LayoutLMv3 के तीन इनपुट स्ट्रीम का वर्णन करेंः पाठ, लेआउट (bbox), छवि पैच, एकीकृत मास्किंग के साथ।
- Donut (OCR मुक्त, छवि → मार्कअप), Nougat (वैज्ञानिक पेपर → LaTeX), DocLLM (लेआउट-जागरूक जनरेटिव), PaliGemma 2 (VLM-नेटिव) की तुलना करें।
- किसी नए कार्य के लिए एक दस्तावेज़ मॉडल चुनें (वैक्यूल्स, वैज्ञानिक पत्र, हस्तलिखित फॉर्म, चीनी रसीदें) ।
समस्या
"इस पीडीएफ को समझें" भ्रामक रूप से कठिन है। जानकारी में हैः
- पाठ सामग्री (सिग्नल का 90%)
- लेआउट (हेडर, फ़ूटनोट, साइडबार, दो स्तंभ प्रारूप)
- तालिकाएँ (पंक्तियाँ, स्तंभ, विलयित कोशिकाएँ)
- आंकड़े और आरेख।
- हाथ से लिखे गए नोट।
- फ़ॉन्ट और टाइपोग्राफी (शीर्षक बनाम शरीर)
एक प्रणाली जो चालानों की परवाह करती है उसे यह जानना चाहिए कि "कुलः $1,245" नीचे दाईं ओर से आया है, एक फुटनोट से नहीं।
अवधारणा
युग 1 ओसीआर पाइपलाइन (पूर्व-2021)
क्लासिक स्टैकः
- प्रति पृष्ठ प्रति छवि PDF →
- टेसेरैक्ट (या वाणिज्यिक ओसीआर) प्रत्येक शब्द के लिए सीमांकन बक्से के साथ पाठ निकालेगा।
- लेआउट विश्लेषक ब्लॉक (हेडर, तालिका, पैराग्राफ) की पहचान करता है।
- तालिका संरचना पहचानकर्ता तालिकाओं को विश्लेषण करता है।
- डोमेन नियम + रेजेक्स निकासी फ़ील्ड।
साफ मुद्रित पाठ के लिए काम करता है. हस्तलिखित पर टूटता है, विकृत स्कैन, जटिल तालिकाओं, गैर-अंग्रेजी स्क्रिप्ट. हर विफलता मोड एक कस्टम अपवाद पथ की आवश्यकता होती है.
ट्रोकर (2021)
TrOCR (Li et al., arXiv:2109.10282) ने टेसेराक्ट के क्लासिक सीएनएन-सीटीसी को सिंथेटिक + वास्तविक पाठ छवियों पर प्रशिक्षित एक ट्रांसफार्मर एन्कोडर-डेकोडर के साथ बदल दिया। हाथ से लिखे और बहुभाषी पाठ पर साफ जीत। अभी भी एक पाइपलाइन (डिटेक्टर फिर TrOCR फिर लेआउट), लेकिन OCR चरण नाटकीय रूप से बेहतर हुआ।
युग 2 ओसीआर मुक्त (2022-2023)
ओसीआर मुक्त पहले मॉडल में कहा गया थाः पूरी तरह से पता लगाने से बचें, सीधे संरचित आउटपुट के लिए छवि पिक्सल का नक्शा बनाएं।
डोनट (किम एट अल., arXiv:2111.15664):
- एन्कोडर-डेकोडर ट्रांसफार्मर, एन्कोडर है स्विन-बी.
- आउटपुट फॉर्म समझ के लिए JSON है, सारांश के लिए मार्कडाउन, या किसी भी कार्य-विशिष्ट योजना।
- कोई ओसीआर, कोई लेआउट, कोई पता लगाने.
नोगाट (Blecher et al., arXiv:2308.13418):
- विशेष रूप से वैज्ञानिक लेखों पर प्रशिक्षित।
- आउटपुट लाटेक्स / मार्कडाउन है।
- समीकरणों, बहु स्तंभ लेआउट, आंकड़े को संभालता है।
- प्रत्येक arXiv-parser कॉल मॉडल.
ये विशेषज्ञ हैं, सामान्यवादी नहीं वैज्ञानिक पेपर पर डोनट विफल रहता है, एक चालान पर नूगट विफल रहता है।
लेआउटLMv3 (2022)
एक अलग ट्रैक। लेआउटLMv3 (Huang et al., arXiv:2204.08387) OCR को बनाए रखता है लेकिन लेआउट समझ जोड़ता हैः
- तीन इनपुट प्रवाहः ओसीआर पाठ टोकन, प्रति टोकन 2 डी बॉन्डिंग बॉक्स, छवि पैच।
- तीनों मोडलिटी (मास्किंग टेक्स्ट, मास्किंग पैच, मास्किंग लेआउट) में मास्क प्रशिक्षण उद्देश्य।
- नीचे की ओरः वर्गीकरण, इकाई निकासी, तालिका QA।
LayoutLMv3 OCR आधारित दस्तावेज़ समझ का शिखर है। फॉर्म और चालानों पर मजबूत। OCR अपस्ट्रीम की आवश्यकता होती है। मानकीकृत दस्तावेज़ बेंचमार्क पर सर्वश्रेष्ठ पूर्व-VLM सटीकता।
डॉकॉलम (2023)
DocLLM (Wang et al., arXiv:2401.00908) LayoutLM का जनरेटिव भाई है। लेआउट टोकन पर शर्त पर मुक्त-आकार उत्तर उत्पन्न करता है। दस्तावेज़ों पर क्यूए के लिए बेहतर; अभी भी ओसीआर इनपुट पर निर्भर करता है।
युग 3 VLM-निवासी (2024+)
2024 VLMs पूरी तरह पाइपलाइन की जगह लेने के लिए पर्याप्त अच्छे हो गए। उच्च संकल्प में एक VLM में पूर्ण पृष्ठ छवि फ़ीड करें, प्रश्न पूछें, एक उत्तर प्राप्त करें।
- LLaVA- NEXT 336- टाइल AnyRes छोटे दस्तावेजों के लिए काम करता है।
- Qwen2.5VL गतिशील-रिज़ॉल्यूशन 2048+ पिक्सल को मूल रूप से संभालता है।
- क्लाउड ओपस 4.7 2576px दस्तावेजों का समर्थन करता है।
- पालीगेमा 2 (अप्रैल 2025) विशेष रूप से दस्तावेजों + हस्तलिखित के लिए प्रशिक्षण देता है।
VLM-native और OCR-pipeline के बीच का अंतर तेजी से बंद हो गया। 2026 तक, VLM-native पर जीत हासिल करती हैः
- दृश्य पाठ (हातलेखन + मुद्रित, मिश्रित स्क्रिप्ट)
- मिश्रित कोशिकाओं वाली जटिल तालिकाएँ।
- पाठ में सम्मिलित गणितीय समीकरण।
- पाठ टिप्पणी के साथ आंकड़े।
ओसीआर पाइपलाइनें अभी भी जीत रही हैंः
- बड़े पैमाने पर काम के भार शुद्ध स्कैन जहां प्रति पृष्ठ विलंबता मायने रखता है।
- पाइपलाइन विश्वसनीयता (निर्धारात्मक विफलता बनाम VLM भ्रम)
- ऑडिट योग्य ओसीआर आउटपुट की आवश्यकता वाले विनियमित वातावरण।
क्लॉड 4.7 / जीपीटी-5 सीमा
2576 पिक्सेल के मूल इनपुट पर, सीमा VLMs लगभग मानव सटीकता पर समझ का दस्तावेजीकरण करते हैं। 2026 की शुरुआत से बेंचमार्क संख्याएंः
- डॉक्यूवीक्यूए: क्लाउड 4.7 ~ 95.1, पालीगेम्मा 2 ~ 88.4, नूगाट ~ 77.3, पाइपलाइन लेआउटLMv3 ~ 83.
- चार्टQA: क्लॉड 4.7 ~ 92.2, GPT-4V ~ 78.
- दृश्य एमआरसी: क्लॉड 4.7 ~ 94.
बंद मॉडल में अंतर ज्यादातर संकल्प और बेस-एलएलएम पैमाने पर होता है। 7 बी पर खुले मॉडल कुछ अंक पीछे हैं लेकिन पकड़ रहे हैं।
गणितीय समीकरण और LaTeX आउटपुट
वैज्ञानिक पत्रों को समीकरणों के लिए सटीक LaTeX आउटपुट की आवश्यकता होती है। Nougat को इस पर प्रशिक्षित किया गया था। LaTeX लक्ष्यों (Qwen2.5-VL-Math, Nougat व्युत्पन्न) के साथ प्रशिक्षित VLMs उपयोग करने योग्य LaTeX का उत्पादन करते हैं। स्पष्ट LaTeX प्रशिक्षण के बिना, VLMs पठनीय लेकिन अस्पष्ट प्रतिलेखन का उत्पादन करते हैं।
2026 में वैज्ञानिक कागज पाइपलाइनों के लिएः पीडीएफ पर नूगाट श्रृंखला, फिर मुश्किल पृष्ठों पर एक वीएलएम।
हस्तलिखित
अभी भी सबसे कठिन उप-कार्य। मिश्रित मुद्रित + हस्तलिखित (चिकित्सकों के नोट्स, भरे हुए फॉर्म) वह जगह है जहां OCR पाइपलाइन अभी भी लागत के लिए VLM से बेहतर है। केवल हस्तलिखित VLM में सुधार हो रहा है (Claude 4.7, PaliGemma 2).
2026 नुस्खा
एक नई दस्तावेज-एआई परियोजना के लिएः
- स्केल में शुद्ध मुद्रित चालानः लेआउटLMv3 + नियम, लागत प्रभावी।
- मिश्रित दस्तावेज (वैज्ञानिक + हस्तलिखित + फॉर्म): VLM-निवासी (PaliGemma 2 या Qwen2.5-VL) ।
- पूर्ण अभिलेखागार सेवन: गणित के लिए नूग, आंकड़ों के लिए वीएलएम।
- नियामक: क्रॉस-चेक के लिए ओसीआर पाइपलाइन + वीएलएम वैलिडेटर।
इसका प्रयोग करें
code/main.py:
- एक खिलौना लेआउट-जागरूक टोकनराइज़रः दिए गए (पाठ, bbox) जोड़े, लेआउटLMv3 शैली में इनपुट उत्पन्न करता है।
- डोनट-शैली कार्य योजना जनरेटरः फॉर्म के लिए JSON टेम्पलेट।
- ओसीआर-पाइपलाइन, डोनट, नूगाट और वीएलएम-नेटिव में प्रति पृष्ठ टोकन बजट की तुलना।
इसे भेजें
यह सबक हमें फल देता हैoutputs/skill-document-ai-stack-picker.md. एक दस्तावेज-एआई परियोजना (क्षेत्र, पैमाने, गुणवत्ता, नियामक) को देखते हुए, ओसीआर पाइपलाइन, ओसीआर मुक्त विशेषज्ञ और वीएलएम-नेटिव के बीच चयन करें।
व्यायाम
- आपकी परियोजना प्रति दिन 10 मिलियन चालान है। कौन सा स्टैक सटीकता खोए बिना प्रति पृष्ठ लागत को कम करता है?
- क्यूए फॉर्म पर लाइट-एलएमवी3 शुद्ध-क्लिप-वीएलएम से बेहतर प्रदर्शन क्यों करता है लेकिन दृश्य-पाठ पर कम प्रदर्शन क्यों करता है? बीबॉक्स स्ट्रीम क्या छोड़ देता है?
- Nougat LaTeX उत्पन्न करता है. एक परीक्षण मामले का प्रस्ताव करें जहां VLM-निवासी आउटपुट LaTeX निष्ठा पर Nougat को हराता है, और एक मामला जहां Nougat जीतता है।
- पालीगेम्मा 2 पेपर पढ़ें (Google, 2024). क्या था प्रशिक्षण-डेटा मुख्य जोड़ा कि पालीगेम्मा 1 के खिलाफ दस्तावेज़ सटीकता को उठाया?
- एक नियामक-सुरक्षित हाइब्रिड डिजाइन करेंः प्राथमिक रूप से ओसीआर पाइपलाइन, द्वितीयक क्रॉस-चेक के रूप में वीएलएम। आप असहमति को कैसे हल करते हैं?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| OCR pipeline | "Tesseract-style" | Stage-wise stack: detect -> OCR -> layout -> rules; deterministic, fragile |
| OCR-free | "Donut-style" | Image-to-output transformer that skips explicit OCR; single model |
| Layout-aware | "LayoutLM" | Input includes per-token bbox coordinates; unified masking across modalities |
| VLM-native | "Frontier VLM" | Feed page image directly to Claude/GPT/Qwen VLM at high resolution; no pipeline |
| DocVQA | "Doc benchmark" | Document VQA standard; most-cited score |
| Markup output | "LaTeX / MD" | Structured output format instead of free-form text; enables downstream automation |
आगे पढ़ना
- Li et al. — TrOCR (arXiv:2109.10282)
- Blecher et al. — Nougat (arXiv:2308.13418)
- Huang et al. — LayoutLMv3 (arXiv:2204.08387)
- Kim et al. — Donut (arXiv:2111.15664)
- Wang et al. — DocLLM (arXiv:2401.00908)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.