Phase 12: Multimodal AI

दस्तावेज और आरेख समझ

दस्तावेज तस्वीरें नहीं हैं। पीडीएफ, वैज्ञानिक पेपर, चालान या हाथ से लिखे गए फॉर्म में लेआउट, तालिकाएं, आरेख, फुटनोट, हेडर और अर्थ संरचना होती है जिसे साधारण छवि समझ में नहीं आता है। पूर्व-वीएलएम स्टैक एक पाइपलाइन थाः टेसरेक्ट ओसीआर + लेआउटLMv3 + तालिका निष्कर्षण हेरिस्टिक्स। VLM लहर ने ओसीआर मुक्त मॉडल डोनट (2022), नूगाट (2023), डॉकएलएलएम (2023) से बदल दिया जो सीधे संरचित मार्कअप उत्सर्जित करते हैं। 2026 तक सीमा सिर्फ "क्लाउड ओपस 4.7 पर पृष्ठ छवि को 2576px देशी पर खिलाएं", और संरचित मार्कअप आउटपुट मुफ्त में आता है। यह पाठ दस्तावेज़ एआई के तीन युग के आर्क को पढ़ता है।

Type: Build

Languages: Python (stdlib, layout-aware document parser skeleton)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 5 (NLP)

Time: ~180 minutes

सीखने के लक्ष्य

  • दस्तावेज़ एआई के तीन युगों को समझाएंः ओसीआर पाइपलाइन, ओसीआर मुक्त, वीएलएम-नेटिव।
  • LayoutLMv3 के तीन इनपुट स्ट्रीम का वर्णन करेंः पाठ, लेआउट (bbox), छवि पैच, एकीकृत मास्किंग के साथ।
  • Donut (OCR मुक्त, छवि → मार्कअप), Nougat (वैज्ञानिक पेपर → LaTeX), DocLLM (लेआउट-जागरूक जनरेटिव), PaliGemma 2 (VLM-नेटिव) की तुलना करें।
  • किसी नए कार्य के लिए एक दस्तावेज़ मॉडल चुनें (वैक्यूल्स, वैज्ञानिक पत्र, हस्तलिखित फॉर्म, चीनी रसीदें) ।

समस्या

"इस पीडीएफ को समझें" भ्रामक रूप से कठिन है। जानकारी में हैः

  • पाठ सामग्री (सिग्नल का 90%)
  • लेआउट (हेडर, फ़ूटनोट, साइडबार, दो स्तंभ प्रारूप)
  • तालिकाएँ (पंक्तियाँ, स्तंभ, विलयित कोशिकाएँ)
  • आंकड़े और आरेख।
  • हाथ से लिखे गए नोट।
  • फ़ॉन्ट और टाइपोग्राफी (शीर्षक बनाम शरीर)

एक प्रणाली जो चालानों की परवाह करती है उसे यह जानना चाहिए कि "कुलः $1,245" नीचे दाईं ओर से आया है, एक फुटनोट से नहीं।

अवधारणा

युग 1 ओसीआर पाइपलाइन (पूर्व-2021)

क्लासिक स्टैकः

  1. प्रति पृष्ठ प्रति छवि PDF →
  2. टेसेरैक्ट (या वाणिज्यिक ओसीआर) प्रत्येक शब्द के लिए सीमांकन बक्से के साथ पाठ निकालेगा।
  3. लेआउट विश्लेषक ब्लॉक (हेडर, तालिका, पैराग्राफ) की पहचान करता है।
  4. तालिका संरचना पहचानकर्ता तालिकाओं को विश्लेषण करता है।
  5. डोमेन नियम + रेजेक्स निकासी फ़ील्ड।

साफ मुद्रित पाठ के लिए काम करता है. हस्तलिखित पर टूटता है, विकृत स्कैन, जटिल तालिकाओं, गैर-अंग्रेजी स्क्रिप्ट. हर विफलता मोड एक कस्टम अपवाद पथ की आवश्यकता होती है.

ट्रोकर (2021)

TrOCR (Li et al., arXiv:2109.10282) ने टेसेराक्ट के क्लासिक सीएनएन-सीटीसी को सिंथेटिक + वास्तविक पाठ छवियों पर प्रशिक्षित एक ट्रांसफार्मर एन्कोडर-डेकोडर के साथ बदल दिया। हाथ से लिखे और बहुभाषी पाठ पर साफ जीत। अभी भी एक पाइपलाइन (डिटेक्टर फिर TrOCR फिर लेआउट), लेकिन OCR चरण नाटकीय रूप से बेहतर हुआ।

युग 2 ओसीआर मुक्त (2022-2023)

ओसीआर मुक्त पहले मॉडल में कहा गया थाः पूरी तरह से पता लगाने से बचें, सीधे संरचित आउटपुट के लिए छवि पिक्सल का नक्शा बनाएं।

डोनट (किम एट अल., arXiv:2111.15664):

  • एन्कोडर-डेकोडर ट्रांसफार्मर, एन्कोडर है स्विन-बी.
  • आउटपुट फॉर्म समझ के लिए JSON है, सारांश के लिए मार्कडाउन, या किसी भी कार्य-विशिष्ट योजना।
  • कोई ओसीआर, कोई लेआउट, कोई पता लगाने.

नोगाट (Blecher et al., arXiv:2308.13418):

  • विशेष रूप से वैज्ञानिक लेखों पर प्रशिक्षित।
  • आउटपुट लाटेक्स / मार्कडाउन है।
  • समीकरणों, बहु स्तंभ लेआउट, आंकड़े को संभालता है।
  • प्रत्येक arXiv-parser कॉल मॉडल.

ये विशेषज्ञ हैं, सामान्यवादी नहीं वैज्ञानिक पेपर पर डोनट विफल रहता है, एक चालान पर नूगट विफल रहता है।

लेआउटLMv3 (2022)

एक अलग ट्रैक। लेआउटLMv3 (Huang et al., arXiv:2204.08387) OCR को बनाए रखता है लेकिन लेआउट समझ जोड़ता हैः

  • तीन इनपुट प्रवाहः ओसीआर पाठ टोकन, प्रति टोकन 2 डी बॉन्डिंग बॉक्स, छवि पैच।
  • तीनों मोडलिटी (मास्किंग टेक्स्ट, मास्किंग पैच, मास्किंग लेआउट) में मास्क प्रशिक्षण उद्देश्य।
  • नीचे की ओरः वर्गीकरण, इकाई निकासी, तालिका QA।

LayoutLMv3 OCR आधारित दस्तावेज़ समझ का शिखर है। फॉर्म और चालानों पर मजबूत। OCR अपस्ट्रीम की आवश्यकता होती है। मानकीकृत दस्तावेज़ बेंचमार्क पर सर्वश्रेष्ठ पूर्व-VLM सटीकता।

डॉकॉलम (2023)

DocLLM (Wang et al., arXiv:2401.00908) LayoutLM का जनरेटिव भाई है। लेआउट टोकन पर शर्त पर मुक्त-आकार उत्तर उत्पन्न करता है। दस्तावेज़ों पर क्यूए के लिए बेहतर; अभी भी ओसीआर इनपुट पर निर्भर करता है।

युग 3 VLM-निवासी (2024+)

2024 VLMs पूरी तरह पाइपलाइन की जगह लेने के लिए पर्याप्त अच्छे हो गए। उच्च संकल्प में एक VLM में पूर्ण पृष्ठ छवि फ़ीड करें, प्रश्न पूछें, एक उत्तर प्राप्त करें।

  • LLaVA- NEXT 336- टाइल AnyRes छोटे दस्तावेजों के लिए काम करता है।
  • Qwen2.5VL गतिशील-रिज़ॉल्यूशन 2048+ पिक्सल को मूल रूप से संभालता है।
  • क्लाउड ओपस 4.7 2576px दस्तावेजों का समर्थन करता है।
  • पालीगेमा 2 (अप्रैल 2025) विशेष रूप से दस्तावेजों + हस्तलिखित के लिए प्रशिक्षण देता है।

VLM-native और OCR-pipeline के बीच का अंतर तेजी से बंद हो गया। 2026 तक, VLM-native पर जीत हासिल करती हैः

  • दृश्य पाठ (हातलेखन + मुद्रित, मिश्रित स्क्रिप्ट)
  • मिश्रित कोशिकाओं वाली जटिल तालिकाएँ।
  • पाठ में सम्मिलित गणितीय समीकरण।
  • पाठ टिप्पणी के साथ आंकड़े।

ओसीआर पाइपलाइनें अभी भी जीत रही हैंः

  • बड़े पैमाने पर काम के भार शुद्ध स्कैन जहां प्रति पृष्ठ विलंबता मायने रखता है।
  • पाइपलाइन विश्वसनीयता (निर्धारात्मक विफलता बनाम VLM भ्रम)
  • ऑडिट योग्य ओसीआर आउटपुट की आवश्यकता वाले विनियमित वातावरण।

क्लॉड 4.7 / जीपीटी-5 सीमा

2576 पिक्सेल के मूल इनपुट पर, सीमा VLMs लगभग मानव सटीकता पर समझ का दस्तावेजीकरण करते हैं। 2026 की शुरुआत से बेंचमार्क संख्याएंः

  • डॉक्यूवीक्यूए: क्लाउड 4.7 ~ 95.1, पालीगेम्मा 2 ~ 88.4, नूगाट ~ 77.3, पाइपलाइन लेआउटLMv3 ~ 83.
  • चार्टQA: क्लॉड 4.7 ~ 92.2, GPT-4V ~ 78.
  • दृश्य एमआरसी: क्लॉड 4.7 ~ 94.

बंद मॉडल में अंतर ज्यादातर संकल्प और बेस-एलएलएम पैमाने पर होता है। 7 बी पर खुले मॉडल कुछ अंक पीछे हैं लेकिन पकड़ रहे हैं।

गणितीय समीकरण और LaTeX आउटपुट

वैज्ञानिक पत्रों को समीकरणों के लिए सटीक LaTeX आउटपुट की आवश्यकता होती है। Nougat को इस पर प्रशिक्षित किया गया था। LaTeX लक्ष्यों (Qwen2.5-VL-Math, Nougat व्युत्पन्न) के साथ प्रशिक्षित VLMs उपयोग करने योग्य LaTeX का उत्पादन करते हैं। स्पष्ट LaTeX प्रशिक्षण के बिना, VLMs पठनीय लेकिन अस्पष्ट प्रतिलेखन का उत्पादन करते हैं।

2026 में वैज्ञानिक कागज पाइपलाइनों के लिएः पीडीएफ पर नूगाट श्रृंखला, फिर मुश्किल पृष्ठों पर एक वीएलएम।

हस्तलिखित

अभी भी सबसे कठिन उप-कार्य। मिश्रित मुद्रित + हस्तलिखित (चिकित्सकों के नोट्स, भरे हुए फॉर्म) वह जगह है जहां OCR पाइपलाइन अभी भी लागत के लिए VLM से बेहतर है। केवल हस्तलिखित VLM में सुधार हो रहा है (Claude 4.7, PaliGemma 2).

2026 नुस्खा

एक नई दस्तावेज-एआई परियोजना के लिएः

  • स्केल में शुद्ध मुद्रित चालानः लेआउटLMv3 + नियम, लागत प्रभावी।
  • मिश्रित दस्तावेज (वैज्ञानिक + हस्तलिखित + फॉर्म): VLM-निवासी (PaliGemma 2 या Qwen2.5-VL) ।
  • पूर्ण अभिलेखागार सेवन: गणित के लिए नूग, आंकड़ों के लिए वीएलएम।
  • नियामक: क्रॉस-चेक के लिए ओसीआर पाइपलाइन + वीएलएम वैलिडेटर।

इसका प्रयोग करें

code/main.py:

  • एक खिलौना लेआउट-जागरूक टोकनराइज़रः दिए गए (पाठ, bbox) जोड़े, लेआउटLMv3 शैली में इनपुट उत्पन्न करता है।
  • डोनट-शैली कार्य योजना जनरेटरः फॉर्म के लिए JSON टेम्पलेट।
  • ओसीआर-पाइपलाइन, डोनट, नूगाट और वीएलएम-नेटिव में प्रति पृष्ठ टोकन बजट की तुलना।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-document-ai-stack-picker.md. एक दस्तावेज-एआई परियोजना (क्षेत्र, पैमाने, गुणवत्ता, नियामक) को देखते हुए, ओसीआर पाइपलाइन, ओसीआर मुक्त विशेषज्ञ और वीएलएम-नेटिव के बीच चयन करें।

व्यायाम

  1. आपकी परियोजना प्रति दिन 10 मिलियन चालान है। कौन सा स्टैक सटीकता खोए बिना प्रति पृष्ठ लागत को कम करता है?
  1. क्यूए फॉर्म पर लाइट-एलएमवी3 शुद्ध-क्लिप-वीएलएम से बेहतर प्रदर्शन क्यों करता है लेकिन दृश्य-पाठ पर कम प्रदर्शन क्यों करता है? बीबॉक्स स्ट्रीम क्या छोड़ देता है?
  1. Nougat LaTeX उत्पन्न करता है. एक परीक्षण मामले का प्रस्ताव करें जहां VLM-निवासी आउटपुट LaTeX निष्ठा पर Nougat को हराता है, और एक मामला जहां Nougat जीतता है।
  1. पालीगेम्मा 2 पेपर पढ़ें (Google, 2024). क्या था प्रशिक्षण-डेटा मुख्य जोड़ा कि पालीगेम्मा 1 के खिलाफ दस्तावेज़ सटीकता को उठाया?
  1. एक नियामक-सुरक्षित हाइब्रिड डिजाइन करेंः प्राथमिक रूप से ओसीआर पाइपलाइन, द्वितीयक क्रॉस-चेक के रूप में वीएलएम। आप असहमति को कैसे हल करते हैं?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
OCR pipeline"Tesseract-style"Stage-wise stack: detect -> OCR -> layout -> rules; deterministic, fragile
OCR-free"Donut-style"Image-to-output transformer that skips explicit OCR; single model
Layout-aware"LayoutLM"Input includes per-token bbox coordinates; unified masking across modalities
VLM-native"Frontier VLM"Feed page image directly to Claude/GPT/Qwen VLM at high resolution; no pipeline
DocVQA"Doc benchmark"Document VQA standard; most-cited score
Markup output"LaTeX / MD"Structured output format instead of free-form text; enables downstream automation

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.