درک اسناد و نمودار
Type: Build
Languages: Python (stdlib, layout-aware document parser skeleton)
Prerequisites: Phase 12 · 05 (LLaVA), Phase 5 (NLP)
Time: ~180 minutes
اهداف یادگیری
- سه دوره ی هوش مصنوعی اسناد را توضیح دهید: خط لوله OCR، بدون OCR، VLM-مبنایی.
- سه جریان ورودی LayoutLMv3 را توصیف کنید: متن، طرح (bbox) ، پچ های تصویر، با ماسک یکپارچه.
- مقایسه Donut (آزاد OCR، تصویر → نشان دادن) ، Nougat (ورق علمی → LaTeX) ، DocLLM (تولیدگر آگاه از طرح) ، PaliGemma 2 (VLM- بومی).
- یک مدل سند را برای یک کار جدید انتخاب کنید (فاکتورها، مقالات علمی، فرم های دست نوشته، رسید های چینی).
مشکل
"فهم این PDF" به طرز فریبنده ای سخت است. اطلاعات در:
- محتوای متن (90 درصد از سیگنال)
- طرح (سرانجام، یادداشت های پای، لابراتوار جانبی، قالب دو ستون)
- جدول ها (صفوف، ستون ها، سلول های ادغام شده)
- ارقام و نمودارها
- يادداشت هاي دستي
- فونت ها و تایپوگرافی (سرانجام با بدن)
یک سیستم که به فاکتورها اهمیت می دهد باید بداند " کل: 1245 دلار" از پایین سمت راست آمده است، نه از یک یادداشت زیر.
مفهوم
دوره 1 خط لوله OCR (پیش از 2021)
دسته کلاسیک:
- PDF → تصویر در هر صفحه
- Tesseract (یا OCR تجاری) متن را با هر کلمه با جعبه های مرزی خارج می کند.
- تحلیلگر طرح بلوک ها را شناسایی می کند (سرنامه، جدول، پاراگراف).
- شناسه سازنده ساختار جدول ها را تجزیه و تحلیل می کند.
- قوانین دامنه + زمینه های استخراج regex.
برای متن چاپ شده تمیز کار می کند. شکاف در خط نوشتاری، اسکن های منحرف، جدول های پیچیده، اسکریپت غیر انگلیسی. هر حالت شکست نیاز به یک مسیر استثناء سفارشی دارد.
TROCR (2021)
TrOCR (Li et al., arXiv:2109.10282) جایگزین CNN-CTC کلاسیک Tesseract با یک ترانسفورماتور کدگذاری-دکودر آموزش داده شده در تصاویر متن مصنوعی + واقعی است. بر روی متن دست نوشته و چندزبانی برنده شدن تمیز است. هنوز یک لوله (دیتکتور سپس TrOCR سپس طرح) است، اما مرحله OCR به طور چشمگیری بهبود یافته است.
دوره 2 بدون OCR (2022-2023)
اولین مدل های بدون OCR می گفتند: تشخیص را کاملاً رد کنید، پیکسل های تصویر را به طور مستقیم به خروجی ساختاری نقشه بزنید.
دونات (Kim et al., arXiv:2111.15664):
- ترانسفورماتور کدگر-دکودر، کدگر سوين-بي
- محصول JSON برای درک فرم، نشان دادن برای خلاصه یا هر طرح خاص وظیفه است.
- هيچ OCR، هيچ طرحي، هيچ کشفي
نوگات (بلیچر و همکارانش، arXiv:2308.13418):
- به طور خاص در مورد مقالات علمی آموزش دیده
- خروجی LaTeX / نشان دادن
- معادلات، طرح چند ستون، ارقام را اداره می کند.
- مدل هر ارکسيف پارسر تماس می گیرد.
این ها متخصصین هستند نه عمومی ها، دونات در یک مقاله علمی شکست می خورد، نوگات در یک فاکتور شکست می خورد.
طرحLMv3 (2022)
یک مسیر متفاوت. LayoutLMv3 (Huang et al., arXiv:2204.08387) OCR را حفظ می کند اما درک طرح را اضافه می کند:
- سه جریان ورودی: توکن های متن OCR، جعبه های مرزی 2D در هر توکن، پچ های تصویر.
- هدف آموزش پوشیده در سه روش (متن پوشیده، پیچ های پوشیده، طرح پوشیده)
- پایین تر: طبقه بندی، استخراج شرکت، جدول QA.
طرحLMv3 اوج درک اسناد مبتنی بر OCR است. قوی در فرم ها و فاکتورها. نیاز به OCR در جریان است. بهترین دقت قبل از VLM در معیار های استاندارد سند.
سند نامه (۲۰۲۳)
DocLLM (Wang et al., arXiv:2401.00908) برادر تولید کننده LayoutLM است. پاسخ های فرم آزاد را با توجه به توکن های طرح تولید می کند. برای QA در اسناد بهتر است؛ هنوز هم به ورودی OCR بستگی دارد.
دوره 3 VLM-منی (2024+)
2024 VLM ها به اندازه کافی خوب شدند تا لوله را به طور کامل جایگزین کنند. تصویر صفحه کامل را با وضوح بالا به یک VLM ارسال کنید، سوال بپرسید، پاسخ بگیرید.
- LLaVA- NEXT 336- تائل AnyRes برای اسناد کوچک کار می کند.
- Qwen2.5VL با رزولوشن دینامیک 2048+ پیکسل را به طور بومی اداره می کند.
- کلاود اپوس 4.7 از اسناد 2576px پشتیبانی می کند.
- PaliGemma 2 (اپریل 2025) به طور خاص برای اسناد + دستخط آموزش می دهد.
شکاف بین لوله VLM-native و OCR به سرعت بسته شد. تا سال 2026، VLM-native بر روی:
- متن صحنه (نویس دست + چاپ، اسکریپت های مخلوط)
- جدول های پیچیده با سلول های ادغام شده
- معادلات ریاضی در متن گنجانده شده
- ارقام با یادداشت های متن
لوله های OCR هنوز برنده هستند:
- بار کاری اسکن خالص در مقیاس عظیم که در آن تاخیر در هر صفحه مهم است.
- قابلیت اطمینان خط لوله (شکست های تعیین کننده در مقابل توهم های VLM).
- محیط های تنظیم شده که نیاز به تولید OCR قابل بررسی دارند.
مرز کلود 4.7 / GPT-5
با ورودی بومی 2576 پیکسل، VLM های مرزی درک را با دقت نزدیک به انسان مستند می کنند. اعداد مرجع از اوایل سال 2026:
- DocVQA: کلود 4.7 ~95.1 ، پال گما 2 ~88.4 ، نوگات ~77.3 ، لاین لاین LLMv3 ~83.
- نمودار QA: کلاود 4.7 ~ 92.2، GPT-4V ~ 78.
- VisualMRC: کلود 4.7 ~ 94
شکاف مدل بسته عمدتاً در مقیاس رزولوشن و LLM پایه است. مدل های باز در 7B چند نقطه عقب هستند اما به سرعت در حال رسیدن هستند.
معادلات ریاضی و تولید LaTeX
مقالات علمی نیاز به تولید دقیق لاتکس برای معادلات دارند. نوگات در این زمینه آموزش دیده است. VLMs آموزش دیده با اهداف لاتکس (Qwen2.5-VL-Math، مشتق های نوگات) لاکتکس قابل استفاده را تولید می کنند. بدون آموزش صریح لاتکس، VLMs نقل های قابل خواندن اما نامشخص را تولید می کنند.
برای خطوط لوله کاغذ علمی در سال 2026: زنجیره نوگات در PDF، سپس VLM در صفحات پیچیده.
خط دست
هنوز هم سخت ترین فرعی است. مخلوط چاپ + دست نوشته (نوشتهای پزشکان، فرم های پر شده) جایی است که لوله های OCR هنوز از VLM ها برای هزینه بهتر می شوند. تنها VLM های دست نوشته بهبود می یابند (کلود 4.7, PaliGemma 2).
نسخه 2026
برای یک پروژه جدید AI اسناد:
- فاکتورهای چاپ شده در مقیاس: طرحLMv3 + قوانین، مقرون به صرفه.
- اسناد مخلوط (علم + دست نوشته + فرم): VLM-مبنایی (PaliGemma 2 یا Qwen2.5-VL).
- مصرف کامل آرکسيف: نوگات برای ریاضیات، VLM برای ارقام
- مقررات: خط لوله OCR + اعتبار دهنده VLM برای بررسی های متقابل.
ازش استفاده کن
code/main.py:
- یک توکنایزر آگاه از طرح بازی: جفت های داده شده (متن، bbox) ، ورودی سبک LayoutLMv3 را تولید می کند.
- یک ژنراتور طرح کار سبک Donut: قالب JSON برای فرم ها.
- مقایسه بودجه های توکن در هر صفحه در پیپلین OCR، Donut، Nougat و VLM-native.
-باده
این درس به ما کمک می کندoutputs/skill-document-ai-stack-picker.md. در نظر گرفتن یک پروژه AI اسناد (منطقه، مقیاس، کیفیت، مقررات) ، بین خط لوله OCR، متخصص بدون OCR و VLM-native انتخاب کنید.
تمرینات
- پروژه شما 10 ميليون فاکتور در روزه.
- چرا LayoutLMv3 در فرم QA از CLIP-VLM های خالص بهتر است اما در scene-text عملکرد کمتری دارد؟ جریان bbox چه چیزی را رها می کند؟
- نوگات لا تیکس را تولید می کند. یک مورد آزمایش را پیشنهاد کنید که در آن تولید بومی VLM نوگات را در وفاداری لا تیکس پیروز می کند و یک مورد که نوگات برنده می شود.
- مقاله PaliGemma 2 را بخوانید (گوگل، 2024) چه اضافه کاری کلیدی در داده های آموزشی بود که دقت اسناد را در مقابل PaliGemma 1 افزایش داد؟
- یک ترکیبی با امنیت قانونی طراحی کنید: لوله OCR به عنوان اصلی، VLM به عنوان چک متقابل ثانویه. چگونه اختلافات را حل می کنید؟
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| OCR pipeline | "Tesseract-style" | Stage-wise stack: detect -> OCR -> layout -> rules; deterministic, fragile |
| OCR-free | "Donut-style" | Image-to-output transformer that skips explicit OCR; single model |
| Layout-aware | "LayoutLM" | Input includes per-token bbox coordinates; unified masking across modalities |
| VLM-native | "Frontier VLM" | Feed page image directly to Claude/GPT/Qwen VLM at high resolution; no pipeline |
| DocVQA | "Doc benchmark" | Document VQA standard; most-cited score |
| Markup output | "LaTeX / MD" | Structured output format instead of free-form text; enables downstream automation |
خواندن بیشتر
- Li et al. — TrOCR (arXiv:2109.10282)
- Blecher et al. — Nougat (arXiv:2308.13418)
- Huang et al. — LayoutLMv3 (arXiv:2204.08387)
- Kim et al. — Donut (arXiv:2111.15664)
- Wang et al. — DocLLM (arXiv:2401.00908)
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.