Phase 12: Multimodal AI

فهم الوثائق والرسومات

الوثائق ليست صور في PDF، ورقة علمية، فاتورة، أو النموذج المكتوب يدوياً لديه ترتيب، الجداول، الرسومات، الملاحظات، العناوين، والهيكل المفصلي الذي لا يمكن فهم الصورة العادية التقاط. كانت كومة ما قبل VLM خط أنابيب: Tesseract OCR + layoutLMv3 + heuristics استخرج الجدول. استبدلت موجة VLM تلك بأمثلة خالية من OCR Donut (2022) ، Nougat (2023) ، DocLLM (2023) التي تنبعث عن علامات هيكلية مباشرة. بحلول عام 2026، سيكون الحد "إطعام الصورة الصفحة إلى Claude Opus 4.7 عند 2576px الأصلي،" وتأتي الخروج المهيمنة للتعريف مجانا. هذا الدرس يقرأ القوس ثلاثية العصور من الذكاء الاصطناعي الوثائق.

Type: Build

Languages: Python (stdlib, layout-aware document parser skeleton)

Prerequisites: Phase 12 · 05 (LLaVA), Phase 5 (NLP)

Time: ~180 minutes

أهداف التعلم

  • شرح ثلاث حقول من المستندات الذكاء الاصطناعي: خط أنابيب OCR، OCR-free، VLM-native.
  • وصف ثلاثة أنابيب إدخال LayoutLMv3: النص، التخطيط (bbox) ، ومصطلحات الصورة، مع التخفيض الموحد.
  • مقارنة دونوت (من دون OCR، الصورة → علامة) ، نوغات (الورقة العلمية → لا تيكس) ، دوكلم (إعداد واعي التوليد) ، PaliGemma 2 (VLM-أصل).
  • اختر نموذج وثيقة لمهمة جديدة (فواتير ورقائق علمية، نماذج مكتوبة يدويا، وصناديق صينية).

المشكلة

"فهم هذا الفيديو" صعب بشكل مخادع.

  • محتوى النص (90٪ من الإشارة).
  • التخطيط (العناوين، الملاحظات، الشرائح الجانبية، شكل عمودين).
  • الجداول (الصفوف والعمود والخلايا المدمجة).
  • الرسومات والرسومات
  • ملاحظات مكتوبة يدوياً
  • الخطوط والطباعة (اللقب مقابل الجسم).

يرمي المخططات المزروعة النص والباقي يفقد. نظام يهتم بالفواتير يحتاج إلى معرفة "مجموع: 1245 دولار" جاء من أسفل اليمين، وليس من ملاحظة أرضية.

المفهوم

الحقبة الأولى خط أنابيب OCR (قبل عام 2021)

الكلاسيكية:

  1. صورة في PDF → الصفحة
  2. تيسيراكت (أو OCR التجاري) يستخرج النص مع مربعات حد لكل كلمة.
  3. تحديد المتحلل التخطيط الكتل (القب، الجدول، الفقرة).
  4. تعريف هيكل الجدول يصف الجداول.
  5. قواعد النطاق + حقل إستخراج regex.

يعمل على النص المطبوع النظيف. فترات على الكتابة اليدوية، مسح المتحولات، الجداول المعقدة، النصوص غير الإنجليزية. كل وضع الفشل يتطلب مسار استثناء مخصص.

(تروكور) (2021)

استبدل TrOCR (Li et al., arXiv:2109.10282) CNN-CTC الكلاسيكي لتسيراكت بمعدل ترنسفورم إكودر-تشريح تدرب على صور نصية اصطناعية + حقيقية. الفوز النظيف على النص المكتوب يدوياً ومتعددة اللغات. لا يزال خط الأنابيب (المتصوص ثم تروكر ثم التخطيط) ، ولكن خطوة OCR تحسنت بشكل كبير.

العصر 2 خالية من OCR (2022-2023)

أول نماذج خالية من OCR قالت: تخطي الكشف بالكامل، خريطة البيكسلات الصورة إلى الخروج المهيكلة مباشرة.

الكعك (كيم وزملاءه):

  • محول إكودر-مُفكّر، إكودر هو سوين-بي.
  • إنتاج هو JSON لفهم النموذج، أو التميز لجمع، أو أي مخطط محدد للمهام.
  • لا توجد أوكر، لا تخطيط، لا اكتشاف.

نوغات (بليشر وزملاؤه، arXiv:2308.13418):

  • تدربت خصيصا على ورق علمية.
  • إنتاج: لا تي إكس / التسجيل
  • يُعامل المعادلات، التخطيط متعدد الأعمدة، الأرقام.
  • النموذج كل مكالمة من أرقام البحث

هؤلاء هم المتخصصون وليسوا عاديين، الكعك على ورقة علمية يفشل، النغات على فاتورة تفشل.

التخطيطLMv3 (2022)

مسار مختلف. LayoutLMv3 (Huang et al., arXiv:2204.08387) يبقي OCR لكنه يضيف فهم التخطيط:

  • ثلاثة تدفقات مدخلة: رموز نصية OCR، مربعات حد 2D لكل رموز، ومصطلحات الصورة.
  • هدف التدريب المُغطى على جميع الطرق الثلاثة (نص مخفي، مساحات مخفي، تخطيط مخفي).
  • أسفل: التصنيف، استيراد الكيانات، الجدول QA.

LayoutLMv3 هو ذروة فهم الوثائق القائمة على OCR. قوية على الاستمارات والفواتير. يتطلب OCR في الأعلى من التيار. أفضل دقة قبل VLM على مقارنات الوثائق الموحدة.

الدكتوراه (2023)

DOCLLM (وانغ وزملاءه، arXiv:2401.00908) هو شقيق توليد LayoutLM. يولد إجابات شكل حر مشروطة على رموز التخطيط. أفضل لتحديد المعلومات على المستندات؛ لا يزال يعتمد على إدخال OCR.

العصر 3 VLM-أصل (2024+)

2024 VLMs أصبحت جيدة بما فيه الكفاية لاستبدال خط الأنابيب بالكامل. إطعام الصورة الكاملة الصفحة في عالية الدقة إلى VLM، طرح السؤال، الحصول على إجابة.

  • LLaVA- NEXT 336- الألواح AnyRes يعمل على المستندات الصغيرة.
  • Qwen2.5VL الديناميكي-مقرر يتعامل مع 2048+ بكسل بشكل أصلي.
  • كلود أوبوس 4.7 تدعم 2576px الوثائق.
  • تدريب PaliGemma 2 (أبريل 2025) خصيصاً للوثائق + الكتابة اليدوية.

تمت إغلاق الفجوة بين خط الأنابيب VLM-native و OCR بسرعة بحلول عام 2026، يربح VLM-native على:

  • نص المشهد (مكتوب يدويا + مطبوعة، مخلوطة النصوص).
  • طاولات معقدة مع خلايا متضمنة
  • معادلات رياضية مدمجة في النص
  • الأرقام مع ملاحظات نصية

خطوط الأنابيب التي تُستخدم في مجال التسجيلات لا تزال تفوز في:

  • تحميلات عمل نقية في نطاق واسع حيث تأخر لكل صفحة مهم.
  • موثوقية خط الأنابيب (الفشل القياسي مقابل الهلوسات في VLM).
  • البيئات المنظمة التي تتطلب إصدارات OCR قابلة للتدقيق.

الحدود كلود 4.7 / GPT-5

عند إدخال محلي 2576 بكسل، تقوم VLMs الحدودية بتوثيق فهم بدقة قريبة من الإنسان.

  • DocVQA: كلود 4.7 ~ 95.1 ، PaliGemma 2 ~ 88.4 ، نوغات ~ 77.3 ، خط الأنابيب LayoutLMv3 ~ 83.
  • الرسم البياني: كلود 4.7 ~ 92.2 ، GPT-4V ~ 78.
  • (مريك) البصري: (كلود) 4.7 ~ 94.

الفجوة في النموذج المغلق هي في الغالب القرار والقياس القياسي لـ LLM. النماذج المفتوحة في 7B تتأخر بضع نقاط ولكن تتعقب.

المعادلات الرياضية وتسجيلات LaTeX

تحتاج الصحف العلمية إلى إنتاج LaTeX الدقيق للمعادلة. تم تدريب Nougat على هذا. تنتج VLMs المدربة بأهداف LaTeX (Qwen2.5-VL-Math ، مشتقات Nougat) LaTeX قابلة للاستخدام. دون تدريب LaTeX صريح ، تنتج VLMs نسخة قابلة للقراءة ولكن غير دقيقة.

لخطوط الأوراق العلمية في عام 2026: سلسلة نوغات على PDF، ثم VLM على صفحات صعبة.

الكتابة اليدوية

لا يزال أسوأ وظيفة فرعية. مخلوطة الطباعة + الكتابة اليدوية (ملاحظات الأطباء، نماذج ملؤة) هي حيث لا تزال خطوط أنابيب OCR تتغلب على VLMs من حيث التكلفة.

وصفة 2026

لمشروع جديد من المستندات الذكية:

  • الفواتير المطبوعة بحتة: ترتيبLMv3 + قواعد، فعالة من حيث التكلفة.
  • الوثائق المختلطة (العلمية + مكتوبة باليد + النماذج): VLM-أصل (PaliGemma 2 أو Qwen2.5-VL).
  • إحتساء كامل من الأرشيف: نوغات للرياضيات، VLM للأرقام.
  • التنظيم: خط أنابيب OCR + مؤكدة VLM للتحقق من التقاطع.

استخدمها

code/main.py:

  • رمزية مدروسة بتخطيط الألعاب: أزواج (نص، bbox) معينة، تنتج مدخلات على طراز LayoutLMv3.
  • مولد مخطط المهام على طراز دونات: قالب JSON للأنماط.
  • مقارنة ميزانيات الرمز لكل صفحة عبر خط أوكر-بيبلين، دونوت، نوغات، و VLM-أصل.

أرسله

هذا الدرس يُنتجoutputs/skill-document-ai-stack-picker.md. في ضوء مشروع المستندات الذكية (المجال، والحجم، والجودة، والتنظيم) ، تختار بين خط أنابيب OCR، ومهندس خالي من OCR، و VLM-أصل.

التمارين

  1. مشروعك هو 10 مليون فاتورة يومياً، أيّ كومة تقلل من تكلفة الصفحة دون فقدان الدقة؟
  1. لماذا LayoutLMv3 يتفوق على CLIP-VLMs النقي على النموذج QA ولكن أقل أداء في المشهد-نص؟ ما الذي يتخلّى عنه سلسلة bbox؟
  1. نوغات تولد لا تيكس. اقترح حالة اختبار حيث الناتج المحلي VLM يضرب نوغات على ولاء لا تيكس، وحالة حيث نوغات يفوز.
  1. اقرأ ورقة PaliGemma 2 (جوجل، 2024) ما هو إضافة البيانات الرئيسية للتدريب التي رفعت دقة الوثائق مقابل PaliGemma 1؟
  1. تصميم هجين آمن للتنظيم: خط أنابيب OCR كمتابعة أولية، VLM كمتابعة ثانوية. كيف تحل الخلافات؟

الشروط الرئيسية

TermWhat people sayWhat it actually means
OCR pipeline"Tesseract-style"Stage-wise stack: detect -> OCR -> layout -> rules; deterministic, fragile
OCR-free"Donut-style"Image-to-output transformer that skips explicit OCR; single model
Layout-aware"LayoutLM"Input includes per-token bbox coordinates; unified masking across modalities
VLM-native"Frontier VLM"Feed page image directly to Claude/GPT/Qwen VLM at high resolution; no pipeline
DocVQA"Doc benchmark"Document VQA standard; most-cited score
Markup output"LaTeX / MD"Structured output format instead of free-form text; enables downstream automation

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.