Phase 08: Generative AI

النماذج الجيناتية التصنيف والتاريخ

كل نموذج الصورة، نموذج النص، نموذج الفيديو، ونموذج 3D يناسب في واحد من خمسة سطل. اختيار سطل خاطئ وسوف تقاتل الرياضيات لأسابيع. اختيار الحق واحد والحقل الـ 12 سنة الأخيرة من التقدم تتراكم نظيفة في رأسك.

Type: Learn

Languages: Python

Prerequisites: Phase 2 (ML Fundamentals), Phase 3 (Deep Learning Core), Phase 7 · 14 (Transformers)

Time: ~45 minutes

المشكلة

النموذج التوليد يقوم بعمل واحد: عينات التدريب المقدمة من بعض التوزيع غير المعروف p_data(x)أظهر عينات جديدة تبدو وكأنها جاءت من نفس التوزيع. وجوه، جمل، ملفات MIDI، هيكل البروتين

المشكلة هي أنp_dataيعيش في مساحة ذات ملايين الأبعاد (صورة RGB 512 × 512 تبلغ 786K أبعاد) ، والعينة تجلس على مجموعة رقيقة داخل هذا المساحة، ويمكنك الحصول على فقط ربما 10M من الأمثلة. القوة الوحشية الكثافة هي بلا أمل. كل نموذج توليدي هو تنازل الذي يتداول مشكلة واحدة صعبة مقابل واحدة أقل صعوبة قليلا.

خمسة عائلات نجوت خلال الاثني عشر عاماً الماضية، معرفة ما الذي يفعله كل عائلة يخبرك لماذا تفوز في بعض المهام وتنهار في الآخرين.

المفهوم

!Five families of generative models — taxonomy by what they model

1. Explicit density, tractable.اكتبlog p(x)النماذج السلبية (PixelCNN، WaveNet، GPT) تصنعp(x) = ∏ p(x_i | x_<i). إنشاء التدفقات الطبيعية (الواقعية النفطية، الوهاء) p(x)كتحويل قابل للتحويل من قاعدة بسيطة. المزايا: احتمالات دقيقة، فقدان التدريب النظيف. المشكلة: استنتاج السريع هو تسلسل (بطيء لسلسلة طويلة) ، وتدفقات تحتاج إلى معمارات قابل للتحويل (مقيّدة من الناحية الهندسة المعمارية).

2. Explicit density, approximate.مقيدlog p(x)من أسفل (ELBO) وتحسين الحدود. تستخدم VAEs (Kingma 2013) مرموزة-مقررة مع خلفية متغيرة. تدرب نماذج التفريق (DDPM ، Ho 2020) على مفسر يفضل بشكل ضمني ELBO الموزن. التفريق هو العمود الفقري المهيمن الصورة والفيديو وال3D في عام 2026.

3. Implicit density.تخطي الكثافة بالكامل ، تعلم المولدG(z)التي تنتج عينات و تمييزD(x)النظام النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي النمطي

4. Score-based / continuous-time.تعلم تدريج كثافة الحشيش∇_x log p(x)(النتيجة) مباشرة. أظهرت سونغ و إرمون (2019) أن مطابقة النتيجة تعامل التوزيع إلى SDE. تطابق التدفق (ليبمان 2023) هو الدرجة الساخنة 2024-2026: التدريب الخالي من المحاكاة ، المسارات المستقيمة ، 4-10 مرات أسرع من DDPM. الاستقرار التوزيع 3 ، التدفق ، الصوت 2 جميع استخدام تطابق التدفق.

5. Token-based autoregressive over discrete codes.قم بتضغط البيانات عالية التميز باستخدام VQ-VAE أو الكميات المتبقية إلى تسلسل قصير من الرموز المتفصلة ، ثم استخدم محول لنموذج تسلسل الرموز. Parti ، MuseNet ، AudioLM ، VALL-E ، Tokenizer الصغرى سورا تستخدم كل هذا. هذا هو علبة 1 بالإضافة إلى Tokenizer تعلم.

قصة قصيرة

YearModelWhy it mattered
2013VAE (Kingma)First deep generative model with a usable training loss.
2014GAN (Goodfellow)Implicit density, no likelihood — shockingly sharp samples.
2015DRAW, PixelCNNSequential image generation.
2017Glow, RealNVPInvertible flows; exact likelihood with depth.
2017Progressive GANFirst megapixel faces.
2019StyleGAN / StyleGAN2Photorealistic faces still hard to beat for that one domain.
2020DDPM (Ho)Diffusion becomes practical.
2021CLIP, DALL-E 1, VQGANText-to-image goes mainstream.
2022Imagen, Stable Diffusion 1, DALL-E 2Latent diffusion + text conditioning = commodity.
2022ControlNet, LoRAFine control over pretrained diffusion.
2023SDXL, Midjourney v5, Flow matchingScale + better training dynamics.
2024Sora, Stable Diffusion 3, Flux.1Video diffusion; flow matching wins.
2025Veo 2, Kling 1.5, Runway Gen-3, Nano BananaProduction-grade video.
2026Consistency + Rectified FlowOne-step sampling from diffusion backbones.

التجريب الخمسة

عندما تنخفض ورقة النموذج الجيني الجديد، اجيب على هذه الأسئلة الخمسة قبل قراءة قسم الطرق.

  1. What is being modeled?البيكسلات، الاختفاءات، القطع التقطيعية، غوسيانات ثلاثية الأبعاد، الشبكات، أشكال الموجات؟
  2. Is the density explicit or implicit?هل يكتبونlog p(x)- ماذا ؟
  3. Sampling: one-shot or iterative?تعني التكرار استنتاج أبطأ، وعادة ما تعني إطلاق واحد عداوة أو نزيف.
  4. Conditioning: unconditional, class, text, image, pose?هذا يحدد الخسارة والهيكل الرفاهية.
  5. Evaluation: FID, CLIP score, IS, human preference, task accuracy?كل منهما لديه أساليب الفشل المعروفة (انظر الدروس 14).

ستجيب على هذه الخمسة في كل درس في هذه المرحلة، في النهاية ستكون ردود فعل.

بناءها

رمز هذا الدروس هو تصور خفيف الوزن: تكييف خليط 1D من غوسيان من عينات باستخدام ثلاثة نهج لعبة (كثافة النواة، نظام التاريخ المتنقل، واكثر من نموذج "GAN-ish" مولد) حتى تتمكن من رؤية الفرق بين الكثافة الصريحة مقابل الضمنية على مشكلة يمكنك طباعة على شاشة واحدة.

أركضcode/main.py.إنه يستخرج 2000 عينة من خليط غوسيان مزدوج، ثم يطبع:

explicit density (histogram): p(x in [-0.5, 0.5]) ≈ 0.38
approximate density (KDE):     p(x in [-0.5, 0.5]) ≈ 0.41
implicit (nearest-sample gen): 20 new samples printed, no p(x)

لاحظ: السؤال الأول والثاني يجعلك تسأل "ما هي احتمالية هذه النقطة؟" والثالث لا يمكن. هذا هو التمييز صريح ضد ضمني الذي سيكون مهما لكل درس مستقبلي.

استخدمها

أي عائلة، لأي مهمة، في عام 2026؟

TaskBest familyWhy
Photoreal faces, narrow domainStyleGAN 2/3Still sharpest, fastest inference.
General text-to-imageLatent diffusion + flow matchingSD3, Flux.1, DALL-E 3.
Fast text-to-imageRectified flow + distillationSDXL-Turbo, SD3-Turbo, LCM.
Text-to-videoDiffusion Transformer + flow matchingSora, Veo 2, Kling.
Speech + musicToken-based AR (AudioLM, VALL-E, MusicGen) or flow matching (AudioCraft 2)Discrete tokens scale cheaply.
3D scenesGaussian Splatting fit, diffusion prior3D-GS for reconstruction, diffusion for novel-view.
Density estimation (no sampling)FlowsOnly family with exact log p(x).
Simulation / physicsFlow matching, score SDEStraight-line paths, smooth vector fields.

أرسله

إبقواoutputs/skill-model-chooser.md. . .

تتطلب المهارة وصف المهمة والمخرجات: (1) العائلة التي تستخدمها، (2) قائمة مرتبة من ثلاثة خيارات مفتوحة وثلاثة مضيفة، (3) وضع الفشل المحتمل الذي يجب عليك الانتباه إليه، و (4) ميزانية الحساب / الوقت.

التمارين

  1. Easy.لكل من هذه المنتجات الخمسة، حدد العائلة والعمود الفقري: صورة ChatGPT، Midjourney v7، Sora، Runway Gen-3, ElevenLabs. يجب أن تكون الأدلة من تقارير تقنية عامة.
  2. Medium.الصحيفة التي ستقرأها غداً تدعي أن العينات أسرع 100 مرة من التوزيع. اكتب ثلاثة أسئلة للتحقق من ما إذا كان التسرع ينجو من التكييف والارتفاع في القرار.
  3. Hard.خذ مجال واحد يهمك (مثل بنية البروتين، CAD، الجزيئات، المسارات) ، وأجيب على التجريب الخمسة للنموذج SOTA الحالي في هذا المجال وخطط ما الذي يمكن أن يغيره نموذج أفضل.

الشروط الرئيسية

TermWhat people sayWhat it actually means
Generative model"It makes new stuff"Learns a sampler for p_data(x), optionally exposes log p(x).
Explicit density"You can evaluate it"Model provides a closed-form or tractable log p(x).
Implicit density"GAN-style"Only a sampler — no way to evaluate p(x) of a given point.
ELBO"Evidence lower bound"A tractable lower bound on log p(x); VAEs and diffusion optimize it.
Score"Gradient of log-density"∇_x log p(x); diffusion and SDE models learn this field.
Manifold hypothesis"Data lives on a surface"High-dim data concentrates on a low-dim manifold; why dimensionality reduction works.
Autoregressive"Predict the next piece"Factorize joint as product of conditionals.
Latent"Compressed code"Low-dim representation from which a decoder can reconstruct the input.

ملاحظة الإنتاج: خمسة عائلات، خمسة أشكال استنتاج

كل عائلة تخطيط إلى منحنى تكلفة مختلفة من خادم الاستنتاج. إدباطات الإنتاج-الإنتاج الإستنتاج إستنتاج LLM كإعداد مقدم + فك؛ نفس التفكيك ينطبق هنا:

  • Autoregressive (bucket 1 and 5).يهيمن التشخيص التسلسل على التخفيف؛ KV-Cache، الإعداد المستمر، والتشخيص المضاربي جميعها تنطبق مباشرة.
  • VAE / diffusion / flow-matching (buckets 2 and 4).لا توجد رمزية في معنى ماجستير في التدريبnum_steps × step_cost، و step_costهو محول أو شبكة U-مضي قدما في قرار متخفي كامل. أزرار الإنتاج هي عدد الخطوات (DDIM / DPM-Solver / نزيف) ، حجم اللحوم ، والدقة (bf16 / fp8 / int4).
  • GAN (bucket 3).واحد إلى الأمام، لا جدول، لا تخزين KV، TTFT ≈ تأخير كامل، هذا هو السبب في StyleGAN لا يزال يفوز على النطاق الضيق UX.

عندما ترى "سرعة أكثر من انتشار" في ملخص ورقية، ترجمها إلى "خطوات أقل × تكلفة نفس الخطوة" أو "خطوات نفسها × تكلفة خطوة أرخص". كل شيء آخر هو التسويق.

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.