إيغل-3 تشخيص التكهنات في الإنتاج
Type: Learn
Languages: Python (stdlib, toy acceptance-rate simulator)
Prerequisites: Phase 17 · 04 (Serving Engine Internals), Phase 10 · 18 (Multi-Token Prediction)
Time: ~60 minutes
أهداف التعلم
- أسمائ الجيلين الثلاث من تشفير التكهنات و اشرح ما تغيرات EAGLE-3 عن EAGLE-2 ومن نموذج مسودة كلاسيكي.
- حدد معدل قبول الفا، وحسب التسارع المتوقع من الفا و K (طول المسودة) ، وتحديد الفا المكافئة لتنسيق هدفك.
- شرح لماذا يتم اختيار تشخيص التكهنات (ليس افتراضيًا) في vLLM 2026 ولماذا تشغيله دون قياس ألفا هو نمط ضد الإنتاج.
- اكتب خطة قياس: أي مقياس، أي توزيع محرر، أي نقطة متزامن، أي مقياس للدخول.
المشكلة
يتم تشخيص الذاكرة. على H100 التي تعمل على Llama 3.3 70B FP8, كل رمز تشخيص يقرأ ~ 140 GB / s من الوزن ويصدر رمزًا واحدًا. محاسبة GPU تكون فارغة تقريبًا أثناء تشخيص الذاكرة.
يستخدم التشفير المضارب الفجوة. إنشاء رموز مرشحة K مع نموذج مشروع رخيص ، ثم طلب من النموذج المستهدف التحقق من جميع K في مرور واحد إلى الأمام. كل رمزا مُحققًا مجانيًا فعليًا (تم إلغاء التسديد إلى مجموعة من K إلى الأمام كان على الهدف القيام بذلك على أي حال).
يستخدم نهج النموذج المسود الكلاسيكي نموذجًا أصغر من نفس العائلة (Llama 3.2 1B مسودة لـ Llama 3.3 70B). إنه يعمل ولكن معدل قبوله متوسط توزيع النموذج الأصغر يختلف عن الهدف. "إيغل"، ثم "إيغل-2"، ثم "إيغل-3"، تدريب رأس مسرح خفيف مباشرة على الحالات الداخلية للنموذج الهدف، لذا فإن توزيع المسرح يتبع الهدف بشكل أكثر قلقة. لهذا السبب يذهب ألفا من 0.4 مع نموذج مشروع إلى 0.6-0.8 مع EAGLE-3.
الصيد: إيغل-3 يختار الدخول في VLLM 2026. speculative_configلا يوجد أي إشارة، لا تسريع، الفريق الذي يُدفع دون قياس ألفا على حركة المرور الحقيقية يرى غالباً تأخر الذيل يزداد سوءاً، وليس أفضل.
المفهوم
ما الذي يشتري التشفير المضارب في الواقع
بدون تشخيص المواصفات، تكلفة كل رمز هو هدف واحد إلى الأمام. مع تشخيص المواصفات في طول مشروع K والقبول ألفا، المتوقع رموز لكل هدف إلى الأمام هو 1 + K alpha. التسارع هو(1 + K alpha) / (1 + epsilon)حيث epsilon هو مسودة زائد التحقق من التكلفة العليا. بالنسبة K=5, ألفا=0.7: (1 + 5*0.7) / (1 + 0.1) = 4.5 / 1.1 = 4.1x.أرقام العالم الحقيقي تتراكم حوالي 2-3x لأن ألفا نادرا ما تكون عالية في حركة الإنتاج و الكمبيوتر النمط ينمو في حجم الحزمة العالي.
لماذا الفا هو المقياس الوحيد الذي يهم
لا تختفي الرموز الرفضة فإنها تجبر الهدف الثاني إلى الأمام للرمز الرفض الأول. في تحميل العمل حيث ينخفض الفا إلى 0.4، تدفع الرسوم العامة المخططة بالإضافة إلى التحقق بالإضافة إلى إعادة التدوير. عند التزامن العالي (قول 256 متزامنًا) ، فإن مجموعة إزالة الرمز كبيرة بما فيه الكفاية بحيث تقلص الفجوة بين "الهدف وحده" و "الهدف مع التحقق". تحت ألفا 0.55 على معظم أجهزة 2026، تعريف المواصفات هو صافي سلبي.
يتغير الفا حسب الحملة العملية. في الدردشة العامة على شير جي بي تي ، يصل EAGLE-3 المتدرب على شير جي بي تي إلى 0.6-0.8 . في حركة المرور المحددة للمنطقة (رمز ، طبي ، قانوني) ينخفض رأس المشروع المتدرب على البيانات العامة إلى 0.4-0.6 .
أجيال النسر في نظرة واحدة
- Classic draft model: نموذج صغير من نفس العائلة. ألفا 0.3-0.5 البنية التحتية بسيطة نموذجين محملين، مشروع يدير K للأمام لكل هدف للأمام.
- EAGLE-1 (2024)الرأس المُسحب الواحد المدرب على الحالات الخفية المستهدفة (طبقة أخيرة). ألفا ~ 0.5 - 0.6 .
- EAGLE-2 (2025): طول مسودة قابلة للتكيف ومسودات على أساس الأشجار (تحقق من العديد من الفروع في مرسلة هدف واحدة). ألفا ~ 0.6-0.7 .
- EAGLE-3 (2025-2026): رأس مشروع مدرب على طبقات متعددة الهدف (ليس فقط الأخيرة) ، تحسين التوجه. ألفا ~ 0.6-0.8 على الدردشة العامة.
وصفة الإنتاج لعام 2026
- نموذج السفينة المستهدفة واضح. قياس خط الأساس TTFT، ITL، التوصيل عند التزامن المستهدف.
- تمكين مشروع EAGLE-3 عبر vLLM
speculative_configإعادة تشغيل المعيار - معدل قبول السجلات الفا. vLLM V1 يذكر هذا
spec_decode_metrics.accepted_tokens_per_request.قسم بطول المسودة المطلوبة للحصول على ألفا - إذا كان الفا < 0.55 على توزيع حركة المرور الإنتاجية، قم بتعطيل تشكيل المواصفات أو تدريب مسودة EAGLE-3 الخاصة بالمنطقة.
- في وقت واحد الإنتاج، إعادة تشغيل تأكيد P99 ITL لم يتفاقم.
فخ الإنتاج: ذيل P99
يقلل متوسط إطار إدارة المعالجة الإلكترونية مع تشكيل المواصفات. يمكن أن يزداد سوءاً P99 إذا لم تتحسن. يسبب مسودات رفض تسلسل مرورين (مسودة + تفشي-فشل + إعادة التدوير). تحت الحزمة الكاملة، تتسلسل هذه الممرات الثنائية. انظر P99 ITL ، وليس P50.
حيث يتم نشر إيغل-3 بالفعل
قامت جوجل بتنفيذ عملية فك التشفير المضاربة في "مراجعات الذكاء الاصطناعي" في عام 2025 (مثل الجودة، استجابة أسرع).speculative_configكما هو الموقع الموثق، وتشير ماتريسه الميزة إلى التشخيص المضاربي على أنه متوافق مع إزالة المواد المسبقة. يدعم SGLang EAGLE-3 كمسار مشروع يوصى به لحملات العمل الثقيلة.
كسر حتى الرياضيات في سطر واحد
التسارع المتوقع: S(alpha, K) = (1 + K*alpha) / (1 + verify_overhead)- إعدادS = 1يحلّل لـ ألفا: alpha_breakeven = verify_overhead / K. بالنسبة للتحقق من التكلفة العالية النموذجية ~ 0.15 و K=5: alpha_breakeven = 0.03لكن هذه هي الرياضيات الخامة للكشف. عند التزامن العالي يرتفع تكلفة التحقق والفئة للكشف بالفعل تعويض قراءات الذاكرة عبر التسلسلات، لذلك الفا_بريكيفن الفعال يرتفع إلى ~0.45-0.55 في الممارسة العملية.
متى لا تستخدم التشفير المضارب
- الجيل الخارجي للطائفة 1 حيث لا يهم التأخير استخدم الهدف العادي
- الناتج القصير جدا (أقل من 50 رمزا).
- المجال المتخصص بدون مدربين في المجال، الفا منخفضة جداً
- افتراض أن كل زوج من الميزات تتكون. تحقق من ماتريكس توافقية vLLM لنسخة الخاص بك: v0.18.0 يرمز إلى فك التشفير المضمن مع prefill الجزئي.
استخدمها
code/main.pyيحاكي حلقة فك التشفير مع ودون فك التشفير المضاربي عبر مجموعة من القيم الألفية وطول المسودة K. يطبخ الفا المكسرة، وتحقيق السرعة المقياسة، وسلوك الذيل. تشغيله على عدة (ألفا، K) مزيجات لمعرفة بالضبط أين يتوقف التشفير المضاربي من الدفع.
أرسله
هذا الدرس يُنتجoutputs/skill-eagle3-rollout.md. بالنظر إلى نموذج هدف، وصف توزيع حركة المرور، والهدف المتزامن، فإنه ينتج خطة تنفيذ EAGLE-3 مرحلية نقطة أساسية مقياس، تمكين التكوين، قياس ألفا، البوابة على ألفا >= 0.55, مشاهدة P99 ITL.
التمارين
- أركض
code/main.pyعند K=5، ما الفا التي تحتاجها لتسريع 2x؟ لتسريع 3x؟ كم هو حساس ذلك للتحقق_العباءات؟ - تخيل حركة الإنتاج تقسم 70٪ من الدردشة العامة، 30٪ من الشفرة. الدردشة العامة تصل إلى ألفا 0.7 مع EAGLE-3 المدربة على ShareGPT.
- اقرأ القرار
speculative_configالمستندات. أسمائ النماذج الثلاثة (نموذج مشروع، EAGLE، N-gram) وتحقق من أي ميزات كل منها يتألف من في إصدار vLLM الخاص بك. - ترى انخفاض متوسط إيه تي إل بنسبة 25% بعد تمكين إيه جيل 3 ولكن إيه تي إل بنسبة 99 ارتفع بنسبة 15%.
- حساب تكلفة الذاكرة من EAGLE-3 مشروع رأس للاما 3.3 70B. كيف يُقارن مع تشغيل Llama 3.2 1B كمسودة كلاسيكية؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| Speculative decoding | "draft plus verify" | Propose K tokens with a cheap model, verify all K in one target forward |
| Acceptance rate alpha | "spec accept rate" | Fraction of draft tokens accepted by the target; the only metric that matters |
| Draft length K | "spec k" | How many tokens the draft proposes per target forward; typical 4-8 |
| Verify overhead epsilon | "spec overhead" | Extra cost to verify-and-reroll vs a plain target forward; grows with batch |
| EAGLE-3 | "latest EAGLE" | 2025-2026 variant; trains draft head on multiple target layers; alpha 0.6-0.8 on general chat |
speculative_config | "vLLM spec config" | The explicit opt-in in vLLM V1; no default means no acceleration |
| N-gram spec decode | "N-gram draft" | GPU-side draft using N-gram lookups in the prompt; chunked-prefill-compatible |
| Break-even alpha | "no-op alpha" | Alpha at which spec decode gives zero speedup; watch this at production concurrency |
| Rejected-draft two-pass | "reroll cost" | Two target forwards when drafts reject; drives P99 tail |
المزيد من القراءة
- vLLM — Speculative Decoding docsمصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر مصدر
speculative_configو التوافق مع المكملات المضادة في V1. - vLLM Speculative Config API مجموعة الحقول الدقيقة.
- EAGLE paper (arXiv:2401.15077) صيغة رأس مسودة الأصلية للنصب
- EAGLE-2 paper (arXiv:2406.16858) مسودات وتشجيرات قابلة للتكيف.
- UC Berkeley EECS-2025-224 نظام فعال لـ LLM مع فك التفكير.
- BentoML — Speculative Decoding قائمة تفحص لتنفيذ الإنتاج
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.