Phase 15: Autonomous Systems

ساتر، V-Satar، ساكن-تار التفكير الذاتي

أصغر حلقة ممكنة للتحسين الذاتي تقع داخل المنطق. النموذج يخلق سلسلة من الأفكار، يحتفظ بالردود الصحيحة، ويقوم بتحسين تلك. هذا هو (ستار) V-STaR يضيف مؤكدا لذلك اختيار وقت الاستنتاج هو أفضل. (تيت ستار) يدفع المنطق إلى كل رمز كلّ الثلاثة يعملون لا أحد منهم سحر الحلقة تحافظ على أي طريق مختصر الذي حدث للوصول إلى الإجابة الصحيحة.

Type: Learn

Languages: Python (stdlib, bootstrap-loop simulator)

Prerequisites: Phase 13 · 01-03 (Reasoning and CoT), Phase 15 · 01 (long-horizon framing)

Time: ~60 minutes

المشكلة

الطريقة السهلة لتعليم نموذج للتفكير هي جمع آثار التفكير المكتوبة من قبل الإنسان. هذا مكلف و بطيء و محدود من قبل كمية سلسلة عالية الجودة من الأفكار البشر على استعداد لكتابة.

يسأل STaR (Self-Teught Reasoner ، Zelikman et al ، 2022): ماذا لو كتب النموذج عقلياته الخاصة ووضعها على النحو المعرف على الإجابات؟

  1. عينة من التفكير تتبع بالإضافة إلى الإجابة.
  2. إذا كانت الإجابة الأخيرة صحيحة، احتفظ بالعلامة
  3. -إحداث تحسين على البصمات المحتفظة
  4. أكرر

يعمل. GSM8K و CommonsenseQA تحسنتا كلاهما دون إشارة بشرية جديدة. ولكن الحلقة لديها تحيز متكامل: يتم الاحتفاظ بأي منطق ينتج الإجابة الصحيحة ، بغض النظر عن ما إذا كان التفكير نفسه صائبًا. V-STaR (Hosseini وآخرون ، 2024) يصلح هذا مع مؤكد مدروس ؛ Quiet-STaR (Zelikman وآخرون ، 2024) يجميع الفكرة إلى تعريف المعقولات الداخلية.

المفهوم

ستار: إطلاق على ما عمل

ابدأ من نموذج أساسي مع قدرة ضعيفة على التفكير. على كل مشكلة تدريبية، عينة منطق زائد الإجابة. إذا كانت الإجابة تتطابق مع العلامة، حافظ على (المشكلة، المنطق، الإجابة) ثلاثية. ضبط النموذج على مجموعة المحفوظة. كرر.

تدوير واحد مهم. إذا لم يتمكن النموذج من إصلاح مشكلة أبداً، فإن الحلقة لا تستطيع التعلم عليها. يضيف STaR rationalization: في حالة فشل النموذج، أدخل الإجابة الصحيحة كلمحة وإعادة تشجيع النموذج لتوفير منطق يؤدي إليه.

النتيجة في الورقة الأصلية (زليكمان وزملاء 2022): تحسن نموذج GPT-J الأساسي على GSM8K من 5.8% إلى 10.7% من خلال جولات STaR المتكررة مع التبرير حوالي 5 نقاط مئوية مطلقة. على CommonsenseQA ، وصل GPT-J 6B المدرب على STaR إلى 72.5%, مقارنة مع GPT-3 175B المعدل بشكل دقيق (~ 73%) نموذج أكبر بنحو 30 مرة تدرب على التبرير الملاحظ يدويا.

V-STaR: تدريب المحقق مع DPO

يرمي STaR العقليات غير الصحيحة. لاحظ Hosseini et al. (2024) أن هذه هي أيضًا بيانات: كل زوج من (عقليات ، "هل هذا صحيح") يمكن تدريب المؤكد. يستخدمون تحسين التفضيلات المباشرة على الحلول الصحيحة وغير الصحيحة لبناء رتبة. في وقت الاستنتاج ، قم بعينة N العقليات واختيار أفضل خيار للمؤكد.

النسبة المبلغ عنها: +4 إلى +17 نقطة مئوية على خطوط أساسية سابقة للتحسين الذاتي على GSM8K و MATH ، مع معظم المكاسب تأتي من استخدام المؤكد لتحديد وقت الاستنتاج بدلاً من تحسين محركات توليد المواد الإضافية.

(تيت ستار): المعقولات الداخلية لكل رمز

سأل زليكمان وزملاء (2024): ماذا لو تعلم النموذج إنشاء منطق داخلي قصير في كل موقف رمزي ، وليس فقط بين المشكلة والجواب؟ تدرب Quiet-STaR النموذج لإصدار "فكر" مخفي قبل كل رمز متوقع ، ثم يخلط التنبؤ الموعد بالتفكير مع التنبؤ الأساسي عبر الوزن المتعلم.

النتيجة: اكتسبت Mistral 7B تحسينات مطلقة من الصفر على GSM8K من 5.9% إلى 10.9% و CommonsenseQA من 36.3% إلى 47.2% دون ضبط محدد للمهمة. تعلم النموذج "متى التفكير" توكنات صعبة تحصل على معايير داخلية أطول ؛ والسهلة تحصل على أي منها تقريبًا.

لماذا كل ثلاثة يشتركون في قلقهم

تستخدم جميع الطرق الثلاثة الإجابة النهائية كإشارة التراجع. يتم تعزيز المنطق الذي يصل إلى الإجابة الصحيحة عن طريق التفكير الخطأ استغلال اختصار أو تخمين أو استخدام نمط غير عام بشكل إيجابي. في مشاكل التوزيع الداخلي يعمل الشريط المختصر. في مشاكل خارج التوزيع ينكسر بصمت.

يُقلل مُحقق V-STaR من خلال تعلم ترتيب العقليات، ولكن المحقق مدرب على نفس مجموعة اللبوحات. يمكنه تعلم تفضيل التفكير الخطأ المُصمم بشكل جيد على عدم اليقين الشديد. التصميم الأكثر أمانا هو دمج بيانات في نمط STaR مع (أ) نماذج مكافأة ترعى تحت إشراف العملية (إعطاء الخطوات المتوسطة للمكافأة، وليس مجرد الإجابات) و (ب) تقييم OOD المتواصل الذي يكسر الشروط البسيطة.

المقارنة

MethodTraining signalInference costData wasteKnown failure mode
STaRkeep (rationale, answer) if correct1xdiscards all incorrect rationalesshortcut rationales
STaR + rationalizationabove + correct-answer hinted retries1xlessrationalized rationales may be implausible
V-STaRSTaR + DPO verifier from both classesNx (best-of-N)minimalverifier can reinforce confident wrongness
Quiet-STaRper-token rationale + mixing weight1.5-3xminimalstill answer-conditioned gradient

حيث هذا يجلس في 2026 كومة

(ستار) قديمة لكن النمط يظهر مرة أخرى في كل مكان في 2025-2026. RL على مشاكل الرياضيات المتحقق (DeepSeek-R1، Kimi-k1.5، o1) هو إشارة تراجع STaR المرتبطة بالرد، مقياسية. نماذج مكافأة العملية (لايتمان وآخرون ، 2023; دعونا نتحقق خطوة بخطوة) هي البديل الذي يتم إشرافه من خلال العملية. ألفا إيفولف (المدرسة 3) هو STaR للبرمجة، مع تقييم البرنامج بدلا من الملصق. آلة داروين غودل (الدرس 4) هي STaR للعميل الرفوف نفسه.

فهم STaR يجعل كل هذه النقر. إنه الحلقة الحد الأدنى من التطوير الذاتي.

استخدمها

code/main.pyيدير حلقة STaR محاكاة على مهمة حسابية لعبة. يمكنك مشاهدة:

  • كيف تتسلق الدقة فوق الرصاصات
  • كيف تُسلل الشروط القصيرة: يحتوي المحاكي على فئة منطقية "كسولة" تحصل على الإجابة الصحيحة في 40% من الأحيان ولكنها تعاملها بشكل سيء. شاهد ما إذا كان STaR يحافظ عليها.
  • كيف يساعد المؤكد (نمط V-STaR) في الإستنتاج ولكن لا يمكن أن تقصص قصاصات المشاركة أثناء التدريب بالكامل.

أرسله

outputs/skill-star-loop-reviewer.mdيساعدك على مراجعة خط الأنابيب المقترح للتفكير الذاتي قبل التدريب عليه.

التمارين

  1. تشغيل المحاكاة. حدد تردد المقصورة إلى الصفر، ثم إلى 0.4. كم الاختلاف بين الدقة النهائية بين الجريتين، على الرغم من أن كلا يصل إلى > 90% على توزيع التدريب؟
  1. إضافة اختبار OOD المتأخر إلى المحاكي. رسم المشاكل من توزيع مختلف وتقييم النموذج المزروع على كل من مجموعة التوزيع الداخلي و OOD. تحديد الفجوة.
  1. اقرأ ورقة Quiet-STaR (arXiv:2403.09629) القسم 3. شرح رمز "نهاية الفكر" ورأس الوزن المختلط في ثلاث جمل لكل منها.
  1. مقارنة مرشح STaR للحفاظ على صحة إذا كان بديلاً يتم إشرافه بالعملية الذي يكافئ كل خطوة منطقية بشكل مستقل. حدد الفرق في تكاليف التسمية والفرق في الجودة المثقلة.
  1. تصميم تقييم واحد الذي سيستقبل العبارات العقلانية للخطوط المختصرة في نموذج يتم نشره. لا يجب أن يكون مثالياً يجب أن يكسر أبسط الخطوط المختصرة التي ستعززها حلقة STaR.

الشروط الرئيسية

TermWhat people sayWhat it actually means
STaR"Self-Taught Reasoner"Fine-tune on model-generated rationales that land correct answers; repeat
Rationalization"Hinted retry"Inject the correct answer and re-prompt for a rationale on problems the base model fails
V-STaR"Verifier STaR"DPO-train a verifier on both correct and incorrect rationales, use it for inference-time selection
Quiet-STaR"Per-token rationales"Generate hidden thoughts at every token position; mix with baseline prediction
Answer-conditioned gradient"Outcome-based signal"The training loop rewards final answers, not reasoning steps
Process reward model"Step-level verifier"Reward model trained on per-step correctness, not outcome — contrasts with STaR
Shortcut rationale"Right answer, wrong reasoning"A rationale that reaches the label via a non-generalizing pattern; STaR keeps these

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.