STAR, V-STAR, خاموش-STAR استدلال خود آموز
Type: Learn
Languages: Python (stdlib, bootstrap-loop simulator)
Prerequisites: Phase 13 · 01-03 (Reasoning and CoT), Phase 15 · 01 (long-horizon framing)
Time: ~60 minutes
مشکل
راه ساده ای برای آموزش یک مدل به استدلال، جمع آوری آثار استدلال نوشته شده توسط انسان است. این کار گران و آهسته است و با توجه به مقدار کیفیت بالای زنجیره ی افکار انسان ها محدود است.
STaR (Self-Teught Reasoner، Zelikman et al., 2022) می پرسد: اگر مدل استدلال های خود را بنویسد و آنها را با پاسخ های شناخته شده رتبه بندی کند چه می شود؟ حلقه این است:
- نمونه ای از استدلال و جواب
- اگه جواب آخر درست باشه، دنبالش کن
- . به دنبال آثار نگهداري شده
- تکرار کنم
این کار می کند. GSM8K و CommonsenseQA هر دو بدون نوتیفکیشن جدید انسانی بهبود یافته اند. اما حلقه دارای یک تعصب داخلی است: هر استدلال که پاسخ درست را تولید می کند، بدون توجه به اینکه استدلال خود درست است یا خیر حفظ می شود. V-STaR (Hosseini و همکاران، 2024) این را با یک تأیید کننده آموخته اصلاح می کند. Quiet-STaR (Zelikman و همکاران، 2024) ایده را به طور کلی به استدلال های داخلی به اشتراک می گذارد.
مفهوم
STaR: بوترسترپ روی آنچه کار کرد
از یک مدل پایه با برخی از توانایی استدلال ضعیف شروع کنید. در هر مشکل آموزشی، یک دلیل و پاسخ را نمونه کنید. اگر پاسخ با برچسب مطابقت دارد، سه برابر را نگه دارید. مدل را در مجموعه نگهداری کنید. تکرار کنید.
یک پیچ مهم است. اگر مدل هرگز نمی تواند یک مشکل را درست کند، حلقه نمی تواند از آن یاد بگیرد.rationalizationدر مورد مشکلات که مدل شکست می دهد، پاسخ درست را به عنوان یک اشاره تزریق کنید و دوباره به مدل کمک کنید تا یک استدلال منجر به آن شود.
نتیجه در مقاله اصلی (Zelikman et al., 2022): یک مدل پایه GPT-J از 5.8% به 10.7% در GSM8K از طریق دور های تکراری STaR با عقلانی سازی حدود 5 درصد نقطه مطلق بهبود یافته است. در CommonsenseQA، GPT-J 6B آموزش دیده توسط STaR به 72.5% رسیده است. قابل مقایسه با یک مدل GPT-3 175B (~73%) تقریبا 30 برابر بزرگتر آموزش دیده است.
V-STaR: یک تایید کننده را با DPO آموزش دهید
STaR استدلال های نادرست را دور می اندازد. Hosseini et al. (2024) مشاهده کرد که این نیز داده ها هستند: هر جفت (عقلانی، "آیا این درست است") می تواند یک تأیید کننده را آموزش دهد. آنها از بهینه سازی اولویت مستقیم در مورد هر دو راه حل درست و نادرست برای ایجاد رتبه بندی استفاده می کنند. در زمان نتیجه گیری، معاینه N استدلال و انتخاب انتخاب انتخاب برتر تأیید کننده را انتخاب کنید.
دلتای گزارش شده: +4 تا +17 درصد نسبت به خط های اولیه بهبود خود در GSM8K و MATH، با استفاده از تایید کننده برای انتخاب زمان نتیجه گیری به جای تنظیم دقیق ژنراتور اضافی، بیشتر سود حاصل می شود.
Quiet-STaR: منطق داخلی در هر توکن
زلیکمن و همکاران (2024) پرسیدند: اگر مدل یاد بگیرد که یک استدلال داخلی کوتاه در هر موقعیت توکن تولید کند، نه فقط بین مشکل و پاسخ؟ خاموش-STaR یک مدل را برای انتشار یک "فکر" پنهان قبل از هر توکن پیش بینی شده آموزش می دهد، سپس پیش بینی آگاهانه با پیش بینی خط پایه را از طریق وزن آموخته ترکیب می کند.
نتیجه: Mistral 7B بهبود مطلق صفر شوت در GSM8K از 5.9٪ به 10.9٪ و CommonsenseQA از 36.3٪ به 47.2٪ بدون تنظیم دقیق خاص به وظایف را به دست آورد. مدل یاد گرفت "چه زمانی فکر کنید" توکن های سخت منطقی داخلی طولانی تر می شوند؛ ساده ها تقریبا هیچ گونه را نمی گیرند.
چرا سه تا هم يه نگرانی براي ايمني دارند
هر سه روش از پاسخ نهایی به عنوان سیگنال گرادینت استفاده می کنند. یک استدلال که از طریق استدلال نادرست به پاسخ درست می رسد بهره برداری از یک میانراه، حدس زدن یا استفاده از یک الگوی غیر عمومی می شود به طور مثبت تقویت می شود. در مشکلات توزیع میانراه کار می کند. در مشکلات خارج از توزیع خاموش شکسته می شود.
تایید کننده V-STaR با یادگیری رتبه بندی استدلال ها کاهش می یابد، اما تایید کننده بر روی همان مجموعه برچسب آموزش دیده است. می تواند یاد بگیرد که استدلال اشتباه با قالب خوبی را بر روی عدم اطمینان صادق ترجیح دهد. طراحی ایمن تر این است که داده های سبک STaR را با (a) مدل های پاداش تحت نظارت فرآیند (حساب مراحل میانگین، نه فقط پاسخ ها) و (b) ارزیابی OOD انجام شده که میانراه های ساده را شکسته است، ترکیب کند.
مقایسه
| Method | Training signal | Inference cost | Data waste | Known failure mode |
|---|---|---|---|---|
| STaR | keep (rationale, answer) if correct | 1x | discards all incorrect rationales | shortcut rationales |
| STaR + rationalization | above + correct-answer hinted retries | 1x | less | rationalized rationales may be implausible |
| V-STaR | STaR + DPO verifier from both classes | Nx (best-of-N) | minimal | verifier can reinforce confident wrongness |
| Quiet-STaR | per-token rationale + mixing weight | 1.5-3x | minimal | still answer-conditioned gradient |
جایی که این در سال 2026 قرار دارد
"ستار" پير شده اما این الگوی در سال های 2025 تا 2026 در همه جا ظاهر می شود. RL در مشکلات ریاضی قابل تأیید (DeepSeek-R1، Kimi-k1.5، o1) سیگنال گرادینت STaR است که با پاسخ شرایط است، مقیاس بندی شده است. مدل های پاداش فرآیند (Lightman و همکارانش، 2023; "بگذارید مرحله به مرحله تایید کنیم") جایگزین نظارت بر فرآیند است. AlphaEvolve (درسی 3) STaR برای کد است، با یک ارزیابی کننده برنامه به جای یک برچسب. ماشین داروین گودل (درسی 4) است STaR برای استقرار عامل خود را.
درک STaR باعث می شود همه این کلیک ها انجام شود. این یک حلقه حداقل قابل اجرا بهبود خود است.
ازش استفاده کن
code/main.pyدر یک کار ریاضی بازی، یک حلقه STaR شبیه سازی شده را اجرا می کند. می توانید ببینید:
- چطور دقت از گلوله هاي بوترپ بالا مي رود
- چگونه میانگوهای به صورت مخفیانه وارد می شوند: شبیه ساز شامل یک کلاس منطقی "سست" است که پاسخ درست را ۴۰ درصد از زمان می گیرد اما به طور ضعیف عمومی می کند. ببینید که آیا STaR آنها را نگه می دارد.
- چگونه یک تأیید کننده (طریقه V-STaR) در نتیجه گیری کمک می کند اما نمی تواند میانگین های راه کوتاه را که در طول آموزش ارائه شده است به طور کامل قطع کند.
-باده
outputs/skill-star-loop-reviewer.mdکمک می کند تا قبل از تمرین روی یک خط خط خط خط خط استدلال خود آموزشی را بررسی کنید.
تمرینات
- شبیه ساز را اجرا کنید. فرکانس شارٹ کُت را به صفر، سپس به 0.4 تنظیم کنید. دقت نهایی بین دو رنده چقدر متفاوت است، حتی اگر هر دو در توزیع تمرین >90٪ را به دست آورند؟
- یک آزمایش OOD طولانی مدت را به شبیه ساز اضافه کنید. مشکلات را از توزیع مختلف بکشید و مدل بوتستر شده را در مجموعه های توزیع و OOD ارزیابی کنید. شکاف را اندازه گیری کنید.
- مقاله Quiet-STaR را بخوانید (arXiv:2403.09629) بخش 3. نماد "آخر فکر" و سر وزن مخلوط را در هر سه جمله توضیح دهید.
- فیلتر درست نگه داشتن STaR را با یک جایگزین تحت نظارت فرآیند مقایسه کنید که هر مرحله منطقی را به طور مستقل پاداش می دهد. تفاوت هزینه برچسب گذاری و تفاوت کیفیت قابل قبول را شناسایی کنید.
- طراحی یک ارزیابی که به دنبال توجیه راه کوتاه در یک مدل استفاده شده باشد. این نباید کامل باشد باید ساده ترین راه کوتاه را که یک حلقه STaR تقویت می کند شکسته باشد.
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| STaR | "Self-Taught Reasoner" | Fine-tune on model-generated rationales that land correct answers; repeat |
| Rationalization | "Hinted retry" | Inject the correct answer and re-prompt for a rationale on problems the base model fails |
| V-STaR | "Verifier STaR" | DPO-train a verifier on both correct and incorrect rationales, use it for inference-time selection |
| Quiet-STaR | "Per-token rationales" | Generate hidden thoughts at every token position; mix with baseline prediction |
| Answer-conditioned gradient | "Outcome-based signal" | The training loop rewards final answers, not reasoning steps |
| Process reward model | "Step-level verifier" | Reward model trained on per-step correctness, not outcome — contrasts with STaR |
| Shortcut rationale | "Right answer, wrong reasoning" | A rationale that reaches the label via a non-generalizing pattern; STaR keeps these |
خواندن بیشتر
- Zelikman et al. (2022). STaR: Bootstrapping Reasoning With Reasoning کاغذ اصلی
- Hosseini et al. (2024). V-STaR: Training Verifiers for Self-Taught Reasoners یک DPO تایید کننده برای انتخاب زمان نتیجه گیری اضافه می کند.
- Zelikman et al. (2024). Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking هر یک از توجیهات داخلی
- Lightman et al. (2023). Let's Verify Step by Step مدل های پاداش فرآیند، سیگنال گرادینت جایگزین.
- DeepSeek-R1 paper (arXiv:2501.12948) آموزش های قابل بررسی، آموزش های STaR به سطح مرز
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.