Phase 15: Autonomous Systems

STAR, V-STAR, خاموش-STAR استدلال خود آموز

کوچکترین حلقه بهبود خود ممکن در درون منطق قرار دارد. یک مدل زنجیره ای از افکار را تولید می کند، آنهایی را که به پاسخ های درست می رسند حفظ می کند و آنها را به خوبی تنظیم می کند. اون استار هست V-STaR یک تایید کننده اضافه می کند بنابراین انتخاب زمان نتیجه گیری بهتر است. خاموشي-ستار منطق رو به هر نشانه اي فشار ميده سه تا هم کار ميکنن هيچکدوم از آنها جادويي نيست. حلقه هر راه کوتاهي را که اتفاق افتاده تا به جواب درست برسيد حفظ ميکنه.

Type: Learn

Languages: Python (stdlib, bootstrap-loop simulator)

Prerequisites: Phase 13 · 01-03 (Reasoning and CoT), Phase 15 · 01 (long-horizon framing)

Time: ~60 minutes

مشکل

راه ساده ای برای آموزش یک مدل به استدلال، جمع آوری آثار استدلال نوشته شده توسط انسان است. این کار گران و آهسته است و با توجه به مقدار کیفیت بالای زنجیره ی افکار انسان ها محدود است.

STaR (Self-Teught Reasoner، Zelikman et al., 2022) می پرسد: اگر مدل استدلال های خود را بنویسد و آنها را با پاسخ های شناخته شده رتبه بندی کند چه می شود؟ حلقه این است:

  1. نمونه ای از استدلال و جواب
  2. اگه جواب آخر درست باشه، دنبالش کن
  3. . به دنبال آثار نگهداري شده
  4. تکرار کنم

این کار می کند. GSM8K و CommonsenseQA هر دو بدون نوتیفکیشن جدید انسانی بهبود یافته اند. اما حلقه دارای یک تعصب داخلی است: هر استدلال که پاسخ درست را تولید می کند، بدون توجه به اینکه استدلال خود درست است یا خیر حفظ می شود. V-STaR (Hosseini و همکاران، 2024) این را با یک تأیید کننده آموخته اصلاح می کند. Quiet-STaR (Zelikman و همکاران، 2024) ایده را به طور کلی به استدلال های داخلی به اشتراک می گذارد.

مفهوم

STaR: بوترسترپ روی آنچه کار کرد

از یک مدل پایه با برخی از توانایی استدلال ضعیف شروع کنید. در هر مشکل آموزشی، یک دلیل و پاسخ را نمونه کنید. اگر پاسخ با برچسب مطابقت دارد، سه برابر را نگه دارید. مدل را در مجموعه نگهداری کنید. تکرار کنید.

یک پیچ مهم است. اگر مدل هرگز نمی تواند یک مشکل را درست کند، حلقه نمی تواند از آن یاد بگیرد.rationalizationدر مورد مشکلات که مدل شکست می دهد، پاسخ درست را به عنوان یک اشاره تزریق کنید و دوباره به مدل کمک کنید تا یک استدلال منجر به آن شود.

نتیجه در مقاله اصلی (Zelikman et al., 2022): یک مدل پایه GPT-J از 5.8% به 10.7% در GSM8K از طریق دور های تکراری STaR با عقلانی سازی حدود 5 درصد نقطه مطلق بهبود یافته است. در CommonsenseQA، GPT-J 6B آموزش دیده توسط STaR به 72.5% رسیده است. قابل مقایسه با یک مدل GPT-3 175B (~73%) تقریبا 30 برابر بزرگتر آموزش دیده است.

V-STaR: یک تایید کننده را با DPO آموزش دهید

STaR استدلال های نادرست را دور می اندازد. Hosseini et al. (2024) مشاهده کرد که این نیز داده ها هستند: هر جفت (عقلانی، "آیا این درست است") می تواند یک تأیید کننده را آموزش دهد. آنها از بهینه سازی اولویت مستقیم در مورد هر دو راه حل درست و نادرست برای ایجاد رتبه بندی استفاده می کنند. در زمان نتیجه گیری، معاینه N استدلال و انتخاب انتخاب انتخاب برتر تأیید کننده را انتخاب کنید.

دلتای گزارش شده: +4 تا +17 درصد نسبت به خط های اولیه بهبود خود در GSM8K و MATH، با استفاده از تایید کننده برای انتخاب زمان نتیجه گیری به جای تنظیم دقیق ژنراتور اضافی، بیشتر سود حاصل می شود.

Quiet-STaR: منطق داخلی در هر توکن

زلیکمن و همکاران (2024) پرسیدند: اگر مدل یاد بگیرد که یک استدلال داخلی کوتاه در هر موقعیت توکن تولید کند، نه فقط بین مشکل و پاسخ؟ خاموش-STaR یک مدل را برای انتشار یک "فکر" پنهان قبل از هر توکن پیش بینی شده آموزش می دهد، سپس پیش بینی آگاهانه با پیش بینی خط پایه را از طریق وزن آموخته ترکیب می کند.

نتیجه: Mistral 7B بهبود مطلق صفر شوت در GSM8K از 5.9٪ به 10.9٪ و CommonsenseQA از 36.3٪ به 47.2٪ بدون تنظیم دقیق خاص به وظایف را به دست آورد. مدل یاد گرفت "چه زمانی فکر کنید" توکن های سخت منطقی داخلی طولانی تر می شوند؛ ساده ها تقریبا هیچ گونه را نمی گیرند.

چرا سه تا هم يه نگرانی براي ايمني دارند

هر سه روش از پاسخ نهایی به عنوان سیگنال گرادینت استفاده می کنند. یک استدلال که از طریق استدلال نادرست به پاسخ درست می رسد بهره برداری از یک میانراه، حدس زدن یا استفاده از یک الگوی غیر عمومی می شود به طور مثبت تقویت می شود. در مشکلات توزیع میانراه کار می کند. در مشکلات خارج از توزیع خاموش شکسته می شود.

تایید کننده V-STaR با یادگیری رتبه بندی استدلال ها کاهش می یابد، اما تایید کننده بر روی همان مجموعه برچسب آموزش دیده است. می تواند یاد بگیرد که استدلال اشتباه با قالب خوبی را بر روی عدم اطمینان صادق ترجیح دهد. طراحی ایمن تر این است که داده های سبک STaR را با (a) مدل های پاداش تحت نظارت فرآیند (حساب مراحل میانگین، نه فقط پاسخ ها) و (b) ارزیابی OOD انجام شده که میانراه های ساده را شکسته است، ترکیب کند.

مقایسه

MethodTraining signalInference costData wasteKnown failure mode
STaRkeep (rationale, answer) if correct1xdiscards all incorrect rationalesshortcut rationales
STaR + rationalizationabove + correct-answer hinted retries1xlessrationalized rationales may be implausible
V-STaRSTaR + DPO verifier from both classesNx (best-of-N)minimalverifier can reinforce confident wrongness
Quiet-STaRper-token rationale + mixing weight1.5-3xminimalstill answer-conditioned gradient

جایی که این در سال 2026 قرار دارد

"ستار" پير شده اما این الگوی در سال های 2025 تا 2026 در همه جا ظاهر می شود. RL در مشکلات ریاضی قابل تأیید (DeepSeek-R1، Kimi-k1.5، o1) سیگنال گرادینت STaR است که با پاسخ شرایط است، مقیاس بندی شده است. مدل های پاداش فرآیند (Lightman و همکارانش، 2023; "بگذارید مرحله به مرحله تایید کنیم") جایگزین نظارت بر فرآیند است. AlphaEvolve (درسی 3) STaR برای کد است، با یک ارزیابی کننده برنامه به جای یک برچسب. ماشین داروین گودل (درسی 4) است STaR برای استقرار عامل خود را.

درک STaR باعث می شود همه این کلیک ها انجام شود. این یک حلقه حداقل قابل اجرا بهبود خود است.

ازش استفاده کن

code/main.pyدر یک کار ریاضی بازی، یک حلقه STaR شبیه سازی شده را اجرا می کند. می توانید ببینید:

  • چطور دقت از گلوله هاي بوترپ بالا مي رود
  • چگونه میانگوهای به صورت مخفیانه وارد می شوند: شبیه ساز شامل یک کلاس منطقی "سست" است که پاسخ درست را ۴۰ درصد از زمان می گیرد اما به طور ضعیف عمومی می کند. ببینید که آیا STaR آنها را نگه می دارد.
  • چگونه یک تأیید کننده (طریقه V-STaR) در نتیجه گیری کمک می کند اما نمی تواند میانگین های راه کوتاه را که در طول آموزش ارائه شده است به طور کامل قطع کند.

-باده

outputs/skill-star-loop-reviewer.mdکمک می کند تا قبل از تمرین روی یک خط خط خط خط خط استدلال خود آموزشی را بررسی کنید.

تمرینات

  1. شبیه ساز را اجرا کنید. فرکانس شارٹ کُت را به صفر، سپس به 0.4 تنظیم کنید. دقت نهایی بین دو رنده چقدر متفاوت است، حتی اگر هر دو در توزیع تمرین >90٪ را به دست آورند؟
  1. یک آزمایش OOD طولانی مدت را به شبیه ساز اضافه کنید. مشکلات را از توزیع مختلف بکشید و مدل بوتستر شده را در مجموعه های توزیع و OOD ارزیابی کنید. شکاف را اندازه گیری کنید.
  1. مقاله Quiet-STaR را بخوانید (arXiv:2403.09629) بخش 3. نماد "آخر فکر" و سر وزن مخلوط را در هر سه جمله توضیح دهید.
  1. فیلتر درست نگه داشتن STaR را با یک جایگزین تحت نظارت فرآیند مقایسه کنید که هر مرحله منطقی را به طور مستقل پاداش می دهد. تفاوت هزینه برچسب گذاری و تفاوت کیفیت قابل قبول را شناسایی کنید.
  1. طراحی یک ارزیابی که به دنبال توجیه راه کوتاه در یک مدل استفاده شده باشد. این نباید کامل باشد باید ساده ترین راه کوتاه را که یک حلقه STaR تقویت می کند شکسته باشد.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
STaR"Self-Taught Reasoner"Fine-tune on model-generated rationales that land correct answers; repeat
Rationalization"Hinted retry"Inject the correct answer and re-prompt for a rationale on problems the base model fails
V-STaR"Verifier STaR"DPO-train a verifier on both correct and incorrect rationales, use it for inference-time selection
Quiet-STaR"Per-token rationales"Generate hidden thoughts at every token position; mix with baseline prediction
Answer-conditioned gradient"Outcome-based signal"The training loop rewards final answers, not reasoning steps
Process reward model"Step-level verifier"Reward model trained on per-step correctness, not outcome — contrasts with STaR
Shortcut rationale"Right answer, wrong reasoning"A rationale that reaches the label via a non-generalizing pattern; STaR keeps these

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.