Phase 15: Autonomous Systems

STAR, V-STAR, Quiet-STAR स्व-शिक्षित तर्क

स्वयं सुधार की सबसे छोटी लूप तर्क के भीतर है। एक मॉडल विचार की एक श्रृंखला उत्पन्न करता है, सही उत्तरों पर उतरने वाले को रखता है, और उन पर बारीक-बारी से ट्यून करता है। यह स्टार है। वी-एसटीएआर एक सत्यापनकर्ता जोड़ता है इसलिए निष्कर्ष समय चयन बेहतर है। Quiet-STaR तर्क को हर टोकन तक धकेलता है। तीनों काम करते हैं। उनमें से कोई भी जादू नहीं है लूप किसी भी शॉर्टकट को संरक्षित करता है जो सही उत्तर तक पहुंचने के लिए हुआ।

Type: Learn

Languages: Python (stdlib, bootstrap-loop simulator)

Prerequisites: Phase 13 · 01-03 (Reasoning and CoT), Phase 15 · 01 (long-horizon framing)

Time: ~60 minutes

समस्या

एक मॉडल को तर्क सिखाने का सीधा तरीका है मानव द्वारा लिखित तर्क के निशान एकत्र करना। यह महंगा, धीमा है, और यह सीमित है कि उच्च गुणवत्ता वाले विचार श्रृंखला के मानव कितने लिखने के इच्छुक हैं।

STaR (स्व-शिक्षित तर्क, Zelikman et al., 2022) पूछता हैः क्या होगा यदि मॉडल अपने स्वयं के तर्क लिखता है और उन्हें ज्ञात उत्तरों के अनुसार दर्जा देता है? लूप हैः

  1. तर्क के निशान प्लस उत्तर का नमूना लें।
  2. यदि अंतिम उत्तर सही है, तो ट्रैक रखें।
  3. संरक्षित निशान पर ठीक-ठीक ट्यून.
  4. दोहराएँ।

यह काम करता है। GSM8K और CommonsenseQA दोनों नए मानव टिप्पणी के बिना बेहतर हुए। लेकिन लूप में एक अंतर्निहित पूर्वाग्रह हैः कोई भी तर्क जो सही उत्तर का उत्पादन करता है, यह बरकरार रहता है, चाहे तर्क स्वयं सही था या नहीं। V-STaR (Hosseini et al., 2024) एक शिक्षित सत्यापनकर्ता के साथ इसे ठीक करता है; Quiet-STaR (Zelikman et al., 2024) विचार को आंतरिक तर्क के लिए सामान्य बनाता है।

अवधारणा

STaR: जो काम किया पर बूटस्ट्रैप

एक आधार मॉडल से शुरू करें जिसमें कुछ कमजोर तर्क क्षमता है। प्रत्येक प्रशिक्षण समस्या पर, एक तर्कसंगत प्लस उत्तर का नमूना लें। यदि उत्तर लेबल से मेल खाता है, तो (प्रश्न, तर्क, उत्तर) तीन रखें। बनाए रखा सेट पर मॉडल को ठीक से समायोजित करें। दोहराएं।

एक मोड़ मायने रखता है। यदि मॉडल कभी भी समस्या को सही नहीं कर सकता है, तो लूप उस पर सीख नहीं सकता है।rationalizationउदाहरण के लिए, एक मॉडल के साथ एक तर्कसंगत तर्क के साथ एक तर्कसंगत तर्क को जोड़ने के लिए एक संकेत के रूप में सही उत्तर इंजेक्ट करें।

मूल पेपर में परिणाम (ज़ेलिकमैन एट अल, 2022): जीपीटी-जे बेस मॉडल में सुधार हुआ GSM8K पर 5.8% से 10.7% तक दोहराए गए STaR राउंड के माध्यम से तर्कसंगतता के साथ लगभग 5 प्रतिशत अंक निरपेक्ष। कॉमन्सेंसQA पर, STaR-प्रशिक्षित GPT-J 6B 72.5% तक पहुंच गया, जो एक ठीक से ट्यून किए गए GPT-3 175B (~73%) के साथ तुलनात्मक है।

वी-स्टारः डीपीओ के साथ एक सत्यापितकर्ता को प्रशिक्षित करें

STaR गलत तर्क को फेंक देता है। होसेनी और अन्य (2024) ने देखा कि ये भी डेटा हैंः प्रत्येक जोड़ी (रैशनल, "क्या यह सही है") एक सत्यापितकर्ता को प्रशिक्षित कर सकती है। वे रैंकर बनाने के लिए सही और गलत समाधानों दोनों पर प्रत्यक्ष वरीयता अनुकूलन का उपयोग करते हैं। निष्कर्ष के समय, N तर्क का नमूना लें और सत्यापितकर्ता की शीर्ष पसंद चुनें।

रिपोर्ट किया गया डेल्टाः GSM8K और MATH पर पूर्व स्व-सुधार मूल्यों की तुलना में +4 से +17 प्रतिशत अंक, जिसमें अधिकांश लाभ अतिरिक्त जनरेटर सूक्ष्म-ट्यूनिंग के बजाय निष्कर्ष-समय चयन के लिए सत्यापनकर्ता का उपयोग करने से आता है।

Quiet-STaR: प्रति टोकन आंतरिक तर्क

Zelikman et al. (2024) ने पूछाः क्या होगा यदि मॉडल प्रत्येक टोकन स्थिति पर एक छोटा आंतरिक तर्क उत्पन्न करना सीखता है, न कि केवल समस्या और उत्तर के बीच? Quiet-STaR प्रत्येक भविष्यवाणी किए गए टोकन से पहले एक छिपे हुए "विचार" को उत्सर्जित करने के लिए एक मॉडल को प्रशिक्षित करता है, फिर एक सीखे हुए वजन के माध्यम से विचार-जागरूक भविष्यवाणी को बेसलाइन भविष्यवाणी के साथ मिलाता है।

परिणामः मिस्ट्रल 7 बी ने GSM8K पर 5.9% से 10.9% और CommonsenseQA पर 36.3% से 47.2% तक कार्य-विशिष्ट बारीक-की-करणी के बिना पूर्ण शून्य-शॉट सुधार प्राप्त किया। मॉडल ने "कब सोचना" सीखा।

तीनों को सुरक्षा संबंधी चिंता क्यों है

सभी तीनों विधियों में अंतिम उत्तर ग्रेडिएंट सिग्नल के रूप में उपयोग किया जाता है। एक तर्क जो गलत तर्क के माध्यम से सही उत्तर तक पहुंचता है एक शॉर्टकट का उपयोग करना, अनुमान लगाना या एक गैर-सामान्य पैटर्न का उपयोग करना सकारात्मक रूप से मजबूत होता है। इन-डिस्ट्रीब्यूशन समस्याओं पर शॉर्टकट काम करता है। आउट-ऑफ-डिस्ट्रीब्यूशन समस्याओं पर यह चुपचाप टूट जाता है।

V-STaR का सत्यापनकर्ता तर्कसंगतों को रैंक करना सीखकर कम करता है, लेकिन सत्यापनकर्ता को एक ही लेबल सेट पर प्रशिक्षित किया गया है। यह ईमानदार अनिश्चितता पर अच्छी तरह से स्वरूपित गलत तर्क को पसंद करना सीख सकता है। अधिक सुरक्षित डिजाइन (ए) प्रक्रिया-निरीक्षण पुरस्कार मॉडल (पुरस्कार मध्यवर्ती चरणों, न कि केवल उत्तर) और (बी) सरल शॉर्टकट को तोड़ने वाले लंबे समय तक OOD मूल्यांकन के साथ STaR-शैली के डेटा को जोड़ना है।

तुलना

MethodTraining signalInference costData wasteKnown failure mode
STaRkeep (rationale, answer) if correct1xdiscards all incorrect rationalesshortcut rationales
STaR + rationalizationabove + correct-answer hinted retries1xlessrationalized rationales may be implausible
V-STaRSTaR + DPO verifier from both classesNx (best-of-N)minimalverifier can reinforce confident wrongness
Quiet-STaRper-token rationale + mixing weight1.5-3xminimalstill answer-conditioned gradient

जहां यह 2026 स्टैक में बैठता है

स्टार पुराना है। लेकिन यह पैटर्न 2025-2026 में हर जगह फिर से दिखाई देता है। सत्यापित गणितीय समस्याओं पर RL (DeepSeek-R1, Kimi-k1.5, o1) STaR के उत्तर-संशोधित ग्रेडिएंट संकेत है, स्केल किया गया है। प्रक्रिया पुरस्कार मॉडल (लाइटमैन और सहयोगियों, 2023; ओपनएआई का "आइये चरण-दर-चरण सत्यापित करें") प्रक्रिया-निरीक्षण विकल्प हैं। AlphaEvolve (Lection 3) कोड के लिए STaR है, एक लेबल के बजाय एक कार्यक्रम मूल्यांकनकर्ता के साथ। डार्विन गोडल मशीन (पाठ 4) एजेंट के लिए स्वयं के स्केफॉल्डिंग के लिए STaR है।

STaR को समझना इन सभी क्लिकों को बनाता है. यह न्यूनतम-जीवनयोग्यता स्व-सुधार लूप है.

इसका प्रयोग करें

code/main.pyआप देख सकते हैंः

  • कैसे सटीकता बूटस्ट्रैप राउंड से ऊपर चढ़ता है।
  • शॉर्टकट कैसे छिपते हैंः सिम्युलेटर में एक "लजी" तर्क वर्ग शामिल है जो 40% समय सही उत्तर प्राप्त करता है लेकिन खराब रूप से सामान्य करता है। देखें कि क्या STaR उन्हें रखता है।
  • वेरिफायर (वी-एसटीएआर शैली) कैसे निष्कर्ष निकालने में मदद करता है लेकिन प्रशिक्षण के दौरान पेश किए गए शॉर्टकट को पूरी तरह से काट नहीं सकता है।

इसे भेजें

outputs/skill-star-loop-reviewer.mdइससे आपको स्वयं-शिक्षित तर्क पाइपलाइन का ऑडिट करने में मदद मिलती है इससे पहले कि आप उस पर प्रशिक्षण लें।

व्यायाम

  1. सिम्युलेटर चलाएं. शॉर्टकट आवृत्ति को शून्य, फिर 0.4 पर सेट करें। दो रन के बीच अंतिम सटीकता कितनी भिन्न होती है, भले ही दोनों प्रशिक्षण वितरण पर > 90% तक पहुंचते हैं?
  1. सिम्युलेटर में एक लंबे समय तक चल रहे OOD परीक्षण जोड़ें। एक अलग वितरण से समस्याएं खींचें और वितरण में और OOD सेट दोनों पर बूटस्ट्रैप मॉडल का मूल्यांकन करें। अंतर को मापें।
  1. Quiet-STaR पेपर (arXiv:2403.09629) धारा 3 पढ़ें। "विचार के अंत" टोकन और मिश्रण भार सिर को प्रत्येक में तीन वाक्य में समझाएं।
  1. STaR के सही होने पर बनाए रखने वाले फ़िल्टर की तुलना प्रक्रिया-निरीक्षण वाले विकल्प से करें जो प्रत्येक तर्कसंगत कदम को स्वतंत्र रूप से पुरस्कृत करता है। लेबलिंग लागत अंतर और विश्वसनीय गुणवत्ता अंतर की पहचान करें।
  1. एक मूल्यांकन डिजाइन करें जो एक तैनात मॉडल में शॉर्टकट तर्क को पकड़ ले। यह सही होने की आवश्यकता नहीं है यह सबसे सरल शॉर्टकट को तोड़ना है जो एक STaR लूप मजबूत करेगा।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
STaR"Self-Taught Reasoner"Fine-tune on model-generated rationales that land correct answers; repeat
Rationalization"Hinted retry"Inject the correct answer and re-prompt for a rationale on problems the base model fails
V-STaR"Verifier STaR"DPO-train a verifier on both correct and incorrect rationales, use it for inference-time selection
Quiet-STaR"Per-token rationales"Generate hidden thoughts at every token position; mix with baseline prediction
Answer-conditioned gradient"Outcome-based signal"The training loop rewards final answers, not reasoning steps
Process reward model"Step-level verifier"Reward model trained on per-step correctness, not outcome — contrasts with STaR
Shortcut rationale"Right answer, wrong reasoning"A rationale that reaches the label via a non-generalizing pattern; STaR keeps these

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.