STAR, V-STAR, Quiet-STAR स्व-शिक्षित तर्क
Type: Learn
Languages: Python (stdlib, bootstrap-loop simulator)
Prerequisites: Phase 13 · 01-03 (Reasoning and CoT), Phase 15 · 01 (long-horizon framing)
Time: ~60 minutes
समस्या
एक मॉडल को तर्क सिखाने का सीधा तरीका है मानव द्वारा लिखित तर्क के निशान एकत्र करना। यह महंगा, धीमा है, और यह सीमित है कि उच्च गुणवत्ता वाले विचार श्रृंखला के मानव कितने लिखने के इच्छुक हैं।
STaR (स्व-शिक्षित तर्क, Zelikman et al., 2022) पूछता हैः क्या होगा यदि मॉडल अपने स्वयं के तर्क लिखता है और उन्हें ज्ञात उत्तरों के अनुसार दर्जा देता है? लूप हैः
- तर्क के निशान प्लस उत्तर का नमूना लें।
- यदि अंतिम उत्तर सही है, तो ट्रैक रखें।
- संरक्षित निशान पर ठीक-ठीक ट्यून.
- दोहराएँ।
यह काम करता है। GSM8K और CommonsenseQA दोनों नए मानव टिप्पणी के बिना बेहतर हुए। लेकिन लूप में एक अंतर्निहित पूर्वाग्रह हैः कोई भी तर्क जो सही उत्तर का उत्पादन करता है, यह बरकरार रहता है, चाहे तर्क स्वयं सही था या नहीं। V-STaR (Hosseini et al., 2024) एक शिक्षित सत्यापनकर्ता के साथ इसे ठीक करता है; Quiet-STaR (Zelikman et al., 2024) विचार को आंतरिक तर्क के लिए सामान्य बनाता है।
अवधारणा
STaR: जो काम किया पर बूटस्ट्रैप
एक आधार मॉडल से शुरू करें जिसमें कुछ कमजोर तर्क क्षमता है। प्रत्येक प्रशिक्षण समस्या पर, एक तर्कसंगत प्लस उत्तर का नमूना लें। यदि उत्तर लेबल से मेल खाता है, तो (प्रश्न, तर्क, उत्तर) तीन रखें। बनाए रखा सेट पर मॉडल को ठीक से समायोजित करें। दोहराएं।
एक मोड़ मायने रखता है। यदि मॉडल कभी भी समस्या को सही नहीं कर सकता है, तो लूप उस पर सीख नहीं सकता है।rationalizationउदाहरण के लिए, एक मॉडल के साथ एक तर्कसंगत तर्क के साथ एक तर्कसंगत तर्क को जोड़ने के लिए एक संकेत के रूप में सही उत्तर इंजेक्ट करें।
मूल पेपर में परिणाम (ज़ेलिकमैन एट अल, 2022): जीपीटी-जे बेस मॉडल में सुधार हुआ GSM8K पर 5.8% से 10.7% तक दोहराए गए STaR राउंड के माध्यम से तर्कसंगतता के साथ लगभग 5 प्रतिशत अंक निरपेक्ष। कॉमन्सेंसQA पर, STaR-प्रशिक्षित GPT-J 6B 72.5% तक पहुंच गया, जो एक ठीक से ट्यून किए गए GPT-3 175B (~73%) के साथ तुलनात्मक है।
वी-स्टारः डीपीओ के साथ एक सत्यापितकर्ता को प्रशिक्षित करें
STaR गलत तर्क को फेंक देता है। होसेनी और अन्य (2024) ने देखा कि ये भी डेटा हैंः प्रत्येक जोड़ी (रैशनल, "क्या यह सही है") एक सत्यापितकर्ता को प्रशिक्षित कर सकती है। वे रैंकर बनाने के लिए सही और गलत समाधानों दोनों पर प्रत्यक्ष वरीयता अनुकूलन का उपयोग करते हैं। निष्कर्ष के समय, N तर्क का नमूना लें और सत्यापितकर्ता की शीर्ष पसंद चुनें।
रिपोर्ट किया गया डेल्टाः GSM8K और MATH पर पूर्व स्व-सुधार मूल्यों की तुलना में +4 से +17 प्रतिशत अंक, जिसमें अधिकांश लाभ अतिरिक्त जनरेटर सूक्ष्म-ट्यूनिंग के बजाय निष्कर्ष-समय चयन के लिए सत्यापनकर्ता का उपयोग करने से आता है।
Quiet-STaR: प्रति टोकन आंतरिक तर्क
Zelikman et al. (2024) ने पूछाः क्या होगा यदि मॉडल प्रत्येक टोकन स्थिति पर एक छोटा आंतरिक तर्क उत्पन्न करना सीखता है, न कि केवल समस्या और उत्तर के बीच? Quiet-STaR प्रत्येक भविष्यवाणी किए गए टोकन से पहले एक छिपे हुए "विचार" को उत्सर्जित करने के लिए एक मॉडल को प्रशिक्षित करता है, फिर एक सीखे हुए वजन के माध्यम से विचार-जागरूक भविष्यवाणी को बेसलाइन भविष्यवाणी के साथ मिलाता है।
परिणामः मिस्ट्रल 7 बी ने GSM8K पर 5.9% से 10.9% और CommonsenseQA पर 36.3% से 47.2% तक कार्य-विशिष्ट बारीक-की-करणी के बिना पूर्ण शून्य-शॉट सुधार प्राप्त किया। मॉडल ने "कब सोचना" सीखा।
तीनों को सुरक्षा संबंधी चिंता क्यों है
सभी तीनों विधियों में अंतिम उत्तर ग्रेडिएंट सिग्नल के रूप में उपयोग किया जाता है। एक तर्क जो गलत तर्क के माध्यम से सही उत्तर तक पहुंचता है एक शॉर्टकट का उपयोग करना, अनुमान लगाना या एक गैर-सामान्य पैटर्न का उपयोग करना सकारात्मक रूप से मजबूत होता है। इन-डिस्ट्रीब्यूशन समस्याओं पर शॉर्टकट काम करता है। आउट-ऑफ-डिस्ट्रीब्यूशन समस्याओं पर यह चुपचाप टूट जाता है।
V-STaR का सत्यापनकर्ता तर्कसंगतों को रैंक करना सीखकर कम करता है, लेकिन सत्यापनकर्ता को एक ही लेबल सेट पर प्रशिक्षित किया गया है। यह ईमानदार अनिश्चितता पर अच्छी तरह से स्वरूपित गलत तर्क को पसंद करना सीख सकता है। अधिक सुरक्षित डिजाइन (ए) प्रक्रिया-निरीक्षण पुरस्कार मॉडल (पुरस्कार मध्यवर्ती चरणों, न कि केवल उत्तर) और (बी) सरल शॉर्टकट को तोड़ने वाले लंबे समय तक OOD मूल्यांकन के साथ STaR-शैली के डेटा को जोड़ना है।
तुलना
| Method | Training signal | Inference cost | Data waste | Known failure mode |
|---|---|---|---|---|
| STaR | keep (rationale, answer) if correct | 1x | discards all incorrect rationales | shortcut rationales |
| STaR + rationalization | above + correct-answer hinted retries | 1x | less | rationalized rationales may be implausible |
| V-STaR | STaR + DPO verifier from both classes | Nx (best-of-N) | minimal | verifier can reinforce confident wrongness |
| Quiet-STaR | per-token rationale + mixing weight | 1.5-3x | minimal | still answer-conditioned gradient |
जहां यह 2026 स्टैक में बैठता है
स्टार पुराना है। लेकिन यह पैटर्न 2025-2026 में हर जगह फिर से दिखाई देता है। सत्यापित गणितीय समस्याओं पर RL (DeepSeek-R1, Kimi-k1.5, o1) STaR के उत्तर-संशोधित ग्रेडिएंट संकेत है, स्केल किया गया है। प्रक्रिया पुरस्कार मॉडल (लाइटमैन और सहयोगियों, 2023; ओपनएआई का "आइये चरण-दर-चरण सत्यापित करें") प्रक्रिया-निरीक्षण विकल्प हैं। AlphaEvolve (Lection 3) कोड के लिए STaR है, एक लेबल के बजाय एक कार्यक्रम मूल्यांकनकर्ता के साथ। डार्विन गोडल मशीन (पाठ 4) एजेंट के लिए स्वयं के स्केफॉल्डिंग के लिए STaR है।
STaR को समझना इन सभी क्लिकों को बनाता है. यह न्यूनतम-जीवनयोग्यता स्व-सुधार लूप है.
इसका प्रयोग करें
code/main.pyआप देख सकते हैंः
- कैसे सटीकता बूटस्ट्रैप राउंड से ऊपर चढ़ता है।
- शॉर्टकट कैसे छिपते हैंः सिम्युलेटर में एक "लजी" तर्क वर्ग शामिल है जो 40% समय सही उत्तर प्राप्त करता है लेकिन खराब रूप से सामान्य करता है। देखें कि क्या STaR उन्हें रखता है।
- वेरिफायर (वी-एसटीएआर शैली) कैसे निष्कर्ष निकालने में मदद करता है लेकिन प्रशिक्षण के दौरान पेश किए गए शॉर्टकट को पूरी तरह से काट नहीं सकता है।
इसे भेजें
outputs/skill-star-loop-reviewer.mdइससे आपको स्वयं-शिक्षित तर्क पाइपलाइन का ऑडिट करने में मदद मिलती है इससे पहले कि आप उस पर प्रशिक्षण लें।
व्यायाम
- सिम्युलेटर चलाएं. शॉर्टकट आवृत्ति को शून्य, फिर 0.4 पर सेट करें। दो रन के बीच अंतिम सटीकता कितनी भिन्न होती है, भले ही दोनों प्रशिक्षण वितरण पर > 90% तक पहुंचते हैं?
- सिम्युलेटर में एक लंबे समय तक चल रहे OOD परीक्षण जोड़ें। एक अलग वितरण से समस्याएं खींचें और वितरण में और OOD सेट दोनों पर बूटस्ट्रैप मॉडल का मूल्यांकन करें। अंतर को मापें।
- Quiet-STaR पेपर (arXiv:2403.09629) धारा 3 पढ़ें। "विचार के अंत" टोकन और मिश्रण भार सिर को प्रत्येक में तीन वाक्य में समझाएं।
- STaR के सही होने पर बनाए रखने वाले फ़िल्टर की तुलना प्रक्रिया-निरीक्षण वाले विकल्प से करें जो प्रत्येक तर्कसंगत कदम को स्वतंत्र रूप से पुरस्कृत करता है। लेबलिंग लागत अंतर और विश्वसनीय गुणवत्ता अंतर की पहचान करें।
- एक मूल्यांकन डिजाइन करें जो एक तैनात मॉडल में शॉर्टकट तर्क को पकड़ ले। यह सही होने की आवश्यकता नहीं है यह सबसे सरल शॉर्टकट को तोड़ना है जो एक STaR लूप मजबूत करेगा।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| STaR | "Self-Taught Reasoner" | Fine-tune on model-generated rationales that land correct answers; repeat |
| Rationalization | "Hinted retry" | Inject the correct answer and re-prompt for a rationale on problems the base model fails |
| V-STaR | "Verifier STaR" | DPO-train a verifier on both correct and incorrect rationales, use it for inference-time selection |
| Quiet-STaR | "Per-token rationales" | Generate hidden thoughts at every token position; mix with baseline prediction |
| Answer-conditioned gradient | "Outcome-based signal" | The training loop rewards final answers, not reasoning steps |
| Process reward model | "Step-level verifier" | Reward model trained on per-step correctness, not outcome — contrasts with STaR |
| Shortcut rationale | "Right answer, wrong reasoning" | A rationale that reaches the label via a non-generalizing pattern; STaR keeps these |
आगे पढ़ना
- Zelikman et al. (2022). STaR: Bootstrapping Reasoning With Reasoning मूल कागज।
- Hosseini et al. (2024). V-STaR: Training Verifiers for Self-Taught Reasoners निष्कर्ष समय चयन के लिए एक डीपीओ सत्यापनकर्ता जोड़ता है।
- Zelikman et al. (2024). Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking प्रति टोकन आंतरिक तर्क।
- Lightman et al. (2023). Let's Verify Step by Step प्रक्रिया इनाम मॉडल, वैकल्पिक ग्रेडिएंट संकेत।
- DeepSeek-R1 paper (arXiv:2501.12948) सत्यापित कार्य पर आरएल, एसटीएआर सीमावर्ती प्रशिक्षण तक स्केल किया गया।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.