स्केलिंग नियम
Type: Learn
Languages: Python
Prerequisites: Phase 7 · 05 (Full Transformer), Phase 7 · 07 (GPT)
Time: ~45 minutes
समस्या
जब आप प्रशिक्षण गणना के सी फ्लोप है और सबसे अच्छा मॉडल चाहते हैं, आप दो बटन का सामना करते हैंः
- How many parameters (N)?बड़ा मॉडल, अधिक क्षमता।
- How many training tokens (D)?अधिक डेटा, क्षमता का बेहतर उपयोग।
FLOPs के पैमाने लगभग 6 × N × Dआप N को ऊपर और D को नीचे धकेल सकते हैं, या D को ऊपर और N को नीचे धकेल सकते हैं। कौन बेहतर है?
2022 से पहले, उत्तर "पीश एन हार्ड" था। GPT-3 (2020) 175B पैरामीटर था जो ~ 300B टोकन पर प्रशिक्षित किया गया था। प्रति पैरामीटर लगभग 1.7 टोकन का अनुपात। कप्लान स्केलिंग कानूनों ने इसे समर्थन किया।
हॉफमैन और अन्य (2022), चिंचिला नामक मॉडल के एक छोटे परिवार को प्रशिक्षित करते हुए, कुछ अलग पायाः इष्टतम अनुपात 20 tokens per parameter. जीपीटी-3 10 गुना कम प्रशिक्षित था. चिंचिला (70 बी पैराम, 1.4 टी टोकन) ने प्रत्येक बेंचमार्क पर जीपीटी-3 (175 बी, 300 बी टोकन) को 2.5 गुना कम अनुमान लागत पर हराया।
2026 एक महत्वपूर्ण मोड़ के साथ चिंचिला की दुनिया है। Llama 3 8B को 15 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, प्रति पैरामीटर 1,875 टोकन का अनुपात। चिंचिला-उपtimal से 94 गुना आगे। इनफेरेंस लागत उन मॉडलों के लिए प्रशिक्षण लागत से अधिक मायने रखती है जिनका उपयोग पैमाने पर किया जाएगा, इसलिए एक छोटे तैनाती योग्य पदचिह्न के लिए ओवर-ट्रेनिंग (पिछली चिंचिला) 2026 डिफ़ॉल्ट है।
अवधारणा
!Chinchilla curves: loss vs compute at various N/D ratios
हॉफमैन कानून
चिंचिला पेपर से, हानि निम्नलिखित हैः
L(N, D) = A / N^α + B / D^β + EN= पैरामीटर (गैर-एम्बेड)D= प्रशिक्षण टोकन।α ≈ 0.34,β ≈ 0.28(करीब सममित) ।E ≈ 1.69, अपरिवर्तनीय हानि छत।A ≈ 406,B ≈ 411. .
दो शब्द एक दूसरे के खिलाफ व्यापार करते हैं जैसे आप पैमाने लेते हैं। व्युत्पन्न W.R.T. ले लो।Nस्थिर गणना (C = 6ND) पर और हल करेंः
N_opt ≈ 0.6 × (C/6)^0.5
D_opt ≈ 0.6 × (C/6)^0.5
D_opt / N_opt ≈ 20गणना-अनुकूलः प्रति पैरामीटर 20 टोकन।
वैसे भी ओवर-ट्रेनिंग क्यों
Chinchilla-उपतम प्रशिक्षण हानि प्रति प्रशिक्षण FLOP कम करता है. लेकिन आप प्रशिक्षण लागत एक बार भुगतान; निष्कर्ष लागत हमेशा के लिए.
एक चैटबॉट के लिए जो प्रति माह एक ट्रिलियन टोकन की सेवा करता है, अनुमान कुल लागत पर हावी होता है। लामा का दृष्टिकोणः ट्रेन छोटा, लंबा। 8B पर 15T टोकन गहराई से अनुमान-अनुकूलित हैः
- उपभोक्ता GPU पर फिट बैठता है।
- विलंबता 70B Chinchilla-उत्तम का एक अंश है।
- अधिकांश कार्यों के लिए गुणवत्ता पर्याप्त है।
डीपमाइंड के 2024 पेपर ("ओवर-ट्रेनिंग नया इष्टतम है") ने इसे औपचारिक रूप दिया। निष्कर्ष-आधारित कार्यभार के लिए, सही अनुपात सेवा मात्रा के आधार पर प्रति पैरामीटर 100500 टोकन के करीब है।
उदय बनाम चिकनाई
दावाः कुछ क्षमताएं (गणितीय, बहु-चरण तर्क, विचार श्रृंखला का पालन) अचानक किसी पैमाने पर "उदय" होती हैं।
शेफर एट अल. (2023) ने तर्क दिया कि यह एक माप कलाकृतियाँ हैंः उभरते मापों का उपयोग विघटित स्कोरिंग (सही मैच, सीमा पर सटीकता) जो अंतर्निहित लॉजिट में चिकनी सुधार को छिपाते हैं। निरंतर माप (क्रॉस-एंट्रोपी) चिकनी वक्र दिखाता है।
2026 में आम सहमति हैः निरंतर हानि के माध्यम से भविष्यवाणियां विश्वसनीय हैं। बेंचमार्क छलांगें अक्सर स्कोरर कलाकृतियां होती हैं। निरंतर माप के खिलाफ बजट की योजना बनाएं।
2026 की तस्वीर
स्केलिंग कानून अभी भी काम करते हैं, लेकिनः
| Factor | Changed how |
|---|---|
| Data quality | Curating "good" tokens (Phi-style) shifts curves by >2× effective compute |
| MoE | Total params decouple from active FLOPs; scaling laws per-active-FLOP |
| Post-training | Some capabilities (instruction following, code) shift with SFT+RLHF more than pretraining |
| Multimodality | Image + text tokens scale together; separate curves per modality |
| Synthetic data | Models generate training data; effective compute can compound |
मून ऑप्टिमाइज़र (किमी मूनलाइट, 2024) ने मेल खाने वाले डेटा पर एडमडब्ल्यू पर ~ 2 × प्रभावी गणना लाभ दिखाया। कुछ 2026 प्रशिक्षण रन डिफ़ॉल्ट रूप से मून का उपयोग करते हैं। स्केलिंग कानून में पूर्ण स्थिरता बदलता है, इसका आकार नहीं।
इसे बनाओ
देखोcode/main.pyहम Chinchilla हानि समीकरण को लागू और गणना-उत्तम के लिए हल करते हैं(N, D)कई कम्प्यूटिंग बजटों में से प्रत्येक पर।
चरण 1: चिंचिला हानि
pythondef chinchilla_loss(N, D, A=406.4, B=410.7, alpha=0.34, beta=0.28, E=1.69):
return A / N ** alpha + B / D ** beta + Eकहानी Lएक कंटूर के रूप में (N, D)तय परC = 6NDन्यूनतम खोजें।
चरण 2: कम्प्यूटिंग-ऑप्टिमाइज़ सीमा
से कम्प्यूटिंग बजट के लिए1e171e25फ्लोप, खोजें (N, D)जो नुकसान को कम करने के अधीन है 6ND = C. अनुपात की जांच करें D/N ≈ 20. .
चरण 3: ओवर-ट्रेनिंग लागत
10 × छोटे मॉडल को प्रशिक्षित करने के लिए आपके द्वारा भुगतान किए जाने वाले अतिरिक्त नुकसान की गणना करें (1/10 का इष्टतम N, 10 × इष्टतम D) ।
चरण 4: वास्तविक मॉडल की तुलना करें
ज्ञात में गिर (N, D)जीपीटी-3, चिंचिला, लामा 3 8बी, डीपसेक-वी3 (सक्रिय पैराम्स) के लिए जोड़े, और अनुमानित बनाम रिपोर्ट किए गए नुकसान की तुलना करें।
इसका प्रयोग करें
आप खुद को एक सीमा मॉडल को प्रशिक्षित करने की संभावना नहीं है, लेकिन स्केलिंग कानूनों आपको बताते हैंः
- Whether your fine-tune has enough data.यदि आपके कार्य-विशिष्ट डेटा बेस मॉडल के प्रति पैरामीटर 20 टोकन से नीचे हैं, तो कुछ हानि स्तर पर संतृप्ति की उम्मीद करें।
- Whether to pick a bigger base model.यदि आप अपने सारे बजट को अनुमान लगाने पर खर्च कर रहे हैं, तो एक छोटे, लंबे समय से प्रशिक्षित मॉडल को पसंद करें।
- Where the returns diminish.1000 × चिंचिला-उत्तम से परे, लॉग-लॉस परिवर्तन शोर बन जाते हैं।
The research trajectory in 2026:
- Data-constrained regime.वेब में उच्च गुणवत्ता वाले टोकन की एक सीमित संख्या है (फिल्टरिंग के बाद ~ 510 ट्रिलियन अंग्रेजी) । फ्रंटियर प्रीट्रेनिंग इस छत के करीब आ रहा है। सिंथेटिक डेटा, बहुभाषी, मल्टीमोडल और आरएलएचएफ-स्केल फाइन-ट्यूनिंग अगले लीवर हैं।
- Compute-multiplier tricks.म्यून अनुकूलक, MoE, बेहतर डेटा क्योर प्रत्येक निरपेक्ष स्थिरांक को स्थानांतरित करता है, asymptote नहीं।
- Scaling laws for RL.आरएल नमूने में शक्ति कानून का सुझाव देता है लेकिन पूर्व प्रशिक्षण से बहुत अलग exponents के साथ।
इसे भेजें
देखोoutputs/skill-training-budget-estimator.md. कौशल चयन करता है .(N, D, hours, GPU)एक नए प्रशिक्षण रन के लिए गणना बजट, तैनाती प्रतिबंध और लक्ष्य हानि को देखते हुए।
व्यायाम
- Easy.दौड़ें
code/main.py. चिंचिला-उत्तम मुद्रण(N, D)कम्प्यूटिंग बजट के लिए1e20,1e22,1e24. वास्तविक मॉडल टेबल की तुलना करें. - Medium.हॉफमैन हानि-असे-कार्य-कंप्यूटर वक्र लागू करें।
log10(C)जब कानून हमें जरूरत है की भविष्यवाणी की पहचान>10^28क्रॉस-एंट्रोपी में अगले 0.1 के लिए FLOPs। - Hard.एक ही डेटासेट पर प्रशिक्षित 5 छोटे मॉडल (100K से 10M पैरामीटर) पर अपने स्वयं के स्केलिंग कानून को फिट करें। अनुमान
αऔरEआपके लेख प्रकाशित लेखों से कितना मेल खाते हैं?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Parameters (N) | "Model size" | Non-embedding weight count; determines capacity. |
| Tokens (D) | "Training data" | Number of training tokens seen; determines how well the parameters get used. |
| Compute (C) | "FLOPs spent" | Approximately 6 × N × D for a standard transformer. |
| Chinchilla-optimal | "D/N ≈ 20" | Ratio that minimizes loss per FLOP of pretraining. |
| Over-training | "Past Chinchilla" | Spend extra training FLOPs to save inference FLOPs; D/N >> 20. |
| Irreducible loss | "The floor" | The E term in the scaling law; the entropy of the data itself. |
| Emergent capability | "Sudden jumps at scale" | Often a scorer artifact; continuous loss is smooth. |
| Effective compute | "Training-efficiency multiplier" | Better data / optimizer / architecture multiplies how far a FLOP goes. |
आगे पढ़ना
- Kaplan et al. (2020). Scaling Laws for Neural Language Models पहला स्केल कानून पेपर; कम प्रशिक्षित।
- Hoffmann et al. (2022). Training Compute-Optimal Large Language Models चिंचिला।
- Schaeffer et al. (2023). Are Emergent Abilities of Large Language Models a Mirage? माप कलाकृतियों के रूप में उभरना।
- Sardana, Frankle (2024). Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws क्यों लामा का ओवर-ट्रेनिंग उसके काम के बोझ के लिए सही है।
- Jordan et al. (2024). Muon: An optimizer for hidden layers in neural networks 2× गणना गुणक।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.