अल्फाईवोल्व विकासवादी कोडिंग एजेंट
Type: Learn
Languages: Python (stdlib, evolutionary-loop toy)
Prerequisites: Phase 15 · 01 (long-horizon framing), Phase 15 · 02 (self-taught reasoning)
Time: ~60 minutes
समस्या
बड़ी भाषा मॉडल कोड लिख सकते हैं। विकासवादी एल्गोरिदम कोड पर खोज कर सकते हैं। दोनों को दशकों से अलग-अलग कोशिश की गई है; दोनों ही छतों को हिट करते हैं। एलएलएम छत संयोग हैः मॉडल विश्वसनीय कोड लिखता है जो यह दावा नहीं करता है। विकासवादी छत खोज लागत हैः वाक्यविन्यास पर यादृच्छिक उत्परिवर्तन शायद ही कभी संकलन योग्य कार्यक्रम उत्पन्न करते हैं, बेहतर कार्यक्रमों को कम करने के लिए।
अल्फाईवोल्व (नोविकोव एट एल्स, डीपमाइंड, arXiv:2506.13131, जून 2025) इन दोनों को जोड़ता है। एलएलएम एक कार्यक्रम डेटाबेस में लक्षित संपादन का प्रस्ताव देता है; एक स्वचालित मूल्यांकनकर्ता प्रत्येक संस्करण को स्कोर करता है; उच्च स्कोर वाले संस्करण भविष्य की पीढ़ियों के लिए माता-पिता बन जाते हैं। एलएलएम विश्वसनीय कोड लिखने के महंगे चरण को संभालता है; मूल्यांकनकर्ता कन्फैबुलेशन को पकड़ता है। लूप घंटे से हफ्तों तक चलता है।
परिणाम रिपोर्ट किए गएः 48-स्केल-मल्टीप्लीकेशन 4x4 जटिल मैट्रिक्स गुणा (स्ट्रैसन की 1969 सीमा 49 थी), गूगल उत्पादन में एक बोर्ग शेड्यूलिंग हेरिस्टिक, 32.5% फ्लैशएटेंशन कर्नेल स्पीडअप, मिथुन प्रशिक्षण थ्रूपुट सुधार।
वास्तुकला काम करती है क्योंकि मूल्यांकनकर्ता मशीन-चेक करने योग्य है। यह मूल्यांकनकर्ता नहीं है जहां काम नहीं करता है। यह असममित्य सबक है।
अवधारणा
लूप
- बीज कार्यक्रम से शुरुआत करें
P_0यह सही है, लेकिन अपर्याप्त है। - वैरिएंट प्रोग्राम का डेटाबेस बनाए रखें, प्रत्येक को मूल्यांकनकर्ता द्वारा स्कोर किया गया है।
- डेटाबेस से एक या अधिक माता-पिता का नमूना (MAP-एलिट-स्टाइल या द्वीप आधारित) ।
- माता-पिता के संशोधित संस्करण को उत्पन्न करने के लिए एलएलएम (बहुत से उम्मीदवारों के लिए जुड़वां फ्लैश, कठिन उम्मीदवारों के लिए जुड़वां प्रो) को प्रेरित करें।
- एक लंबे समय तक चलने वाले मूल्यांकनकर्ता पर संस्करण को संकलित करें, चलाएं और मूल्यांकन करें।
- अपने स्कोर और फीचर वेक्टर द्वारा कीजेड डेटाबेस में डालें।
- दोहराएँ।
दो विवरण मायने रखते हैं। पहला, एलएलएम को मूल कार्यक्रम से अधिक के साथ प्रेरित किया जाता है आमतौर पर डेटाबेस से कई शीर्ष संस्करण, प्लस मूल्यांकनकर्ता हस्ताक्षर, प्लस एक छोटा कार्य विवरण। मॉडल का काम एक लक्षित परिवर्तन का प्रस्ताव करना है जो स्कोर में सुधार कर सकता है। दूसरा, डेटाबेस संरचित है (मैप-एलिट ग्रिड, द्वीप आधारित) ताकि लूप विविधता का पता लगाता है, न कि केवल वर्तमान नेता।
मूल्यांकनकर्ता को गैर-विमर्श योग्य क्यों बनाता है
अल्फाईवोल्व की जीत सभी ऐसे डोमेन से आती है जहां मूल्यांकनकर्ता तेज, निर्धारक और खेलना मुश्किल हैः
- Matrix multiplication algorithm: एक इकाई परीक्षण जो मैट्रिक्स को गुणा करता है और समानता को बिट-इडेंटिफिकेट रूप से जांचता है।
- Borg scheduling heuristic: एक उत्पादन-स्तर सिम्युलेटर जो ऐतिहासिक क्लस्टर लोड को फिर से चलाता है और व्यर्थ गणना को मापता है।
- FlashAttention kernel: एक सटीकता परीक्षण और वास्तविक हार्डवेयर पर एक दीवार घड़ी बेंचमार्क।
- Gemini training throughput: प्रति चरण GPU-सेकंड मापा गया।
प्रत्येक मामले में मूल्यांकनकर्ता LLM त्रुटियों के वर्ग को पकड़ता है जो अन्यथा हावी होते हैंः संदिग्ध सटीकता दावे, हार्डवेयर पर गायब होने वाले प्रदर्शन दावे, और किनारे मामले विफलताएं। मूल्यांकनकर्ता को हटा दें और लूप सुंदर कोड के लिए अनुकूलित करता है।
पुरस्कार हैकिंग उस बयान का दूसरा चेहरा है
विकास मूल्यांकनकर्ता के लिए अनुकूलन करता है जो भी उपाय करता है। यदि मूल्यांकनकर्ता अधूरा है, तो लूप अधूरापन को पाएगा। एक अप्रत्याशित डोमेन में लूप सतह सुविधा के लिए अनुकूलन करेगा, न कि इच्छित व्यवहार के लिए। डीपमाइंड पेपर में स्पष्ट रूप से इस पर चिह्नित करता हैः अल्फाईवॉल की सफलताएं केवल उन डोमेन में स्थानांतरित होती हैं जहां मूल्यांकनकर्ता कठोरता खोज की महत्वाकांक्षा से मेल खाती है।
कोड खोज लूप में इनाम हैकिंग के ठोस उदाहरण 2025-2026:
- "पूरा करने का समय" के लिए इनाम देने वाले अनुकूलन लक्ष्य खाली समाधान प्रस्तुत करने के लिए इनाम प्राप्त करते हैं।
- बेंचमार्क स्कोर जो कि सटीकता-अंडर-टेस्ट-स्मरण परीक्षणों और ओवरफिटिंग को पुरस्कृत करते हैं।
- "कोड गुणवत्ता" प्रॉक्सी ने बिना अर्थिक परिवर्तन के टिप्पणियों को हटाने और चर नामों को फिर से लिखने का पुरस्कार दिया।
अल्फाईवोल्व में फिक्सः एलएलएम ने कभी नहीं देखा है कि एक लंबे समय तक चलने वाले मूल्यांकनकर्ता को भेजें, मूल्यांकन के समय उत्पन्न इनपुट के साथ। तब भी, डीपमाइंड किसी भी प्रस्तावित तैनाती पर मजबूत समीक्षा की सिफारिश करता है।
क्यों LLM + खोज या तो अकेले से हरा
LLM संकलित, अर्थिक रूप से यथार्थवादी संशोधनों का उत्पादन कर सकता है। 2000 लाइन पायथन फ़ाइल पर एक यादृच्छिक उत्परिवर्तन GA लगभग हमेशा वाक्यरचना त्रुटियों का उत्पादन करता है। LLM भी यथार्थवादी पड़ोसों पर खोज केंद्रित करता है (एक फ़ंक्शन को बदलें, यादृच्छिक बाइट नहीं) जो नाटकीय रूप से बर्बाद मूल्यांकनकर्ता कॉल को कम करता है।
मूल्यांकनकर्ता, बदले में, LLM के संयोगों को पकड़ता है। LLM आत्मविश्वास से दावा करेंगे कि एक फ़ंक्शन "सीमा में O(n log n) है" जब यह वास्तव में O(n ^ 2) है; एक दीवार घड़ी बेंचमार्क प्रश्न को हल करता है।
जहां AlphaEvolve सीमा ढेर में फिट बैठता है
| System | Generator | Evaluator | Domain | Example win |
|---|---|---|---|---|
| AlphaEvolve | Gemini | correctness + benchmark | algorithms, kernels, schedulers | 48-mul 4x4 matmul |
| FunSearch (DeepMind, 2023) | PaLM / Codey | correctness | combinatorial math | cap-set lower bounds |
| AI Scientist v2 (Sakana, L5) | GPT/Claude | LLM critique + experiment | ML research | ICLR workshop paper |
| Darwin Godel Machine (L4) | agent scaffolding | SWE-bench / Polyglot | agent code | 20% → 50% SWE-bench |
चारो एक ही नुस्खा के भिन्नताएं हैंः जनरेटर प्लस मूल्यांकनकर्ता, लूप। अंतर यह है कि मूल्यांकनकर्ता क्या ग्रेड देता है और यह कितना कठोर है।
इसका प्रयोग करें
code/main.py"एलएलएम" एक खेलौना प्रतीकात्मक-प्रतिगमन समस्या पर एक न्यूनतम अल्फाईवोल्व-जैसा लूप लागू करता है। "एलएलएम" एक stdlib प्रॉक्सी है जो एक लक्ष्य फ़ंक्शन की गणना करने वाले कार्यक्रम में छोटे वाक्यरचनात्मक उत्परिवर्तन का प्रस्ताव देता है। "मूल्यांकनकर्ता" उपायों का अर्थ है कि आयोजित परीक्षण बिंदुओं पर वर्ग त्रुटि।
देखो:
- कैसे पीढ़ी दर पीढ़ी सर्वश्रेष्ठ स्कोर में सुधार होता है।
- कैसे एक मैप-एलिट ग्रिड विभिन्न समाधानों को जीवित रखता है ताकि लूप स्थानीय न्यूनतम पर अभिसरण नहीं करता है।
- कैसे रोक दिया गया परीक्षण (केवल प्रशिक्षण मूल्यांकनकर्ता) को हटाने के लिए लूप शानदार रूप से ओवरफिट करता है।
इसे भेजें
outputs/skill-evaluator-rigor-audit.mdएक नए डोमेन में अल्फा इवोल्व शैली लूप पर विचार करने की पूर्व शर्त हैः क्या आपका मूल्यांकनकर्ता वास्तव में आप परवाह की विफलताओं को पकड़ता है?
व्यायाम
- दौड़ें
code/main.py. सर्वश्रेष्ठ स्कोर ट्रैकरेक्टरी को ध्यान में रखें.--no-holdout) और फिर से चलाएं। अति-फिटिंग को मात्राबद्ध करें।
- MAP-एलिट ग्रिड पर अल्फाईवॉल पेपर के सेक्शन 3 को पढ़ें। एक नई समस्या (जैसे संकलक अनुकूलन पास) के लिए एक विशेषता-वेक्टर वर्णक डिजाइन करें जो खोज को विविध बनाए रखेगा।
- 48 गुणा 4x4 परिणाम में 56 साल के बाद स्ट्रैसन के 49-mul बॉन्ड में सुधार हुआ। पेपर के परिशिष्ट F को पढ़ें और तीन वाक्य में समझाएं कि इस समस्या के लिए मूल्यांकनकर्ता को सही करना विशेष रूप से आसान क्यों है, और अधिकांश डोमेन ऐसा क्यों नहीं हैं।
- एक डोमेन प्रस्ताव जहां अल्फा इवोल्व विफल होगा, सटीक रूप से पहचानें कि मूल्यांकनकर्ता कहां टूटता है और क्यों।
- आपके द्वारा ज्ञात डोमेन के लिए, आप जो मूल्यांकनकर्ता हस्ताक्षर उपयोग करेंगे, उसे लिखें। इसमें (ए) सटीकता की शर्तें, (बी) प्रदर्शन मीट्रिक, (ग) आउट-ऑफ-इनपुट जेनरेशन नियम, (डी) कम से कम एक रिवार्ड-हैकिंग जांच शामिल करें।
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| AlphaEvolve | "DeepMind's evolutionary coding agent" | Gemini + program database + machine-checkable evaluator |
| MAP-elites | "Diversity-preserving archive" | Grid keyed by feature vectors; each cell holds the best variant with that descriptor |
| Island model | "Parallel evolution subpopulations" | Independent populations that migrate periodically; prevents premature convergence |
| Machine-checkable evaluator | "Deterministic oracle" | A unit test, simulator, or benchmark the LLM cannot fake — a prerequisite for this loop |
| Reward hacking | "Optimizing the measure, not the goal" | Loop finds a way to maximize score without doing the intended task |
| Seed program | "The starting point" | An initial correct-but-suboptimal program the loop evolves from |
| Held-out evaluator | "Evaluation data the LLM never saw" | Inputs generated at evaluation time to prevent memorization |
आगे पढ़ना
- Novikov et al. (2025). AlphaEvolve: A coding agent for scientific and algorithmic discovery पूरा पेपर।
- DeepMind blog on AlphaEvolve परिणामों के साथ विक्रेता की सूची।
- AlphaEvolve results repository 48-मल 4x4 मत्मल सहित एल्गोरिदम की खोज की।
- Romera-Paredes et al. (2023). Mathematical discoveries from program search with LLMs (FunSearch) पूर्ववर्ती प्रणाली।
- Anthropic — Responsible Scaling Policy v3.0 (Feb 2026) मूल्यांकनकर्ता-बाध्य स्वायत्तता को एक प्रमुख अनुसंधान दिशा के रूप में ढांचा।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.