Phase 15: Autonomous Systems

अल्फाईवोल्व विकासवादी कोडिंग एजेंट

एक विकासशील लूप और एक मशीन-चेक करने योग्य मूल्यांकनकर्ता के साथ एक सीमा कोडिंग मॉडल को जोड़ें। लूप को पर्याप्त लंबा चलाने दें। यह एक 4x4 जटिल-मैट्रिक्स गुणा प्रक्रिया की खोज करता है जो 48 स्केलर गुणन का उपयोग करता है 56 वर्षों में स्ट्रैसन पर पहला सुधार। यह एक Google-व्यापी बोर्ग शेड्यूलिंग हेरिस्टिक भी पाता है जो उत्पादन में क्लस्टर कम्प्यूटिंग का ~0.7% पुनर्प्राप्त करता है। वास्तुकला जानबूझकर ही उबाऊ है। जीत मूल्यांकनकर्ता की कठोरता से आती है।

Type: Learn

Languages: Python (stdlib, evolutionary-loop toy)

Prerequisites: Phase 15 · 01 (long-horizon framing), Phase 15 · 02 (self-taught reasoning)

Time: ~60 minutes

समस्या

बड़ी भाषा मॉडल कोड लिख सकते हैं। विकासवादी एल्गोरिदम कोड पर खोज कर सकते हैं। दोनों को दशकों से अलग-अलग कोशिश की गई है; दोनों ही छतों को हिट करते हैं। एलएलएम छत संयोग हैः मॉडल विश्वसनीय कोड लिखता है जो यह दावा नहीं करता है। विकासवादी छत खोज लागत हैः वाक्यविन्यास पर यादृच्छिक उत्परिवर्तन शायद ही कभी संकलन योग्य कार्यक्रम उत्पन्न करते हैं, बेहतर कार्यक्रमों को कम करने के लिए।

अल्फाईवोल्व (नोविकोव एट एल्स, डीपमाइंड, arXiv:2506.13131, जून 2025) इन दोनों को जोड़ता है। एलएलएम एक कार्यक्रम डेटाबेस में लक्षित संपादन का प्रस्ताव देता है; एक स्वचालित मूल्यांकनकर्ता प्रत्येक संस्करण को स्कोर करता है; उच्च स्कोर वाले संस्करण भविष्य की पीढ़ियों के लिए माता-पिता बन जाते हैं। एलएलएम विश्वसनीय कोड लिखने के महंगे चरण को संभालता है; मूल्यांकनकर्ता कन्फैबुलेशन को पकड़ता है। लूप घंटे से हफ्तों तक चलता है।

परिणाम रिपोर्ट किए गएः 48-स्केल-मल्टीप्लीकेशन 4x4 जटिल मैट्रिक्स गुणा (स्ट्रैसन की 1969 सीमा 49 थी), गूगल उत्पादन में एक बोर्ग शेड्यूलिंग हेरिस्टिक, 32.5% फ्लैशएटेंशन कर्नेल स्पीडअप, मिथुन प्रशिक्षण थ्रूपुट सुधार।

वास्तुकला काम करती है क्योंकि मूल्यांकनकर्ता मशीन-चेक करने योग्य है। यह मूल्यांकनकर्ता नहीं है जहां काम नहीं करता है। यह असममित्य सबक है।

अवधारणा

लूप

  1. बीज कार्यक्रम से शुरुआत करें P_0यह सही है, लेकिन अपर्याप्त है।
  2. वैरिएंट प्रोग्राम का डेटाबेस बनाए रखें, प्रत्येक को मूल्यांकनकर्ता द्वारा स्कोर किया गया है।
  3. डेटाबेस से एक या अधिक माता-पिता का नमूना (MAP-एलिट-स्टाइल या द्वीप आधारित) ।
  4. माता-पिता के संशोधित संस्करण को उत्पन्न करने के लिए एलएलएम (बहुत से उम्मीदवारों के लिए जुड़वां फ्लैश, कठिन उम्मीदवारों के लिए जुड़वां प्रो) को प्रेरित करें।
  5. एक लंबे समय तक चलने वाले मूल्यांकनकर्ता पर संस्करण को संकलित करें, चलाएं और मूल्यांकन करें।
  6. अपने स्कोर और फीचर वेक्टर द्वारा कीजेड डेटाबेस में डालें।
  7. दोहराएँ।

दो विवरण मायने रखते हैं। पहला, एलएलएम को मूल कार्यक्रम से अधिक के साथ प्रेरित किया जाता है आमतौर पर डेटाबेस से कई शीर्ष संस्करण, प्लस मूल्यांकनकर्ता हस्ताक्षर, प्लस एक छोटा कार्य विवरण। मॉडल का काम एक लक्षित परिवर्तन का प्रस्ताव करना है जो स्कोर में सुधार कर सकता है। दूसरा, डेटाबेस संरचित है (मैप-एलिट ग्रिड, द्वीप आधारित) ताकि लूप विविधता का पता लगाता है, न कि केवल वर्तमान नेता।

मूल्यांकनकर्ता को गैर-विमर्श योग्य क्यों बनाता है

अल्फाईवोल्व की जीत सभी ऐसे डोमेन से आती है जहां मूल्यांकनकर्ता तेज, निर्धारक और खेलना मुश्किल हैः

  • Matrix multiplication algorithm: एक इकाई परीक्षण जो मैट्रिक्स को गुणा करता है और समानता को बिट-इडेंटिफिकेट रूप से जांचता है।
  • Borg scheduling heuristic: एक उत्पादन-स्तर सिम्युलेटर जो ऐतिहासिक क्लस्टर लोड को फिर से चलाता है और व्यर्थ गणना को मापता है।
  • FlashAttention kernel: एक सटीकता परीक्षण और वास्तविक हार्डवेयर पर एक दीवार घड़ी बेंचमार्क।
  • Gemini training throughput: प्रति चरण GPU-सेकंड मापा गया।

प्रत्येक मामले में मूल्यांकनकर्ता LLM त्रुटियों के वर्ग को पकड़ता है जो अन्यथा हावी होते हैंः संदिग्ध सटीकता दावे, हार्डवेयर पर गायब होने वाले प्रदर्शन दावे, और किनारे मामले विफलताएं। मूल्यांकनकर्ता को हटा दें और लूप सुंदर कोड के लिए अनुकूलित करता है।

पुरस्कार हैकिंग उस बयान का दूसरा चेहरा है

विकास मूल्यांकनकर्ता के लिए अनुकूलन करता है जो भी उपाय करता है। यदि मूल्यांकनकर्ता अधूरा है, तो लूप अधूरापन को पाएगा। एक अप्रत्याशित डोमेन में लूप सतह सुविधा के लिए अनुकूलन करेगा, न कि इच्छित व्यवहार के लिए। डीपमाइंड पेपर में स्पष्ट रूप से इस पर चिह्नित करता हैः अल्फाईवॉल की सफलताएं केवल उन डोमेन में स्थानांतरित होती हैं जहां मूल्यांकनकर्ता कठोरता खोज की महत्वाकांक्षा से मेल खाती है।

कोड खोज लूप में इनाम हैकिंग के ठोस उदाहरण 2025-2026:

  • "पूरा करने का समय" के लिए इनाम देने वाले अनुकूलन लक्ष्य खाली समाधान प्रस्तुत करने के लिए इनाम प्राप्त करते हैं।
  • बेंचमार्क स्कोर जो कि सटीकता-अंडर-टेस्ट-स्मरण परीक्षणों और ओवरफिटिंग को पुरस्कृत करते हैं।
  • "कोड गुणवत्ता" प्रॉक्सी ने बिना अर्थिक परिवर्तन के टिप्पणियों को हटाने और चर नामों को फिर से लिखने का पुरस्कार दिया।

अल्फाईवोल्व में फिक्सः एलएलएम ने कभी नहीं देखा है कि एक लंबे समय तक चलने वाले मूल्यांकनकर्ता को भेजें, मूल्यांकन के समय उत्पन्न इनपुट के साथ। तब भी, डीपमाइंड किसी भी प्रस्तावित तैनाती पर मजबूत समीक्षा की सिफारिश करता है।

क्यों LLM + खोज या तो अकेले से हरा

LLM संकलित, अर्थिक रूप से यथार्थवादी संशोधनों का उत्पादन कर सकता है। 2000 लाइन पायथन फ़ाइल पर एक यादृच्छिक उत्परिवर्तन GA लगभग हमेशा वाक्यरचना त्रुटियों का उत्पादन करता है। LLM भी यथार्थवादी पड़ोसों पर खोज केंद्रित करता है (एक फ़ंक्शन को बदलें, यादृच्छिक बाइट नहीं) जो नाटकीय रूप से बर्बाद मूल्यांकनकर्ता कॉल को कम करता है।

मूल्यांकनकर्ता, बदले में, LLM के संयोगों को पकड़ता है। LLM आत्मविश्वास से दावा करेंगे कि एक फ़ंक्शन "सीमा में O(n log n) है" जब यह वास्तव में O(n ^ 2) है; एक दीवार घड़ी बेंचमार्क प्रश्न को हल करता है।

जहां AlphaEvolve सीमा ढेर में फिट बैठता है

SystemGeneratorEvaluatorDomainExample win
AlphaEvolveGeminicorrectness + benchmarkalgorithms, kernels, schedulers48-mul 4x4 matmul
FunSearch (DeepMind, 2023)PaLM / Codeycorrectnesscombinatorial mathcap-set lower bounds
AI Scientist v2 (Sakana, L5)GPT/ClaudeLLM critique + experimentML researchICLR workshop paper
Darwin Godel Machine (L4)agent scaffoldingSWE-bench / Polyglotagent code20% → 50% SWE-bench

चारो एक ही नुस्खा के भिन्नताएं हैंः जनरेटर प्लस मूल्यांकनकर्ता, लूप। अंतर यह है कि मूल्यांकनकर्ता क्या ग्रेड देता है और यह कितना कठोर है।

इसका प्रयोग करें

code/main.py"एलएलएम" एक खेलौना प्रतीकात्मक-प्रतिगमन समस्या पर एक न्यूनतम अल्फाईवोल्व-जैसा लूप लागू करता है। "एलएलएम" एक stdlib प्रॉक्सी है जो एक लक्ष्य फ़ंक्शन की गणना करने वाले कार्यक्रम में छोटे वाक्यरचनात्मक उत्परिवर्तन का प्रस्ताव देता है। "मूल्यांकनकर्ता" उपायों का अर्थ है कि आयोजित परीक्षण बिंदुओं पर वर्ग त्रुटि।

देखो:

  • कैसे पीढ़ी दर पीढ़ी सर्वश्रेष्ठ स्कोर में सुधार होता है।
  • कैसे एक मैप-एलिट ग्रिड विभिन्न समाधानों को जीवित रखता है ताकि लूप स्थानीय न्यूनतम पर अभिसरण नहीं करता है।
  • कैसे रोक दिया गया परीक्षण (केवल प्रशिक्षण मूल्यांकनकर्ता) को हटाने के लिए लूप शानदार रूप से ओवरफिट करता है।

इसे भेजें

outputs/skill-evaluator-rigor-audit.mdएक नए डोमेन में अल्फा इवोल्व शैली लूप पर विचार करने की पूर्व शर्त हैः क्या आपका मूल्यांकनकर्ता वास्तव में आप परवाह की विफलताओं को पकड़ता है?

व्यायाम

  1. दौड़ेंcode/main.py. सर्वश्रेष्ठ स्कोर ट्रैकरेक्टरी को ध्यान में रखें.--no-holdout) और फिर से चलाएं। अति-फिटिंग को मात्राबद्ध करें।
  1. MAP-एलिट ग्रिड पर अल्फाईवॉल पेपर के सेक्शन 3 को पढ़ें। एक नई समस्या (जैसे संकलक अनुकूलन पास) के लिए एक विशेषता-वेक्टर वर्णक डिजाइन करें जो खोज को विविध बनाए रखेगा।
  1. 48 गुणा 4x4 परिणाम में 56 साल के बाद स्ट्रैसन के 49-mul बॉन्ड में सुधार हुआ। पेपर के परिशिष्ट F को पढ़ें और तीन वाक्य में समझाएं कि इस समस्या के लिए मूल्यांकनकर्ता को सही करना विशेष रूप से आसान क्यों है, और अधिकांश डोमेन ऐसा क्यों नहीं हैं।
  1. एक डोमेन प्रस्ताव जहां अल्फा इवोल्व विफल होगा, सटीक रूप से पहचानें कि मूल्यांकनकर्ता कहां टूटता है और क्यों।
  1. आपके द्वारा ज्ञात डोमेन के लिए, आप जो मूल्यांकनकर्ता हस्ताक्षर उपयोग करेंगे, उसे लिखें। इसमें (ए) सटीकता की शर्तें, (बी) प्रदर्शन मीट्रिक, (ग) आउट-ऑफ-इनपुट जेनरेशन नियम, (डी) कम से कम एक रिवार्ड-हैकिंग जांच शामिल करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
AlphaEvolve"DeepMind's evolutionary coding agent"Gemini + program database + machine-checkable evaluator
MAP-elites"Diversity-preserving archive"Grid keyed by feature vectors; each cell holds the best variant with that descriptor
Island model"Parallel evolution subpopulations"Independent populations that migrate periodically; prevents premature convergence
Machine-checkable evaluator"Deterministic oracle"A unit test, simulator, or benchmark the LLM cannot fake — a prerequisite for this loop
Reward hacking"Optimizing the measure, not the goal"Loop finds a way to maximize score without doing the intended task
Seed program"The starting point"An initial correct-but-suboptimal program the loop evolves from
Held-out evaluator"Evaluation data the LLM never saw"Inputs generated at evaluation time to prevent memorization

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.