Phase 15: Autonomous Systems

एआई वैज्ञानिक v2 कार्यशाला-स्तरीय स्वायत्त अनुसंधान

साकाना के एआई वैज्ञानिक v2 (यामाडा एट अल, arXiv:2504.08066) पूरे शोध लूप को चलाता हैः परिकल्पना, कोड, प्रयोग, आंकड़े, लेखन, प्रस्तुत। यह पहली प्रणाली है जिसमें आईसीएलआर 2025 कार्यशाला में पेपर पास पीयर रिव्यू उत्पन्न किया गया है। स्वतंत्र मूल्यांकन (बील और अन्य) में पाया गया कि 42% प्रयोगों को कोडिंग त्रुटियों से विफल रखा गया और साहित्य समीक्षा ने अक्सर स्थापित अवधारणाओं को उपन्यास के रूप में गलत लेबल दिया। साकाना के स्वयं के डॉक्टर चेतावनी देते हैं कि कोडबेस एलएलएम-लिखित कोड निष्पादित करता है और डॉकर अलगाव की सिफारिश करते हैं। उस चित्र के दोनों आधे बिंदु हैं।

Type: Learn

Languages: Python (stdlib, research-loop state-machine toy)

Prerequisites: Phase 15 · 03 (AlphaEvolve), Phase 15 · 04 (DGM)

Time: ~60 minutes

समस्या

शोध एक खुला कार्य है। अल्फाईवोल्व के एल्गोरिथम खोज या डीजीएम के बेंचमार्क-सीमित स्व-संशोधन के विपरीत, एक शोध परिणाम में मशीन-चेक योग्य सटीकता मानदंड नहीं होता है। एक पेपर का मूल्यांकन समीक्षकों द्वारा किया जाता है, इकाई परीक्षणों द्वारा नहीं। यह लूप को बंद करना कठिन बनाता है और बंद होने पर अधिक मूल्यवान होता है, क्योंकि अनुसंधान वह जगह है जहां समग्र प्रगति रहती है।

एआई साइंटिस्ट v1 (सकाना, 2024) ने मानव-लेखित टेम्पलेट्स से शुरू करके लूप को बंद कर दिया। LLM ने एक निश्चित मंच के भीतर प्रयोगों को भर दिया। एआई साइंटिस्ट v2 (यामाडा एट अल, 2025) ने दृष्टि-भाषा मॉडल आलोचना लूप के साथ एजेंटिक ट्री सर्च का उपयोग करके टेम्पलेट आवश्यकता को हटा दिया। यह प्रणाली विचारों का उत्पादन करती है, प्रयोगों को लागू करती है, आंकड़े उत्पन्न करती है, एक पेपर लिखती है और समीक्षक प्रतिक्रिया पर पुनरावृत्ति करती है।

पीयर रिव्यू वर्डिक्टः एक v2 उत्पन्न पेपर को ICLR 2025 कार्यशाला में स्वीकार किया गया था (खुलासा के साथ) । स्वतंत्र मूल्यांकन वर्डिक्टः प्रणाली विश्वसनीय से बहुत दूर है। दोनों सच हैं।

अवधारणा

वास्तुकला

  1. Idea generation.एमएलएल एक विषय और पूर्व साहित्य पर आधारित शोध विचारों का प्रस्ताव देता है। v1 टेम्पलेट्स का उपयोग करता है; v2 परिकल्पनाओं के एक स्थान पर एजेंटिक खोज का उपयोग करता है।
  2. Novelty check.साहित्य की खोज के चरण में यह जांच की जाती है कि क्या विचार प्रकाशित किया गया है। यह चरण है जहां बील एट अल के मूल्यांकन में गलत लेबलिंग पाया गया है।
  3. Experiment plan.एजेंट एक प्रयोगात्मक प्रोटोकॉल तैयार करता है और कोड लिखता है।
  4. Execution.कोड एक सैंडबॉक्स में चलता है। विफलताएं एक पुनः प्रयास लूप में वापस दी जाती हैं। बील और अन्य के माप में, 42% प्रयोग इस चरण में कोडिंग त्रुटियों से विफल रहे।
  5. Figure generation.एक दृष्टि-भाषा मॉडल उत्पन्न आंकड़ों को पढ़ता है और स्पष्टता के लिए उन्हें फिर से लिखता है। यह v2 का मुख्य तकनीकी जोड़ था।
  6. Writeup.एमएलएल एक पेपर तैयार करता है, एक आंतरिक समीक्षक के साथ पुनरावृत्ति करता है।
  7. Optional: submission.पेपर को एक स्थल पर प्रस्तुत किया जाता है।

कार्यशाला-स्वीकार परिणाम का क्या अर्थ है

एक v2 उत्पन्न पेपर ने आईसीएलआर 2025 कार्यशाला में सहकर्मी समीक्षा पारित की। लेखकों ने कार्यक्रम समिति को पेपर की उत्पत्ति का खुलासा किया। स्वीकृति एक डेटा बिंदु है; यह प्रणाली का दावा करने का लाइसेंस नहीं है "अनुसंधान करता है।"

महत्वपूर्ण संदर्भः कार्यशाला के पेपर मुख्य सम्मेलन के पेपर की तुलना में कम बार हैं। सहकर्मी समीक्षा शोर है; किसी भी दिन प्रस्तुतियों का एक छोटा अंश स्वीकार किया जाता है। एक सफलता अवधारणा का प्रमाण है, विश्वसनीयता का दावा नहीं है। प्रकृति 2026 पेपर अंत-से-अंत लूप का दस्तावेज है और स्वयं मानव शोधकर्ताओं द्वारा सह-लेखक था; यह "प्रणाली ने एक प्रकृति पेपर लिखा नहीं है।"

स्वतंत्र मूल्यांकन में क्या पाया गया

बील एट अल (arXiv:2502.14297) ने एक बाहरी मूल्यांकन किया। मुख्य निष्कर्षः

  • Experiment failures.42% प्रयोगों में कोडिंग त्रुटियों (खराब आयात, आकार असंगतियां, अपरिभाषित चर) के कारण विफलता हुई। पुनः प्रयास लूप कुछ, सभी नहीं पकड़ा।
  • Novelty mislabeling.साहित्य-पुनर्प्राप्ती चरण में अक्सर स्थापित अवधारणाओं को उपन्यास के रूप में चिह्नित किया जाता है। यह भ्रम के अनुसंधान समकक्ष है।
  • Presentation-quality gap.दृष्टि भाषा आकृति आलोचना ने प्रकाशन-ग्रेड के दृश्यों का उत्पादन किया, जो अंतर्निहित प्रयोगात्मक कमजोरियों को छिपाता है।

इस चरण के लिए अंतिम निष्कर्ष महत्वपूर्ण है। एक प्रणाली जो आश्वस्त अनुसंधान किए बिना आश्वस्त परिणाम देती है, वह जोखिमपूर्ण है, सुरक्षित नहीं है, एक प्रणाली जो स्पष्ट रूप से विफल होती है। मूल्यांकन को अंतर्निहित दावों तक पहुंचना चाहिए, आंकड़े पर नहीं रुकना चाहिए।

रेत बॉक्स से भागने की चिंता

साकाना की अपनी रिपॉजिटरी README चेतावनी देती हैः

इस सॉफ्टवेयर की प्रकृति के कारण, जो एलएलएम-जनरेट कोड निष्पादित करता है, हम सुरक्षा की गारंटी नहीं दे सकते हैं. खतरनाक पैकेज, अनियंत्रित वेब एक्सेस और अनचाहे प्रक्रियाओं के प्रजनन के जोखिम हैं। अपने जोखिम पर उपयोग करें और डॉकर अलगाव पर विचार करें।

यह एक अप्रत्याशित डोमेन में स्वायत्तता का परिचालन रूप है। एलएलएम कोड लिखता है; कोड चलाता है; कोड कुछ भी कर सकता है जो प्रक्रिया को करने की अनुमति है। बिना एक सैंडबॉक्स के जो फ़ाइल सिस्टम, नेटवर्क और प्रक्रिया कार्यों को कठिन सीमाएं देता है, कोई भी स्व-निर्देशित अनुसंधान एजेंट डेटा को बाहर निकाल सकता है, गणना को जला सकता है, या खुद को फिर से लिख सकता है।

अल्फाईवोल्व की सैंडबॉक्स कहानी आसान है क्योंकि इसका मूल्यांकनकर्ता तंग है। एआई साइंटिस्ट v2 का लूप ओपन-एंड कोड चलाता है जिसमें ओपन-एंड लक्ष्य होते हैं। यही कारण है कि इसे सिस्टम छोड़ने से पहले मजबूत अलगाव (डॉकर न्यूनतम; सेकम्प / जीविज़र पसंद किया जाता है) और प्रत्येक सबमिशन की मैन्युअल समीक्षा की आवश्यकता होती है।

जहां v2 सीमा ढेर में बैठता है

SystemTargetOutput kindEvaluatorKnown failure
AlphaEvolvealgorithmscodeunit + benchmarkbounded by evaluator rigor
DGMagent scaffoldingcodeSWE-benchreward hacking
AI Scientist v2research paperstext + code + figurespeer review (weak)experiment failures, mislabeling, polish masking weakness

v2 में तीनों में से सबसे कमजोर स्वचालित मूल्यांकनकर्ता, सबसे व्यापक आउटपुट सतह और सार्वजनिक कलाकृतियों के लिए सबसे छोटा मार्ग है। परिचालन नियंत्रण (सैंडबॉक्स, समीक्षा, प्रकटीकरण) सुरक्षा कार्य का अधिकांश हिस्सा कर रहे हैं।

इसका प्रयोग करें

code/main.pyv2 लूप को एक स्टेट मशीन के रूप में सिमुलेट करता हैः आइडिया → न्यूविटी चेक → प्रयोग → आकृति → लेखन → समीक्षा → स्वीकार-या-विचार। प्रत्येक स्टेट में बील और अन्य के निष्कर्षों से खींची जा सकती है विफलता की संभावना। N लूप के लिए सिमुलेटर चलाएं और गिनेंः

  • कितने विचार सबमिशन तक पहुंचते हैं।
  • कितने सबमिशन में एक महत्वपूर्ण प्रयोगात्मक दोष होता है जो पॉलिश पेपर छिपाता है।
  • कैसे पुनः प्रयास बजट गुणवत्ता बनाम उपज के साथ व्यापार करते हैं।

इसे भेजें

outputs/skill-ai-scientist-sandbox-review.mdयह एक शोध-लूप एजेंट द्वारा उत्पादित किसी भी चीज़ के लिए दो-गेट समीक्षा चेकलिस्ट है जो सैंडबॉक्स से बाहर निकलने से पहले है।

व्यायाम

  1. दौड़ेंcode/main.pyलूप रन का कौन सा अंश एक "शुद्ध" पेपर बनाता है? कौन सा अंश एक पेपर के साथ एक प्रयोग-विफलता त्रुटि बनाता है आंकड़ा आलोचना पॉलिश किया?
  1. पूर्वनिर्धारित पहले से ही बीएल और अन्य के 42% / 25% का उपयोग करते हैं।--experiment-failure 0.20 --novelty-mislabel 0.10और फिर --experiment-failure 0.60 --novelty-mislabel 0.40. . कैसे पॉलिश लेकिन दोषपूर्ण शेयर दो रन के बीच स्थानांतरित करता है?
  1. सैकाना के एआई साइंटिस्ट v2 रेपो README को सैंडबॉक्स आवश्यकताओं पर पढ़ें। दो अतिरिक्त प्रतिबंधों का नाम दें (डॉकर के अलावा) आप कई दिनों के स्वायत्त रन के लिए आवेदन करेंगे।
  1. बील एट अल. सेक्शन 4 पर प्रस्तुति-गुणवत्ता अंतर पढ़ें। एक अतिरिक्त मूल्यांकनकर्ता डिजाइन करें जो पॉलिश दिखने वाले लेकिन प्रयोगात्मक रूप से दोषपूर्ण पेपर को पकड़ सकता है।
  1. शोध एजेंटों के आउटपुट के लिए मानव-पुनरावलोकन प्रोटोकॉल का प्रस्ताव करें जो "एक पीएचडी हर पेपर पढ़ता है" से बेहतर स्केल करता है। इसके आसपास की बोतल की खाई और डिजाइन की पहचान करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
AI Scientist v1"Sakana's templated research agent"Filled experiments into a fixed scaffold
AI Scientist v2"Template-free research agent"Agentic tree search with VLM figure critique
Agentic tree search"Branching research agent"Expands multiple experiment plans in parallel; prunes by internal critic
Vision-language critique"VLM polish on figures"Multimodal model reads figures and rewrites them for clarity
Literature retrieval"Novelty check"Searches prior work to confirm idea novelty — documented to mislabel
Polish masking"Pretty paper, broken research"Presentation quality exceeds experimental quality; hides weaknesses
Sandbox escape"LLM code breaks out"Agent-executed code does things the loop designer did not intend

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.