Phase 15: Autonomous Systems

عالم الذكاء الاصطناعي v2 بحث مستقل على مستوى ورشة عمل

سكانا العلماء الذكاء الاصطناعي v2 (يامادا وآخرين، arXiv:2504.08066) يدير حلقة البحث الكاملة: الفرضية، والرمز، والخبرات، والأرقام، والكتابة، والإرسال. إنه أول نظام يُنتج مراجعة بين الأقران لتمرير ورقة في ورشة عمل ICLR 2025. وجدت تقييم مستقل (Beel et al.) أن 42% من التجارب فشلت من أخطاء التشفير ومراجعة الأدب غالبا ما يضعون علامة خاطئة على المفاهيم القائمة كشيء جديد. أطباء سكانا يحذرون من أن قاعدة الشفرة تنفذ شفرة مكتوبة في الـ "إل إل ام" و يوصون بعزل "دوكر" كلا النصفين من هذه الصورة هم النقطة

Type: Learn

Languages: Python (stdlib, research-loop state-machine toy)

Prerequisites: Phase 15 · 03 (AlphaEvolve), Phase 15 · 04 (DGM)

Time: ~60 minutes

المشكلة

البحث هو مهمة مفتوحة. على عكس البحث الخوارزمي AlphaEvolve أو DGM المحدودة بمعايير التغيير الذاتي، لا يكون نتيجة البحث معايير الدقة التي يمكن التحقق منها بالجهاز. يتم تقييم ورقة من قبل المراجعين، وليس اختبارات الوحدة. وهذا يجعل الحلقة أصعب إغلاقها وأكثر قيمة إذا تم إغلاقها، لأن البحث هو المكان الذي يعيش فيه التقدم المشترك.

قام عالم الذكاء الاصطناعي v1 (ساكانا، 2024) بإغلاق الحلقة من خلال البدء من القوالب التي كتبها الإنسان. وملأت الماجستير التجربات داخل منصة ثابتة يزيل عالم الذكاء الاصطناعي v2 (Yamada et al., 2025) متطلبات الشبكة باستخدام البحث عن الأشجار الوكالة مع حلقة انتقاد النموذج لغة الرؤية. النظام يولد الأفكار، وينفذ التجارب، ويُنتج الأرقام، ويكتب ورقة، ويكرر على ردود الفعل المراجعة.

حكم مراجعة الأقران: تم قبول ورقة واحدة من أدوات v2 في ورشة عمل ICLR 2025 (مع الكشف عن ذلك). حكم تقييم مستقل: النظام بعيد عن الوقوف عليه. كلاهما صحيح.

المفهوم

الهندسة المعمارية

  1. Idea generation.يقدم ماجستير في العلوم الأفكار البحثية المشروطة على موضوع وأدب سابق. v1 تستخدم القوالب؛ v2 تستخدم البحث الوكلي على مساحة من الفرضيات.
  2. Novelty check.تتحقق خطوة استرداد الأدب من ما إذا كانت الفكرة قد نشرت. هذه هي الخطوة التي وجدت فيها تقييم بيل وغيره من التسمية الخاطئة طرق مؤكدة يتم تصنيفها غالبًا على أنها رواية.
  3. Experiment plan.العميل يصمم بروتوكول تجريبي ويكتب الرموز
  4. Execution.يدير الرمز في صندوق رمل. يتم إعادة فشل في حلقة إعادة التجربة. في قياسات بيل وغيره، فشل 42% من التجارب من أخطاء التشفير في هذه المرحلة.
  5. Figure generation.نموذج لغة الرؤية يقرأ الأرقام المولدة ويكتبها من جديد من أجل وضوح. كان هذا إضافة تقنية رئيسية في v2.
  6. Writeup.ماجستير القانون يضع ورقة، يتكرر مع مراجعة داخلية.
  7. Optional: submission.يتم تقديم الورقة إلى مكان.

ما يعني نتيجة قبول الورشة

تمت مراجعة ورقة v2 في ورشة عمل ICLR 2025. كشف المؤلفون عن أصل الورقة لجنة البرنامج. القبول هو نقطة بيانات؛ وليس ترخيصًا للاعتراف بأن النظام "يقوم بالبحث".

سياق مهم: ورق ورشة العمل هي شريط أقل من ورق المؤتمر الرئيسي. مراجعة الأقران ضوضاء؛ يتم قبول جزء صغير من المقدمة في أي يوم معين. النجاح واحد هو دليل على المفهوم، وليس ادعاء على موثوقية. وثيقة الطبيعة 2026 ورقة نهاية إلى نهاية و كان نفسها مؤلفا من قبل الباحثين البشريين؛ وليس "النظام كتب ورقة الطبيعة".

ما وجدت التقييم المستقل

قام Beel et al. (arXiv:2502.14297) بتقييم خارجي. النتائج الرئيسية:

  • Experiment failures.فشلت 42٪ من التجارب بسبب أخطاء التشفير (الستيراد السيئ، وعدم الانسجام في الشكل، والمتغيرات غير المحددة).
  • Novelty mislabeling.في الخطوة التي تتخذها الأدب والحصول على الأدب، غالباً ما يتم وضع علامة على المفاهيم القائمة كشيء جديد. هذا ما يعادل البحث من الهلوسة.
  • Presentation-quality gap.إن انتقادات اللغة الرؤية التي تُستخدم في تحليل الأشكال الرسمية قد أنتجت صورًا بصرية من نوع المنشورات، مما غطى نقاط ضعف التجريبية الأساسية.

النتائج الأخيرة هي المهمة في هذه المرحلة: نظام ينتج نتائج مقنعة دون إجراء أبحاث مقنعة هو أكثر خطورة، وليس أكثر أمانا، من نظام يفشل بشكل واضح. يجب أن تصل التقييم إلى الادعاءات الأساسية، وليس التوقف على الرقم.

مخاوف الهروب من صندوق الرمال

ويقول مخزن سكانا README:

بسبب طبيعة هذا البرنامج، الذي ينفذ الشفرة التي تم إنشاؤها من قبل الجامعة، لا يمكننا ضمان السلامة. هناك مخاطر من الحزم الخطيرة، والوصول إلى الويب غير السيطرة، والزراعة من العمليات غير المقصودة. استخدم على خطرك الخاص والنظر في عزلة دوكر.

هذا هو الشكل التشغيلي للسيطرة الذاتية في نطاق غير مؤكد. يكتب LLM الشفرة؛ يدير الشفرة؛ يمكن للشفرة أن تفعل أي شيء يسمح للعملية القيام به. بدون صندوق رمل يحد من نظام الملفات والشبكة والإجراءات العملية، يمكن لأي وكيل بحثي ذاتي التوجيه إزفالات البيانات، أو حرق الحساب، أو إعادة كتابة نفسه.

قصة صندوق الرمل في ألفا إيفوليف أسهل لأن تقييمها ضيق. يدير حلقة AI Scientist v2 رمزًا مفتوحًا مع أهداف مفتوحة. لهذا السبب يحتاج إلى عزلة أقوى (دوكر أدنى ، seccomp / gVisor تفضل) ومراجعة يدوية لكل تقديم قبل مغادرة النظام.

حيث يجلس v2 في كومة الحدود

SystemTargetOutput kindEvaluatorKnown failure
AlphaEvolvealgorithmscodeunit + benchmarkbounded by evaluator rigor
DGMagent scaffoldingcodeSWE-benchreward hacking
AI Scientist v2research paperstext + code + figurespeer review (weak)experiment failures, mislabeling, polish masking weakness

يحتوي v2 على أضعف المقيّم الآلي من الثلاثة، وأوسع سطح الخروج، وأقصر مسار إلى الأثاث العامة. تقوم أجهزة التحكم التشغيلية (صندوق الرمل، مراجعة، الكشف عن) بأغلب أعمال السلامة.

استخدمها

code/main.pyيحاكي حلقة v2 كجهاز حالة: فكرة → اختبار جديد → تجربة → رقم → كتابة → مراجعة → قبول أو التأكيد. لكل حالة احتمالية فشل قابلة للتكوين تم استخراجها من نتائج Beel et al. تشغيل المحاكي ل N حلقات والحساب:

  • كم عدد الأفكار التي تصل إلى التعبير
  • كم عدد المقدمين سيكون لديهم عيب تجريبي حرج يختبئ الورق الملموس.
  • كيف تجارب الميزانيات المعدنية مقابل الميزانيات المعدنية

أرسله

outputs/skill-ai-scientist-sandbox-review.mdقائمة مراجعة بوابتين لكل شيء ينتجها وكيل حلقة البحث قبل مغادرة صندوق الرمل.

التمارين

  1. أركضcode/main.pyمع المعايير الافتراضية. ما الجزء من الدورات الحلقة تنتج ورقة "نظيفة"؟ ما الجزء ينتج ورقة مع خطأ تجربة فشل النقاش الرقمية مسح؟
  1. الاختلافات تستخدم بالفعل 42% / 25% من بييل وآخرين.--experiment-failure 0.20 --novelty-mislabel 0.10ثم مع--experiment-failure 0.60 --novelty-mislabel 0.40كيف تتحول حصة المشرقة ولكن العيب بين الجريتين؟
  1. اقرأ تقرير "Sakana's AI Scientist v2 repo README" حول متطلبات صندوق الرمال. أسمي قيود إضافية (بعد "دوكر") التي يمكنك تطبيقها لتمارين مستقلة متعددة الأيام.
  1. اقرأ Beel et al. القسم 4 حول الفجوة في جودة العرض. صمم مقياس إضافي واحد يمكن أن يلتقط ورق تبدو شديدة اللون ولكن العيب التجريبي.
  1. اقترح بروتوكول مراجعة البشر لمنتجات وكلاء البحوث الذي يقدر بشكل أفضل من "دكتوراه يقرأ كل ورقة". حدد العنق الزجاجة والتصميم حولها.

الشروط الرئيسية

TermWhat people sayWhat it actually means
AI Scientist v1"Sakana's templated research agent"Filled experiments into a fixed scaffold
AI Scientist v2"Template-free research agent"Agentic tree search with VLM figure critique
Agentic tree search"Branching research agent"Expands multiple experiment plans in parallel; prunes by internal critic
Vision-language critique"VLM polish on figures"Multimodal model reads figures and rewrites them for clarity
Literature retrieval"Novelty check"Searches prior work to confirm idea novelty — documented to mislabel
Polish masking"Pretty paper, broken research"Presentation quality exceeds experimental quality; hides weaknesses
Sandbox escape"LLM code breaks out"Agent-executed code does things the loop designer did not intend

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.