عالم الذكاء الاصطناعي v2 بحث مستقل على مستوى ورشة عمل
Type: Learn
Languages: Python (stdlib, research-loop state-machine toy)
Prerequisites: Phase 15 · 03 (AlphaEvolve), Phase 15 · 04 (DGM)
Time: ~60 minutes
المشكلة
البحث هو مهمة مفتوحة. على عكس البحث الخوارزمي AlphaEvolve أو DGM المحدودة بمعايير التغيير الذاتي، لا يكون نتيجة البحث معايير الدقة التي يمكن التحقق منها بالجهاز. يتم تقييم ورقة من قبل المراجعين، وليس اختبارات الوحدة. وهذا يجعل الحلقة أصعب إغلاقها وأكثر قيمة إذا تم إغلاقها، لأن البحث هو المكان الذي يعيش فيه التقدم المشترك.
قام عالم الذكاء الاصطناعي v1 (ساكانا، 2024) بإغلاق الحلقة من خلال البدء من القوالب التي كتبها الإنسان. وملأت الماجستير التجربات داخل منصة ثابتة يزيل عالم الذكاء الاصطناعي v2 (Yamada et al., 2025) متطلبات الشبكة باستخدام البحث عن الأشجار الوكالة مع حلقة انتقاد النموذج لغة الرؤية. النظام يولد الأفكار، وينفذ التجارب، ويُنتج الأرقام، ويكتب ورقة، ويكرر على ردود الفعل المراجعة.
حكم مراجعة الأقران: تم قبول ورقة واحدة من أدوات v2 في ورشة عمل ICLR 2025 (مع الكشف عن ذلك). حكم تقييم مستقل: النظام بعيد عن الوقوف عليه. كلاهما صحيح.
المفهوم
الهندسة المعمارية
- Idea generation.يقدم ماجستير في العلوم الأفكار البحثية المشروطة على موضوع وأدب سابق. v1 تستخدم القوالب؛ v2 تستخدم البحث الوكلي على مساحة من الفرضيات.
- Novelty check.تتحقق خطوة استرداد الأدب من ما إذا كانت الفكرة قد نشرت. هذه هي الخطوة التي وجدت فيها تقييم بيل وغيره من التسمية الخاطئة طرق مؤكدة يتم تصنيفها غالبًا على أنها رواية.
- Experiment plan.العميل يصمم بروتوكول تجريبي ويكتب الرموز
- Execution.يدير الرمز في صندوق رمل. يتم إعادة فشل في حلقة إعادة التجربة. في قياسات بيل وغيره، فشل 42% من التجارب من أخطاء التشفير في هذه المرحلة.
- Figure generation.نموذج لغة الرؤية يقرأ الأرقام المولدة ويكتبها من جديد من أجل وضوح. كان هذا إضافة تقنية رئيسية في v2.
- Writeup.ماجستير القانون يضع ورقة، يتكرر مع مراجعة داخلية.
- Optional: submission.يتم تقديم الورقة إلى مكان.
ما يعني نتيجة قبول الورشة
تمت مراجعة ورقة v2 في ورشة عمل ICLR 2025. كشف المؤلفون عن أصل الورقة لجنة البرنامج. القبول هو نقطة بيانات؛ وليس ترخيصًا للاعتراف بأن النظام "يقوم بالبحث".
سياق مهم: ورق ورشة العمل هي شريط أقل من ورق المؤتمر الرئيسي. مراجعة الأقران ضوضاء؛ يتم قبول جزء صغير من المقدمة في أي يوم معين. النجاح واحد هو دليل على المفهوم، وليس ادعاء على موثوقية. وثيقة الطبيعة 2026 ورقة نهاية إلى نهاية و كان نفسها مؤلفا من قبل الباحثين البشريين؛ وليس "النظام كتب ورقة الطبيعة".
ما وجدت التقييم المستقل
قام Beel et al. (arXiv:2502.14297) بتقييم خارجي. النتائج الرئيسية:
- Experiment failures.فشلت 42٪ من التجارب بسبب أخطاء التشفير (الستيراد السيئ، وعدم الانسجام في الشكل، والمتغيرات غير المحددة).
- Novelty mislabeling.في الخطوة التي تتخذها الأدب والحصول على الأدب، غالباً ما يتم وضع علامة على المفاهيم القائمة كشيء جديد. هذا ما يعادل البحث من الهلوسة.
- Presentation-quality gap.إن انتقادات اللغة الرؤية التي تُستخدم في تحليل الأشكال الرسمية قد أنتجت صورًا بصرية من نوع المنشورات، مما غطى نقاط ضعف التجريبية الأساسية.
النتائج الأخيرة هي المهمة في هذه المرحلة: نظام ينتج نتائج مقنعة دون إجراء أبحاث مقنعة هو أكثر خطورة، وليس أكثر أمانا، من نظام يفشل بشكل واضح. يجب أن تصل التقييم إلى الادعاءات الأساسية، وليس التوقف على الرقم.
مخاوف الهروب من صندوق الرمال
ويقول مخزن سكانا README:
بسبب طبيعة هذا البرنامج، الذي ينفذ الشفرة التي تم إنشاؤها من قبل الجامعة، لا يمكننا ضمان السلامة. هناك مخاطر من الحزم الخطيرة، والوصول إلى الويب غير السيطرة، والزراعة من العمليات غير المقصودة. استخدم على خطرك الخاص والنظر في عزلة دوكر.
هذا هو الشكل التشغيلي للسيطرة الذاتية في نطاق غير مؤكد. يكتب LLM الشفرة؛ يدير الشفرة؛ يمكن للشفرة أن تفعل أي شيء يسمح للعملية القيام به. بدون صندوق رمل يحد من نظام الملفات والشبكة والإجراءات العملية، يمكن لأي وكيل بحثي ذاتي التوجيه إزفالات البيانات، أو حرق الحساب، أو إعادة كتابة نفسه.
قصة صندوق الرمل في ألفا إيفوليف أسهل لأن تقييمها ضيق. يدير حلقة AI Scientist v2 رمزًا مفتوحًا مع أهداف مفتوحة. لهذا السبب يحتاج إلى عزلة أقوى (دوكر أدنى ، seccomp / gVisor تفضل) ومراجعة يدوية لكل تقديم قبل مغادرة النظام.
حيث يجلس v2 في كومة الحدود
| System | Target | Output kind | Evaluator | Known failure |
|---|---|---|---|---|
| AlphaEvolve | algorithms | code | unit + benchmark | bounded by evaluator rigor |
| DGM | agent scaffolding | code | SWE-bench | reward hacking |
| AI Scientist v2 | research papers | text + code + figures | peer review (weak) | experiment failures, mislabeling, polish masking weakness |
يحتوي v2 على أضعف المقيّم الآلي من الثلاثة، وأوسع سطح الخروج، وأقصر مسار إلى الأثاث العامة. تقوم أجهزة التحكم التشغيلية (صندوق الرمل، مراجعة، الكشف عن) بأغلب أعمال السلامة.
استخدمها
code/main.pyيحاكي حلقة v2 كجهاز حالة: فكرة → اختبار جديد → تجربة → رقم → كتابة → مراجعة → قبول أو التأكيد. لكل حالة احتمالية فشل قابلة للتكوين تم استخراجها من نتائج Beel et al. تشغيل المحاكي ل N حلقات والحساب:
- كم عدد الأفكار التي تصل إلى التعبير
- كم عدد المقدمين سيكون لديهم عيب تجريبي حرج يختبئ الورق الملموس.
- كيف تجارب الميزانيات المعدنية مقابل الميزانيات المعدنية
أرسله
outputs/skill-ai-scientist-sandbox-review.mdقائمة مراجعة بوابتين لكل شيء ينتجها وكيل حلقة البحث قبل مغادرة صندوق الرمل.
التمارين
- أركض
code/main.pyمع المعايير الافتراضية. ما الجزء من الدورات الحلقة تنتج ورقة "نظيفة"؟ ما الجزء ينتج ورقة مع خطأ تجربة فشل النقاش الرقمية مسح؟
- الاختلافات تستخدم بالفعل 42% / 25% من بييل وآخرين.
--experiment-failure 0.20 --novelty-mislabel 0.10ثم مع--experiment-failure 0.60 --novelty-mislabel 0.40كيف تتحول حصة المشرقة ولكن العيب بين الجريتين؟
- اقرأ تقرير "Sakana's AI Scientist v2 repo README" حول متطلبات صندوق الرمال. أسمي قيود إضافية (بعد "دوكر") التي يمكنك تطبيقها لتمارين مستقلة متعددة الأيام.
- اقرأ Beel et al. القسم 4 حول الفجوة في جودة العرض. صمم مقياس إضافي واحد يمكن أن يلتقط ورق تبدو شديدة اللون ولكن العيب التجريبي.
- اقترح بروتوكول مراجعة البشر لمنتجات وكلاء البحوث الذي يقدر بشكل أفضل من "دكتوراه يقرأ كل ورقة". حدد العنق الزجاجة والتصميم حولها.
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| AI Scientist v1 | "Sakana's templated research agent" | Filled experiments into a fixed scaffold |
| AI Scientist v2 | "Template-free research agent" | Agentic tree search with VLM figure critique |
| Agentic tree search | "Branching research agent" | Expands multiple experiment plans in parallel; prunes by internal critic |
| Vision-language critique | "VLM polish on figures" | Multimodal model reads figures and rewrites them for clarity |
| Literature retrieval | "Novelty check" | Searches prior work to confirm idea novelty — documented to mislabel |
| Polish masking | "Pretty paper, broken research" | Presentation quality exceeds experimental quality; hides weaknesses |
| Sandbox escape | "LLM code breaks out" | Agent-executed code does things the loop designer did not intend |
المزيد من القراءة
- Yamada et al. (2025). The AI Scientist-v2- الورق
- Sakana blog on the Nature 2026 publication ملخص المورد مع سياق مراجعة الأقران.
- Beel et al. (2025). Independent evaluation of The AI Scientist أرقام التقييم الخارجي.
- Sakana AI Scientist v1 paperسلفها المُقسم
- Anthropic — Measuring AI agent autonomyإطار أوسع للوكلاء البحثيين المفتوحين.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.