دانشمند هوش مصنوعی v2 تحقیق مستقل در سطح کارگاه
Type: Learn
Languages: Python (stdlib, research-loop state-machine toy)
Prerequisites: Phase 15 · 03 (AlphaEvolve), Phase 15 · 04 (DGM)
Time: ~60 minutes
مشکل
تحقیقات یک کار باز است. برخلاف جستجوی الگوریتم AlphaEvolve یا DGM، یک نتیجه تحقیقاتی معیاری محدود به خود اصلاح نمی کند. یک مقاله توسط بازرسان قضاوت می شود، نه آزمایش های واحد. این باعث می شود حلقه را سخت تر به پایان برسد و اگر بسته شود ارزشمندتر شود، زیرا تحقیقات جایی است که پیشرفت ترکیب زندگی می کند.
AI Scientist v1 (Sakana، 2024) با شروع از قالب های نوشته شده توسط انسان، حلقه را بسته است. ماجستري در اين رشته در يک استفادادنگ ثابت تجارب انجام داد AI Scientist v2 (Yamada et al., 2025) با استفاده از جستجوی درخت با یک حلقه انتقاد مدل زبان دید، نیاز به قالب را حذف می کند. این سیستم ایده ها را تولید می کند، آزمایشات را اجرا می کند، اعداد را تولید می کند، مقاله ای می نویسد و بر روی بازخورد بازبینی بازتاب می کند.
حکم بررسی همتایان: یک مقاله تولید شده توسط v2 در یک کارگاه ICLR 2025 پذیرفته شد (با افشای آن). حکم ارزیابی مستقل: سیستم بسیار دور از قابل اعتماد است. هر دو درست هستند.
مفهوم
معماری
- Idea generation.LLM ایده های تحقیقاتی را که بر اساس یک موضوع و ادبیات قبلی مورد نیاز است پیشنهاد می کند. v1 از قالب ها استفاده می کند؛ v2 از جستجوی عوامل در فضای فرضیه استفاده می کند.
- Novelty check.یک مرحله بازیافت ادبیات بررسی می کند که آیا ایده منتشر شده است. این مرحله است که ارزیابی بیل و همکارانش نشان داد که برچسب گذاری اشتباه است.
- Experiment plan.مامور پروتکل تجربی را طراحی کرده و کد می نویسد.
- Execution.کد در یک جعبه شن روی می کند. شکست ها به یک حلقه تکرار می شوند. در اندازه گیری های بیل و همکاران، 42٪ از آزمایش ها در این مرحله از خطا های کد گذاری شکست خورده اند.
- Figure generation.یک مدل زبان بینایی اعداد تولید شده را می خواند و برای شفافیت آنها را دوباره می نویسد. این یک اضافه فنی کلیدی v2 بود.
- Writeup.ماجستري مقاله اي را مي نویسد، با بازرس داخلي تکرار ميکنه.
- Optional: submission.مقاله به یک محل ارسال می شود.
معنی نتیجه پذیرش کارگاه
یک مقاله تولید شده توسط v2 در یک کارگاه ICLR 2025 از بررسی همتایان عبور کرد. نویسندگان اصل مقاله را به کمیته برنامه اعلام کردند. پذیرش یک نقطه داده است؛ این مجوز برای ادعا کردن سیستم "تحقیق می کند" نیست.
زمینه مهم: مقالات کارگاهی نسبت به مقالات کنفرانس اصلی بار پایین تر هستند. بررسی همتایان شور است؛ یک بخش کوچک از ارسال ها در هر روز معین پذیرفته می شود. یک موفقیت اثبات مفهوم است، نه ادعای قابلیت اطمینان. مقاله طبیعت 2026 مدارک حلقه پایان به پایان و خود توسط محققان انسانی به اشتراک گذاشته شده است. این "سیستم مقاله طبیعت را نوشت" نیست.
آنچه که ارزیابی مستقل نشان داد
بیل و همکاران (arXiv:2502.14297) یک ارزیابی خارجی انجام دادند.
- Experiment failures.۴۲ درصد از آزمایش ها به دلیل اشتباهات کدگذاری (استوردات بد، عدم مطابقت شکل، متغیرهای غیرقابل تعریف) شکست خوردند.
- Novelty mislabeling.مرحله بازیافت ادبیات اغلب مفاهیم تاسیس شده را به عنوان جدید نشان می دهد. این معادل تحقیقات توهم است.
- Presentation-quality gap.انتقاد از چهره های زبان دید، تصویری در درجه انتشار تولید کرد و ضعف های تجربی اساسی را پنهان کرد.
آخرین یافته برای این مرحله مهم است. یک سیستم که بدون انجام تحقیقات قانع کننده نتایج قانع کننده ای تولید می کند خطرناک تر است، نه امن تر از یک سیستم که به طور واضح شکست می خورد. ارزیابی باید به ادعاهای اساسی برسد، نه به اعداد متوقف شود.
نگرانی فرار از جعبه شن
ذخیره سازی خود ساکانا README هشدار می دهد:
به دلیل ماهیت این نرم افزار که کد تولید شده توسط LLM را اجرا می کند، ما نمی توانیم امنیت را تضمین کنیم. خطرات بسته های خطرناک، دسترسی غیر کنترل شده به وب و تولید فرآیندهای ناخواسته وجود دارد. از خطر خود استفاده کنید و از دور کردن Docker در نظر بگیرید.
این شکل عملیاتی استقلال در یک دامنه غیر تأیید شده است. LLM کد را می نویسد؛ کد اجرا می شود؛ کد می تواند هر کاری را که فرآیند مجاز به انجام دادن است انجام دهد. بدون یک جعبه قمار که به سختی سیستم فایل، شبکه و اقدامات فرآیند را محدود می کند، هر عامل تحقیقاتی خودگردان می تواند داده ها را خارج کند، محاسبه را بسوزاند یا خود را دوباره بنویسد.
داستان sandbox AlphaEvolve آسان تر است زیرا ارزیابی کننده آن تنگ است. حلقه AI Scientist v2 کد باز با اهداف باز را اجرا می کند. به همین دلیل نیاز به انزوا قوی تری دارد (دکتر حداقل؛ seccomp / gVisor ترجیح داده می شود) و بررسی دستی هر ارسال قبل از خروج از سیستم.
جایی که v2 در دسته مرز قرار دارد
| System | Target | Output kind | Evaluator | Known failure |
|---|---|---|---|---|
| AlphaEvolve | algorithms | code | unit + benchmark | bounded by evaluator rigor |
| DGM | agent scaffolding | code | SWE-bench | reward hacking |
| AI Scientist v2 | research papers | text + code + figures | peer review (weak) | experiment failures, mislabeling, polish masking weakness |
v2 دارای ضعیف ترین ارزیابی کننده خودکار سه، گسترده ترین سطح خروجی و کوتاه ترین مسیر به آثار هنری عمومی است. کنترل های عملیاتی (ساند باکس، بررسی، افشای) بیشتر کار ایمنی را انجام می دهند.
ازش استفاده کن
code/main.pyشبیه سازی حلقه v2 به عنوان یک دستگاه حالت: ایده → بررسی جدیدیت → آزمایش → شکل → نوشتن → بررسی → قبول یا تکرار. هر حالت دارای احتمال شکست قابل تنظیم است که از یافته های بیل و همکارانش گرفته شده است. شبیه ساز را برای حلقه های N اجرا کنید و شمارش کنید:
- چقدر ایده ها به تسلیم می رسند.
- چند تا از ارسال ها نقص آزمایشی مهم دارند که کاغذ پاک شده پنهان می کند.
- چطور بودجه های دوباره امتحان کردن با کیفیت مقابل بهره برداری معامله می کنند
-باده
outputs/skill-ai-scientist-sandbox-review.mdاین یک چک لیست بررسی دو دروازه برای هر چیزی که توسط یک عامل تحقیق تولید شده قبل از اینکه از جعبه شنگی خارج شود.
تمرینات
- فرار کن
code/main.pyبا پارامترهای پیش فرض. چه بخش از چرخه اجرا می کند یک کاغذ "صاف" تولید کند؟ چه بخش تولید می کند یک کاغذ با یک خطا آزمایش شکست داده شده است که نقض ارقام را بر روی شلیک کرده است؟
- در موارد پیش فرض، از 42٪ / 25٪ بیل و همکاران استفاده می شود.
--experiment-failure 0.20 --novelty-mislabel 0.10و بعدش با--experiment-failure 0.60 --novelty-mislabel 0.40. چطوري سهم درست و ناقص بين دو رينگ عوض ميشه؟
- در گزارش AI Scientist v2 README در مورد نیازهای sandbox بخوانید. دو محدودیت اضافی (بیشتر از Docker) را نام ببرید که برای یک اجرا مستقل چند روزه درخواست می کنید.
- بخش 4 در مورد شکاف کیفیت ارائه را بخوانید. یک ارزیابی کننده اضافی طراحی کنید که کاغذ های با ظاهر خوب اما آزمایشی ناقص را شناسایی کند.
- یک پروتکل بررسی انسانی برای نتایج آژانس تحقیقاتی را پیشنهاد کنید که بهتر از "دکتر هر مقاله را می خواند".
اصطلاحات کلیدی
| Term | What people say | What it actually means |
|---|---|---|
| AI Scientist v1 | "Sakana's templated research agent" | Filled experiments into a fixed scaffold |
| AI Scientist v2 | "Template-free research agent" | Agentic tree search with VLM figure critique |
| Agentic tree search | "Branching research agent" | Expands multiple experiment plans in parallel; prunes by internal critic |
| Vision-language critique | "VLM polish on figures" | Multimodal model reads figures and rewrites them for clarity |
| Literature retrieval | "Novelty check" | Searches prior work to confirm idea novelty — documented to mislabel |
| Polish masking | "Pretty paper, broken research" | Presentation quality exceeds experimental quality; hides weaknesses |
| Sandbox escape | "LLM code breaks out" | Agent-executed code does things the loop designer did not intend |
خواندن بیشتر
- Yamada et al. (2025). The AI Scientist-v2کاغذ
- Sakana blog on the Nature 2026 publication خلاصه فروشنده با زمینه بررسی همتایان.
- Beel et al. (2025). Independent evaluation of The AI Scientist اعداد ارزیابی خارجی
- Sakana AI Scientist v1 paper پیشرو مدل شده
- Anthropic — Measuring AI agent autonomy چارچوبی گسترده تر از عوامل تحقیقاتی باز.
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.