Phase 15: Autonomous Systems

स्वायत्त कोडिंग एजेंट परिदृश्य (2026)

एसवीई-बेंच सत्यापित तीन साल से भी कम समय में 4% से बढ़कर 80.9% हो गया। उसी क्लाउड सोननेट 4.5 ने SWE-agent v1 पर 43.2% और Cline स्वायत्त पर 59.8% स्कोर किया। ओपन हैंड्स (पूर्व में ओपनडेविन) सबसे सक्रिय एमआईटी-लाइसेंस वाला मंच है और इसका कोडएक्ट लूप जेएसओएन टूल कॉल के बजाय सीधे सैंडबॉक्स में पायथन एक्शन निष्पादित करता है। शीर्षक संख्याओं में एक पद्धतिगत समस्या छिपी हैः 500 SWE-बेंच सत्यापित कार्यों में से 161 को केवल 12 लाइन परिवर्तन की आवश्यकता होती है, और SWE-बेंच प्रो (10+ लाइन कार्यों) एक ही सीमा मॉडल के लिए 2359% पर बैठता है।

Type: Learn

Languages: Python (stdlib, CodeAct vs JSON tool-call comparison)

Prerequisites: Phase 14 · 07 (Tool use), Phase 15 · 01 (Long-horizon agents)

Time: ~45 minutes

समस्या

"कौन सी कोडिंग एजेंट सबसे अच्छी है" गलत सवाल है। सही सवाल यह हैः एक कार्य वितरण जो मेरे काम से मेल खाता है, उत्पादन में चलाने वाले स्केफॉल्डिंग के साथ, मुझे अंत से अंत तक विश्वसनीयता क्या मिलती है?

2022 और 2026 के बीच क्षेत्र ने सीखा कि स्केफॉल्डिंग रिट्रीवल लेयर, प्लानर, सैंडबॉक्स, एडिट-वेरिफिकेशन लूप, फीडबैक प्रारूप लोड-बरोस है। क्लाउड सोनट 4.5 पर SWE-एजेंट v1 ने SWE-बेंच सत्यापित पर 43.2% स्कोर किया; क्लाइन के स्वायत्त स्केफल्ड के अंदर एक ही मॉडल ने 59.8% स्कोर किया। 16.6 पूर्ण अंतर बिंदु, समान वजन। आधार मॉडल एक घटक है; लूप उत्पाद है।

साथ में समस्या यह है कि बेंचमार्क संतृप्ति प्रतिगमन को छिपाती है। SWE-बेंच सत्यापित संतृप्त के करीब है, और आसान-कार्य पूंछ (161 500 कार्यों में से 2 लाइनों की आवश्यकता होती है) शीर्ष स्कोर को खींचता है। वास्तविक दुनिया की गुणवत्ता SWE-बेंच प्रो जैसे वितरण पर बेहतर मापी जाती है (10+ लाइन परिवर्तन), जहां एक ही नेता अभी भी 2359% पर बैठते हैं।

अवधारणा

एसईई-बेंच, एक पैराग्राफ

SWE-bench (Jimenez et al.) ग्राउंड-सचई पैच के साथ वास्तविक GitHub मुद्दों को लेता है और एक एजेंट को एक पैच बनाने के लिए कहता है जो परीक्षण सूट को पारित करता है। SWE-bench Verified (OpenAI, 2024) एक मानव-संरक्षित 500-कार्य उपसमूह है जिसमें अस्पष्ट और टूटने वाले कार्य हटा दिए गए हैं। SWE-bench Pro सबसे कठिन उत्तराधिकारी है परिवर्तन की 10+ पंक्तियों की आवश्यकता होती है, जहां वर्तमान सीमा एजेंट 2359% पर बैठते हैं।

क्या वास्तव में 2022 → 2026 वक्र दिखाता है

  • 2022: कच्चे SWE-बेंच पर ~ 4% पर अनुसंधान मॉडल।
  • 2024: GPT-4 + Devin शैली की स्केफॉल्डिंग ~ 14%; SWE एजेंट ~ 12%।
  • 2025: क्लाउड 3.5/3.7 एडर और एसवीई एजेंट के अंदर सोनेट 4055% की सीमा में धक्का।
  • 2026: क्लाउड सोनट 4.5 और सीमा प्रतियोगियों 7080%+ पर SWE-बेंच सत्यापित। युग एआई के रैंकिंग बोर्ड इस लाइव ट्रैक करता है।

ढलान तीन घटक स्रोतों से आयाः बेहतर आधार मॉडल, बेहतर स्टफॉल्डिंग (कोडएक्ट, प्रतिबिंब, सत्यापन लूप), और बेहतर बेंचमार्क (सत्यापित शोर हटाने) ।

CodeAct बनाम JSON उपकरण कॉल

ओपनहैंड्स (ऑल-हैंड्स-एआई, arXiv:2407.16741, पूर्व में ओपनडेविन) ने एक विशिष्ट वास्तुकला शर्त लीः मॉडल द्वारा जेएसओएन टूल कॉल जारी करने के बजाय जो एक होस्ट डिकोड और निष्पादित करता है, मॉडल पायथन कोड जारी करता है और एक ज्यूपिटर-शैली वाला कर्नेल इसे सैंडबॉक्स में चलाता है। एजेंट फ़ाइलों, श्रृंखला उपकरणों पर लूप कर सकता है, और एक कार्रवाई के भीतर अपने अपवादों को पकड़ सकता है।

व्यापार समझौताः

  • JSON tool calls: प्रत्येक क्रिया एक बार होती है; ऑडिट करना आसान; रचनात्मकता सीमित; डिफ़ॉल्ट रूप से सुरक्षित क्योंकि प्रत्येक कॉल एक स्पष्ट सत्यापनकर्ता से गुजरती है।
  • CodeAct: एक कार्रवाई एक पूरे कार्यक्रम हो सकता है; रचनात्मक; एक कठोर सैंडबॉक्स की आवश्यकता होती है (ओपनहैंड्स Docker अलगाव का उपयोग करता है); विफलता मोड में सैंडबॉक्स रनटाइम की अनुमति देने वाले कुछ भी शामिल हैं।

दोनों वास्तुकला उत्पादन में हैं। कोडएक्ट खुले प्लेटफार्मों (ओपनहैंड्स, स्मोलेजेन्ट) में हावी है। जेएसओएन टूल कॉल प्रबंधित सेवाओं (एथ्रोपिक मैनेज्ड एजेंट, ओपनएआई असिस्टेंट) में हावी रहते हैं जहां प्रदाता निष्पादक को नियंत्रित करता है।

2026 के परिदृश्य में स्टेफल्ड

ScaffoldLicenseExecution modelNotable property
OpenHands (OpenDevin)MITCodeAct in DockerMost active open platform; event-stream replayable
SWE-agentMITAgent-Computer Interface (ACI)First end-to-end SWE-bench scaffold
AiderApache-2edit-via-diff in local repoMinimal scaffold, strong regression stability
ClineApache-2VS Code agent with tool policyHighest-scoring open scaffold on Sonnet 4.5
Devin (Cognition)ProprietaryManaged VM + plannerFirst "AI software engineer" product category
Claude CodeProprietaryPermission modes + routinesLesson 10 covers the agent loop in detail

क्यों स्केफॉल्डिंग हावी है

एक कोडिंग रन एक लंबी क्षितिज की पटरियों (पढ़ना 1) है। कदमों के पार विश्वसनीयता यौगिक। तीन स्थान जहां स्केफॉल्डिंग अंक खरीदता हैः

  1. RetrievalSWE एजेंट की ACI, OpenHands की फ़ाइल सूचकांक, और Aider के रेपो-मैप सभी इस पर हमला करते हैं।
  2. Verifier loop: परीक्षण चलाने, स्टैक के निशान पढ़ने, और फिर से प्रयास करने के लिए 10+ बिंदु डेल्टा SWE-बेंच पर है।
  3. Failure containmentएक ही मॉडल के साथ और बिना एक सत्यापन लूप दो अलग-अलग उत्पादों की तरह दिखता है।

बेंचमार्क संतृप्ति और वास्तविक वितरण

ओपनहैंड्स के लेखकों और ईपोक एआई दोनों ने कहा कि एसवीई-बेंच सत्यापित में एक आसान पूंछ हैः 500 कार्यों में से 161 को केवल 12 बदलाव लाइनों की आवश्यकता होती है। उच्च स्कोर आंशिक रूप से इस पूंछ से प्रेरित होते हैं। एसवीई-बेंच प्रो 10+ लाइन परिवर्तनों तक सीमित करता है और सीमावर्ती प्रणालियों के लिए भी 2359% रेंज में स्कोर देता है। आपका उत्पादन वितरण लगभग निश्चित रूप से सत्यापित की तुलना में प्रो के करीब है।

एजेंट चुनने के लिए प्रभावः अपने स्वयं के बग बैकलॉग का एक प्रो-जैसा उपसमूह चलाएं। जो अंक मायने रखता है वह आपके द्वारा भेजे गए कार्यों पर अंक है।

इसका प्रयोग करें

code/main.pyएक निश्चित मिनी-कार्य वितरण पर दो खिलौना एजेंट स्टफल्ड की तुलना करता हैः

  1. ए JSON tool-callएक पलटाव पर एक कार्रवाई करने वाला एक मंच।
  2. ए CodeActएक मंच है कि प्रति कार्रवाई एक छोटे से पायथन स्निपेट जारी कर सकते हैं.

दोनों एक स्टब "मॉडल" (निर्धारक नियम) का उपयोग करते हैं ताकि तुलना मॉडल गुणवत्ता से स्केफॉल्ड को अलग कर दे। आउटपुट से पता चलता है कि CodeAct स्केफॉल्ड प्रति कार्रवाई बड़े विस्फोट त्रिज्या की लागत से कम मोड़ में अधिक कार्य हल करता है।

इसे भेजें

outputs/skill-scaffold-audit.mdआपको अपनाए जाने से पहले एक प्रस्तावित कोडिंग एजेंट स्टैफल्ड का ऑडिट करने में मदद करता हैः निकासी की गुणवत्ता, सत्यापितकर्ता उपस्थिति, सैंडबॉक्स अलगाव और बेंचमार्क-टू-डिस्ट्रीब्यूशन फिट।

व्यायाम

  1. दौड़ेंcode/main.pyएक ही कार्य सेट पर प्रत्येक स्केफॉल्ड कितने मोड़ लेता है? प्रत्येक के प्रति कार्रवाई विस्फोट त्रिज्या क्या है?
  1. OpenHands पेपर पढ़ें (arXiv:2407.16741). पेपर का तर्क है कि जटिल कार्यों पर JSON टूल कॉल से CodeAct बेहतर है। एक विफलता मोड की पहचान करें जिसे पेपर स्वीकार करता है और एक वाक्य लिखें जब उस मोड में उत्पादन में हावी होगा।
  1. अपनी बग बैकलॉग से एक कार्य चुनें जिसमें दो फ़ाइलों में परिवर्तन की 10+ पंक्तियों की आवश्यकता होगी। (ए) JSON टूल कॉल और (बी) CodeAct के तहत सीमा मॉडल के लिए अंत-से-अंत सफलता की संभावना का अनुमान लगाएं। अंतर को सही ठहराएं।
  1. SWE-bench Verified में 161 एकल-फ़ाइल, 12 लाइन कार्यों है। एक स्कोर बनाएं जो उन्हें बाहर करता है। रैंकिंग बोर्ड कैसे मिलाता है?
  1. "SWE-bench Verified" (OpenAI) को पढ़िए। अस्पष्ट कार्यों को हटाने के लिए उपयोग की जाने वाली विशिष्ट पद्धति की व्याख्या करें, और एक श्रेणी का नाम दें जिसे क्यूरेशन याद करेगा।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
SWE-bench"Coding benchmark"Real GitHub issues with ground-truth patches and test suites
SWE-bench Verified"Cleaned subset"500 human-curated tasks, easier-tail present
SWE-bench Pro"Harder subset"10+ line changes; frontier sits at 23–59%
CodeAct"Code-as-action"Agent emits Python; Jupyter-style kernel executes in sandbox
JSON tool call"Function calling"Each action is a structured JSON payload validated before execution
Scaffold"Agent framework"Retrieval + planner + executor + verifier loop around the base model
ACI (Agent-Computer Interface)"SWE-agent's format"Command set designed for LLM ergonomics, not human shells
Verifier loop"Test-and-retry"Run tests, read output, revise patch; biggest non-model reliability gain

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.