Phase 14: Agent Engineering

बेंचमार्कः वेबएरेना और ओएसवर्ल्ड

WebArena ने चार स्वयं होस्ट किए गए ऐप्स में वेब एजेंट क्षमता का परीक्षण किया। OSWorld ने उबंटू, विंडोज, मैकओएस में डेस्कटॉप एजेंट क्षमता का परीक्षण किया। रिलीज (20232024) पर दोनों ने सर्वश्रेष्ठ-इन-क्लास एजेंटों और मनुष्यों के बीच एक बड़ा अंतर दिखाया। अंतर संकुचित हो रहा है; विफलता मोड नहीं बदले हैं।

Type: Learn

Languages: Python (stdlib)

Prerequisites: Phase 14 · 19 (SWE-bench, GAIA)

Time: ~60 minutes

सीखने के लक्ष्य

  • वेबएरेना के चार स्वयं होस्ट किए गए ऐप का वर्णन करें और निष्पादन आधारित मूल्यांकन महत्वपूर्ण क्यों है।
  • OSWorld पहुंच एपीआई के बजाय वास्तविक ओएस स्क्रीनशॉट का उपयोग क्यों करता है, समझाएं।
  • OSWorld के दो मुख्य विफलता मोडों का नाम देंः GUI ग्राउंडिंग और परिचालन ज्ञान।
  • मूल बेंचमार्क के शीर्ष पर ओएसवर्ल्ड-जी और ओएसवर्ल्ड-ह्यूमन क्या जोड़ते हैं, इसका सारांश दें।

समस्या

सामान्यवादी एजेंट उपकरण कॉल कर सकते हैं। क्या वे शॉपिंग चेकआउट को पूरा करने के लिए 20 क्लिक पर ब्राउज़र चला सकते हैं? क्या वे केवल कीबोर्ड और माउस का उपयोग करके लिनक्स बॉक्स को कॉन्फ़िगर कर सकते हैं? ये वेबएरेना और ओएसवर्ल्ड के सवालों के जवाब हैं।

अवधारणा

वेबएरेना (झोउ एट अल, आईसीएलआर 2024)

  • चार स्व-होस्ट किए गए वेब ऐप्स पर 812 लंबी दूरी के कार्यः एक शॉपिंग साइट, एक मंच, एक GitLab जैसे डेवलपमेंट टूल, एक बिजनेस सीएमएस।
  • और उपयोगिताओंः नक्शा, कैलकुलेटर, स्क्रैचपैड.
  • मूल्यांकन जिम एपीआई के माध्यम से निष्पादन पर आधारित है आदेश रखा गया था, मुद्दा बंद किया गया था, क्या सीएमएस पृष्ठ अद्यतन किया गया था?
  • रिलीज़ परः सर्वश्रेष्ठ जीपीटी-4 एजेंट ने 14.41% सफलता हासिल की, जबकि मानव 78.24%।

स्व-होस्ट किए गए फ्रेमिंग मायने रखता है बेंचमार्क फ्लेक नहीं है क्योंकि लक्ष्य ऐप पिन किए गए हैं और पुनः उत्पन्न हो सकते हैं।

विस्तार

  • VisualWebArena दृश्य आधारित कार्य जहां सफलता छवियों की व्याख्या पर निर्भर करती है (स्क्रीनशॉट प्रथम श्रेणी के अवलोकन के रूप में) ।
  • TheAgentCompany(डिसेम्बर 2024) टर्मिनल + कोडिंग जोड़ता है; अधिक एक वास्तविक दूरस्थ कार्य वातावरण की तरह।

OSWorld (Xie et al., NeurIPS 2024)

  • 369 वास्तविक कंप्यूटर कार्यों उबंटू, विंडोज, मैकओएस पर।
  • वास्तविक अनुप्रयोगों के मुक्त-रूप कीबोर्ड और माउस नियंत्रण।
  • 1920×1080 स्क्रीनशॉट के रूप में अवलोकन।
  • रिलीज़ परः सर्वश्रेष्ठ मॉडल 12.24% बनाम मानव 72.36%.

प्राथमिक विफलता मोड

  1. GUI grounding.पिक्सेल → तत्व मानचित्रण। मॉडल 1920×1080 में विश्वसनीय रूप से UI तत्वों को स्थानीयकृत करने के लिए संघर्ष करते हैं।
  2. Operational knowledge.किस मेनू में सेटिंग है, किस कीबोर्ड शॉर्टकट, किस वरीयता फ़लक में। ज्ञान पूंछ जो लोग वर्षों से बनाते हैं।

अनुवर्ती

  • OSWorld-G 564 नमूना ग्राउंडिंग सूट + जेडी प्रशिक्षण सेट। योजना से ग्राउंडिंग को तोड़ता है ताकि आप उन्हें अलग से माप सकें।
  • OSWorld-Human मैन्युअल रूप से संकलित सोने की कार्रवाई की पटरियों। शीर्ष एजेंटों को आवश्यक से 1.4-2.7 गुना अधिक कदम (पटरियों-कुशलता अंतर) का उपयोग दिखाता है।

यह क्यों मायने रखता है

क्लाउड कंप्यूटर उपयोग, ओपनएआई सीयूए, जेमिनी 2.5 कंप्यूटर उपयोग (पाठ 21) सभी वेबएरेना और ओएसवर्ल्ड द्वारा आकार दिए गए वर्कलोड पर प्रशिक्षित होते हैं। बेंचमार्क लक्ष्य हैं; उत्पादन मॉडल शिप किए गए उत्तर हैं।

जहां बेंचमार्किंग गलत हो जाता है

  • Screenshot-only evals.OSWorld स्क्रीनशॉट-चालित है; एक एजेंट का मूल्यांकन जो OSWorld पर DOM या पहुंच एपीआई का उपयोग करता है, ग्राउंडिंग चुनौती से चूक जाता है।
  • Ignoring trajectory length.केवल सफलता दर को स्कोर करने से ओएसवर्ल्ड-मानव सतहों की 1.4-2.7x कदम की अक्षमता गायब हो जाती है।
  • Stale self-hosted apps.वेबएरेना के ऐप विशिष्ट संस्करणों को पिन करते हैं; बिना पुनः क्यूरेशन किए अपडेट तुलनात्मकता को तोड़ता है।

इसे बनाओ

code/main.pyएक खिलौना वेब एजेंट हार्नेस लागू करता हैः

  • एक न्यूनतम "शॉपिंग ऐप" राज्य मशीनः सूची_आइटम, add_to_cart, चेकआउट।
  • 3 कार्यों के लिए सोने की पटरियों।
  • एक स्क्रिप्ट एजेंट जो हर कार्य का प्रयास करता है।
  • निष्पादन आधारित मूल्यांकनकर्ता (राज्य जांच) और प्रक्षेपवक्र-कुशलता मीट्रिक (चरण बनाम सोना) ।

इसे चलाओः

python3 code/main.py

आउटपुटः प्रति कार्य सफलता दर और प्रक्षेपवक्र दक्षता, OSWorld-Human की पद्धति को प्रतिबिंबित करना।

इसका प्रयोग करें

  • WebArena Verifiedनिरंतर मूल्यांकन के लिए एक आंतरिक समूह पर स्वयं होस्ट किया गया।
  • OSWorldडेस्कटॉप एजेंटों के लिए एक वीएम बेड़े में.
  • Computer-use agents(पाठ 21) क्लाउड, ओपनएआई सीयूए, मिथुन सभी को इस तरह के कार्यभार पर प्रशिक्षित किया गया।
  • Your own product flows अपने शीर्ष 20 कार्यों के लिए सोने के मार्गों को पकड़ें; उनके खिलाफ एजेंटों को साप्ताहिक रूप से चलाएं।

इसे भेजें

outputs/skill-web-desktop-harness.mdनिष्पादन आधारित मूल्यांकन और प्रक्षेपवक्र दक्षता मीट्रिक के साथ वेब/डेस्कटॉप एजेंट हर्नस का निर्माण करता है।

व्यायाम

  1. खेलौना हर्नर को दूसरे ऐप (फोरम) के साथ बढ़ाएं। 3 कार्य और सोने की पटरियों को लिखें।
  2. अपने खिलौना पर, एजेंट 1x, 2x, या 3x सोने से अधिक है?
  3. एक "विघटनकारी" उपकरण लागू करें एक सोने की प्रक्षेपवक्र कभी नहीं उपयोग करता है। क्या स्क्रिप्ट एजेंट को प्रलोभन मिलता है?
  4. ओएसवर्ल्ड-जी को पढ़ें आप अपने स्वयं के मूल्यांकन में योजना विफलताओं से जमीनीकरण विफलताओं को कैसे अलग करेंगे?
  5. वेबएरेना के ऐप्स पढ़ें README. जब आप एक pinned ऐप संस्करणों में से एक को अपग्रेड करते हैं तो क्या टूट जाता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
WebArena"Web agent benchmark"812 tasks across 4 self-hosted apps; gym-style evaluation
VisualWebArena"Visual WebArena"Visually grounded WebArena; screenshots are observations
OSWorld"Desktop agent benchmark"369 tasks on real Ubuntu/Windows/macOS
GUI grounding"Pixel-to-element mapping"Model localizing UI elements in 1920x1080
Operational knowledge"OS know-how"Which menu, which shortcut, which preference pane
OSWorld-G"Grounding suite"564 grounding-only samples + training set
OSWorld-Human"Gold trajectories"Manual expert action sequences to measure efficiency
Trajectory efficiency"Steps over gold"Agent step count divided by human minimum

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.