المقاييس: WebArena و OSWorld
Type: Learn
Languages: Python (stdlib)
Prerequisites: Phase 14 · 19 (SWE-bench, GAIA)
Time: ~60 minutes
أهداف التعلم
- وصف أربعة تطبيقات WebArena التي تستضيف نفسها ولماذا التقييم القائم على التنفيذ مهم.
- شرح لماذا تستخدم OSWorld صور شاشة نظام التشغيل الحقيقية بدلاً من APIs الوصول.
- أسمائ وضعين أساسيين للفشل في OSWorld: إرساء واجهة التشغيل (GUI) والمعرفة التشغيلية.
- قم بإخلاصة ما تضيفه OSWorld-G و OSWorld-Human فوق المعيار المرجعي الأساسي.
المشكلة
يمكن لوكلاء المعماريين استدعاء الأدوات. هل يمكنهم تشغيل متصفح عبر 20 نقرة لإكمال عملية التسوق؟ هل يمكنهم تكوين مربع لينكس باستخدام لوحة مفاتيح ومواوس فقط؟ هذه هي الأسئلة التي يجيبها ويبارينا و OSWorld.
المفهوم
ويب آرينا (زوه وزملاءه، ICLR 2024)
- 812 مهمة طويلة الأفق عبر أربعة تطبيقات ويب مضيفة ذاتيا: موقع تسوق، منتدى، أداة تطوير مثل GitLab، CMS الأعمال.
- بالإضافة إلى المرافق: خريطة، آلة الحاسبة، ورقة الحفر.
- التقييم يقوم على تنفيذها عبر APIs رياضية هل تم وضع الطلب ، هل تم إغلاق القضية ، هل تم تحديث صفحة CMS؟
- عند الإفراج: أفضل عامل GPT-4 حقق 14.41% نجاح مقابل البشر 78.24%.
الإطار المضمن الذاتي مهم لا يكون المعيار متضارب لأن التطبيقات المستهدفة محمولة ويمكن إعادة تكوينها.
التوسع
- VisualWebArena مهام ذات أساس بصري حيث يعتمد النجاح على تفسير الصور (صور الشاشة كلاحظات من الدرجة الأولى).
- TheAgentCompany(ديسمبر 2024) يضيف المحطة + التشفير؛ أكثر تشبه بيئة عمل عن بعد حقيقية.
OSWorld (Xie et al., NeurIPS 2024)
- 369 مهمة كمبيوتر حقيقية عبر أوبونتو و ويندوز و ماكوس
- التحكم في لوحة المفاتيح والفأر في التطبيقات الحقيقية
- صور شاشة 1920×1080 كملاحظة
- عند الإفراج: أفضل نموذج 12.24% مقابل البشر 72.36%.
أساليب الفشل الأساسية
- GUI grounding.خريطة العناصر في Pixel → العناصر. النماذج تكافح لتحديد موقع عناصر UI بشكل موثوق في 1920 × 1080.
- Operational knowledge.أي قائمة لديها الإعدادات، أي شاركت لوحة المفاتيح، أي شريحة الاختيارات. ذيل المعرفة التي يبنيها البشر على مر السنين.
المتابعات
- OSWorld-Gمجموعة 564 عينة من أرضيات + مجموعة تدريب الجيداي. يفكك أرضيات من التخطيط حتى تتمكن من قياسها بشكل منفصل.
- OSWorld-Human مسارات العمل الذهبية المنتجة يدوياً. تظهر وكلاء الأعلى استخدام 1.4-2.7x أكثر من الخطوات اللازمة (فجوة المسار-فعالية).
لماذا هذا مهم
استخدام الكمبيوتر كلود، OpenAI CUA، Gemini 2.5 استخدام الكمبيوتر (دروس 21) جميعها تدرب على عبء عمل تشكلت من قبل WebArena و OSWorld.
حيث يذهب التقييم الموازي بشكل خاطئ
- Screenshot-only evals.يُقود OSWorld على شاشة؛ وتفوت تقييم وكيل يستخدم DOM أو APIs الوصول على OSWorld تحدي الأرض.
- Ignoring trajectory length.تسجيل النجاح فقط يفتقر إلى 1.4-2.7x عدم كفاءة خطوة OSWorld- البشر السطحات.
- Stale self-hosted apps.تطبيقات ويبارينا تعتمد على نسخ محددة؛ التحديث دون إعادة التكريم يفسد المقارنة.
بناءها
code/main.pyيضع جهاز ألعاب الويب:
- آلة الحالة "تطبيق التسوق" الحد الأدنى: list_items، add_to_cart، checkout.
- مسارات ذهبية لثلاث مهام
- عميل مكتوب يحاول كل مهمة
- المقياس القائم على التنفيذ (تحقق الحكومة) ومقياس كفاءة المسار (خطوات مقابل الذهب).
إشغله
python3 code/main.pyالناتج: معدل نجاح كل مهمة وكفاءة المسار، مما يعكس منهجية OSWorld-Human.
استخدمها
- WebArena Verifiedيتم استضافة نفسها على مجموعة داخلية للتقييم المستمر.
- OSWorldفي أسطول VM لعاملين سطح المكتب.
- Computer-use agents(دروس 21) كلود، OpenAI CUA، جيميني كلّهم مدربون على عبء عمل كهذا.
- Your own product flows-القبض على مسارات الذهب لـ 20 مهمة مهمة؛ إدارة العملاء ضدهم أسبوعياً.
أرسله
outputs/skill-web-desktop-harness.mdيُبني حزمة وكيل الويب / المكتب مع قياسات كفاءة التنفيذ والمسار القائمة على التنفيذ.
التمارين
- قم بتوسيع حزمة الألعاب مع تطبيق آخر (منتدى) ، وكتب 3 مهام بالإضافة إلى مسارات ذهبية.
- إضافة تقارير كفاءة المسار لكل مهمة على لعبةك، هل العامل 1x، 2x، أو 3x على الذهب؟
- تنفيذ أداة "مشتت" لا تستخدمها مسار الذهب. هل الوكيل المخطط يُغري؟
- كيف ستفصل فشل التأمين عن فشل التخطيط في تقييماتك الخاصة؟
- اقرأ تطبيقات ويب آرينا قراءة ما الذي ينتهي عندما تقوم بتحديث إحدى إصدارات التطبيقات المثبتة؟
الشروط الرئيسية
| Term | What people say | What it actually means |
|---|---|---|
| WebArena | "Web agent benchmark" | 812 tasks across 4 self-hosted apps; gym-style evaluation |
| VisualWebArena | "Visual WebArena" | Visually grounded WebArena; screenshots are observations |
| OSWorld | "Desktop agent benchmark" | 369 tasks on real Ubuntu/Windows/macOS |
| GUI grounding | "Pixel-to-element mapping" | Model localizing UI elements in 1920x1080 |
| Operational knowledge | "OS know-how" | Which menu, which shortcut, which preference pane |
| OSWorld-G | "Grounding suite" | 564 grounding-only samples + training set |
| OSWorld-Human | "Gold trajectories" | Manual expert action sequences to measure efficiency |
| Trajectory efficiency | "Steps over gold" | Agent step count divided by human minimum |
المزيد من القراءة
- Zhou et al., WebArena (arXiv:2307.13854) مقياس شبكة الإنترنت لأربعة تطبيقات
- Xie et al., OSWorld (arXiv:2404.07972) مقياس سطح المكتب عبر نظام التشغيل
- Anthropic, Introducing computer use قدرة كلود على شكل مقياس
- OpenAI, Computer-Using Agent أرقام OSWorld و WebArena
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.