Phase 14: Agent Engineering

شاخص های استاندارد: WebArena و OSWorld

WebArena توانایی آژانس وب را در چهار برنامه میزبان خود آزمایش می کند. OSWorld قابلیت آژانس کامپیوتری را در Ubuntu، Windows، macOS آزمایش می کند. در انتشار (20232024) هر دو شکاف بزرگی بین بهترین آژانس های کلاس و انسان را نشان می دهند. شکاف در حال کاهش است. حالت شکست تغییر نکرده است.

Type: Learn

Languages: Python (stdlib)

Prerequisites: Phase 14 · 19 (SWE-bench, GAIA)

Time: ~60 minutes

اهداف یادگیری

  • چهار برنامه خود میزبان WebArena را توصیف کنید و چرا ارزیابی مبتنی بر اجرای مهم است.
  • توضیح دهید که چرا OSWorld از عکس های صفحه اصلی OS به جای API دسترسی استفاده می کند.
  • دو حالت اصلی OSWorld را نام ببرید: زمین سازی GUI و دانش عملیاتی.
  • خلاصه کنید که OSWorld-G و OSWorld-Human چه چیزی را علاوه بر معیار پایه اضافه می کنند.

مشکل

آیا می توانند یک جعبه لینوکس را با استفاده از فقط صفحه کلید و ماوس پیکربندی کنند؟ این پرسش های WebArena و OSWorld است.

مفهوم

WebArena (Zhou و همکارانش، ICLR 2024)

  • 812 کار افق دراز در چهار برنامه وب خود میزبان: یک سایت خرید، یک انجمن، یک ابزار توسعه مانند GitLab، یک CMS کسب و کار.
  • و ابزارها: نقشه، ماشین حساب، سکرتچپد
  • ارزیابی از طریق APIs ورزشی مبتنی بر اجرای است آیا سفارش داده شده است، آیا مسئله بسته شده است، آیا صفحه CMS به روز شده است؟
  • در زمان انتشار: بهترین عامل GPT-4 موفق شد 14.41% در مقابل انسان 78.24%.

چارچوب های خود میزبان مهم است معیار فلیکی نیست زیرا برنامه های هدف گیر شده و قابل بازیافت هستند.

گسترش

  • VisualWebArena وظایف مبتنی بر بصری که موفقیت آن بستگی به تفسیر تصاویر دارد (اسکرین شاټ ها به عنوان مشاهدات درجه اول).
  • TheAgentCompany(دسامبر 2024) اضافه می کند ترمینال + کدینگ؛ بیشتر شبیه یک محیط کار از راه دور واقعی است.

OSWorld (Xie و همکارانش، NeurIPS 2024)

  • 369 کار واقعی کامپیوتر در Ubuntu، Windows، macOS.
  • کنترل صفحه کلید و ماوس در قالب آزاد برنامه های واقعی
  • 1920×1080 عکس صفحه نمایش به عنوان مشاهده
  • در زمان انتشار: بهترین مدل 12.24% در مقابل انسان 72.36%.

حالت های شکست اصلی

  1. GUI grounding.نقشه برداری پکسل → عنصر. مدل ها برای محوطه سازی عناصر UI به طور قابل اعتماد در 1920 × 1080 تلاش می کنند.
  2. Operational knowledge.کدام منو تنظیمات، کدام میانبر کیبورد، کدام صفحه ترجیحات دارد.

پیگیری

  • OSWorld-G 564 نمونه سويت زير زمين + مجموعه آموزش جادي. زير زمين از برنامه ريزي را تجزیه مي کند تا شما بتونيد آنها را به طور جداگانه اندازه بگيريد.
  • OSWorld-Human مسیرهای عمل طلا را که به صورت دستی انتخاب شده است نشان می دهد که عوامل برتر از اندازه لازم 1.4-2.7 برابر قدم بیشتری را استفاده می کنند (فرق تراکتوری-کارایی).

چرا این مهم است

کلاود استفاده از کامپیوتر، OpenAI CUA، Gemini 2.5 استفاده از کامپیوتر (درسی 21) همه در بارهای کاری شکل داده شده توسط WebArena و OSWorld آموزش می دهند. معیارها هدف هستند؛ مدل های تولید پاسخ ارسال شده هستند.

جایی که مقایسه اشتباه می شود

  • Screenshot-only evals.OSWorld با عکس های صفحه نمایش هدایت می شود؛ ارزیابی یک عامل که از DOM یا API دسترسی در OSWorld استفاده می کند، چالش زمین را از دست می دهد.
  • Ignoring trajectory length.نمره گرفتن فقط نرخ موفقیت از ناکارآمدی مرحله ای 1.4-2.7x سطح OSWorld-Human را از دست می دهد.
  • Stale self-hosted apps.برنامه های WebArena نسخه های خاص را پین می کنند؛ به روز رسانی بدون تکرار قابلیت مقایسه را شکسته است.

آن را بسازید

code/main.pyیک آرمینش بازیابی وب-آژانت را اجرا می کند:

  • یک دستگاه حداقل "آپ خرید": لیست_آمورکی، add_to_cart، چک کردن.
  • مسیرهای طلا برای سه وظیفه
  • يه مامور با اسکریپت که هر کاري رو انجام ميده
  • ارزیابی مبتنی بر اجرای (تحقق دولت) و متریک بهره وری مسیر (خطوات در مقابل طلا).

اجرا کن

python3 code/main.py

تولید: نرخ موفقیت در هر کار و بهره وری مسیر، که از روش OSWorld-Human منعکس می شود.

ازش استفاده کن

  • WebArena Verifiedخود میزبان در یک خوشه داخلی برای ارزیابی مداوم.
  • OSWorldدر یک ناوگان VM برای ماموران دسکتاپ
  • Computer-use agents(درسی 21) کلود، اوپن ای ای سی یو، جمینی همه در این باره آموزش دیده اند.
  • Your own product flows مسیرهای طلا را برای ۲۰ وظیفه اصلی تان ضبط کنید؛ هر هفته مامورین را در برابر آنها اجرا کنید.

-باده

outputs/skill-web-desktop-harness.mdیک ابزار عامل وب/دسکتاپ با ارزیابی مبتنی بر اجرای و متریک بهره وری مسیر ایجاد می کند.

تمرینات

  1. با یک اپلیکیشن دوم (فورم) ، آرک بازی را گسترش دهید. 3 کار و مسیرهای طلایی را بنویسید.
  2. به گزارش بهره وری مسیر در هر کار اضافه کنید. در اسباب بازی شما، عامل 1x، 2x، یا 3x بر طلا؟
  3. استفاده از ابزار "مشترک" که مسیر طلا هرگز از آن استفاده نمی کند. آیا عامل متن شده وسوسه می شود؟
  4. OSWorld-G رو بخونيد چطوري شکست هاي زمين سازي رو از شکست هاي برنامه ريزي در ارزیابی هاي خودتون جدا ميکنيد؟
  5. برنامه های WebArena README را بخوانید. وقتی یکی از نسخه های برنامه های گیر شده را ارتقا دهید چه شکاف هایی ایجاد می شود؟

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
WebArena"Web agent benchmark"812 tasks across 4 self-hosted apps; gym-style evaluation
VisualWebArena"Visual WebArena"Visually grounded WebArena; screenshots are observations
OSWorld"Desktop agent benchmark"369 tasks on real Ubuntu/Windows/macOS
GUI grounding"Pixel-to-element mapping"Model localizing UI elements in 1920x1080
Operational knowledge"OS know-how"Which menu, which shortcut, which preference pane
OSWorld-G"Grounding suite"564 grounding-only samples + training set
OSWorld-Human"Gold trajectories"Manual expert action sequences to measure efficiency
Trajectory efficiency"Steps over gold"Agent step count divided by human minimum

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.