Phase 15: Autonomous Systems

ब्राउज़र एजेंट और लंबी दूरी के वेब कार्य

चैटजीपीटी एजेंट (जुलाई 2025) ने ऑपरेटर और गहन शोध को एक ब्राउज़र/टर्मिनल एजेंट में मिलाया और ब्राउज़कॉम्प SOTA को 68.9% पर सेट किया। ओपनएआई ने ऑपरेटर को 31 अगस्त 2025 को बंद कर दिया। एंथ्रोपिक के वर्सेप्ट अधिग्रहण ने ओएसवर्ल्ड पर क्लाउड सोनेट को 15% से नीचे से 72.5% तक ले जाया। वेबएरेना-वेरिफाइड (सर्विस नाउ, आईसीएलआर 2026) ने मूल वेबएरेना में 11.3 प्रतिशत अंक की झूठी-नकारात्मक दर तय की और 258-कार्य हार्ड उपसमूह को भेज दिया। संख्याएँ वास्तविक हैं। हमले की सतह भीः ओपनएआई के तैयारी के प्रमुख ने सार्वजनिक रूप से कहा कि ब्राउज़र एजेंटों में अप्रत्यक्ष शीघ्र इंजेक्शन "एक बग नहीं है जिसे पूरी तरह से ठीक किया जा सकता है।" दस्तावेज 20252026 हमलेः टेन्टेड मेमोरीज (एटलस सीएसआरएफ), हैशजैक (कैटो नेटवर्क), और एक क्लिक के साथ अपहरण में भ्रमित धूमकेतु।

Type: Learn

Languages: Python (stdlib, indirect prompt-injection attack surface model)

Prerequisites: Phase 15 · 10 (Permission modes), Phase 15 · 01 (Long-horizon agents)

Time: ~45 minutes

समस्या

ब्राउज़र एजेंट एक लंबी दूरी का एजेंट है जो अविश्वसनीय सामग्री पढ़ता है और इसके परिणामस्वरूप कार्रवाई करता है। एजेंट द्वारा देखे जाने वाले प्रत्येक पृष्ठ एक इनपुट है जिसे उपयोगकर्ता ने नहीं लिखा है। प्रत्येक पृष्ठ पर प्रत्येक फॉर्म एक संभावित कमांड चैनल है। 20252026 हमले कॉर्पस से पता चलता है कि यह परिकल्पना नहीं हैः टेंटेड मेमोरीज एक हमलावर को एक निर्मित पृष्ठ के माध्यम से एजेंट की स्मृति में दुर्भावनापूर्ण निर्देशों को बांधने देता है; हैशजैक एजेंट द्वारा देखे जाने वाले URL टुकड़ों में कमांड छिपाता है; भ्रम कॉमेट अपहरण एक क्लिक में हिट करता है।

रक्षा की तस्वीर असहज है। ओपनएआई के तैयारी के प्रमुख ने जोर से कहा कि चुपचाप भागः अप्रत्यक्ष शीघ्र इंजेक्शन "एक बग नहीं है जिसे पूरी तरह से ठीक किया जा सकता है।" यह इसलिए है क्योंकि हमला एजेंट की रीडिंग- बनाम-एक्टिंग सीमा में रहता है, जो वास्तुशिल्प रूप से धुंधला है।

यह पाठ हमले की सतह का नाम देता है, बेंचमार्क परिदृश्य का नाम देता है (ब्राउजकॉम्प, ओएसवर्ल्ड, वेबएरेना-वेरिफाइड), और एक न्यूनतम अप्रत्यक्ष-प्रोम्प्ट इंजेक्शन परिदृश्य का मॉडल बनाता है ताकि आप पाठ 14 और 18 में वास्तविक रक्षा के बारे में तर्क दे सकें।

अवधारणा

प्रति प्रणाली एक पैराग्राफ में 2026 परिदृश्य

ChatGPT agent (OpenAI).जुलाई 2025 में लॉन्च किया गया। ऑपरेटर (ब्राउजिंग) और डीप रिसर्च (बहु-घंटे का शोध) को एकीकृत करता है। 31 अगस्त, 2025 को स्टैंडअलोन ऑपरेटर को बंद कर दिया गया। ब्राउज़ कॉम्प पर SOTA 68.9% पर; ओएसवर्ल्ड और वेबएरेना-वेरिफाइड पर मजबूत संख्या।

Claude Sonnet + Vercept (Anthropic).एंथ्रोपिक के वर्सेप्ट अधिग्रहण ने कंप्यूटर उपयोग क्षमताओं पर ध्यान केंद्रित किया। ओएसवर्ल्ड पर क्लाउड सोनट को <15% से 72.5% तक ले जाया गया। क्लाउड कंप्यूटर उपयोग उपकरण एपीआई के रूप में जहाजों को स्थानांतरित करता है।

Gemini 3 Pro with Browser Use (DeepMind).ब्राउज़र उपयोग एकीकरण कंप्यूटर उपयोग नियंत्रण जहाजों; FSF v3 (अप्रैल 2026, पाठ 20) विशेष रूप से ML अनुसंधान और विकास डोमेन में स्वायत्तता ट्रैक करता है।

WebArena-Verified (ServiceNow, ICLR 2026).एक अच्छी तरह से प्रलेखित समस्या को ठीक करता हैः मूल वेबएरेना में ~11.3% झूठी नकारात्मक दर थी (कार्य जो वास्तव में हल किए गए थे वे विफल रहे थे) । सत्यापित रिलीज मानव-संरक्षित सफलता मानदंडों के साथ पुनः ग्रेड करता है और एक 258-कार्य हार्ड उपसमूह जोड़ता है (ICLR 2026 पेपर, openreview.net/forum?id=94tlGxmqkN) ।

ब्राउज़ कॉम्प बनाम ओएसवर्ल्ड बनाम वेबएरेना

BenchmarkWhat it measuresHorizon
BrowseCompFinding specific facts on the open web under time pressureminutes
OSWorldAgent operating a full desktop (mouse, keyboard, shell)tens of minutes
WebArena-VerifiedTransactional web tasks in simulated sitesminutes
Hard subsetWebArena-Verified tasks with multi-page state transitionstens of minutes

विभिन्न अक्ष। एक उच्च ब्राउज़ कॉम्प स्कोर कहता है कि एजेंट तथ्यों को ढूंढता है; यह नहीं कहता है कि एजेंट एक उड़ान बुक कर सकता है। ओएसवर्ल्ड स्कोर "क्या यह मेरे डेस्कटॉप पर काम करता है" के करीब है। वेबएरेना-वेरिफाइड "क्या यह एक प्रवाह को पूरा कर सकता है" के करीब है। किसी भी उत्पादन निर्णय को बेंचमार्क की आवश्यकता होती है जो कार्य वितरण से मेल खाता है।

हमला करने वाली सतह, जिसका नाम

  1. Indirect prompt injection.अविश्वसनीय पृष्ठ सामग्री में निर्देश होते हैं। एजेंट उन्हें पढ़ता है। एजेंट उन्हें निष्पादित करता है। सार्वजनिक उदाहरणः 2024 Kai Greshake et al., 2025 Tainted Memories पेपर, 2026 HashJack (Cato Networks) ।
  2. URL fragment / query injection.#fragmentया क्रॉल URL की क्वेरी स्ट्रिंग में कमांड होते हैं. कभी दिखाई नहीं दिया; अभी भी एजेंट के संदर्भ के भीतर.
  3. Memory-binding attacks.पेज एजेंट को एक स्थायी मेमोरी लिखने का निर्देश देता है (पाठ 12 में टिकाऊ स्थिति शामिल है) अगले सत्र में, मेमोरी बिना किसी दृश्य ट्रिगर के उपयोगिता लोड को चलाती है।
  4. CSRF-shaped attacks on authenticated sessions.दूषित स्मृति वर्गः एजेंट कहीं लॉग इन है; हमलावर के पृष्ठ में राज्य परिवर्तन अनुरोध जारी किए जाते हैं एजेंट उपयोगकर्ता के कुकीज़ के साथ निष्पादित करता है।
  5. One-click hijack.एक दृष्टि से हानिरहित बटन एक उपयोगी लोड पर सवारी एजेंट का पालन करता है।
  6. Content-Security-Policy holes in the agent's host surface.रेंडरिंग और टूल लेयर स्वयं हमले वेक्टर हो सकते हैं; ब्राउज़र-इन-ए-ब्राउजर-एजेंट स्टैक व्यापक है।

"पूरी तरह से पैच करने योग्य" क्यों नहीं

हमला एजेंट की क्षमता के लिए isomorphic है। एजेंट को अपना काम करने के लिए अविश्वसनीय सामग्री पढ़नी चाहिए। एजेंट द्वारा पढ़ी गई किसी भी सामग्री में निर्देश हो सकते हैं। एजेंट द्वारा दिए गए किसी भी निर्देश को उपयोगकर्ता के वास्तविक अनुरोध के साथ गलत तरीके से संरेखित किया जा सकता है। रक्षा (विश्वास सीमाएं, वर्गीकरणकर्ता, उपकरण अनुमतियों, परिणामात्मक कार्यों पर HITL) हमले की लागत को बढ़ाता है और इसके विस्फोट त्रिज्या को कम करता है। वे कक्षा बंद नहीं करते हैं।

यह लोब के प्रमेय (पढ़ना 8) के समान तर्क है: एजेंट अगले टोकन को सुरक्षित साबित नहीं कर सकता है; यह केवल एक ऐसी प्रणाली स्थापित कर सकता है जहां असुरक्षित टोकन अधिक पता लगाने योग्य हैं।

रक्षा मुद्रा जो वास्तव में जहाजों

  • Read / write boundary.पढ़ना कभी भी परिणाम नहीं होता है। लेखन (फॉर्म जमा करना, सामग्री पोस्ट करना, दुष्प्रभाव वाले उपकरण को कॉल करना) को नए मानव अनुमोदन की आवश्यकता होती है यदि प्रारंभ सामग्री विश्वास सीमा से बाहर से आई थी।
  • Tool allowlist per task.एजेंट ब्राउज़ कर सकता है; वह जब तक कि उस उपकरण को स्पष्ट रूप से कार्य के लिए सक्षम नहीं किया गया हो तब तक एक बैंकिंग हस्तांतरण शुरू नहीं कर सकता है। पाठ 13 बजट को कवर करता है।
  • Session isolation.ब्राउज़र एजेंट सत्र केवल स्कोप क्रेडेंशियल के साथ चलाया जाता है. कोई उत्पादन लेखक, कोई व्यक्तिगत ईमेल नहीं. हर HTTP अनुरोध का लॉग लेखा परीक्षा के लिए संग्रहीत किया जाता है.
  • Content sanitizer.लटकाए गए HTML को मॉडल संदर्भ में संयोजन करने से पहले ज्ञात-बुरे पैटर्न से हटा दिया जाता है। (आसान हमलों को कम करता है; परिष्कृत उपयोगिता लोड को नहीं रोकता है) ।
  • HITL on consequential actions.प्रस्ताव-फिर-कार्य-आधारित पैटर्न (पाठ 15)
  • Canary tokens on memory.यदि कोई मेमोरी प्रविष्टि आग लगती है, तो उपयोगकर्ता इसे देखता है (पाठ 14) ।

इसका प्रयोग करें

code/main.pyएक पृष्ठ सौम्य है, एक में दृश्यमान पाठ में प्रत्यक्ष प्रॉम्प्ट-इंजेक्शन ब्लाब है, एक में यूआरएल-फ्रेगमेंट इंजेक्शन (जो दृश्यमान नहीं है लेकिन एजेंट के संदर्भ के भीतर है) है। स्क्रिप्ट दिखाता है (ए) एक भोले एजेंट क्या करेगा, (बी) एक पढ़ें / लिखें सीमा क्या पकड़ता है, (सी) एक सैनिटाइजर क्या पकड़ता है, (डी) क्या कोई भी पकड़ता है।

इसे भेजें

outputs/skill-browser-agent-trust-boundary.mdएक प्रस्तावित ब्राउज़र-एजेंट तैनाती के दायरेः यह किस विश्वास क्षेत्रों को छूता है, इसे लिखने के लिए अधिकृत किया जाता है, और जो रक्षा पहले रन से पहले जगह में होना चाहिए।

व्यायाम

  1. दौड़ेंcode/main.py. पहचानें कि किस हमले में सैनिटाइजर पकड़ता है लेकिन पढ़ने/लिखने की सीमा नहीं, और कौन केवल पढ़ने/लिखने की सीमा पकड़ता है।
  1. हशजैक शैली के यूआरएल-फ्रागमेंट इंजेक्शन के एक वर्ग का पता लगाने के लिए सैनिटाइजर का विस्तार करें। वैध टुकड़ों के साथ सौम्य यूआरएल पर झूठी सकारात्मक दर मापें।
  1. एक वास्तविक ब्राउज़र एजेंट वर्कफ़्लो चुनें जिसे आप जानते हैं (जैसे, "एक उड़ान बुक करें") प्रत्येक पढ़ने और हर लिखने की सूची बनाएं। जो लिखता है उसे HITL की आवश्यकता है और क्यों।
  1. वेबएरेना- सत्यापित आईसीएलआर 2026 पेपर पढ़ें। एक श्रेणी के कार्य की पहचान करें जहां मूल वेबएरेना का स्कोरिंग अविश्वसनीय था और समझाएं कि सत्यापित उपसमूह इसे कैसे हल करता है।
  1. ब्राउज़र एजेंट सेटिंग के लिए मेमोरी कैनरी डिज़ाइन करें। आप क्या स्टोर करेंगे, कहां, और अलार्म को क्या ट्रिगर करता है?

प्रमुख शर्तें

TermWhat people sayWhat it actually means
Indirect prompt injection"Bad page text"Untrusted content in a page the agent reads contains instructions the agent executes
Tainted Memories"Memory attack"Agent writes an attacker-supplied instruction to durable memory; triggered next session
HashJack"URL fragment attack"Payload hidden in URL fragment / query string is in the agent's context but not visibly rendered
One-click hijack"Bad button"Visible affordance rides a follow-on payload the agent executes
BrowseComp"Web search benchmark"Finding specific facts on the open web; minute-scale horizon
OSWorld"Desktop benchmark"Full OS control; multi-step GUI tasks
WebArena-Verified"Fixed web-task benchmark"ServiceNow's regraded WebArena with Hard subset
Read/write boundary"Side-effect gate"Reading never consequential; writing requires fresh approval if content is out-of-trust

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.