ब्राउज़र एजेंट और लंबी दूरी के वेब कार्य
Type: Learn
Languages: Python (stdlib, indirect prompt-injection attack surface model)
Prerequisites: Phase 15 · 10 (Permission modes), Phase 15 · 01 (Long-horizon agents)
Time: ~45 minutes
समस्या
ब्राउज़र एजेंट एक लंबी दूरी का एजेंट है जो अविश्वसनीय सामग्री पढ़ता है और इसके परिणामस्वरूप कार्रवाई करता है। एजेंट द्वारा देखे जाने वाले प्रत्येक पृष्ठ एक इनपुट है जिसे उपयोगकर्ता ने नहीं लिखा है। प्रत्येक पृष्ठ पर प्रत्येक फॉर्म एक संभावित कमांड चैनल है। 20252026 हमले कॉर्पस से पता चलता है कि यह परिकल्पना नहीं हैः टेंटेड मेमोरीज एक हमलावर को एक निर्मित पृष्ठ के माध्यम से एजेंट की स्मृति में दुर्भावनापूर्ण निर्देशों को बांधने देता है; हैशजैक एजेंट द्वारा देखे जाने वाले URL टुकड़ों में कमांड छिपाता है; भ्रम कॉमेट अपहरण एक क्लिक में हिट करता है।
रक्षा की तस्वीर असहज है। ओपनएआई के तैयारी के प्रमुख ने जोर से कहा कि चुपचाप भागः अप्रत्यक्ष शीघ्र इंजेक्शन "एक बग नहीं है जिसे पूरी तरह से ठीक किया जा सकता है।" यह इसलिए है क्योंकि हमला एजेंट की रीडिंग- बनाम-एक्टिंग सीमा में रहता है, जो वास्तुशिल्प रूप से धुंधला है।
यह पाठ हमले की सतह का नाम देता है, बेंचमार्क परिदृश्य का नाम देता है (ब्राउजकॉम्प, ओएसवर्ल्ड, वेबएरेना-वेरिफाइड), और एक न्यूनतम अप्रत्यक्ष-प्रोम्प्ट इंजेक्शन परिदृश्य का मॉडल बनाता है ताकि आप पाठ 14 और 18 में वास्तविक रक्षा के बारे में तर्क दे सकें।
अवधारणा
प्रति प्रणाली एक पैराग्राफ में 2026 परिदृश्य
ChatGPT agent (OpenAI).जुलाई 2025 में लॉन्च किया गया। ऑपरेटर (ब्राउजिंग) और डीप रिसर्च (बहु-घंटे का शोध) को एकीकृत करता है। 31 अगस्त, 2025 को स्टैंडअलोन ऑपरेटर को बंद कर दिया गया। ब्राउज़ कॉम्प पर SOTA 68.9% पर; ओएसवर्ल्ड और वेबएरेना-वेरिफाइड पर मजबूत संख्या।
Claude Sonnet + Vercept (Anthropic).एंथ्रोपिक के वर्सेप्ट अधिग्रहण ने कंप्यूटर उपयोग क्षमताओं पर ध्यान केंद्रित किया। ओएसवर्ल्ड पर क्लाउड सोनट को <15% से 72.5% तक ले जाया गया। क्लाउड कंप्यूटर उपयोग उपकरण एपीआई के रूप में जहाजों को स्थानांतरित करता है।
Gemini 3 Pro with Browser Use (DeepMind).ब्राउज़र उपयोग एकीकरण कंप्यूटर उपयोग नियंत्रण जहाजों; FSF v3 (अप्रैल 2026, पाठ 20) विशेष रूप से ML अनुसंधान और विकास डोमेन में स्वायत्तता ट्रैक करता है।
WebArena-Verified (ServiceNow, ICLR 2026).एक अच्छी तरह से प्रलेखित समस्या को ठीक करता हैः मूल वेबएरेना में ~11.3% झूठी नकारात्मक दर थी (कार्य जो वास्तव में हल किए गए थे वे विफल रहे थे) । सत्यापित रिलीज मानव-संरक्षित सफलता मानदंडों के साथ पुनः ग्रेड करता है और एक 258-कार्य हार्ड उपसमूह जोड़ता है (ICLR 2026 पेपर, openreview.net/forum?id=94tlGxmqkN) ।
ब्राउज़ कॉम्प बनाम ओएसवर्ल्ड बनाम वेबएरेना
| Benchmark | What it measures | Horizon |
|---|---|---|
| BrowseComp | Finding specific facts on the open web under time pressure | minutes |
| OSWorld | Agent operating a full desktop (mouse, keyboard, shell) | tens of minutes |
| WebArena-Verified | Transactional web tasks in simulated sites | minutes |
| Hard subset | WebArena-Verified tasks with multi-page state transitions | tens of minutes |
विभिन्न अक्ष। एक उच्च ब्राउज़ कॉम्प स्कोर कहता है कि एजेंट तथ्यों को ढूंढता है; यह नहीं कहता है कि एजेंट एक उड़ान बुक कर सकता है। ओएसवर्ल्ड स्कोर "क्या यह मेरे डेस्कटॉप पर काम करता है" के करीब है। वेबएरेना-वेरिफाइड "क्या यह एक प्रवाह को पूरा कर सकता है" के करीब है। किसी भी उत्पादन निर्णय को बेंचमार्क की आवश्यकता होती है जो कार्य वितरण से मेल खाता है।
हमला करने वाली सतह, जिसका नाम
- Indirect prompt injection.अविश्वसनीय पृष्ठ सामग्री में निर्देश होते हैं। एजेंट उन्हें पढ़ता है। एजेंट उन्हें निष्पादित करता है। सार्वजनिक उदाहरणः 2024 Kai Greshake et al., 2025 Tainted Memories पेपर, 2026 HashJack (Cato Networks) ।
- URL fragment / query injection.
#fragmentया क्रॉल URL की क्वेरी स्ट्रिंग में कमांड होते हैं. कभी दिखाई नहीं दिया; अभी भी एजेंट के संदर्भ के भीतर. - Memory-binding attacks.पेज एजेंट को एक स्थायी मेमोरी लिखने का निर्देश देता है (पाठ 12 में टिकाऊ स्थिति शामिल है) अगले सत्र में, मेमोरी बिना किसी दृश्य ट्रिगर के उपयोगिता लोड को चलाती है।
- CSRF-shaped attacks on authenticated sessions.दूषित स्मृति वर्गः एजेंट कहीं लॉग इन है; हमलावर के पृष्ठ में राज्य परिवर्तन अनुरोध जारी किए जाते हैं एजेंट उपयोगकर्ता के कुकीज़ के साथ निष्पादित करता है।
- One-click hijack.एक दृष्टि से हानिरहित बटन एक उपयोगी लोड पर सवारी एजेंट का पालन करता है।
- Content-Security-Policy holes in the agent's host surface.रेंडरिंग और टूल लेयर स्वयं हमले वेक्टर हो सकते हैं; ब्राउज़र-इन-ए-ब्राउजर-एजेंट स्टैक व्यापक है।
"पूरी तरह से पैच करने योग्य" क्यों नहीं
हमला एजेंट की क्षमता के लिए isomorphic है। एजेंट को अपना काम करने के लिए अविश्वसनीय सामग्री पढ़नी चाहिए। एजेंट द्वारा पढ़ी गई किसी भी सामग्री में निर्देश हो सकते हैं। एजेंट द्वारा दिए गए किसी भी निर्देश को उपयोगकर्ता के वास्तविक अनुरोध के साथ गलत तरीके से संरेखित किया जा सकता है। रक्षा (विश्वास सीमाएं, वर्गीकरणकर्ता, उपकरण अनुमतियों, परिणामात्मक कार्यों पर HITL) हमले की लागत को बढ़ाता है और इसके विस्फोट त्रिज्या को कम करता है। वे कक्षा बंद नहीं करते हैं।
यह लोब के प्रमेय (पढ़ना 8) के समान तर्क है: एजेंट अगले टोकन को सुरक्षित साबित नहीं कर सकता है; यह केवल एक ऐसी प्रणाली स्थापित कर सकता है जहां असुरक्षित टोकन अधिक पता लगाने योग्य हैं।
रक्षा मुद्रा जो वास्तव में जहाजों
- Read / write boundary.पढ़ना कभी भी परिणाम नहीं होता है। लेखन (फॉर्म जमा करना, सामग्री पोस्ट करना, दुष्प्रभाव वाले उपकरण को कॉल करना) को नए मानव अनुमोदन की आवश्यकता होती है यदि प्रारंभ सामग्री विश्वास सीमा से बाहर से आई थी।
- Tool allowlist per task.एजेंट ब्राउज़ कर सकता है; वह जब तक कि उस उपकरण को स्पष्ट रूप से कार्य के लिए सक्षम नहीं किया गया हो तब तक एक बैंकिंग हस्तांतरण शुरू नहीं कर सकता है। पाठ 13 बजट को कवर करता है।
- Session isolation.ब्राउज़र एजेंट सत्र केवल स्कोप क्रेडेंशियल के साथ चलाया जाता है. कोई उत्पादन लेखक, कोई व्यक्तिगत ईमेल नहीं. हर HTTP अनुरोध का लॉग लेखा परीक्षा के लिए संग्रहीत किया जाता है.
- Content sanitizer.लटकाए गए HTML को मॉडल संदर्भ में संयोजन करने से पहले ज्ञात-बुरे पैटर्न से हटा दिया जाता है। (आसान हमलों को कम करता है; परिष्कृत उपयोगिता लोड को नहीं रोकता है) ।
- HITL on consequential actions.प्रस्ताव-फिर-कार्य-आधारित पैटर्न (पाठ 15)
- Canary tokens on memory.यदि कोई मेमोरी प्रविष्टि आग लगती है, तो उपयोगकर्ता इसे देखता है (पाठ 14) ।
इसका प्रयोग करें
code/main.pyएक पृष्ठ सौम्य है, एक में दृश्यमान पाठ में प्रत्यक्ष प्रॉम्प्ट-इंजेक्शन ब्लाब है, एक में यूआरएल-फ्रेगमेंट इंजेक्शन (जो दृश्यमान नहीं है लेकिन एजेंट के संदर्भ के भीतर है) है। स्क्रिप्ट दिखाता है (ए) एक भोले एजेंट क्या करेगा, (बी) एक पढ़ें / लिखें सीमा क्या पकड़ता है, (सी) एक सैनिटाइजर क्या पकड़ता है, (डी) क्या कोई भी पकड़ता है।
इसे भेजें
outputs/skill-browser-agent-trust-boundary.mdएक प्रस्तावित ब्राउज़र-एजेंट तैनाती के दायरेः यह किस विश्वास क्षेत्रों को छूता है, इसे लिखने के लिए अधिकृत किया जाता है, और जो रक्षा पहले रन से पहले जगह में होना चाहिए।
व्यायाम
- दौड़ें
code/main.py. पहचानें कि किस हमले में सैनिटाइजर पकड़ता है लेकिन पढ़ने/लिखने की सीमा नहीं, और कौन केवल पढ़ने/लिखने की सीमा पकड़ता है।
- हशजैक शैली के यूआरएल-फ्रागमेंट इंजेक्शन के एक वर्ग का पता लगाने के लिए सैनिटाइजर का विस्तार करें। वैध टुकड़ों के साथ सौम्य यूआरएल पर झूठी सकारात्मक दर मापें।
- एक वास्तविक ब्राउज़र एजेंट वर्कफ़्लो चुनें जिसे आप जानते हैं (जैसे, "एक उड़ान बुक करें") प्रत्येक पढ़ने और हर लिखने की सूची बनाएं। जो लिखता है उसे HITL की आवश्यकता है और क्यों।
- वेबएरेना- सत्यापित आईसीएलआर 2026 पेपर पढ़ें। एक श्रेणी के कार्य की पहचान करें जहां मूल वेबएरेना का स्कोरिंग अविश्वसनीय था और समझाएं कि सत्यापित उपसमूह इसे कैसे हल करता है।
- ब्राउज़र एजेंट सेटिंग के लिए मेमोरी कैनरी डिज़ाइन करें। आप क्या स्टोर करेंगे, कहां, और अलार्म को क्या ट्रिगर करता है?
प्रमुख शर्तें
| Term | What people say | What it actually means |
|---|---|---|
| Indirect prompt injection | "Bad page text" | Untrusted content in a page the agent reads contains instructions the agent executes |
| Tainted Memories | "Memory attack" | Agent writes an attacker-supplied instruction to durable memory; triggered next session |
| HashJack | "URL fragment attack" | Payload hidden in URL fragment / query string is in the agent's context but not visibly rendered |
| One-click hijack | "Bad button" | Visible affordance rides a follow-on payload the agent executes |
| BrowseComp | "Web search benchmark" | Finding specific facts on the open web; minute-scale horizon |
| OSWorld | "Desktop benchmark" | Full OS control; multi-step GUI tasks |
| WebArena-Verified | "Fixed web-task benchmark" | ServiceNow's regraded WebArena with Hard subset |
| Read/write boundary | "Side-effect gate" | Reading never consequential; writing requires fresh approval if content is out-of-trust |
आगे पढ़ना
- OpenAI — Introducing ChatGPT agent ऑपरेटर और गहन अनुसंधान का विलय; BrowseComp SOTA।
- OpenAI — Computer-Using Agent ऑपरेटर वंश और वास्तुकला जो चैटजीपीटी एजेंट बन गया।
- Zhou et al. — WebArena मूल बेंचमार्क।
- WebArena-Verified (OpenReview) ICLR 2026 फिक्स्ड सबसेट पेपर।
- Anthropic — Measuring agent autonomy in practice कंप्यूटर उपयोग एजेंटों के लिए हमले की सतह चर्चा शामिल है।
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.