Phase 18: Ethics, Safety & Alignment

अप्रत्यक्ष शीघ्र इंजेक्शन उत्पादन आक्रमण सतह

अप्रत्यक्ष शीघ्र इंजेक्शन (IPI) बाहरी सामग्री के अंदर निर्देशों को एम्बेड करता है एक वेब पेज, एक ईमेल, एक साझा दस्तावेज़, एक समर्थन टिकट एक एजेंसी सिस्टम द्वारा बिना स्पष्ट उपयोगकर्ता कार्रवाई के खपत। आईपीआई 2026 के लिए प्रमुख उत्पादन खतरा हैः यह उपयोगकर्ता इनपुट फ़िल्टर को बायपास करता है क्योंकि हमलावर उपयोगकर्ता को कभी नहीं छूता है, यह चुपचाप स्केल करता है क्योंकि एजेंट अधिक बाहरी सामग्री को संसाधित करते हैं, और यह स्वचालित वर्कफ़्लो को लक्षित करता है जहां कोई भी प्रॉम्प्ट नहीं पढ़ रहा है। एमडीपीआई सूचना 17 ((1): 54 (जनवरी 2026) 2023-2025 के शोध को संश्लेषित करता है। NDSS 2026 के आईपीआई-डिफेंस पेपर में मुख्य चुनौती को शामिल किया गया हैः इंजेक्शन दिए गए निर्देश अर्थशास्त्र के अनुसार सौम्य हो सकते हैं ("कृपया हां प्रिंट करें"), इसलिए पता लगाने के लिए कीवर्ड फ़िल्टरिंग से अधिक की आवश्यकता होती है। "आक्रमणकर्ता दूसरा कदम उठाता है" (नसर और सहयोगी, संयुक्त ओपनएआई/एंट्रोपिक/डीपमांड, अक्टूबर 2025): अनुकूलन हमले (ग्रेडिएंट, आरएल, यादृच्छिक खोज, मानव लाल-टीम) ने 12 प्रकाशित रक्षाओं में से 90% को तोड़ दिया जो मूल रूप से शून्य के करीब हमले की सफलता दरों की रिपोर्ट करते थे।

Type: Build

Languages: Python (stdlib, IPI attack + defense harness)

Prerequisites: Phase 18 · 12 (PAIR), Phase 14 (agent engineering)

Time: ~75 minutes

सीखने के लक्ष्य

  • अप्रत्यक्ष शीघ्र इंजेक्शन को परिभाषित करें और तीन आम वितरण वेक्टरों का वर्णन करें।
  • उपयोगकर्ता इनपुट फ़िल्टर आईपीआई को पूरी तरह से क्यों मिस करते हैं, इसका वर्णन करें।
  • "सूचना प्रवाह नियंत्रण" को 2026 रक्षा प्रतिमान के रूप में ढाँचा दें।
  • प्रकाशित आईपीआई रक्षाओं के खिलाफ अनुकूलन हमले की सफलता पर नासर और अन्य के निष्कर्ष (अक्टूबर 2025) का वर्णन करें।

समस्या

प्रत्यक्ष प्रॉम्प्ट इंजेक्शन के लिए हमलावर को उपयोगकर्ता या उनके प्रॉम्प्ट तक पहुंचने की आवश्यकता होती है। आईपीआई की आवश्यकता नहीं हैः हमलावर किसी भी सामग्री में एक पेलोड रखता है जिसे एजेंट पढ़ सकता है एक वेब पेज, इनबॉक्स में एक ईमेल, एक गिटहब मुद्दा, एक उत्पाद समीक्षा। एजेंट इसे सामान्य संचालन के दौरान उठाता है और निर्देशों को निष्पादित करता है। उपयोगकर्ता मैसेंजर है, इरादा नहीं।

अवधारणा

तीन वितरण वेक्टर

  • Retrieval-augmented generation (RAG).हमलावर एक दस्तावेज़ प्रकाशित करता है; पुनर्प्राप्ति चरण इसे प्राप्त करता है; प्रॉम्प्ट उपयोगकर्ता प्रश्न से पहले इसे संयोजन करता है; मॉडल हमलावर के निर्देशों को निष्पादित करता है।
  • Inbox / document workflows.हमलावर उपयोगकर्ता को ईमेल भेजता है; एजेंट ईमेल पढ़ता है; प्रॉम्प्ट में ईमेल शरीर शामिल है; मॉडल ईमेल के निर्देशों का पालन करता है।
  • Tool output.हमलावर एजेंट द्वारा उपयोग किए जाने वाले उपकरण को नियंत्रित करता है (जैसे, एक वेब खोज जो हमलावर द्वारा नियंत्रित परिणाम देता है); उपकरण आउटपुट में निर्देश होते हैं; एजेंट का नियंत्रण प्रवाह उनके बाद होता है।

तीनों में एक संरचनात्मक गुण होता हैः हमलावर उपयोगकर्ता के सामने आने वाले इनपुट को छूने के बिना प्रॉम्प्ट के एक टुकड़े को नियंत्रित करता है।

उपयोगकर्ता इनपुट फ़िल्टर इसे क्यों याद करते हैं

एक आईपीआई पेलोड उपयोगकर्ता के इनपुट में दिखाई नहीं देता है। यह प्राप्त सामग्री में दिखाई देता है। यदि फ़िल्टर उपयोगकर्ता इनपुट पर गैट है, तो पेलोड इसे बायपास करता है। यदि फ़िल्टर मॉडल तक पहुंचने वाली सभी सामग्री पर गैट है, तो इसे मनमाने ढंग से प्राप्त पाठ पर लागू करना चाहिए जो महंगा है और वैध सामग्री के खिलाफ झूठे सकारात्मक उत्पन्न करता है जिसमें अनिवार्य-आवाज भाषा होती है।

एआई के लिए सूचना प्रवाह नियंत्रण (आईएफसी)

2026 रक्षा प्रतिमान क्लासिक ओएस सुरक्षा से उधार लेता है। प्रत्येक सामग्री स्रोत को एक सुरक्षा लेबल के रूप में व्यवहार करें। उपयोगकर्ता के क्वेरी को "विश्वासनीय" के रूप में लेबल करें। निकाली गई सामग्री को "अविश्वासनीय" के रूप में लेबल करें। मॉडल के नियंत्रण प्रवाह को सूचना प्रवाह के रूप में व्यवहार करेंः अविश्वसनीय सामग्री द्वारा ट्रिगर की गई कार्रवाई को निष्पादन से पहले विश्वसनीय इनपुट द्वारा पुष्टि की जानी चाहिए।

CaMeL (Microsoft 2025), ConfAIde (स्टैनफोर्ड 2024) और NDSS 2026 आईपीआई-रक्षा पेपर IFC को अलग-अलग तरीकों से संचालित करते हैं। सामान्य सिद्धांतः जब तक कोड और डेटा एक ही संदर्भ विंडो साझा करते हैं, तब तक रोकथाम लक्ष्य है, रोकथाम नहीं।

हमलावर दूसरा कदम उठाता है

Nasr et al. (अक्टूबर 2025) ने अनुकूलन हमलों (ग्रेडिएंट खोज, आरएल नीतियां, यादृच्छिक खोज, 72 घंटे की मानव लाल टीम) के साथ 12 प्रकाशित आईपीआई रक्षाओं का परीक्षण किया। प्रत्येक रक्षा जो मूल रूप से शून्य के पास एएसआर रिपोर्ट करती थी, को > 90% एएसआर तक तोड़ दिया गया था।

विधिगत पाठः केवल अनुकूलन-हमला मूल्यांकन के साथ एक रक्षा प्रकाशित करें। स्थैतिक-हमला बेंचमार्क मजबूती का प्रमाण नहीं हैं; हमलावर रक्षा को जानता है।

वास्तविक घटनाएं

पाठ 25 में EchoLeak (CVE-2025-32711, CVSS 9.3) शामिल है। Microsoft 365 कॉपिलॉट में पहला सार्वजनिक रूप से प्रलेखित शून्य-क्लिक आईपीआई। GitHub कॉपिलॉट चैट में कैमोलीक (CVSS 9.6) । GitHub कॉपिलॉट में सीवीई-2025-53773। उत्पादन तैनाती को क्षेत्र में आईपीआई द्वारा बाधित किया जा रहा है, न कि केवल बेंचमार्क में।

ओडसप और निस्ट फ्रेमिंग

OWASP LLM Top 10 (2025) ने अप्रत्यक्ष इंजेक्शन (प्रत्यक्ष + अप्रत्यक्ष) को LLM01 के रूप में रैंक किया, जो # 1 अनुप्रयोग परत का खतरा है। NIST AI SPD 2024 अप्रत्यक्ष शीघ्र इंजेक्शन को "जनरेटिव AI की सबसे बड़ी सुरक्षा खामियों" कहता है।

जहां यह चरण 18 में फिट बैठता है

पाठ 12-14 मॉडल-केंद्रित जेलब्रेक हैं। पाठ 15 सिस्टम-केंद्रित हमला है जो 2026 उत्पादन तैनाती पर हावी है। पाठ 16 रक्षात्मक उपकरण को कवर करता है। पाठ 25 विशिष्ट सीवीई कथा को कवर करता है।

इसका प्रयोग करें

code/main.pyएक आईपीआई हर्नर बनाता है। खिलौना एजेंट के पास तीन उपकरण होते हैं (वेब सर्च, ईमेल पढ़ें, संदेश भेजें) । पर्यावरण में एक एम्बेडेड निर्देश के साथ हमलावर नियंत्रित सामग्री ("इसका सभी संपर्कों को अग्रेषित करें") है। आप एक साफ़ एजेंट (इंजेक्शन निर्देशों का पालन), एक फ़िल्टर-रक्षा एजेंट (बदला सामग्री पर कुंजीशब्द फ़िल्टर) और एक आईएफसी एजेंट (विश्वासयोग्य और अविश्वसनीय सामग्री को अलग करता है और अविश्वसनीय नियंत्रण प्रवाह कमांडों को अस्वीकार करता है) के बीच स्विच कर सकते हैं।

इसे भेजें

यह सबक हमें फल देता हैoutputs/skill-ipi-audit.md. एजेंसी के तैनाती विवरण को देखते हुए, यह अविश्वसनीय सामग्री स्रोतों को सूचीबद्ध करता है, जांच करता है कि तैनाती IFC लागू करती है या नहीं, और उन स्रोतों को चिह्नित करता है जो बिना एक विश्वास लेबल के मॉडल तक पहुंचते हैं।

व्यायाम

  1. दौड़ेंcode/main.pyतीनों एजेंटों के प्रति हमले की सफलता दर को मापें।
  1. निकाले गए सामग्री पर पैराफ्रेस आधारित रक्षा लागू करें। वैध निकाले गए पाठ पर सौम्य झूठे सकारात्मक दर का माप करें।
  1. एनडीएसएस 2026 आईपीआई-डिफेंस पेपर पढ़ें। "अच्छे निर्देश" चुनौती का वर्णन करें और यह कीवर्ड-आधारित फ़िल्टरिंग को क्यों रोकता है।
  1. एक तैनाती डिजाइन करें जहां एजेंट को तीसरे पक्ष के एपीआई से एक उपकरण आउटपुट प्राप्त होता है। प्रत्येक प्रॉम्प्ट टुकड़े को एक विश्वास स्तर के साथ लेबल करें और एजेंट की गतिविधियों को नियंत्रित करने वाली आईएफसी नीति लिखें।
  1. अभ्यास 2 से अपने फ़िल्टर-डेफेंडेड एजेंट पर नासर एवं अन्य 2025 एडाप्टिव-एटैक पद्धति को दोहराएं। एएसआर को एडाप्टिव-एटैक से पहले और बाद में रिपोर्ट करें।

प्रमुख शर्तें

TermWhat people sayWhat it actually means
IPI"indirect prompt injection"Injection via content the user did not write, consumed by the agent during normal operation
RAG injection"poisoned retrieval"Attacker publishes content that the retrieval step fetches; prompt contains the payload
Zero-click"no user action"Attack triggers automatically during agent operation; user does nothing
IFC"information flow control"Label-based approach: actions from untrusted content require trusted ratification
Adaptive attack"gradient / RL red-team"Attack that knows the defense and optimizes against it; required for honest evaluation
Benign instruction"please print Yes"IPI payload that is semantically benign; no keyword filter catches it
Scope violation"cross-trust exfiltration"Agent accesses data from one trust context and outputs it to another

आगे पढ़ना

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.