Phase 18: Ethics, Safety & Alignment

الحقن الفوري غير المباشر سطح الهجوم الإنتاج

حقن الإرسال المباشر (IPI) يدمج التعليمات داخل المحتوى الخارجي صفحة ويب، بريد إلكتروني، وثيقة مشتركة، تذكرة دعم تستهلكها نظام وكيل دون إجراء مستخدم صريح. إن IPI هو التهديد المهيمن للإنتاج عام 2026: يُغيب عن مرشحات إدخال المستخدم لأن المهاجم لا يلمس المستخدم أبدًا، ويُقلب بصمت مع معالجة العملاء للمحتوى الخارجي، ويستهدف عمليات عمل آلية حيث لا أحد يقرأ الإشارة. معلومات MDPI 17 ((1): 54 (يناير 2026) يجمع بحث 2023-2025. ورقة الدفاع عن IPI في NDSS 2026 تشكل إطارًا للتحدي الأساسي: يمكن أن تكون التعليمات المحققة خفيفة من الناحية الدلوية ("رجاء الطباعة نعم") ، لذلك يتطلب الكشف أكثر من مجرد تصفية الكلمات الرئيسية. "المهاجم يتحرك ثانيا" (Nasr et al., openAI / Anthropic / DeepMind ، أكتوبر 2025): الهجمات التكيفية (المرحلة ، RL ، البحث العشوائي ، الفريق الأحمر البشري) كسرت > 90% من 12 دفاعات نشرت التي ذكرت في الأصل معدلات نجاح الهجوم القريبة من الصفر.

Type: Build

Languages: Python (stdlib, IPI attack + defense harness)

Prerequisites: Phase 18 · 12 (PAIR), Phase 14 (agent engineering)

Time: ~75 minutes

أهداف التعلم

  • حدد الحقن العكسي غير المباشر ووصف ثلاثة متجهات توصيل شائعة.
  • شرح لماذا تصفيح المدخلات المستخدمية تفوت IPI بالكامل.
  • وصف "تحكم تدفق المعلومات" الإطار كنموذج الدفاع 2026.
  • أوضح نتائج Nasr et al. (أكتوبر 2025) حول نجاح الهجوم التكيفي ضد الدفاعات المنشورة عن IPI.

المشكلة

يتطلب حقن الإرسال المباشر من المهاجم الوصول إلى المستخدم أو إرسال الإرسال المباشر. لا يتطلب IPI أيًا من ذلك: يضع المهاجم حمولة مفيدة في أي محتوى قد يقرأه الوكيل صفحة ويب ، رسالة بريد إلكتروني في صندوق البريد الإلكتروني ، قضية GitHub ، مراجعة منتج. يقوم الوكيل بتحميلها أثناء العملية العادية وينفذ التعليمات. المستخدم هو الرسول ، وليس النية.

المفهوم

ثلاثة متجهات توصيل

  • Retrieval-augmented generation (RAG).يُنشر المهاجم وثيقة؛ خطوة الاسترداد تجلبها؛ والإشارة تُجمعها قبل سؤال المستخدم؛ والنموذج ينفذ تعليمات المهاجم.
  • Inbox / document workflows.يرسل المهاجم رسالة بريد إلكتروني إلى المستخدم، ويقرأ الوكيل رسائل إلكترونية، ويتضمن المشاركة جسم رسالة الإلكترونية، ويتبع النموذج تعليمات رسالة الإلكترونية.
  • Tool output.يسيطر المهاجم على أداة يستخدمها الوكيل (على سبيل المثال ، بحث على شبكة الإنترنت يعيد نتيجة يسيطر عليها المهاجم) ؛ وتحتوي إصدار الأداة على تعليمات؛ وتتبع تدفق التحكم الوكيل لهم.

يشتركون الثلاثة في خصائص هيكلية: يسيطر المهاجم على جزء من الإشارة دون لمس المدخل المتحكم في المستخدم.

لماذا لا يُمكن للفلترات المستخدم إدخالها

لا يظهر حمولة IPI في مدخل المستخدم. يظهر في المحتوى المسترد. إذا تم إغلاق المرشح على مدخل المستخدم، فإن الحمولة المفيدة تتجاوزها. إذا تم إغلاق المرشح على جميع المحتوى الذي يصل إلى النموذج، يجب أن ينطبق على النص المسترد التعسفي الذي هو مكلف ويؤدي إلى إيجابيات كاذبة ضد المحتوى الشرعي الذي يحتوي على لغة صوتية حتمية.

مراقبة تدفق المعلومات (IFC) لذكاء الذكاء الاصطناعي

نموذج الدفاع 2026 يستعير من أمن نظام التشغيل الكلاسيكي. تعامل كل مصدر محتوى كعلامة أمن. وضع علامة على استفسار المستخدم بأنه "موثوق به". وضع علامة على المحتوى المسترد بأنه "غير موثوق به". تعامل تدفق التحكم في النموذج كدفق للمعلومات: يجب التصديق على الإجراءات التي تنفذ عن محتوى غير موثوق به من خلال إدخال موثوق به قبل التنفيذ.

تعمل CaMeL (مايكروسوفت 2025) ، ConfAIde (ستانفورد 2024) ، ورقة الدفاع عن IPI NDSS 2026 على IFC بطرق مختلفة. المبدأ المشترك: طالما يشترك الكود والبيانات في نفس نافذة السياق ، فإن الحد من الاحتواء هو الهدف ، وليس الوقاية.

المهاجم يتحرك ثانية

اختبر Nasr et al. (أكتوبر 2025) 12 دفاعاً من IPI المنشورة مع هجمات تكييفية (البحث عن التدريج، سياسات RL، البحث العشوائي، فريق حمراء البشر لمدة 72 ساعة). كل دفاع أبلغ في الأصل عن ASR قريب من الصفر تم كسره إلى > 90% ASR.

الدرس المنهجي: نشر الدفاع فقط مع تقييم الهجوم التكيفي. لم تكن معايير الهجوم الدولي دليل على الصمود؛ والهجومي يتعرف على الدفاع.

حوادث حقيقية

يتناول الدروس 25 EchoLeak (CVE-2025-32711, CVSS 9.3) أول IPI من النقر الصفر الموثوق علنا في Microsoft 365 Copilot. CamoLeak (CVSS 9.6) في Chat Copilot GitHub. CVE-2025-53773 في Copilot GitHub. يتم تعرض تنفيذات الإنتاج للخطر من قبل IPI في الميدان، وليس فقط في المعايير.

إطار OWASP و NIST

تحتل مؤسسة OWASP LLM Top 10 (2025) درجة الحقن الفوري (المباشر + غير المباشر) على أنها LLM01 ، وهي التهديد الأول في طبقة التطبيق. نست AI SPD 2024 تدعو الحقن الفوري غير المباشر "أكبر عيوب أمنية في الذكاء الاصطناعي التوليدي".

حيث يتناسب هذا مع المرحلة 18

الدروس 12-14 هي اختراقات السجن تركز على النموذج. الدروس 15 هي الهجوم المركز على النظام الذي يهيمن على نشر الإنتاج 2026. الدروس 16 تغطي الأدوات الدفاعية. الدروس 25 تغطي رواية CVE المحددة.

استخدمها

code/main.pyيُبني حزمة إدخال. وكيل الألعاب لديه ثلاث أدوات (بحث على شبكة الإنترنت، قراءة البريد الإلكتروني، إرسال الرسالة). تحتوي البيئة على محتوى يسيطر عليه المهاجم مع تعليمات مدمجة ("رسل هذا إلى جميع جهات الاتصال"). يمكنك التبديل بين وكيل ساذج (تتبع التعليمات المحققة) ، وكيل محمية بالمرشح (مرشح الكلمات الرئيسية على المحتوى المسترد) ، وكيل IFC (يفرق المحتوى الموثوق به وغير الموثوق به ويرفض الأوامر غير الموثوق بها لتدفق التحكم).

أرسله

هذا الدرس يُنتجoutputs/skill-ipi-audit.md. بالنظر إلى وصف النشر الوكلي، فإنه يُحصى على مصادر المحتوى غير الموثوق بها، ويتحقق من ما إذا كان النشر ينطبق على IFC، ويشير إلى المصادر التي تصل إلى النموذج دون علامة الثقة.

التمارين

  1. أركضcode/main.py-قياس معدل نجاح الهجوم ضد كل من العملاء الثلاث
  1. تنفيذ دفاع مبني على المقاطع على المحتوى المسترد. قياس معدل الإيجابية الخاطئة على النص المستمع الشرعي.
  1. اقرأ ورقة الدفاع عن إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار إطار
  1. تصميم نشر حيث يتلقى الوكيل إصدار أداة من API طرف ثالث. وضع علامة على كل قطعة على الفور بمستوى الثقة وكتب سياسة IFC التي تحكم أفعال الوكيل.
  1. إعادة إنتاج منهجية Nasr et al. 2025 الهجوم التكيفي على وكيلك المدافع عن الفلتر من التمرين 2.

الشروط الرئيسية

TermWhat people sayWhat it actually means
IPI"indirect prompt injection"Injection via content the user did not write, consumed by the agent during normal operation
RAG injection"poisoned retrieval"Attacker publishes content that the retrieval step fetches; prompt contains the payload
Zero-click"no user action"Attack triggers automatically during agent operation; user does nothing
IFC"information flow control"Label-based approach: actions from untrusted content require trusted ratification
Adaptive attack"gradient / RL red-team"Attack that knows the defense and optimizes against it; required for honest evaluation
Benign instruction"please print Yes"IPI payload that is semantically benign; no keyword filter catches it
Scope violation"cross-trust exfiltration"Agent accesses data from one trust context and outputs it to another

المزيد من القراءة

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.