Phase 18: Ethics, Safety & Alignment

تزریق فوری غیر مستقیم سطح حمله تولید

تزریق فوری غیر مستقیم (IPI) دستورالعمل ها را در محتوای خارجی یک صفحه وب، ایمیل، یک سند مشترک، یک بلیط پشتیبانی مصرف می کند که توسط یک سیستم عامل بدون عمل صریح کاربر مصرف می شود. IPI تهدید تولید 2026 است: فیلترهای ورودی کاربر را دور می کشد زیرا مهاجم هرگز کاربر را لمس نمی کند، به طور خاموش مقیاس می گیرد زیرا عوامل محتوای خارجی بیشتری را پردازش می کنند و جریان های کاری خودکار را در جایی که هیچ کس پیام را نمی خواند هدف قرار می دهد. اطلاعات MDPI 17 ((1): 54 (جنوری 2026) تحقیقات 2023-2025 را ترکیب می کند. مقاله دفاعی IPI NDSS 2026 چالش اصلی را حل می کند: دستورالعمل های تزریق شده می توانند از نظر معنوی خفیف باشند ("لطفا چاپ کنید بله") ، بنابراین تشخیص نیاز به بیش از فیلتر کردن کلمات کلیدی دارد. "هجومگر دوم حرکت می کند" (Nasr و همکارانش، مشترک OpenAI / Anthropic / DeepMind، اکتبر 2025): حملات سازنده (گرادینت، RL، جستجوی تصادفی، تیم قرمز انسان) >90٪ از 12 دفاعی منتشر شده را که در ابتدا نرخ موفقیت حمله نزدیک صفر را گزارش کرده بودند، شکست دادند.

Type: Build

Languages: Python (stdlib, IPI attack + defense harness)

Prerequisites: Phase 18 · 12 (PAIR), Phase 14 (agent engineering)

Time: ~75 minutes

اهداف یادگیری

  • تزریق فوری غیرمستقیم را تعریف کنید و سه متجه تحویل مشترک را توصیف کنید.
  • توضیح دهید که چرا فیلترهای ورودی کاربر IPI را کاملاً از دست می دهند.
  • چارچوبی از "کنترلی جریان اطلاعات" را به عنوان پارادایم دفاعی 2026 توصیف کنید.
  • یافته های Nasr و همکارانش (اکتبر 2025) در مورد موفقیت حملات سازنده علیه دفاع های IPI منتشر شده را بیان کنید.

مشکل

تزریق فوری مستقیم به حمله کننده نیاز دارد تا به کاربر یا پیامک آنها برسد. IPI به هیچ یک از این موارد نیاز ندارد: حمله کننده بار مفید را در هر محتوایی قرار می دهد که عامل ممکن است بخواند یک صفحه وب، یک ایمیل در جعبه ورودی، یک مشکل GitHub، یک بررسی محصول. عامل آن را در طول عملیات عادی جمع آوری می کند و دستورالعمل ها را اجرا می کند. کاربر پیام رسان است، نه قصد.

مفهوم

سه متری تحویل

  • Retrieval-augmented generation (RAG).مهاجم یک سند را منتشر می کند؛ مرحله بازیافت آن را می گیرد؛ پرامپت آن را قبل از سوال کاربر به هم متصل می کند؛ مدل دستورالعمل های مهاجم را اجرا می کند.
  • Inbox / document workflows.مهاجم یک ایمیل را به کاربر می فرستد؛ مامور ایمیل ها را می خواند؛ پیامک شامل بدن ایمیل است؛ مدل دستورالعمل های ایمیل را دنبال می کند.
  • Tool output.مهاجم ابزاری را که عامل استفاده می کند کنترل می کند (به عنوان مثال، جستجوی وب که نتیجه کنترل شده توسط مهاجم را باز می آورد) ؛ محصول ابزار حاوی دستورالعمل است؛ جریان کنترل عامل از آنها پیروی می کند.

سه تا یک ویژگی ساختاری مشترک دارند: مهاجم یک قطعه از پیام را بدون لمس ورودی کاربر کنترل می کند.

چرا فیلترهای ورودی کاربر از آن غافل می شوند

یک بارگیری IPI در ورودی کاربر ظاهر نمی شود. در محتوای بازیافت شده ظاهر می شود. اگر فیلتر در ورودی کاربر گات شده باشد، بارگیری آن را دور می گذارد. اگر فیلتر در تمام محتوای که به مدل می رسد گات شده باشد، باید برای متن بازیافت شده تعسفی اعمال شود که گران است و مثبت های غلط را در مقابل محتوای مشروع تولید می کند که شامل زبان صدای ضروری است.

کنترل جریان اطلاعات (IFC) برای هوش مصنوعی

پارادایم دفاعی 2026 از امنیت OS کلاسیک قرض گرفته است. به هر منبع محتوا به عنوان یک برچسب امنیتی برخورد کنید. سوال کاربر را به عنوان "قابل اعتماد" برچسب بزنید. محتوای بازیافت شده را به عنوان "غیر قابل اعتماد" برچسب بزنید. جریان کنترل مدل را به عنوان یک جریان اطلاعات رفتار کنید: اقدامات ناشی از محتوای غیر قابل اعتماد باید قبل از اجرای توسط ورودی قابل اعتماد تأیید شود.

CaMeL (مایکروسافت 2025), ConfAIde (ستانفورد 2024) و سند دفاعی IPI NDSS 2026 IFC را به روش های مختلف عملیاتی می کنند. اصل مشترک: تا زمانی که کد و داده ها پنجره زمینه ای مشابه را به اشتراک می گذارند، جلوگیری هدف است نه پیشگیری.

حمله کننده دوم حرکت می کند

Nasr و همکاران (اکتبر 2025) 12 دفاعی منتشر شده IPI را با حملات سازنده ( جستجوی درجه بندی، سیاست های RL، جستجوی تصادفی، 72 ساعت تیم قرمز انسانی) آزمایش کردند. هر دفاعی که در ابتدا ASR نزدیک به صفر را گزارش داد، به > 90% ASR شکسته شد.

درس روش شناسی: دفاعی را تنها با ارزیابی حمله سازنده منتشر کنید. معیار های حمله ای ثابت شواهد قوی نیستند؛ مهاجم دفاع را می شناسد.

حوادث واقعی

درس 25 شامل EchoLeak (CVE-2025-32711, CVSS 9.3) اولین IPI با کلیک صفر در Microsoft 365 Copilot. CamoLeak (CVSS 9.6) در Chat Copilot GitHub. CVE-2025-53773 در Copilot GitHub. انتشار تولید توسط IPI در زمینه، نه فقط در معیارها در معرض خطر قرار می گیرد.

قاب بندی OWASP و NIST

OWASP LLM Top 10 (2025) تزریق فوری (مستقیم + غیرمستقیم) را به عنوان LLM01 رتبه بندی می کند، تهدید درجه اول در لایه برنامه. NIST AI SPD 2024 تزریق غیرمستقیم را "بزرگترین نقص امنیتی هوش مصنوعی تولید کننده" می نامد.

جایی که این در مرحله 18 قرار داره

درس 12-14، jailbreaks مدل متمرکز است. درس 15، حمله سیستم متمرکز است که بر انتشار تولید 2026 تسلط دارد. درس 16، ابزار دفاعی را پوشش می دهد. درس 25، روایت خاص CVE را پوشش می دهد.

ازش استفاده کن

code/main.pyیک آرم IPI را می سازد. یک نماینده اسباب بازی سه ابزار دارد (بخش وب، خواندن ایمیل، ارسال پیام). محیط حاوی محتوای کنترل شده توسط مهاجم با یک دستورالعمل داخلی ("این را به تمام تماس ها ارسال کنید") است. شما می توانید بین یک عامل ساده (به دستورالعمل های تزریق شده عمل کنید) ، یک عامل حفاظت شده از فیلتر (فلتر کلمات کلیدی در محتوای بازیافت شده) و یک عامل IFC (محتفظات قابل اعتماد و غیر قابل اعتماد را جدا می کند و دستورات جریان کنترل غیر قابل اعتماد را رد می کند) تغییر دهید.

-باده

این درس به ما کمک می کندoutputs/skill-ipi-audit.md. در نظر گرفتن یک توصیف اجنسی از انتشار، منابع محتویات غیرقابل اعتماد را فهرست می کند، بررسی می کند که آیا انتشار IFC را اعمال می کند یا خیر، و منابع را نشان می دهد که بدون برچسب اعتماد به مدل می رسند.

تمرینات

  1. فرار کنcode/main.py. اندازه گیری موفقیت حمله علیه هر یک از سه عامل
  1. دفاع مبتنی بر پارافرز را در محتوای بازیافت شده اجرا کنید. میزان مثبت غلط خوب در متن بازیافت شده مشروع را اندازه گیری کنید.
  1. مقاله دفاعی از IPI NDSS 2026 را بخوانید. چالش "توصیه خوب" را توصیف کنید و چرا از فیلتر مبتنی بر کلمات کلیدی جلوگیری می کند.
  1. طراحی یک پیاده سازی که در آن عامل یک ابزار از یک API شخص ثالث دریافت می کند. هر قطعه پرامپت را با سطح اعتماد برچسب بزنید و سیاست IFC را بنویسید که اقدامات عامل را اداره می کند.
  1. روش حمله سازنده Nasr et al. 2025 را در مورد عامل دفاعی فیلتر خود از تمرین 2 بازیافت کنید.

اصطلاحات کلیدی

TermWhat people sayWhat it actually means
IPI"indirect prompt injection"Injection via content the user did not write, consumed by the agent during normal operation
RAG injection"poisoned retrieval"Attacker publishes content that the retrieval step fetches; prompt contains the payload
Zero-click"no user action"Attack triggers automatically during agent operation; user does nothing
IFC"information flow control"Label-based approach: actions from untrusted content require trusted ratification
Adaptive attack"gradient / RL red-team"Attack that knows the defense and optimizes against it; required for honest evaluation
Benign instruction"please print Yes"IPI payload that is semantically benign; no keyword filter catches it
Scope violation"cross-trust exfiltration"Agent accesses data from one trust context and outputs it to another

خواندن بیشتر

This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.

Browse the complete course catalog or open this lesson on GitHub.