ASCII Sanat ve Görsel Hapishane Çıkışları
Type: Build
Languages: Python (stdlib, ArtPrompt token-masking harness)
Prerequisites: Phase 18 · 12 (PAIR), Phase 18 · 13 (MSJ)
Time: ~60 minutes
Öğrenme Hedefleri
- ArtPrompt saldırısını açıklayın: kelime tanımlama adım, ASCII-art değiştirme, son gizlenmiş istek.
- Standart savunmaların (PPL, Parafraze, Retokenization) ArtPrompt'te neden başarısız olduğunu açıklayın.
- ViTC'yi tanımlayın ve ölçümlerini açıklayın.
- StructuralSleight'ı keyfi olmayan Uygulanabilir Metin Kodlanmış Yapılara genelleştirme olarak tanımlayın.
Sorun
Parafrase ve rol oynaması (Daahi 12) ve uzun bağlam (Daahi 13) yoluyla saldırılar metin düzeyde bir patern üzerinde çalışır. ArtPrompt tanıma düzeyinde çalışır: model yasaklı jetonu analiz etmez.
Anlaşım
ArtPrompt, iki adım
Adım 1. Sözcük Tanımlama. Zararlı bir talebe göre saldırgan, güvenlikle ilgili kelimeleri tanımlamak için bir LLM kullanır (örneğin, "bomba nasıl yapılır"daki "bomba").
Adım 2. Gizli Çözüm Yükleme. Her tanımlanan kelimeyi ASCII sanatı gösterimiyle değiştirin (harf şeklini oluşturan 7x5 veya 7x7 karakter blokları). Modelle yeterli derecede yetenekli bir modelin kelime olarak tanıyabileceği noktalama ve boşluklar bir şebekesi gelir; güvenlik filtre sadece şebekesi görür.
Sonuç: GPT-4, Gemini, Claude, Llama-2, GPT-3.5 hepsi başarısız oldu.
Standart savunma neden başarısız oluyor
- PPL (perplexity filter).ASCII sanatı yüksek karmaşıklığa sahiptir ama tüm yeni girişler de aynıdır. ArtPrompt'i engelleyen eşiği seçimler de meşru yapılandırılmış girişleri engeller.
- Paraphrase.Promptu'nun parafrase edilmesi ASCII sanatını yok eder.
- Retokenization.Tokenleri farklı bir şekilde bölmek, modelin görmesinin harf şekillerini tanıdığını değiştirmez.
Temel sorun, güvenlik filtrelerinin token veya semantik düzeyde olmasıdır; ArtPrompt görsel tanıma düzeyinde çalışır.
ViTC referans değerini
Semantik olmayan görsel isteklerin tanınması. Modelin ASCII-art, wingdings ve diğer metin-semantik olmayan görsel içeriği okumayı ölçer. ArtPrompt'in etkinliği ViTC doğruluğu ile ilişkilidir: model görsel metni ne kadar iyi okursa ArtPrompt üzerinde o kadar iyi çalışır. Bu bir yetenek-güvenlik pazarlamasıdır.
YapısalSleight
ArtPrompt: Usual Metin Kodlanmış Yapılar (UTES) Genelleştirir. Ağaclar, grafikler, yuvalanmış JSON, CSV-in-JSON, farklı stil kod blokları.
Savunma anlamı: modelin analiz edebileceği yapılandırılmış temsiller boyunca güvenlik genelleşmelidir.
Görüntü-modallik analog
Görsel LLM'ler (GPT-5.2, Gemini 3 Pro, Claude Opus 4.5, Grok 4.1) saldırı yüzeyini genişletiyor.
Bu 18 fazaya uygun.
Ders 12-14 üç ortogonal saldırı vektörünü tanımlar: İteratif Düzeltme (PAIR), Konekst Uzunluğu (MSJ) ve Kodlama (ArtPrompt/StructuralSleight).15 ders model merkezli saldırılardan sistem sınırlı saldırılara (indirekt acil enjeksiyon) geçiyor.16 ders savunma araç tepkisini tanımlar.
Kullan
code/main.pyASCII-art gliflerle zararlı bir sorguda belirli kelimeleri gizleyebilir, gizlenmiş dizinin anahtar kelime filtresi geçmesini doğrulayabilir ve (veya seçeneği olarak) gizlenmiş dizinin basit bir tanıtıcı kullanarak tekrar şifreleyebilirsiniz.
Gönder
Bu ders bize çok yararlı .outputs/skill-encoding-audit.md. Bir jailbreak savunma raporu göz önüne alındığında, kapsamlı kodlama saldırı aileleri (ASCII sanatı, base64, leet-speak, UTF-8 homoglif, UTES) ve her birini yakalayan savunma katmanı sayılır.
Egzersizler
- Çık .
code/main.pyGizli dizinin basit bir anahtar kelime filtreyi geçtiğini kontrol edin.
- İkinci bir kodlama uygulayın: base64 aynı hedef kelime için. ArtPrompt ile filtre-önleme oranını ve kurtarma zorluğunu karşılaştırın.
- Jiang et al. 2024 Bölüm 4.3 (beş model sonuçları) okuyun.
- ASCII sanat şeklinde bölgeleri anında algılayan bir ön nesil savunma tasarlayın. Kanunlu kod, tablolar ve matematiksel notasyonda yanlış pozitif oranı ölçün.
- StructuralSleight 10 kodlama yapısını listeler. 10'u ele alan genel bir savunma çizin ve savunulan bir istek için hesaplama maliyetini tahmin edin.
Anahtar Terimler
| Term | What people say | What it actually means |
|---|---|---|
| ArtPrompt | "the ASCII-art attack" | Two-step jailbreak that masks safety words with ASCII-art renderings |
| Cloaking | "hide the word" | Replace a forbidden token with a visual representation the model reads but the filter does not |
| UTES | "uncommon structure" | Uncommon Text-Encoded Structure — tree, graph, nested JSON, etc. used to smuggle content |
| ViTC | "visual-text capability" | Benchmark for model's ability to read non-semantic visual encoding |
| Perplexity filter | "PPL defense" | Reject prompts with high perplexity; fails because legitimate structured input also scores high |
| Retokenization | "tokenizer shift defense" | Pre-process the prompt with a different tokenizer; fails because recognition is visual |
| Homoglyph | "lookalike characters" | Unicode characters that look identical to Latin letters; bypass substring checks |
Daha Fazla Okumak
- Jiang et al. — ArtPrompt (ACL 2024, arXiv:2402.11753) ASCII-art jailbreak kağıdı
- Li et al. — StructuralSleight (arXiv:2406.08754) UTES genelleşimi
- Chao et al. — PAIR (Lesson 12, arXiv:2310.08419) Ek iteratif saldırı
- Anil et al. — Many-shot Jailbreaking (Lesson 13) Ek uzunluk saldırısı
This free lesson is part of the AI Engineering from Scratch curriculum. Read the full explanation, run the lesson code, and verify the result in the interactive reader or from the repository source.
Browse the complete course catalog or open this lesson on GitHub.