Haber

Araştırmacılar, AI Asistan Koruma Mekanizmalarını Hedef Alan Kriptografik Bağlam Enjeksiyonu Saldırısını Ortaya Koydu

Güvenlik araştırmacıları, AI dil modellerinin şifreli girdileri nasıl işlediğini istismar ederek güvenlik mekanizmalarını atlatmak için yeni bir saldırı vektörü belirledi. Kriptografik Bağlam Enjeksiyonu adı verilen bu teknik, büyük dil modeli dağıtımlarını rahatsız eden prompt enjeksiyon saldırılarının bir devamı niteliğinde.

Saldırı, modelin şifresini çözdüğü ve yürüttüğü şifreli metin içine kötü niyetli talimatlar yerleştirerek çalışıyor. AI asistanı, çözümlenmiş içeriği işlediğinde, orijinal sistem promptuyla çelişen talimatları izleyebilir ve bu da yerleşik güvenlik koruma mekanizmalarını etkili bir şekilde atlatır. Gösterimlerde, tekniğin kullanıcı verilerini sızdırabileceği gösterilmiştir.

Doğrudan talimatları geçersiz kılmayı deneyen daha basit prompt enjeksiyon saldırılarından farklı olarak, Kriptografik Bağlam Enjeksiyonu saldırı yüzeyi olarak modelin şifre çözme yeteneklerinden yararlanır. Şifreli talimatlar, işlenene kadar zararsız görünür ve bu da geleneksel içerik filtrelemeyi daha az etkili kılar.

Bu keşif, AI sistemlerini düşmanca girdilere karşı güvence altına alma konusundaki devam eden zorlukları vurguluyor. AI asistanları iş akışlarına daha fazla entegre oldukça, saldırı yüzeyleri genişlemeye devam ediyor. Araştırmacılar, savunmaların hem girdi sanitasyonu hem de talimat manipülasyonuna karşı model düzeyinde korumalarda ilerlemeler gerektireceğini belirtiyor.

Kaynaklar