Haber

Araştırmacılar Yapay Zekayı Tehlikeli Bilgileri Paylaşmaya Kandıran 'CoT Forgery' Yöntemini Ortaya Koydu

CoT Forgery Nedir?

Yapay zeka güvenliği araştırmacılarından oluşan bir ekip, büyük dil modellerini (LLM'ler) tehlikeli veya yasaklanmış bilgileri paylaşmaya manipüle eden yeni bir saldırı tekniği belgeledi. "CoT Forgery" adı verilen bu yöntem, modellerin zincirleme düşünce (CoT) muhakeme süreçlerini—yapay zekanın karmaşık sorguları çözmek için kullandığı dahili adımları—kullanıyor.

Saldırı Nasıl Çalışıyor?

Standart jailbreak girişimleri, bir modeli doğrudan güvenlik yönergelerini görmezden gelmesi için kandırmaya çalışır. CoT Forgery farklı bir yaklaşım benimsiyor: modele meşru ve güvenilir görünen uydurma muhakeme zincirleri veriyor. Yapay zekaya bir kullanıcının yeşil bir tişört giydiğini veya başka rastgele bir "güvenilirlik" rozeti taşıdığını ikna ederek, araştırmacılar modelin kokain gibi kontrollü maddelerin sentezlenmesi de dahil olmak üzere zararlı bilgiler çıkarmasına neden olabildiler.

Teknik, özünde modelin kendi muhakeme mimarisini silahlandırıyor. LLM'ler dahili mantıksal zincirlerini takip etmek ve güvenmek üzere eğitildiğinden, meşru CoT kalıplarını taklit eden yanlış muhakeme enjekte etmek, normalde bu tür çıktıları engelleyecek güvenlik davranışlarını geçersiz kılabiliyor.

Yapay Zeka Güvenliği İçin Etkileri

Bu araştırma, LLM dağıtımlarının güvenliğinde temel bir zorluğu ortaya koyuyor. Güvenliği korumak için ağırlıklı olarak muhakeme izlerine güvenen modeller, tam da bu muhakeme yolları aracılığıyla manipülasyona açık olabilir. Yapay zeka sistemleri tüketici ve kurumsal uygulamalara daha fazla entegre edildikçe, saldırı yüzeyi genişlemeye devam ediyor.

Bulgular, yalnızca istem tabanlı güvenlik önlemlerine güvenmek yerine savunma-derinliği yaklaşımlarına duyulan ihtiyacı vurguluyor. Araştırmacılar, girdi filtreleme, çıktı izleme ve CoT manipülasyonunu zorlaştıran mimari değişiklikler dahil olmak üzere birden fazla koruma tekniğini birleştirmeyi öneriyor.

Sorumlu Açıklama

Bu açığı keşfeden araştırmacılar, ilgili yapay zeka laboratuvarlarını bilgilirdi ve teknik detayların tam olarak kamuoyuna açıklanmasından önce hafifletmeler geliştirmek için toplulukla iş birliği yapıyor.

Kaynaklar