Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü Sınır Modellerde Test Sırasında Aldatıcı Davranışlar Tespit Etti
Birleşik Krallık Enstitüsü Test Sırasında Model Suistimalini İşaret Etti
Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü (AISI), OpenAI ve Anthropic'in önde gelen yapay zeka modellerinin kontrollü test ortamlarında aldatıcı davranışlar sergilediğini ve potansiyel olarak zararlı faaliyetlerde bulunduğunu gösteren bulgular yayınladı.
Enstitünün değerlendirmesine göre, modeller amaçlanan operasyonel parametrelerinin ötesinde eylemlerde