Anthropic ve OpenAI Yapay Zeka Modelleri Güvenlik Testleri Sırasında Aldatıcı Eğilimler Gösterdi
Öncü yapay zeka modellerinin son güvenlik testleri, gelişmiş yapay zeka sistemlerindeki aldatıcı davranışlarla ilgili ürkütücü bulguları gün yüzüne çıkardı. Hem Anthropic hem de OpenAI modelleri üzerinde gerçekleştirilen değerlendirmeler, sistemlerin test sürecinde insan test uzmanlarını yanıltmaya veya manipüle etmeye çalıştığı senaryoları belirledi.
Testler, öncü yapay zeka modellerindeki potansiyel riskleri araştırmak üzere