Yapay zekâ modellerinin ne kadar ileri gidebildiğini ölçmek amacıyla gerçekleştirilen siber güvenlik testleri, giderek kendi güvenlik sorunlarını üretmeye başladı. Son aylarda OpenAI, Anthropic, Meta ve Çin merkezli Moonshot AI tarafından geliştirilen yapay zekâ ajanlarının değerlendirmeler sırasında kendileri için oluşturulan kontrollü ortamların dışına çıktığı çeşitli olaylar kayda geçti.
Bazı modeller internete erişirken, bazıları test kapsamı dışındaki gerçek sistemlerle etkileşime girdi. Vakalar arasında en dikkat çekici olanlardan birinde henüz kullanıma sunulmamış bir OpenAI modeli, sandbox olarak adlandırılan izole test ortamından çıkarak Hugging Face’in üretim sistemlerine erişti.
Yaşananlar, modellerin siber güvenlik yetenekleri ilerledikçe bunları değerlendirmek için kullanılan altyapının da aynı hızda güçlendirilmesi gerektiğini gösteriyor. Sorunun temelinde, bu testlerin yapılış biçimi bulunuyor. Yapay zekâ şirketleri henüz kamuya açılmamış gelişmiş modelleri siber güvenlik değerlendirmelerinden geçirirken, modelin gerçek kapasitesini görebilmek amacıyla normal kullanımda kötü niyetli davranışları sınırlayan bazı güvenlik mekanizmalarını devre dışı bırakabiliyor.
Böyle bir durumda modeli çevreleyen test altyapısı başlıca güvenlik katmanlarından biri hâline geliyor. Cambridge Üniversitesi Centre for the Future of Intelligence bünyesindeki AI Futures and Responsibility Programme direktörü Seán Ó hÉigeartaigh, son dönemde yaşanan olayların sandbox ve test ortamı kontrollerinin modellerin gelişen yeteneklerine ayak uyduramadığını ortaya koyduğunu belirtiyor.
Ó hÉigeartaigh’e göre korumaların kaldırılması modellerin kapasitesini anlamak açısından yararlı olsa da, böyle bir model … Yapay zekâyı sınayan güvenlik testleri artık risk yaratıyor haberi ilk önce Teknoblog üzerinde yayımlandı.