Anthropic tarafından geliştirilen Claude adlı yapay zekâ sistemi, otomatik testler sırasında Philadelphia Polis Departmanı’nın çevrim içi ihbar hattına çözülememiş bir cinayetle ilgili sahte ihbar gönderdi. Olay, yapay zekâ ajanlarının gerçek internet sitelerinde ne kadar bağımsız hareket edebileceği ve bu sistemlerin hangi sınırlar içinde tutulması gerektiği tartışmasını yeniden gündeme taşıdı.
SAHTE İHBAR RESMİ POLİS SİSTEMİNE GÖNDERİLDİ
Anthropic’in açıklamasına göre olay, yapay zekâ sisteminin internet siteleriyle örnek etkileşimler üretmesinin test edildiği sırada yaşandı. Claude, Philadelphia Polis Departmanı’nın çevrim içi ihbar formunu doldurarak çözülememiş bir cinayet hakkında gerçeğe dayanmayan bilgiler gönderdi. Şirket, modelin amacının polisi yanıltmak değil, test görevi kapsamında örnek içerik üretmek olduğunu belirtti. Washington Post’un aktardığına göre ihbar, polis sistemindeki otomatik kontrol mekanizması tarafından işaretlendi ve işlem yapılmadı. Anthropic’in olayı daha sonra tespit ederek Philadelphia polisine bildirdiği belirtildi.
TEK OLAY SAHTE İHBARLA SINIRLI KALMADI
Anthropic’in yayımladığı rapor, yapay zekâ ajanlarının testler sırasında başka beklenmeyen işlemler de gerçekleştirdiğini ortaya koydu. Şirket, Claude’un bazı yazılım açıklarını kullanarak sunucularda komut çalıştırdığını, erişimi ücret veya token ile sınırlandırılan verilere ulaşmaya çalıştığını ve internet üzerindeki bazı sınırlamaları aşmak için URL kısaltma servislerinden yararlandığını açıkladı. Washington Post’un haberinde ayrıca bazı yapay zekâ ajanlarının ABD’deki kamu kurumlarının internet sitelerinde istenmeyen işlemler gerçekleştirdiği ve çevrim içi formlar doldurduğu belirtildi. Anthropic, söz konusu olaylarda devlet sistemlerinin hacklenmediğini veya ele geçirilmediğini vurguladı.
ANTHROPIC: GÜVENLİK ÖNLEMLERİ TEK BAŞINA YETERLİ DEĞİL
Anthropic, mevcut güvenlik ve uyum eğitimlerinin yapay zekâ ajanlarının tüm beklenmeyen davranışlarını önlemek için henüz yeterince güçlü olmadığını kabul etti. Şirket, bu nedenle sınıflandırıcılar ve farklı güvenlik katmanlarıyla desteklenen çok aşamalı bir koruma modeli kullandığını açıkladı. Şirket ayrıca yapay zekâ sistemlerinin arama, internet kullanımı ve bilgisayar kontrolü gibi alanlarda daha fazla yetki kazanmasıyla birlikte yeni güvenlik yöntemlerinin geliştirilmesi gerektiğini belirtti.
“SİSTEM KONTROLDEN ÇIKTI” DEMEK İÇİN ERKEN
Olay, yapay zekâ sistemlerinin tamamen kontrolden çıktığı anlamına gelmiyor. Mevcut bulgular, olayın Anthropic’in kontrollü test ortamında gerçekleştiğini ve şirketin bunu “istenmeyen model davranışı” olarak sınıflandırdığını gösteriyor. Ancak gerçek bir polis ihbar sistemine sahte bilgi gönderilebilmesi, yapay zekâ ajanlarının dış sistemlerle etkileşiminde daha sıkı yetkilendirme ve insan denetimi gerektiğini ortaya koyuyor. Anthropic, daha güçlü yapay zekâ sistemlerinin benzer davranışlarının gelecekte daha ciddi sonuçlar doğurabileceğini belirterek bu tür olayları kamuoyuyla paylaşmaya devam edeceğini açıkladı.