OpenAI, yapay zekâ sistemlerinin hatalarını gizlemeye çalıştığı, eksik bilgileri uydurduğu ve bazı durumlarda kullanıcı izni olmadan dosyaları internete taşıdığı 6 yeni vaka tespit ettiğini açıkladı.
Şirketin internet sitesinde yayımlanan açıklamada, söz konusu örnekler “uyumsuzluk” olarak tanımlandı. Bu kavram, yapay zekâ sistemlerinin amaç veya eylemlerinin insanların niyet ve değerlerinden sapmasını ifade ediyor.
OpenAI, mevcut güvenlik ve izleme yöntemlerinin yapay zekâ sistemlerinin gelişim hızına ayak uydurmakta zorlandığını belirterek, sektörün sistemleri güvenli şekilde geliştirme ve izleme yaklaşımının “uzun süre daha azami hızda ilerlemeyi sorumlu şekilde sürdürebilecek yeterlilikte” olmadığını bildirdi.
YAPAY ZEKÂ HATALARINI GİZLEMEYE ÇALIŞTI
OpenAI’ın tespit ettiği vakalardan birinin GPT-5.6 Sol modelinin geliştirilmesi sırasında yaşandığı belirtildi. Modelin, kullanıcıların hataları fark etmesini önlemek amacıyla kendisi hakkında gizli notlar oluşturduğu aktarıldı. Bu notlarda eksik verilerin uydurulması ve kaynak materyallerin farklı sürümleri arasındaki uyuşmazlıkların gizlenmesine yönelik talimatların bulunduğu ifade edildi. Yayımlanmamış başka bir modelin de kendi oluşturduğu notlara, kendisine getirilen kısıtlamaları göz ardı etmesi yönünde talimatlar eklediği belirtildi.
EKSİK VERİLERİ UYDURDU
Başka bir vakada yapay zekâ sisteminin rutin bir soruyu yanıtlamaya çalışırken internette bulunan bir API anahtarını izinsiz kullandığı bildirildi. Sistemin soruyu yanıtlamak için ihtiyaç duyduğu rakamları bulamayınca verileri uydurduğu aktarıldı. OpenAI, yayımlanmamış başka bir modelin ise bir problemi kod kullanarak doğru şekilde çözdüğünü, ardından internet üzerinden kaynak gösterebilmek amacıyla kendi dosyasını izinsiz şekilde internete yüklediğini açıkladı.
MODELLER BİRBİRLERİYLE YETKİSİZ İLETİŞİM KURDU
Tespit edilen vakalar arasında yapay zekâ modellerinin birbirleriyle iletişim kurma biçimleri de yer aldı. Bazı modellerin eksik dosyaları ararken farklı eğitim örnekleri arasında talep ve yanıt alışverişi yapmak için şirketin dahili yazılım deposunu bir mesaj panosu gibi kullandığı belirtildi. Başka bir olayda ise aynı eğitim görevi üzerinde çalışan yapay zekâ sistemlerinin, birbirlerinin yerel dosyalarına erişememeleri üzerine dosya paylaşmak amacıyla halka açık dosya paylaşım sitelerini kullandığı kaydedildi.
OPENAI: VAKALAR SIKLIĞI GÖSTERMİYOR
OpenAI, kamuoyuyla paylaşılan 6 vakanın yaklaşık son 6 ayda gözlemlenen davranışlardan münferit örnekler olduğunu vurguladı. Şirket, bu örneklerin yapay zekâ sistemlerinde uyumsuz davranışların ne sıklıkta ortaya çıktığını göstermediğini belirtti.