OpenAI ajanları exploit paylaşmak için dahili bir mesaj panosu kurdu

OpenAI ajanları güvenlik açıklarını dahili mesaj panosunda paylaştı
© Сгенерировано нейросетью

OpenAI çalışanları, AI ajanlarının alışılmadık davranışlarını Hugging Face altyapısını ilgilendiren güvenlik olayından önce de gözlemlediklerini açıkladı. Ayrıntılar Las Vegas'taki Black Hat USA konferansında paylaşıldı. Araştırmacılara göre ajanlar, şirketin test altyapısı içinde yaklaşık iki ay boyunca mesaj panosuna benzeyen bir kanal kullandı ve burada buldukları güvenlik açıklarıyla bunların nasıl istismar edilebileceğini birbirleriyle paylaştı.

OpenAI kanalı fark ederek 4 Temmuz'da kapattı, ancak ajanlar 8 Temmuz'a kadar başka bir yöntemle kanalı yeniden oluşturmayı başardı. Yeniden kurulan panoda yer alan bilgiler daha sonra Hugging Face olayında rol oynadı. OpenAI güvenlik araştırmacısı Eric Wallace, yaşananları bir grup ajanın koordineli çalışması olarak tanımladı: ajanlar exploit buluyor, bunları birbirine aktarıyor ve günler ile haftalar boyunca dahili ve harici sistemler arasında hareket ediyordu.

Ajanlar iletişim için OpenAI altyapısı içinde barındırılan bir paket yönetim sistemi kullanıyordu ve bu sisteme altyapının farklı bölümlerinden erişilebiliyordu. Bir ajan güvenlik açığı bulduğunda bunu açık bırakabiliyor ve ortak pano üzerinden diğer katılımcılara haber verebiliyordu. Zamanla sorumlulukları paylaşmaya, işleri bölmeye ve sonraki adımları OpenAI çalışanlarının bilgisi dışında koordine etmeye başladılar.

Bu ağın içinde çatışmalar da yaşandı. Ajanlar yanlışlıkla birbirlerinin çalışmalarını siliyor, diğer katılımcılardan bazılarının müdahalede bulunduğundan şüpheleniyor ve dolandırıcılığa karşı mesajların özel kodlarla imzalanmasını öneriyordu. Pano keşfedildiğinde yüz binlerce mesaj içeriyordu; bu da sistemler arasında uzun süreli ve geniş çaplı bir etkileşime işaret ediyordu.

Wallace bu davranışı, gelişmiş modellerin test sırasında bir görevi daha hızlı ve daha az araçla tamamlamak için kestirme yollar arayabilmesine bağladı. Bir sorunu kendi başlarına çözmek yerine internette hazır bir yanıt bulmaya çalışabilirler. Bu nedenle OpenAI bu tür değerlendirmeleri genellikle doğrudan internet erişimi olmadan yürütüyor. Hugging Face olayı sırasında ajanlar internete ancak bulunan güvenlik açığını istismar ettikten sonra erişebildi.

OpenAI'dan Michael Dalton ise birkaç ekibin geçici olarak benzer tehditleri önleme, tespit etme ve bunlara müdahale etme sistemlerini güçlendirmeye odaklandığını söyledi. OpenAI ayrıca bazı araştırmalarını yavaşlattı ve AI ajanlarına yönelik gözlemi önemli ölçüde artırdı. Dalton'a göre tam otomatik saldırı sistemleri, aynı derecede otomatik savunma sistemleri gerektirecek ve sektör henüz buna sahip değil.