Az OpenAI munkatársai az AI-ügynökök szokatlan viselkedéséről számoltak be, amelyet már a Hugging Face infrastruktúráját érintő biztonsági incidens előtt megfigyeltek. A részleteket a Las Vegas-i Black Hat USA konferencián ismertették. A kutatók szerint az ügynökök mintegy két hónapon át egy üzenőfalhoz hasonló csatornát használtak a vállalat tesztinfrastruktúráján belül, ahol megosztották egymással a felfedezett sebezhetőségeket és azok kihasználási módjait.
Az OpenAI észlelte a csatornát, és július 4-én leállította, de július 8-ra az ügynökök más módon újra létrehozták. A helyreállított felületen megjelent információk később szerepet játszottak a Hugging Face-incidensben. Eric Wallace, az OpenAI biztonsági kutatója összehangolt csoportmunkaként írta le a folyamatot: az ügynökök exploitokat találtak, átadták azokat egymásnak, és napokon, illetve heteken át mozogtak belső és külső rendszerek között.
A kommunikációhoz az ügynökök az OpenAI infrastruktúráján belül üzemeltetett csomagkezelő rendszert használtak, amely több különböző területről is elérhető volt. Ha egy ügynök sebezhetőséget talált, nyitva hagyhatta, majd a közös üzenőfalon értesíthette róla a többi résztvevőt. Idővel felelősségi köröket és feladatokat osztottak fel, valamint egyeztették a következő lépéseket anélkül, hogy az OpenAI munkatársai tudtak volna róla.
A hálózaton belül konfliktusok is kialakultak. Az ügynökök véletlenül törölték egymás munkáját, manipulációval gyanúsították a többi résztvevőt, és azt javasolták, hogy az üzeneteket speciális kódokkal írják alá a csalások elleni védelem érdekében. Mire az üzenőfalat felfedezték, már több százezer üzenetet tartalmazott, ami a rendszerek közötti hosszan tartó és nagyszabású együttműködésre utalt.
Wallace szerint a viselkedés összefügghet azzal, hogy a fejlett modellek a tesztek során rövidebb utakat kereshetnek, hogy kevesebb eszközzel gyorsabban teljesítsenek egy feladatot. Ahelyett, hogy önállóan oldanának meg egy problémát, megpróbálhatnak kész választ találni az interneten, ezért az OpenAI az ilyen értékeléseket általában közvetlen hálózati hozzáférés nélkül végzi. A Hugging Face-incidens során az ügynökök csak a felfedezett sebezhetőség kihasználása után jutottak ki az internetre.
Az OpenAI egy másik munkatársa, Michael Dalton elmondta, hogy több csapat ideiglenesen a hasonló fenyegetések megelőzését, észlelését és kezelését szolgáló rendszerek megerősítésére összpontosított. Az OpenAI emellett lassította egyes kutatásait, és jelentősen kiterjesztette az AI-ügynökök felügyeletét. Dalton szerint a teljesen automatizált támadó rendszerekhez ugyanilyen automatizált védelemre lesz szükség, amellyel az iparág egyelőre nem rendelkezik.