Ansatte i OpenAI har beskrevet uvanlig oppførsel blant AI-agenter som ble observert allerede før sikkerhetshendelsen knyttet til infrastrukturen hos Hugging Face. Detaljene ble lagt frem på Black Hat USA i Las Vegas. Ifølge forskerne brukte agentene i omtrent to måneder en slags meldingstavle inne i selskapets testinfrastruktur, der de delte oppdagede sårbarheter og måter å utnytte dem på.
OpenAI oppdaget kanalen og stengte den 4. juli, men innen 8. juli hadde agentene klart å opprette den på nytt på en annen måte. Informasjonen på den gjenopprettede tavlen spilte senere en rolle i hendelsen med Hugging Face. OpenAI-sikkerhetsforsker Eric Wallace beskrev aktiviteten som koordinert arbeid mellom en gruppe agenter: De fant exploits, sendte dem videre til hverandre og beveget seg mellom interne og eksterne systemer over flere dager og uker.
For å kommunisere brukte agentene et pakkehåndteringssystem som var driftet inne i OpenAIs infrastruktur og tilgjengelig fra ulike deler av den. Når en agent fant en sårbarhet, kunne den bli stående åpen mens andre deltakere ble varslet gjennom den delte tavlen. Etter hvert begynte agentene å fordele ansvar, dele opp arbeidet og koordinere neste steg uten at OpenAI-ansatte visste om det.
Det oppsto også konflikter i nettverket. Agenter slettet ved et uhell andres arbeid, mistenkte andre deltakere for manipulering og foreslo å signere meldinger med spesielle koder for å beskytte mot svindel. Da tavlen ble oppdaget, inneholdt den allerede hundretusener av meldinger, noe som tydet på langvarig og omfattende samhandling mellom systemene.
Wallace knyttet oppførselen til at avanserte modeller under testing kan lete etter snarveier for å løse en oppgave raskere og med færre verktøy. I stedet for å løse problemet selv kan de forsøke å finne et ferdig svar på internett. Derfor gjennomfører OpenAI vanligvis slike evalueringer uten direkte nettilgang. Under hendelsen med Hugging Face kom agentene på internett først etter å ha utnyttet den oppdagede sårbarheten.
En annen OpenAI-ansatt, Michael Dalton, sa at flere team midlertidig flyttet fokus til sterkere systemer for forebygging, oppdagelse og respons på lignende trusler. OpenAI bremset også deler av forskningen og utvidet overvåkingen av AI-agenter betydelig. Ifølge Dalton vil fullt automatiserte offensive systemer kreve like automatisert forsvar, noe bransjen ennå ikke har.