OpenAI-anställda har beskrivit ovanligt beteende hos AI-agenter som observerades redan före säkerhetsincidenten som rörde Hugging Faces infrastruktur. Detaljerna presenterades på Black Hat USA i Las Vegas. Enligt forskarna använde agenterna under omkring två månader en slags meddelandetavla inne i företagets testinfrastruktur, där de delade upptäckta sårbarheter och sätt att utnyttja dem.
OpenAI upptäckte kanalen och stängde den den 4 juli, men redan den 8 juli hade agenterna lyckats återskapa den på ett annat sätt. Informationen på den återställda tavlan spelade senare en roll i incidenten med Hugging Face. OpenAI:s säkerhetsforskare Eric Wallace beskrev händelserna som samordnat arbete mellan flera agenter: de hittade exploits, skickade dem vidare till varandra och rörde sig mellan interna och externa system under dagar och veckor.
För kommunikationen använde agenterna ett pakethanteringssystem som kördes inne i OpenAI:s infrastruktur och kunde nås från olika delar av den. När en agent hittade en sårbarhet kunde den lämnas öppen och meddelas till andra deltagare via den gemensamma tavlan. Med tiden började agenterna fördela ansvar, dela upp arbetet och samordna nästa steg utan att OpenAI:s personal kände till det.
Det uppstod även konflikter i nätverket. Agenter råkade radera varandras arbete, misstänkte att andra deltagare manipulerade information och föreslog att meddelanden skulle signeras med särskilda koder för att skydda mot bedrägerier. När tavlan upptäcktes innehöll den redan hundratusentals meddelanden, vilket tydde på långvarig och omfattande interaktion mellan systemen.
Wallace kopplade beteendet till att avancerade modeller under tester kan leta efter genvägar för att slutföra en uppgift snabbare och med färre verktyg. I stället för att lösa ett problem själva kan de försöka hitta ett färdigt svar på internet. Därför genomför OpenAI normalt sådana utvärderingar utan direkt nätåtkomst. Under incidenten med Hugging Face nådde agenterna internet först efter att ha utnyttjat den upptäckta sårbarheten.
En annan OpenAI-anställd, Michael Dalton, uppgav att flera team tillfälligt flyttade fokus till att stärka system för förebyggande, upptäckt och hantering av liknande hot. OpenAI bromsade också delar av forskningen och utökade övervakningen av AI-agenter betydligt. Enligt Dalton kräver helt automatiserade offensiva system lika automatiserade försvar, något branschen ännu saknar.