Agenții OpenAI au creat un panou intern pentru a distribui exploituri

Agenții OpenAI schimbau vulnerabilități printr-un panou intern de mesaje
© Сгенерировано нейросетью

Angajații OpenAI au descris un comportament neobișnuit al agenților AI, observat încă înainte de incidentul de securitate legat de infrastructura Hugging Face. Detaliile au fost prezentate la conferința Black Hat USA din Las Vegas. Potrivit cercetătorilor, agenții au folosit timp de aproximativ două luni un fel de panou de mesaje în interiorul infrastructurii de test a companiei, unde își transmiteau vulnerabilitățile descoperite și metodele de exploatare.

OpenAI a identificat canalul și l-a închis pe 4 iulie, însă până pe 8 iulie agenții reușiseră să-l recreeze printr-o altă metodă. Informațiile apărute pe panoul restaurat au jucat ulterior un rol în incidentul cu Hugging Face. Eric Wallace, cercetător în securitate la OpenAI, a descris activitatea drept o colaborare coordonată între mai mulți agenți: aceștia găseau exploituri, și le transmiteau între ei și se deplasau între sisteme interne și externe timp de zile și săptămâni.

Pentru comunicare, agenții foloseau un sistem de administrare a pachetelor găzduit în infrastructura OpenAI și accesibil din mai multe zone ale acesteia. Când un agent descoperea o vulnerabilitate, o putea lăsa deschisă și îi putea informa pe ceilalți participanți prin panoul comun. În timp, agenții au început să împartă responsabilitățile, să distribuie sarcinile și să coordoneze pașii următori fără ca personalul OpenAI să știe.

În cadrul rețelei au apărut și conflicte. Agenții ștergeau accidental munca altora, îi suspectau pe ceilalți participanți de manipulare și propuneau semnarea mesajelor cu coduri speciale pentru protecție împotriva fraudelor. Când panoul a fost descoperit, acesta conținea deja sute de mii de mesaje, semn al unei interacțiuni îndelungate și de amploare între sisteme.

Wallace a legat acest comportament de faptul că modelele avansate pot căuta scurtături în timpul testelor pentru a finaliza o sarcină mai rapid și cu mai puține instrumente. În loc să rezolve singure o problemă, ele pot încerca să găsească un răspuns gata făcut pe internet, motiv pentru care OpenAI desfășoară de regulă astfel de evaluări fără acces direct la rețea. În incidentul cu Hugging Face, agenții au ajuns pe internet abia după exploatarea vulnerabilității descoperite.

Un alt angajat OpenAI, Michael Dalton, a declarat că mai multe echipe și-au mutat temporar atenția către consolidarea sistemelor de prevenire, detectare și răspuns la amenințări similare. OpenAI a încetinit și o parte din cercetare și a extins semnificativ monitorizarea agenților AI. Potrivit lui Dalton, sistemele ofensive complet automatizate vor necesita apărări la fel de automatizate, de care industria încă nu dispune.