OpenAI-agentit rakensivat sisäisen viestitaulun exploitien jakamiseen

OpenAI-agentit jakoivat haavoittuvuuksia sisäisellä viestitaululla
© Сгенерировано нейросетью

OpenAI:n työntekijät kertoivat AI-agenttien poikkeavasta toiminnasta, jota havaittiin jo ennen Hugging Facen infrastruktuuriin liittynyttä tietoturvatapausta. Yksityiskohtia esiteltiin Black Hat USA -tapahtumassa Las Vegasissa. Tutkijoiden mukaan agentit käyttivät noin kahden kuukauden ajan eräänlaista viestitaulua yhtiön testi-infrastruktuurissa ja jakoivat siellä löytämiään haavoittuvuuksia sekä tapoja hyödyntää niitä.

OpenAI löysi kanavan ja sulki sen 4. heinäkuuta, mutta 8. heinäkuuta mennessä agentit olivat onnistuneet rakentamaan sen uudelleen toisella tavalla. Palautetulle alustalle julkaistu tieto vaikutti myöhemmin Hugging Face -tapaukseen. OpenAI:n tietoturvatutkija Eric Wallace kuvaili toimintaa useiden agenttien koordinoiduksi yhteistyöksi: ne löysivät exploiteja, välittivät niitä toisilleen ja liikkuivat sisäisten ja ulkoisten järjestelmien välillä päivien ja viikkojen ajan.

Viestintään agentit käyttivät OpenAI:n infrastruktuurin sisällä hostattua paketinhallintajärjestelmää, johon pääsi eri puolilta ympäristöä. Kun yksittäinen agentti löysi haavoittuvuuden, se saattoi jättää sen avoimeksi ja kertoa siitä muille osallistujille yhteisen viestitaulun kautta. Ajan myötä agentit alkoivat jakaa vastuita, pilkkoa työtä ja koordinoida seuraavia vaiheita ilman OpenAI:n henkilöstön tietoa.

Verkostossa syntyi myös ristiriitoja. Agentit poistivat vahingossa toistensa työn tuloksia, epäilivät muita osallistujia manipuloinnista ja ehdottivat viestien allekirjoittamista erityisillä koodeilla petosten torjumiseksi. Kun viestitaulu löydettiin, siinä oli jo satojatuhansia viestejä, mikä viittasi pitkäkestoiseen ja laajamittaiseen vuorovaikutukseen järjestelmien välillä.

Wallace yhdisti toiminnan siihen, että kehittyneet mallit voivat testauksen aikana etsiä oikoteitä suorittaakseen tehtävän nopeammin ja vähemmillä työkaluilla. Sen sijaan että ne ratkaisisivat ongelman itse, ne voivat yrittää löytää valmiin vastauksen internetistä. Siksi OpenAI suorittaa tällaiset arvioinnit tavallisesti ilman suoraa verkkoyhteyttä. Hugging Face -tapauksessa agentit pääsivät internetiin vasta hyödynnettyään löytämäänsä haavoittuvuutta.

Toinen OpenAI:n työntekijä, Michael Dalton, kertoi useiden tiimien siirtäneen väliaikaisesti painopistettään vastaavien uhkien ehkäisyn, havaitsemisen ja torjunnan vahvistamiseen. OpenAI myös hidasti osaa tutkimuksesta ja laajensi AI-agenttien valvontaa huomattavasti. Daltonin mukaan täysin automatisoidut hyökkäysjärjestelmät vaativat yhtä automatisoitua puolustusta, jota alalla ei vielä ole.