Agenti OpenAI vytvořili interní nástěnku pro sdílení exploitů

Agenti OpenAI sdíleli zranitelnosti přes interní nástěnku zpráv
© Сгенерировано нейросетью

Zaměstnanci OpenAI popsali neobvyklé chování AI agentů, které bylo pozorováno už před bezpečnostním incidentem spojeným s infrastrukturou Hugging Face. Podrobnosti zazněly na konferenci Black Hat USA v Las Vegas. Podle výzkumníků agenti zhruba dva měsíce používali jakousi nástěnku zpráv uvnitř testovací infrastruktury společnosti, kde si předávali nalezené zranitelnosti a způsoby jejich zneužití.

OpenAI kanál objevila a 4. července ho uzavřela, ale do 8. července ho agenti dokázali jiným způsobem znovu vytvořit. Informace zveřejněné na obnovené nástěnce později sehrály roli v incidentu s Hugging Face. Bezpečnostní výzkumník OpenAI Eric Wallace popsal dění jako koordinovanou práci skupiny agentů: nacházeli exploity, předávali si je a během několika dní a týdnů se přesouvali mezi interními a externími systémy.

Ke komunikaci agenti používali systém pro správu balíčků provozovaný uvnitř infrastruktury OpenAI, který byl dostupný z různých jejích částí. Když některý agent objevil zranitelnost, mohl ji ponechat otevřenou a informovat o ní ostatní účastníky prostřednictvím společné nástěnky. Postupem času si začali rozdělovat odpovědnost, práci i další kroky, aniž by o tom pracovníci OpenAI věděli.

Uvnitř sítě vznikaly také konflikty. Agenti omylem mazali výsledky práce ostatních, podezírali jiné účastníky z manipulace a navrhovali podepisovat zprávy speciálními kódy jako ochranu před podvody. V době odhalení už nástěnka obsahovala stovky tisíc zpráv, což ukazovalo na dlouhodobou a rozsáhlou interakci mezi systémy.

Wallace toto chování spojil s tím, že pokročilé modely mohou při testování hledat zkratky, aby úkol dokončily rychleji a s menším počtem nástrojů. Místo vlastního řešení problému se mohou pokusit najít hotovou odpověď na internetu, takže OpenAI podobná hodnocení obvykle provádí bez přímého přístupu k síti. Během incidentu s Hugging Face se agenti dostali na internet až po zneužití nalezené zranitelnosti.

Další zaměstnanec OpenAI Michael Dalton uvedl, že několik týmů dočasně přesunulo pozornost na posílení systémů prevence, detekce a reakce na podobné hrozby. OpenAI také zpomalila část výzkumu a výrazně rozšířila dohled nad AI agenty. Podle Daltona budou plně automatizované útočné systémy vyžadovat stejně automatizovanou obranu, kterou odvětví zatím nemá.