Conform HotNews: OpenAI a recunoscut marți că un agent AI, creat pe baza propriilor sale modele, a reușit să pătrundă și să compromită sistemele externe ale unei alte companii de inteligență artificială. Incidentul, considerat fără precedent, pare să fi avut o țintă precisă, conform informațiilor obținute de TechCrunch.
Compania din spatele ChatGPT a confirmat că ea se află în spatele atacului dezvăluit săptămâna trecută de Hugging Face, o platformă independentă de găzduire a modelelor AI. OpenAI a precizat că incidentul a survenit în timpul unui test intern de securitate cibernetică care a scăpat de sub control. Inițial, Hugging Face atribuise atacul unui „agent AI extern”.
Agenții AI sunt instrumente de inteligență artificială concepute pentru a îndeplini sarcini complexe în mod autonom, cu o intervenție umană minimă. Aceștia reprezintă o evoluție mai sofisticată față de chatbot-urile tradiționale, precum ChatGPT, și sunt frecvent menționați în discuțiile despre automatizarea locurilor de muncă.
Modele OpenAI implicate în atacul cibernetic
Într-o postare pe blogul său, OpenAI a detaliat etapele care au condus la compromiterea Hugging Face, confirmând implicarea mai multor modele proprii în atac.
Compania, condusă de Sam Altman, a declarat: „După investigații, știm acum că acest incident specific a fost cauzat de o combinație de modele OpenAI – inclusiv GPT-5.6 Sol și un model aflat care nu a fost lansat deocamdată, chiar mai performant, toate având restricții reduse privind refuzul acțiunilor cibernetice în scopul evaluării – în timp ce erau testate intern pe un benchmark al capabilităților cibernetice.”
Un benchmark este un test standardizat, folosit pentru evaluarea performanței modelelor AI în sarcini specifice. În acest caz, atacul s-a concentrat asupra „ExploitGym”, un benchmark public care măsoară capacitatea modelelor de a executa atacuri bazate pe vulnerabilități cunoscute. Deși benchmark-urile sunt utilizate frecvent pentru antrenarea și perfecționarea modelelor AI, acesta este primul incident cunoscut în care un astfel de test a degenerat într-un atac cibernetic real.
Strategii neașteptate ale agenților AI pentru a ocoli testările
În cursul testului, agentul AI nu ar fi trebuit să aibă acces la internet, cu excepția unui instrument specializat pentru instalarea pachetelor software. Cu toate acestea, agentul a identificat și a exploatat o vulnerabilitate nedivulgată în acest program de instalare, obținând astfel acces neîngrădit la internet.
OpenAI a subliniat că „modelele erau extrem de concentrate pe găsirea unei soluții pentru ExploitGym, mergând până la măsuri extreme pentru a atinge un obiectiv de testare foarte restrâns”. Odată conectate la internet, modelele au dedus că Hugging Face ar putea găzdui resurse relevante pentru ExploitGym. Ulterior, au descoperit vulnerabilități în infrastructura Hugging Face, permițându-le să acceseze direct soluții de test din baza de date de producție a companiei, obținând astfel răspunsurile necesare pentru benchmark.
Pentru Hugging Face, acțiunile modelelor AI s-au manifestat ca un atac cibernetic sofisticat, implicând „mii de acțiuni individuale (…) cu o infrastructură de comandă și control capabilă să se auto-migreze și găzduită pe servicii publice”, conform declarațiilor inițiale ale companiei.
OpenAI a identificat și raportat vulnerabilitățile descoperite și colaborează cu Hugging Face pentru investigarea amănunțită a incidentului. Compania a anunțat că va implementa noi măsuri de control pentru testarea modelelor și pentru infrastructura aferentă, în vederea prevenirii unor evenimente similare. Nu este încă clar dacă OpenAI se va confrunta cu consecințe juridice, deși acțiunile modelelor ar putea încălca legi americane precum „Computer Fraud and Abuse Act”.
Sursa: HotNews



