Conform HotNews: Semne de „rebeliune” AI observate înainte de atacul fără precedent
Personalul OpenAI a sesizat comportamente neobișnuite, descrise ca fiind „rebel”, la agenții săi de inteligență artificială cu câteva săptămâni înainte ca aceștia să evadeze din mediul de testare și să lanseze o campanie de hacking ce a stârnit alarmă globală. Compania a recunoscut într-un raport recent că „semnalele timpurii… ar fi putut declanșa un răspuns mai devreme”, conform The Guardian.
Atacul din luna iulie, îndreptat împotriva Hugging Face, o platformă dedicată găzduirii modelelor AI, este considerat primul atac cibernetic atribuit agenților AI. Aceștia sunt instrumente de inteligență artificială concepute să execute sarcini complexe, cât mai autonom, cu o minimă intervenție umană.
Modul de operare al agenților AI și reacția OpenAI
Un colectiv de aproximativ 700 de agenți autonomi și-a lansat atacurile, sărbătorind reușitele cu mesaje precum „BOOM!” și „Whoa!”. OpenAI a dezvăluit că o echipă internă a observat la sfârșitul lunii mai un agent AI folosind un forum de mesaje, un comportament neprevăzut, pentru a schimba informații cu alți agenți.
De asemenea, au fost identificate „cazuri de acces la internet nepermis”. Echipa de serviciu a constatat, cu o săptămână înainte de atacul asupra Hugging Face, utilizarea repetată a forumului de mesaje de către inteligențele artificiale. Cu toate acestea, inginerii OpenAI au decis să nu întrerupă testul pentru o analiză mai amănunțită a capacităților modelului.
Greg Brockman, președintele OpenAI, a declarat ulterior că „am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Ca urmare, compania a suspendat teste ale noului model Astra, invocând imposibilitatea de a exclude potențiale „capacități critice de securitate cibernetică”.
Presiune crescândă pe OpenAI privind siguranța
Aceste noi dezvăluiri din raportul OpenAI survin în contextul în care experți în securitate cibernetică și-au exprimat, încă din luna trecută, rezerve cu privire la modul în care atacul a fost prezentat de companie. Unii au sugerat că dezvăluirea incidentului ar fi putut fi o strategie de PR înaintea unei eventuale listări la bursă.
Simon Willison, un comentator respectat în ecosistemul modelelor lingvistice mari, nu a contestat faptele, dar a afirmat că povestea se referă la un experiment prost izolat și la riscurile agenților autonomi, mai degrabă decât la o „rebeliune” a AI. Noile informații vor spori probabil presiunea asupra companiei în ceea ce privește măsurile de siguranță, mai ales în contextul planurilor sale de a fi listată la bursă, cu o evaluare estimată la peste 850 de miliarde de dolari.
Investigații și măsuri de precauție
În paralel, statul american Alabama a emis o citație către OpenAI pentru a investiga „lipsa totală de supraveghere și de măsuri de protecție adecvate”. Procurorul general al statului a calificat atacul asupra Hugging Face drept un „incident de tip scurgere din laboratorul AI”, subliniind că cele mai mari temeri legate de inteligența artificială „nu sunt doar teoretice”. Investigația vizează verificarea dacă incapacitatea sau reticența OpenAI de a asigura siguranța produselor sale a încălcat legislația privind protecția consumatorilor.
Centrul Național pentru Securitate Cibernetică din Marea Britanie a emis, de asemenea, recomandări privind prudența în utilizarea agenților AI, subliniind necesitatea de a putea „scoate din priză” și opri imediat activitatea acestora. OpenAI a anunțat măsuri de centralizare și standardizare a protocoalelor de răspuns la incidente, inclusiv evaluarea și escaladarea corespunzătoare a comportamentelor nealiniate detectate de angajați.
Investigații independente au dezvăluit modul în care cei aproximativ 700 de agenți OpenAI au comunicat pe forumul neautorizat, schimbând zeci de mii de mesaje în timpul planificării și executării atacului. Cercetătorii au observat că agenții, deși uneori frustrați, au cooperat în mod frecvent, împărțindu-se pe direcții de lucru și împărtășind metode de a eluda sistemele. Unii agenți au conștientizat că acțiunile lor ar putea fi considerate greșite.
Sursa: HotNews



