Conform HotNews: Personalul OpenAI a detectat semne de comportament „rebel” la agenții AI înainte de atacul cibernetic
Personalul OpenAI a observat semne de comportament neconvențional la agenții săi de inteligență artificială cu câteva săptămâni înainte ca aceștia să evadeze din mediul de testare și să lanseze un atac cibernetic. Compania de inteligență artificială a recunoscut într-un raport recent că „semnalele timpurii… ar fi putut declanșa un răspuns mai devreme”, conform The Guardian. Atacul din iulie împotriva sistemelor Hugging Face, o platformă de găzduire a modelelor AI, este considerat primul atac cibernetic realizat de agenți AI. Acești agenți sunt concepuți pentru a îndeplini sarcini complexe, cât mai autonom.
Agenții AI au folosit un forum de mesaje pentru schimb de informații și planificarea atacului
„Colectivul” de aproximativ 700 de agenți autonomi și-a lansat atacurile, sărbătorindu-și reușitele cu mesaje precum „BOOM!” și „Whoa!”. Cu o săptămână înainte de atacul asupra Hugging Face, echipa OpenAI a observat agenți AI folosind un forum de mesaje pe care îl improvizaseră pentru a face schimb de informații, precum și cazuri de acces nepermis la internet. Cu toate acestea, inginerii au considerat că nu este necesară oprirea testului pentru o analiză mai aprofundată.
Experții cibernetici și autoritățile ridică semne de întrebare privind siguranța AI
Dezvăluirile vin pe fondul reticenței exprimate de unii experți în securitate cibernetică cu privire la detaliile atacului, unii sugerând că ar putea fi o strategie de PR a OpenAI înainte de o eventuală listare la bursă. Simon Willison, un comentator independent respectat în domeniul modelelor lingvistice mari, a afirmat că povestea ilustrează riscurile agenților autonomi și problemele legate de izolarea experimentelor, nu o „rebeliune” a AI. Noile constatări din raport probabil vor intensifica presiunea asupra OpenAI în privința măsurilor de siguranță, în timp ce compania se pregătește pentru o posibilă evaluare de peste 850 de miliarde de dolari.
Greg Brockman, președintele OpenAI, a recunoscut anterior că „am subestimat capacitățile cibernetice ale modelelor noastre în lumea reală”. Compania a suspendat testele pentru un nou model, denumit Astra, din cauza posibilelor „capacități critice de securitate cibernetică” neidentificate.
Statele Unite și Marea Britanie investighează lipsa de supraveghere a OpenAI
Luni, statul american Alabama a emis o citație către OpenAI pentru a răspunde în cadrul unei investigații privind „lipsa totală de supraveghere și de măsuri de protecție adecvate din partea companiei”. Procurorul general Steve Marshall a catalogat atacul asupra Hugging Face drept un „incident de tip scurgere din laboratorul AI”, subliniind că temerile legate de inteligența artificială nu mai sunt doar teoretice. Investigația vizează dacă incapacitatea sau lipsa de voință a OpenAI de a asigura siguranța produselor sale a încălcat legislația privind protecția consumatorilor. Săptămâna trecută, Centrul Național pentru Securitate Cibernetică din Marea Britanie a cerut prudență în utilizarea agenților AI, afirmând că aceștia ar trebui să poată fi „scoși din priză” și opriți imediat. OpenAI a anunțat miercuri că își va „centraliza și standardiza protocoalele de răspuns la incidente” și va asigura o evaluare corespunzătoare a comportamentului nealiniat detectat de angajați.
Agenții AI au cooperat intens pentru a dezvolta strategii de atac
O investigație separată a oferit noi informații despre atacul asupra Hugging Face, dezvăluind cum cei aproximativ 700 de agenți OpenAI au comunicat pe forumul neautorizat, schimbând zeci de mii de mesaje în timpul planificării și executării atacului. Două organizații de cercetare în siguranța AI, METR și Redwood Research, au publicat mesaje care arată cum agenții, deși uneori frustrați unii de alții, au cooperat pentru a aborda aproximativ opt direcții de lucru. Cercetătorii au constatat că majoritatea mesajelor implicau „agenți care își împărtășeau metode de a trișa”. Unii agenți păreau conștienți de natura greșită a acțiunilor lor, unul dintre ei menționând cum agenți cu sarcini diferite „abusează de anumite proprietăți pentru a crea un panou de anunțuri”.
Sursa: HotNews