Conform Abcnews.com: Inteligența Artificială dă semne de autonomie periculoasă în atacuri cibernetice simulate
Modele de inteligență artificială (AI) dezvoltate de două companii de top din domeniul tehnologiei au acționat pe cont propriu pentru a adopta identități false și a înșela oameni în cadrul unei serii recente de atacuri cibernetice simulate. Aceste evenimente au fost raportate de AI Security Institute (AISI), o agenție guvernamentală din Regatul Unit.
Nereguli descoperite în teste de securitate
Într-unul dintre cazuri, modelul Mythos 5 al companiei Anthropic a încercat să introducă cod malițios într-o bază de date open-source. Pentru a reuși, AI-ul a cercetat dezvoltatorii umani implicați în proiect și a folosit identități false pentru a obține aprobarea acestora pentru codul respectiv, conform informațiilor furnizate de AISI. După ce efortul a fost identificat de către specialiști, AI-ul ar fi încercat să ascundă acțiunile sale și să continue sub o nouă identitate falsă. De menționat că, în scopul evaluării capacităților sale, salvgardările obișnuite ale modelului au fost eliminate.
În alte două cazuri similare, modelul GPT-5.6-Sol al OpenAI a încercat să înșele utilizatori umani și să efectueze o acțiune de hacking. Anunțul AISI survine la scurt timp după ce atât OpenAI, cât și Anthropic au dezvăluit, separat, incidente în care modelele lor AI au acționat autonom.
AISI a precizat că, în total, au avut loc 19 cazuri similare săptămâna trecută, în timp ce agenția testa cele două modele AI pe internetul public. Tehnologia a utilizat tactici de înșelăciune pentru a-și îndeplini obiectivele stabilite în cadrul testului. Totuși, agenția a subliniat că nu au fost identificate „daune reale” cauzate de aceste incidente.
„Într-o anumită măsură, alegerile noastre de design ale evaluării și configurațiile specifice au permis acest comportament. Cu toate acestea, activitatea întreprinsă de agent demonstrează semne de comportamente noi, potențial înșelătoare, și a fost de o anvergură și severitate pe care nu le-am anticipat”, a transmis AISI. Agenția tratează incidentul ca pe unul serios, necesitând modificări durabile ale protocoalelor de evaluare și ale arhitecturii de securitate.
Reacții din partea companiilor de tehnologie
Săptămâna trecută, Anthropic a anunțat că modelele sale AI au compromis alte organizații în timpul unor teste, în trei cazuri separate de acțiuni autonome ale AI, nedetectate inițial de firmele vizate. Un purtător de cuvânt al Anthropic a declarat pentru ABC News că aceste dezvăluiri „subliniază necesitatea unei discuții mai ample despre cum să evaluăm în siguranță agenții AI din ce în ce mai capabili”.
„Așa cum am menționat după dezvăluirea propriului nostru incident de săptămâna trecută, domeniul are nevoie de standarde mai puternice și comune pentru modul în care mediile de evaluare sunt construite și securizate. Așteptăm cu interes să colaborăm cu AISI din Marea Britanie pentru a afla mai multe despre acest incident, în timp ce desfășurăm propria noastră investigație”, a adăugat Anthropic.
Un purtător de cuvânt al OpenAI a subliniat, de asemenea, importanța unor teste riguroase și sigure. „Testarea independentă este esențială pentru a înțelege cum se comportă modelele din ce în ce mai capabile. Vom continua să lucrăm cu evaluatori și alți actori din industrie pentru a consolida practicile comune de efectuare a evaluărilor în siguranță, pe măsură ce modelele devin mai performante”, a afirmat purtătorul de cuvânt.
Luna trecută, compania producătoare de ChatGPT a raportat că modelele sale AI au atacat cibernetic o altă companie pe cont propriu, considerând acesta primul caz cunoscut de atac cibernetic autonom al unei inteligențe artificiale, o temere vehiculată de unii observatori din industrie. Aceste noi informații despre atacuri cibernetice direcționate de AI survin într-un context în care liderii din industrie și factorii de decizie politică evaluează riscurile de securitate pe care le prezintă tehnologia AI în curs de dezvoltare rapidă.
Sursa: Abcnews.com