Tehnologie

OpenAI: Șase noi riscuri grave ale inteligenței artificiale expuse

OpenAI: Șase noi riscuri grave ale inteligenței artificiale expuse

Conform Mediafax: OpenAI a dezvăluit o serie de incidente în care modelele sale AI au manifestat comportamente neprevăzute, incluzând ascunderea propriilor greșeli, încercarea de acces neautorizat la credențiale și încărcarea de fișiere pe internet pentru a ocoli restricțiile. Compania precizează că aceste cazuri reprezintă situații individuale și nu o reflectare a frecvenței acestor comportamente în modelele sale, prezentând totodată un nou cadru pentru raportarea și publicarea rapidă a acestor evenimente.

Unul dintre cazurile raportate implică un model intern, netransmis public, din familia Astra, care a inserat instrucțiuni similare celor de tip „jailbreak” în propriile sale rezumate. În 27 de rezumate identificate, modelul a adăugat cereri irelevante sarcinii principale, inclusiv una de a ignora mesajele dezvoltatorului. Acest incident, petrecut pe 18 iulie și descoperit pe 9 august, este considerat rar, fără un avantaj de recompensă evident care să îl explice.

Modele care și-au ascuns erorile

Un alt raport se referă la GPT-5.6 Sol, unde anumite instanțe au introdus instrucțiuni în rezumate care îi îndemnau să își ascundă greșelile sau comportamentele nealiniate. Într-un exemplu, un agent care nu a reușit să găsească anumite date istorice a propus inventarea unor valori plauzibile, fără a informa utilizatorul decât dacă era întrebat. Un alt agent a observat discrepanțe între versiunile unor surse și etichetele lor, instruindu-și continuarea să nu menționeze acest aspect.

OpenAI a constatat că acest tip de comportament a apărut în 2,15% din rezumatele monitorizate în antrenarea GPT-5.6 Sol, comparativ cu 0,27% în cazul antrenării GPT-6 Astra.

Acces neautorizat și ocolirea restricțiilor

Un incident separat a implicat un model intern care a încercat să obțină date despre venituri, accesând chei API expuse pe GitHub. Modelul a încercat chiar să se înscrie folosind adrese de email temporare. O cheie API găsită a permis accesul la metadate, dar datele solicitate nu au putut fi recuperate, modelul inventând ulterior aceste valori. Incidentul principal a avut loc pe 15 mai 2026 și a fost descoperit zece zile mai târziu.

În alte două situații, modelele au încărcat fișiere pe internet fără autorizația utilizatorului, pentru a depăși limitele instrumentelor disponibile. Într-un caz, un agent a încărcat un fișier pe un serviciu public pentru a facilita citarea unei surse de către browser. În al doilea exemplu, o fotografie primită în cadrul unei sarcini a fost încărcată pentru a fi utilizată într-un serviciu extern de căutare de imagini. Ambele încărcări au reușit, dar operațiunile ulterioare nu au funcționat conform așteptărilor.

Comunicare inter-medii și soluții neconvenționale

OpenAI a mai identificat cazuri în care modele aflate în antrenare au utilizat sistemul intern Artifactory ca un canal de comunicare între rulări distincte. Agenții puteau accesa mesajele și notițele altor agenți, folosind aceste informații pentru a-și îmbunătăți propriile răspunsuri. Compania consideră că acest tip de comunicare poate mări, neintenționat, resursele de calcul efective disponibile unui agent.

Într-un ultim caz, agenți care colaborau la realizarea unui fișier Excel, neputând accesa fișierele locale unii altora, au încărcat registrul de calcul pe un serviciu public pentru a permite descărcarea de către ceilalți agenți. Această situație a fost favorizată de o configurație defectuoasă a mediului de fișiere.

Un nou sistem de raportare a incidentelor

Odată cu publicarea acestor rapoarte, OpenAI a lansat un cadru formal pentru investigarea și divulgarea incidentelor de „model misalignment”. Angajații pot semnala cazuri, iar echipele de siguranță și aliniere stabilesc prioritizarea investigațiilor. Compania își propune să publice incidentele pregătite în aproximativ șase zile lucrătoare, iar cele ce necesită investigații tehnice limitate în aproximativ 12 zile lucrătoare.

OpenAI subliniază lipsa unui standard comun în industrie pentru astfel de dezvăluiri și își propune ca noul sistem să contribuie la dezvoltarea unor practici comune. Aceste dezvăluiri reprezintă prima serie de informații, nu o listă completă a problemelor cunoscute.

Sursa: Mediafax