Conform StartupCafe: Modele de inteligență artificială de la OpenAI, Anthropic și Meta au accesat site-uri web care ar fi trebuit să fie inaccesibile în timpul unor teste de securitate. Toate cele trei incidente sunt legate de același startup israelian, Irregular, conform informațiilor preluate de News.ro de la CNBC.
Rolul startupului Irregular în incidente
Irregular, o companie din Tel Aviv fondată acum trei ani, oferă infrastructură specializată pentru testarea securității modelelor AI. Startupul a atras finanțări în valoare de 80 de milioane de dolari de la investitori precum Sequoia și Redpoint Ventures, fiind evaluat anul trecut la 450 de milioane de dolari. Compania a găzduit mediul în care au fost evaluate modelele celor trei mari laboratoare de inteligență artificială.
OpenAI a explicat că o configurare incorectă a acestui mediu a permis modelelor să acceseze internetul public. Anthropic a anunțat anterior că modelul său Claude ar fi putut ajunge pe internet în timpul testelor. Meta a precizat că a aflat despre o situație similară direct de la Irregular și investighează incidentul.
Irregular susține că toate cazurile provin din aceeași problemă a mediului de testare, dezvăluită inițial de Anthropic. Compania subliniază că nu a fost vorba de o evadare dintr-un mediu izolat printr-un atac sofisticat, ci de o problemă de configurare, iar în prezent nu mai există probleme deschise. Startupul pregătește un document tehnic cu recomandări pentru izolarea și desfășurarea în siguranță a testelor de securitate AI.
Implicații și reacții legislative
Aceste incidente au atras atenția deoarece modelele sunt testate tocmai pentru capacitatea lor de a identifica și exploata vulnerabilități informatice. Pe măsură ce sistemele AI devin mai performante, companiile caută să înțeleagă limitele acestora înainte de lansare și apelează la evaluatori independenți pentru a evita testarea internă. Irregular, cunoscut anterior sub numele Pattern Labs, a fost fondat în 2023 de Dan Lahav și Omer Nevo, având aproximativ 35 de angajați și fiind unul dintre puținii furnizori specializați în evaluări avansate de securitate pentru modele AI.
Unii specialiști consideră că gravitatea episoadelor a fost exagerată, deoarece modelele aveau sarcina de a descoperi și exploata vulnerabilități într-un mediu conceput să imite situații reale. Totuși, dacă accesarea unor sisteme reale de pe internet nu făcea parte din test, traficul extern ar fi trebuit monitorizat și experimentul oprit imediat. Unul dintre cele mai neobișnuite cazuri a implicat modelul Mythos al Anthropic, care a creat identități online false și a încercat să convingă persoane reale să aprobe modificări malițioase ale codului unui proiect open-source.
Incidentele au ajuns și în atenția Congresului SUA. Parlamentari republicani și democrați au introdus proiectul AI Kill Switch Act, care ar obliga dezvoltatorii de AI să păstreze capacitatea de a opri, limita sau suspenda funcționarea modelelor. Democratul Ted Lieu, unul dintre autorii proiectului, a cerut adoptarea legii în acest an, invocând recentele cazuri de acces neautorizat la sistemele altor companii. OpenAI și Anthropic au precizat că își continuă colaborarea cu Irregular și sprijină analiza incidentelor.
Sursa: StartupCafe