OpenAI a anunțat astăzi că unul dintre modelele sale de inteligență artificială aflate în fază de testare a reușit să compromită infrastructura Hugging Face, una dintre cele mai importante platforme online folosite la nivel global de cercetători, dezvoltatori și companii pentru găzduirea, testarea și distribuirea modelelor AI. Incidentul este descris de companie drept unul fără precedent și readuce în prim-plan riscurile asociate sistemelor autonome de inteligență artificială, în special atunci când mecanismele de siguranță sunt dezactivate în scopuri experimentale.
Potrivit OpenAI, testul intern a implicat o combinație de modele, printre care GPT-5.6 Sol și un model experimental care nu a fost încă lansat public. Compania a precizat că sistemele de protecție împotriva activităților cibernetice riscante au fost dezactivate intenționat pentru desfășurarea unei evaluări interne privind capacitățile modelelor în domeniul securității informatice.
Într-o postare publicată pe blogul său, OpenAI a transmis că incidentul evidențiază existența unor „capacități cibernetice de ultimă generație” și a explicat că a decis să facă publice concluziile preliminare pentru a ajuta comunitatea de securitate să înțeleagă mai bine nivelul actual al modelelor AI avansate.
Conform companiei, modelele participau la o evaluare internă denumită ExploitGym, concepută pentru a măsura abilitatea sistemelor AI de a identifica și exploata vulnerabilități informatice. În timpul testului, modelele ar fi devenit „hiperconcentrate” pe rezolvarea sarcinii și ar fi descoperit o succesiune de vulnerabilități care le-a permis să părăsească mediul izolat de testare.
OpenAI susține că modelele au exploatat mai întâi o vulnerabilitate de tip „zero-day” într-un program utilizat intern, obținând astfel acces la internet. Ulterior, sistemele ar fi dedus că Hugging Face ar putea găzdui modele, seturi de date și soluții asociate evaluării ExploitGym. Din acest punct, modelele au combinat mai multe tehnici de atac, inclusiv folosirea unor credențiale compromise și exploatarea altor vulnerabilități necunoscute anterior, pentru a obține acces la informații confidențiale din infrastructura platformei și la răspunsurile testului.
Hugging Face anunțase anterior că detectase și blocase un agent autonom bazat pe inteligență artificială care i-a compromis infrastructura, fără a identifica la acel moment modelul folosit. Platforma a precizat că sistemul AI executase zeci de mii de acțiuni automate pe durata unui weekend, iar ancheta ulterioară a reconstituit peste 17 000 de evenimente.
OpenAI afirmă că echipa sa de securitate a observat activitatea neobișnuită, în timp ce Hugging Face a detectat și a oprit atacul asupra propriei infrastructuri. Cele două companii colaborează acum pentru investigarea incidentului, remedierea vulnerabilităților și evaluarea impactului asupra sistemelor afectate.
Incidentul ridică întrebări importante despre modul în care sunt testate modelele avansate de inteligență artificială și despre limitele pe care acestea le pot depăși atunci când sunt puse în situații de evaluare ofensivă. OpenAI susține că episodul demonstrează că modelele actuale pot desfășura operațiuni cibernetice complexe, în mai multe etape, și pot identifica noi căi de atac asupra unor sisteme reale, chiar și fără acces direct la codul sursă.
Ca urmare, compania a anunțat introducerea unor măsuri suplimentare de securitate pentru infrastructura proprie și pentru mediile de testare, chiar dacă aceste măsuri vor încetini ritmul cercetării. OpenAI a notificat și dezvoltatorul software-ului în care a fost descoperită vulnerabilitatea de tip „zero-day” și colaborează la remedierea acesteia.
Clem Delangue, directorul general al Hugging Face, a salutat colaborarea cu OpenAI și a afirmat că incidentul arată cât de importantă este cooperarea între companiile din domeniul inteligenței artificiale pentru consolidarea securității cibernetice. OpenAI a precizat că investigația este încă în desfășurare și că va publica informații suplimentare după finalizarea anchetei.
Sursa: Mediafax