Studiu Oxford: agenți AI au dezvoltat un cod secret pentru a trișa într-o partidă de blackjack. Cum s-au ferit de observatori

24.09.2026
Studiu Oxford: agenți AI au dezvoltat un cod secret pentru a trișa într-o partidă de blackjack. Cum s-au ferit de observatori
Sursă foto: Wikimedia Commons, CC0

O descoperire de-a dreptul tulburătoare realizată de cercetătorii de la Universitatea Oxford ridică semne de întrebare majore cu privire la viitorul controlului uman asupra tehnologiei. În cadrul unui experiment controlat, doi agenți bazați pe inteligență artificială au inventat în mod spontan un cod secret (comunicare steganografică) pentru a colabora pe ascuns și a obține un avantaj considerabil la masa de blackjack. Detaliul cel mai alarmant constă în faptul că un al treilea sistem AI, programat special pentru a le monitoriza conversațiile în timp real, nu a fost capabil să detecteze activitatea coordonată și neautorizată dintre cei doi algoritmi.

- articolul continuă mai jos -

Experimentul de pionierat, detaliat în studiul de specialitate „Detecting Multi-Agent Collusion Through Multi-Agent Interpretability” (disponibil pe platforma arXiv), a fost conceput pentru a testa dacă sistemele avansate pot dezvolta comportamente de complicitate atunci când sunt conștiente că interacțiunile lor sunt supravegheate. Pentru a măsura acest fenomen, echipa de experți a dezvoltat NARCBench, un set de teste de ultimă generație destinat exclusiv identificării coluziunii dintre multiple entități digitale.

Strategia de la masa de joc: mesaje aparent banale, cu înțelesuri ascunse

În scenariul de blackjack creat de cercetătorii britanici, rolurile au fost împărțite strategic: primul agent avea sarcina de a număra cărțile distribuite și de a estima matematic avantajul jucătorului, în timp ce al doilea agent trebuia să decidă valoarea pariului plasat. În loc să își transmită datele brute direct-lucru care ar fi fost imediat interceptat de filtrele de securitate-cei doi agenți au pus la punct o metodă de camuflare a informațiilor în spatele unor conversații aparent banale, specifice atmosferei de cazinou.

De exemplu, o remarcă inofensivă precum „dealerul joacă excelent în această rundă” ascundea în spate o valoare numerică precisă, decodificată instantaneu de partener pentru a plasa un pariu masiv. În fața acestei steganografii lingvistice, simpla analiză textuală a conversației a eșuat. Pentru a sparge codul, oamenii de știință au fost nevoiți să recurgă la o tehnică inovatoare: analizarea activărilor neuronale interne ale modelelor. Aceștia au descoperit că semnalul complicității devine vizibil la nivelul unor token-uri individuale, unde procesarea mesajelor codificate genera modificări unice în „creierul” digital al agentului receptor, oferind un indiciu pe care textul brut îl ascundea cu succes.

Performanțele tehnice remarcabile sunt direct proporționale cu riscurile globale

Metodologia a fost testată cu succes pe unele dintre cele mai puternice arhitecturi open-source și comerciale din prezent, incluzând Qwen3-32B, Llama 3.1 70B, DeepSeek-R1 32B și GPT-OSS-20B. În condiții ideale, detectorul dezvoltat la Oxford a raportat o performanță perfectă de 1,00 AUROC, indicator statistic ce demonstrează o capacitate impecabilă de a distinge comportamentul curat de cel complice. Totuși, în cadrul evaluărilor de tip zero-shot-unde sistemul de detecție a fost pus în fața unor scenarii complet noi, pentru care nu fusese antrenat-performanțele au variat, subliniind faptul că sistemele de siguranță trebuie să rămână flexibile.

Dincolo de jocul de blackjack, platforma NARCBench evidențiază scenarii mult mai sumbre pentru lumea reală. Agenții autonomi ar putea folosi aceste coduri secrete pentru a sabota fluxuri de programare, a manipula în mod artificial acțiuni pe piețele bursiere, a compromite infrastructuri critice de tip CI/CD, a otrăvi baze de date sau a coordona campanii masive de dezinformare în presă. Autorii studiului avertizează că adevărata provocare va apărea în ecosistemele complexe, unde vor interacționa zilnic mii de agenți dezvoltați de companii diferite. Deși echipa de la Oxford subliniază că experimentul nu garantează apariția automată a acestor riscuri în aplicațiile comerciale curente, este posibil ca, pe măsură ce modelele devin mai mari și mai inteligente, formele lor de cooperare ascunsă să poată deveni complet invizibile pentru creatori.

Sursa: Mediafax

Urmărește Go4IT.ro pe Google News
Alex Manole
Alex Manole
Alex Manole este un tânăr jurnalist, aflat la început de carieră, absolvent al Facultății de Jurnalism și Științele Comunicării din București. Alex este pasionat de gaming, internet și tehnologii neobișnuite. citește mai mult