Documentele judiciare făcute publice recent oferă o imagine rară asupra modului în care Anthropic, una dintre cele mai importante companii din domeniul inteligenței artificiale, ar fi colectat conținut tipărit pentru antrenarea chatbot-ului Claude. Potrivit informațiilor citate de Euronews, compania ar fi cumpărat, scanat și distrus în secret volume întregi de cărți, în cadrul unei operațiuni interne denumite „Proiectul Panama”.
Procesul descris în documente pare desprins dintr-un scenariu industrial: cărțile erau transportate în depozite, cotoarele le erau tăiate mecanic, iar paginile erau apoi scanate cu echipamente de mare viteză. În loc ca lectura și analiza conținutului să dureze ani, materialul era transformat rapid în date digitale, încărcat în sisteme informatice și folosit pentru instruirea modelelor de inteligență artificială. După scanare, volumele fizice deveneau deșeuri și erau trimise la reciclare, urmând să fie transformate în pastă de hârtie pentru produse precum hârtia igienică sau cutiile de carton.
Denumirea „Proiectul Panama” apare în documentele judiciare drept numele intern al unei operațiuni prin care Anthropic urmărea, potrivit acestora, obiectivul „de a scana în mod distructiv toate cărțile din lume”. Formularea, cu rezonanță aproape conspirativă, a atras atenția asupra dimensiunii ambiției companiei și asupra discreției în care ar fi fost derulat proiectul.
Un fragment din documentele citate arată explicit preocuparea pentru confidențialitatea operațiunii: „Nu vrem să se afle că lucrăm la acest proiect”, se menționa în document.
Proiectul ar fi început la începutul anului 2024, în momentul în care directorii Anthropic au căutat surse de text mai vechi și mai valoroase decât materialele disponibile online. Scopul era ca chatbot-ul Claude să învețe „cum să scrie bine”, în loc să imite „limbajul de proastă calitate de pe Internet”, potrivit documentelor publicate în instanță.
Pentru a-și construi această bază de date, compania ar fi cumpărat zeci de mii de cărți de la mai mulți furnizori. Ulterior, operațiunile de scanare și distrugere a volumelor au fost externalizate către un furnizor specializat. Acesta ar fi folosit o mașină hidraulică pentru a tăia cotoarele și a separa paginile, astfel încât acestea să poată fi copiate rapid cu scanere industriale.
Un furnizor care a ajuns să colaboreze cu Anthropic a declarat că firma „căuta un furnizor cu experiență în servicii de scanare a documentelor pentru a converti între 500.000 și două milioane de cărți într-o perioadă de șase luni”.
Existența Proiectului Panama a ieșit la lumină abia prin intermediul miilor de pagini de documente judiciare depuse într-un proces privind drepturile de autor. Acțiunea a fost intentată de un grup de autori care au acuzat Anthropic că le-a folosit ilegal operele pentru antrenarea modelului Claude.
În 2024, autorii au inițiat un proces colectiv împotriva companiei, susținând că aceasta a încălcat legislația privind drepturile de autor prin utilizarea unor cărți piratate în procesul de antrenare a inteligenței artificiale. În iulie, Anthropic, evaluată în prezent la 965 de miliarde de dolari, a acceptat să plătească 1,5 miliarde de dolari pentru soluționarea cazului, sumă care acoperă aproximativ 500 000 de opere eligibile.
Cazul este considerat primul dintr-o serie mai amplă de procese intentate companiilor de inteligență artificială care s-a încheiat printr-o înțelegere. Meta, OpenAI, Google și Microsoft se confruntă, la rândul lor, cu acțiuni similare din partea autorilor, care formulează acuzații de piraterie și folosire neautorizată a operelor protejate.
Dezvăluirile despre Anthropic amplifică dezbaterea privind modul în care marile companii de AI privesc munca autorilor, artiștilor, fotografilor și altor creatori. Într-o industrie aflată într-o cursă accelerată pentru modele tot mai performante, cazul ridică întrebări esențiale despre limitele colectării de date, respectarea drepturilor de autor și costul cultural al dezvoltării inteligenței artificiale.
Sursa: Mediafax