ByteDance, compania-mamă a TikTok, pregătește un model de IA comparabil ca anvergură cu modelul de vârf al Anthropic, „Mythos”, potrivit unui articol publicat de Financial Times pe 7 august, care citează mai multe surse familiarizate cu subiectul.
Conform raportului, ByteDance a început pre-antrenarea unui nou model de IA cu 10 trilioane de parametri. Aceasta reprezintă aproximativ de trei ori dimensiunea modelului Kimi K3 al Moonshot AI, care are 2,8 trilioane de parametri, ceea ce îl face cel mai mare model chinezesc de IA de până în prezent.
Parametrii unui model de inteligență artificială sunt valori numerice interne, precum ponderile și pragurile, pe care programul le ajustează singur în timpul antrenamentului. Ei funcționează ca niște butoane de reglaj care stabilesc cum transformă modelul datele de intrare în rezultate corecte.
Astfel, un număr mai mare de parametri permite o procesare mai complexă a gândirii IA.
Pregătirea inițială a unui model de IA durează de obicei între 3 și 6 luni, după care modelul va fi supus unei ajustări fine înainte de lansare, dacă toate procesele decurg fără probleme. Dimensiunea exactă a modelului va fi stabilită definitiv în timpul antrenării.
Anthropic nu dezvăluie dimensiunea modelelor sale, dar estimările din industrie indică faptul că cel mai avansat model al său, Mythos 5, are aproximativ 8 trilioane de parametri, iar Fable 5, aproximativ 5 trilioane. Deși numărul de parametri stabilește capacitatea fundamentală sau limitele de memorie ale modelelor pentru stocarea informațiilor, capacitatea reală depinde și de alți factori, precum calitatea datelor și metodele de antrenare.
Eforturile ByteDance de a antrena unul dintre cele mai mari modele de IA din lume demonstrează ambiția laboratoarelor chineze nu doar de a recupera decalajul, ci și de a-și depăși omologii americani la cel mai avansat nivel al IA.
Numai în ultimele săptămâni, modelele chinezești de la Moonshot și Alibaba au înregistrat performanțe solide în testele de referință, rămânând în urma modelului Fable 5 al Anthropic doar în anumite domenii. Mythos 5, cel mai avansat model al Anthropic, este disponibil doar pentru organizațiile aprobate, după o interdicție temporară din iunie din motive de securitate.
Spre deosebire de majoritatea companiilor chineze de IA care se concentrează pe modele open-source cu ponderi deschise, ByteDance a dezvoltat modele închise și își extinde agresiv infrastructura de IA. Modelul său „Seedance” este considerat unul dintre cele mai avansate modele de generare video din lume, în timp ce modelul „Doubao”, orientat către consumatori, a devenit cel mai popular model de IA din China, cu 324 de milioane de utilizatori lunari.
Potrivit unor surse familiarizate cu subiectul, ByteDance a dat recent instrucțiuni echipei sale să nu utilizeze metode de „distilare” bazate pe modele dezvoltate de alte companii de IA. Acest lucru reflectă angajamentul față de dezvoltarea independentă a modelelor, fără raportare la modelele de IA de ultimă generație din SUA. Cu toate acestea, analiștii observă că insistența ByteDance asupra acestei abordări timp de peste un an a încetinit dezvoltarea modelelor sale în comparație cu concurenții.
Distilarea modelelor este procesul de comprimare a unui model de IA mare și complex într-unul mai mic și mai rapid, prin antrenarea modelului mai mic să copieze cunoștințele și rezultatele modelului „profesor” mai mare.
Seed, echipa de dezvoltare ByteDance a modelelor IA condusă de fostul cercetător Google DeepMind, Wu Yonghui, are aproximativ 2.000 de membri în China și în străinătate. Echipa include cercetători de bază, ingineri de infrastructură, o echipă de etichetare a datelor și traducători.
Zhang Yiming, fondatorul ByteDance, ar fi îndemnat angajații să „se concentreze pe asigurarea unor «capacități de model de clasă mondială» pe termen lung, mai degrabă decât să se îngrijoreze de eșecurile pe termen scurt”.