Meta a lansat Muse Voice Transcribe, un model de inteligență artificială capabil să transcrie vocea în timp real. Sistemul poate identifica mai mult de 20 de vorbitori și poate procesa conversații în mai multe limbi.
Modelul a fost dezvoltat de Meta Superintelligence Labs și face parte din familia Muse Spark. Meta îl prezintă drept primul său model de percepție audio conceput pentru procesare în timp real.
Modelul procesează sunetul în segmente de câte 80 de milisecunde. Fiecare segment este transformat într-un token audio.
Muse Voice Transcribe decide în timp real dacă trebuie să continue să asculte sau să genereze text. Acest mecanism îi permite să controleze cantitatea de context audio folosită pentru fiecare cuvânt.
Meta numește această perioadă „delay”. Există un compromis între acuratețe și latență.
Un timp mai lung de analiză poate crește precizia transcrierii. În același timp, textul apare mai târziu.
Pentru a rezolva această problemă, Meta folosește un sistem numit „adaptive delay”. Acesta ajustează automat timpul de analiză pentru fiecare cuvânt, în funcție de dificultatea sa.
Sistemul este antrenat cu reinforcement learning. Meta combină recompense pentru rata de eroare a cuvintelor și pentru întârzierea transcrierii.
Muse Voice Transcribe include și funcții de diarizare. Modelul poate determina cine vorbește în cadrul unei conversații.
Diarizarea (sau diarizarea vorbitorului) este o tehnologie bazată pe inteligență artificială care răspunde la întrebarea: „cine a vorbit când?” într-o înregistrare audio.
Sistemul detectează schimbarea vorbitorului și atribuie o etichetă fiecărei persoane. Aceeași etichetă poate fi păstrată atunci când vocea unui participant este împărțită în mai multe segmente.
Modelul poate detecta și începutul și finalul unei intervenții. Aceste funcții sunt antrenate împreună cu sistemul de transcriere.
Meta consideră că această capacitate este importantă pentru conversațiile reale. Acestea pot include întreruperi, suprapuneri ale vocilor și accente diferite.
Muse Voice Transcribe a fost antrenat pentru peste 70 de limbi. Meta a verificat extensiv 25 dintre acestea.
Compania recomandă cele 25 de limbi pentru versiunea inițială. Modelul oferă însă suport și pentru alte limbi.
O funcție importantă este recunoașterea schimbării limbii în timpul conversației. Utilizatorii pot alterna între limbi chiar în aceeași propoziție.
Modelul poate folosi și informații suplimentare pentru recunoaștere. Printre acestea se numără limba, cuvintele-cheie și contextul conversației.
Contextul poate îmbunătăți acuratețea în cazul conversațiilor în care sunt folosite mai multe limbi.
Muse Voice Transcribe acceptă înregistrări audio cu o durată de peste o oră. Sistemul poate gestiona și mai mult de 20 de vorbitori.
Un alt avantaj este faptul că rezultatul nu necesită post-procesare. Funcțiile de transcriere și identificare a vorbitorilor sunt realizate în timpul procesării audio.
Aceste caracteristici pot fi utile pentru întâlniri, interviuri și conversații de grup.
Meta afirmă că Muse Voice Transcribe ocupă primul loc în clasamentul Artificial Analysis pentru transcriere vocală în streaming.
Compania susține că modelul se află pe prima poziție și în benchmarkurile publice pentru diarizare. Rezultatele și clasamentele menționate de Meta sunt valabile la 1 septembrie 2026.
Aceste rezultate provin din evaluările prezentate de companie. Ele nu reprezintă o comparație independentă realizată de Meta cu toate modelele disponibile pe piață.
Muse Voice Transcribe este folosit pentru dictarea vocală din Meta AI și Muse Code. Funcția poate fi utilizată cu alte aplicații și ferestre de pe computer.
Meta spune că utilizatorii pot activa dictarea prin apăsarea tastei Fn.
Modelul este disponibil prin Meta Model API, Meta AI pentru Mac și Muse Code. Meta îl poziționează astfel atât pentru dezvoltatori, cât și pentru utilizatorii propriilor aplicații.