Google Gemini 3.5, dictare AI cu 85+ limbi

Conform Playtech.ro: Gemini 3.5 Transcribe revoluționează procesarea audio

Google anunță o nouă etapă în evoluția inteligenței artificiale cu lansarea Gemini 3.5 Transcribe, un model avansat capabil să înțeleagă și să corecteze în mod natural limbajul vorbit. Noul sistem se distinge prin capacitatea sa de a gestiona ezitările, corectările și expresiile non-esențiale din discurs, oferind transcrieri mai curate și mai ușor de utilizat.

Un avantaj major al Gemini 3.5 Transcribe este modul în care interpretează corectările făcute în timp real de vorbitor. De exemplu, dacă cineva spune „ne întâlnim marți, nu, miercuri”, sistemul va înregistra corectarea și va reda textul final doar cu informația corectă, eliminând varianta inițială și orice ezitări. Acest lucru se aplică și eliminării vocilor de umplutură, precum „ăă” sau „mmm”, atunci când acestea nu contribuie la sensul mesajului.

Optimizări pentru o transcriere eficientă

Pe lângă acuratețea în interpretarea vorbirii, Gemini 3.5 Transcribe aduce îmbunătățiri semnificative și în organizarea textului transcris. Sistemul poate structura automat informația și permite modificări ulterioare prin comenzi vocale, simplificând procesul de editare. Performanța este impresionantă, Google susținând o rată medie de eroare de doar 4% pentru transcrierea în timp real și 2,6% în scenariile de procesare offline, conform măsurătorilor realizate de Artificial Analysis.

Capacitatea de a recunoaște vocabular personalizat este un alt punct forte. Fie că este vorba de nume proprii neobișnuite, termeni tehnici specifici sau coduri alfanumerice, Gemini 3.5 Transcribe poate integra și reda corect aceste elemente. Suportul multilingv este, de asemenea, extins, modelul fiind capabil să detecteze și să transcrie automat peste 85 de limbi, adaptându-se la diverse accente regionale și dialecte.

Recunoaștere vocală extinsă și viteza de procesare

Gemini 3.5 Transcribe nu se limitează la transcrierea unui singur vorbitor. În cazul înregistrărilor audio cu mai mulți participanți, noul model poate atribui replicile diferitelor persoane și poate adăuga marcaje temporale precise. În prezent, funcționalitatea permite identificarea a până la trei vorbitori, cu un suport extins în curs de dezvoltare.

Un alt beneficiu major adus de Gemini 3.5 Transcribe este reducerea drastică a timpului necesar pentru obținerea transcrierii finale. Comparativ cu modelul anterior, Chirp 3, timpul de procesare este cu aproximativ 70% mai mic. Pe benchmark-ul FLEURS, dedicat testării performanței multilingve, Gemini 3.5 Transcribe a înregistrat o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming.

Google a anunțat că modelul va fi disponibil pentru dezvoltatori prin intermediul Google AI Studio și Vertex AI. Acest lucru va permite integrarea tehnologiei în diverse aplicații și servicii, de la instrumente de productivitate la soluții pentru cercetare.

Sursa: Playtech.ro

Redacția StiriFresh

Autor

Materiale de sinteză realizate de echipa StiriFresh pe baza surselor citate în text, cu ajutorul instrumentelor de inteligență artificială, verificate editorial înainte de publicare.

Lasa un comentariu