sâmbătă, 19 septembrie 2026
ReactiveNews Jurnalism independent
Acasă Tehnologie Google Gemini 3.5: dictare inteligentă în 85 de limbi
Tehnologie

Google Gemini 3.5: dictare inteligentă în 85 de limbi

Conform Playtech.ro: Google lansează Gemini 3.5 Transcribe, o nouă tehnologie de inteligență artificială care promite să revoluționeze modul în care gestionăm înregistrările audio. Noul model se distinge prin capacitatea de a înțelege și corecta modurile naturale de vorbire, inclusiv ezitările și răzgândirile, oferind o transcriere mai curată și mai eficientă.

Înțelegerea vorbirii naturale

Una dintre inovațiile majore ale Gemini 3.5 Transcribe este modul în care gestionează corectările în timp real. Dacă un vorbitor se răzgândește, spunând de exemplu „ne întâlnim marți, nu, miercuri”, sistemul este capabil să identifice corectarea și să producă un text final care reflectă intenția corectă, eliminând discordanțele din discurs.

Modelul elimină, de asemenea, automată expresiile de umplutură, precum „ăă” sau „mmm”, atunci când acestea nu adaugă valoare informațională transcrierii. Pe lângă acestea, Gemini 3.5 Transcribe poate organiza automat textul și permite modificări ulterioare prin comenzi vocale formulate natural.

Potrivit datelor furnizate de Google și măsurătorilor realizate de Artificial Analysis, Gemini 3.5 Transcribe prezintă o rată medie de eroare de 4% în transcrierea în timp real și de 2,6% în scenariile în care audio-ul este procesat fără constrângeri de streaming.

Capacități extinse de recunoaștere

Modelul este capabil să recunoască și să proceseze vocabular personalizat, o funcționalitate utilă pentru transcrierea numelor neobișnuite, a termenilor tehnici specifici sau a codurilor alfanumerice. Google afirmă că Gemini 3.5 Transcribe poate detecta și transcrie automat peste 85 de limbi, adaptându-se la diverse accente regionale și dialecte.

Identificarea vorbitorilor și eficiență sporită

Gemini 3.5 Transcribe nu se limitează doar la dictare. În cazul înregistrărilor audio preexistente, tehnologia poate atribui replicile unor vorbitori diferiți și poate include marcaje temporale precise. În prezent, funcția poate identifica până la trei persoane, iar suportul pentru un număr mai mare de vorbitori este încă în faza experimentală.

Google subliniază o reducere semnificativă a timpului necesar pentru obținerea transcrierii finale. În comparație cu modelul precedent, Chirp 3, lansat în 2025, timpul de procesare s-a micșorat cu aproximativ 70%, conform măsurătorilor interne ale companiei.

Pe benchmark-ul FLEURS, care evaluează performanța multilingvă, Gemini 3.5 Transcribe a înregistrat o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming, acoperind un set variat de limbi și regiuni.

Sursa: Playtech.ro