Tehnologie

Google Gemini 3.5: AI-ul revoluționar pentru dictare, vorbește 85 de limbi

Google Gemini 3.5: AI-ul revoluționar pentru dictare, vorbește 85 de limbi

Conform Playtech.ro: Google lansează Gemini 3.5 Transcribe, o tehnologie avansată de recunoaștere vocală ce promite să revoluționeze modul în care interacționăm cu fișierele audio. Noul model este capabil să înțeleagă și să corecteze, în timp real, ezitările și reformulările specifice vorbirii naturale.

Înțelege și corectează vorbirea naturală

Unul dintre punctele forte ale Gemini 3.5 Transcribe este capacitatea sa de a gestiona situațiile în care utilizatorii se răzgândesc pe parcursul discuției. De exemplu, dacă cineva spune „ne întâlnim marți, nu, miercuri”, sistemul va identifica corectarea și va genera textul final fără a include ezitările inițiale.

Modelul elimină automat sunete precum „ăă” sau „mmm”, atunci când acestea nu adaugă informație relevantă. De asemenea, oferă posibilitatea organizării automate a textului transcris și permite modificări ulterioare prin comenzi vocale, formulate într-un limbaj natural.

Conform datelor publicate, Gemini 3.5 Transcribe prezintă o rată medie de eroare de 4% în transcrierea în timp real și de 2,6% în scenariile în care audio-ul este procesat fără constrângeri de streaming. Aceste cifre au fost validate de către Artificial Analysis.

Recunoaștere lingvistică extinsă și identificare a vorbitorilor

Capacitatea de a recunoaște vocabular personalizat reprezintă un alt avantaj major, fiind deosebit de utilă în transcrierea numelor specifice, a termenilor tehnici, a codurilor sau a identificatorilor alfanumerici. Google afirmă că Gemini 3.5 Transcribe poate detecta și transcrie automat peste 85 de limbi, adaptându-se la diverse accente regionale și dialecte.

Pentru înregistrările audio preînregistrate, modelul poate atribui replicile unor vorbitori diferiți și poate include marcaje temporale precise. În prezent, funcționalitatea permite identificarea a până la trei persoane, dezvoltarea suportului pentru un număr mai mare de vorbitori fiind încă în stadiu experimental.

Google subliniază o reducere semnificativă a timpului necesar pentru obținerea transcrierii finale. În comparație cu modelul Chirp 3, lansat în 2025, timpul de procesare este cu aproximativ 70% mai mic, conform măsurătorilor interne ale companiei.

Pe benchmark-ul FLEURS, destinat testării performanței multilingve, Gemini 3.5 Transcribe a înregistrat o rată de eroare de 5,50% în modul streaming și 5,04% în scenariile non-streaming, evaluat pe un set divers de limbi și regiuni.

Google anunță disponibilizarea Gemini 3.5 Transcribe prin intermediul Google AI Studio și Vertex AI, oferind astfel dezvoltatorilor acces la aceste capabilități avansate.

Sursa: Playtech.ro