Torna al blog
5 min di lettura

Gemini 3.5 Transcribe: Google trasforma la dettatura in interpretazione (e non è un dettaglio)

Google presenta Gemini 3.5 Transcribe, il modello speech-to-text che cancella gli "ehm", corregge al volo i ripensamenti e riformatta il testo. Più veloce del 70% rispetto a Chirp 3, già dentro Gboard e nell'app Gemini per macOS. Ma quando la trascrizione riscrive quello che hai detto, cambia il gioco.

Close-up of a woman using smartphone voice command, showcasing technology and communication.

Foto di cottonbro studio su Pexels

Mentre mezzo settore aspetta ancora Gemini 3.5 Pro — annunciato per giugno e mai arrivato — Google ha fatto uscire dal ramo 3.5 un modello che nessuno stava chiedendo a gran voce ma che rischia di essere usato da molte più persone del suo fratello maggiore. Si chiama Gemini 3.5 Transcribe, è uno speech-to-text, e la sua caratteristica principale non è sentire meglio: è capire cosa volevi dire.

La differenza è sottile e importante. Un motore di riconoscimento vocale classico prova a scrivere esattamente i suoni che gli arrivano. Questo modello, invece, prende l'audio grezzo e restituisce testo già pulito: via gli "ehm" e gli "aah", punteggiatura e formattazione automatiche, e — soprattutto — gestione dei ripensamenti. L'esempio portato da Google DeepMind è chiarissimo: se dici "ci vediamo martedì, no, mercoledì", nel testo finale resta mercoledì. Nessuna cancellazione manuale, nessun copia-incolla.

I numeri, e cosa dicono davvero

Google posiziona 3.5 Transcribe come il successore di Chirp 3, il suo precedente motore di trascrizione. Il dato più solido è la latenza: il tempo per arrivare alla trascrizione definitiva migliora del 70% secondo le misurazioni di Artificial Analysis citate da DeepMind. Sull'accuratezza il quadro è più sfumato. Nella media rilevata da Artificial Analysis il Word Error Rate è del 4,0% in streaming e del 2,6% sull'audio pre-registrato; sul benchmark multilingue FLEURS, però, si sale al 5,50% in streaming e 5,04% in modalità non-streaming, contro il 7,32% di Chirp 3.

Tradotto: il salto sull'errore c'è ma non è drammatico, come ha notato anche Ars Technica. Il vero guadagno è altrove — nella velocità e nel fatto che il testo esce già presentabile. Chi ha provato a dettare un messaggio lungo sa che il problema non è tanto la parola sbagliata, è dover tornare indietro col dito su uno schermo per sistemare tre virgole e due esitazioni. È lì che si perde la voglia di usare la voce.

Il resto delle specifiche è da modello di fascia enterprise: oltre 85 lingue con rilevamento automatico, accenti e dialetti regionali, vocabolario personalizzato per gergo tecnico e grafie particolari (utile per nomi di prodotto, codici, terminologia medica), timestamp a livello di parola e attribuzione fino a tre parlanti sull'audio registrato — oltre i tre, Google ammette che è sperimentale. Buona precisione dichiarata anche su entità alfanumeriche tipo CAP e ID d'ordine, che è esattamente il punto dove i sistemi vocali dei call center fanno tradizionalmente disastri.

Per gli sviluppatori ci sono due strade: gemini-3.5-transcribe-live sulla Live API per lo streaming bidirezionale con latenza sotto il secondo, e gemini-3.5-transcribe sulla Interactions API per l'audio pre-registrato. Disponibili in public preview tramite Gemini API in AI Studio, Antigravity e la Gemini Enterprise Agent Platform. Piattaforme come LiveKit, Pipecat, LangChain, Vercel, Agora e Fishjam sono già citate come partner di integrazione.

Dove lo trovate già

La parte consumer è quella che farà volume. Il modello alimenta Rambler, la funzione di dettatura di Gboard su Android (in rollout in alcuni Paesi e lingue), ed è dietro alla nuova dettatura dell'app Gemini su macOS, in inglese per tutti gli utenti. Su macOS fa anche qualcosa in più: usa il function calling per delegare compiti ad altri modelli Gemini, quindi con la voce puoi chiedere di riassumere un file locale o generare un'immagine direttamente dove hai il cursore. In Antigravity il modello legge — col vostro permesso — il contesto dello schermo e la cronologia della chat per azzeccare nomi di file e termini tecnici. In AI Studio si può fare vibe coding parlando. Chrome arriverà, dice Google, con la dettatura in qualsiasi campo di testo del web.

Il punto che nessuno vuole affrontare

Qui sta il nodo interessante, e vale la pena essere espliciti: un modello che riscrive quello che hai detto non è più un trascrittore, è un editor. Ars Technica lo ha messo in evidenza dopo aver testato Rambler — funziona bene sui testi brevi, ma tecnicamente altera le parole pronunciate.

Su un messaggio WhatsApp è una benedizione. Su un verbale, un colloquio giornalistico, una visita medica, una deposizione, un consiglio d'amministrazione, la fedeltà letterale non è un vezzo: è il requisito. E un'esitazione, una correzione a metà frase, un ripensamento sono a volte l'informazione più preziosa dell'intera registrazione. Chi costruirà prodotti su queste API farà bene a offrire due modalità distinte — verbatim e ripulita — e a dirlo chiaramente all'utente. Sospetto che il primo caso legale su una trascrizione "migliorata" dall'AI arriverà prima di quanto pensiamo.

L'altro effetto collaterale è economico. Lo speech-to-text di qualità è stato per anni un mercato di specialisti; infilarlo dentro la Gemini API, con latenza sotto il secondo e vocabolario custom incluso, significa spingere la trascrizione verso lo status di funzionalità di piattaforma. Non è la fine dei fornitori dedicati, ma è un'altra voce che si sposta dal listino al bundle.

Ultima nota, quasi comica ma rivelatrice: The Verge aveva scritto, sulla base delle informazioni ricevute da Google, che sarebbero arrivati anche Gemini 3.5 Live e 3.5 Live Experimental. Dopo la pubblicazione l'azienda ha corretto il tiro: quei modelli non sono in uscita, e non c'è una nuova data. Con 3.5 Pro ancora fantasma, la sensazione è che Google stia rilasciando la famiglia 3.5 a pezzi, seguendo la disponibilità reale più che una roadmap. La voce, evidentemente, era pronta prima del ragionamento.

GoogleGeminiintelligenza artificialespeech-to-textDeepMindAPItrascrizione automatica