Torna al blog
6 min di lettura

Gemini Robotics 2: Google punta all'AGI fisica, dai piedi alle dita

Con Gemini Robotics 2 Google DeepMind porta il controllo dell'intero corpo dei robot umanoidi, aggiunge la collaborazione tra macchine diverse e un nuovo benchmark di sicurezza. Ecco perché questo aggiornamento conta più dei video acrobatici che vediamo da anni.

Robotic arm playing a strategic chess game on a wooden board, showcasing technology and innovation.

Foto di Pavel Danilyuk su Pexels

I video di robot che corrono, ballano e fanno salti mortali girano su Internet da almeno dieci anni, e hanno un problema: sono coreografie. Codice scritto per un compito solo, ripetuto alla perfezione. Quello che Google DeepMind ha annunciato con Gemini Robotics 2 va in una direzione diversa e, per chi lavora nel settore, molto più interessante: un cervello generalista che si adatta a corpi diversi, capisce cosa sta succedendo mentre agisce e — novità non banale — sa quando fermarsi.

La release si articola su tre modelli. Il primo è Gemini Robotics ER 2, il livello di "ragionamento incarnato": un modello vision-language che osserva, dialoga, pianifica compiti in più passaggi e poi delega l'esecuzione motoria. È l'unico dei tre già disponibile pubblicamente, tramite Gemini API e Google AI Studio, con una preview privata sulla piattaforma enterprise. Sotto ci sono Gemini Robotics 2, il modello vision-language-action che traduce le intenzioni in movimento, e la versione On-Device 2, pensata per girare in locale senza connessione. Questi ultimi due restano per ora in mano a un gruppo ristretto di tester.

Dal busto in su, al corpo intero

Il salto più visibile riguarda il controllo motorio. La generazione precedente si concentrava sulla parte superiore del corpo degli umanoidi; ora DeepMind parla di movimenti che vanno "dai piedi alle dita", con la possibilità di camminare, accovacciarsi, allungarsi e manipolare oggetti in modo coordinato. Nei video mostrati alla stampa, l'Apollo 2 di Apptronik si piega per raccogliere un annaffiatoio e recupera oggetti specifici da uno scaffale — usando mani a cinque dita fornite dall'azienda Sharpa.

E qui entra in gioco la destrezza. Chiudere un sacchetto Ziploc, annodare un sacco della spazzatura, svitare una lampadina: compiti che un bambino di otto anni esegue senza pensarci e che per un robot restano un incubo di attrito, forza controllata e feedback tattile. Google non sostiene di averli risolti, ma di aver reso il controllo di mani complesse governabile da un modello unico anziché da software dedicato per ogni gesto.

Il secondo blocco di miglioramenti è temporale, ed è quello che secondo me pesa di più nel lungo periodo. ER 2 elabora flussi video continui e classifica l'avanzamento di un compito su cinque fasce percentuali, con un'accuratezza dichiarata del 57,4%. Detto così sembra poco. Ma il numero che conta davvero è un altro: il "moment finding", cioè individuare il fotogramma esatto in cui accade l'evento critico — quando smettere di versare il caffè, per usare l'esempio di DeepMind — arriva al 91,3% di accuratezza con uno scarto medio di meno di un secondo. Google rivendica anche una velocità di esecuzione quadrupla rispetto a modelli di categoria superiore, con latenza sotto il secondo.

Perché è decisivo? Perché un robot che non sa se ha finito è un robot che riparte da zero a ogni intoppo. Con ER 2, se la palla rotola via o qualcuno sposta un contenitore, il sistema riprova quel singolo passaggio invece di ricominciare l'intera sequenza. È la differenza tra una demo e qualcosa che potrebbe stare in un magazzino.

Robot che parlano tra loro

L'altra funzione nuova è la collaborazione multi-robot. Macchine con corpi e capacità diverse condividono una comprensione semantica dell'obiettivo e si passano il lavoro. In una demo l'Apollo 2 istruisce un robot a doppio braccio di Google a mettere gli utensili in un bidone mentre si riordina un garage; in un'altra Apollo 2 e il Franka F3 Duo lavorano nello stesso spazio senza intralciarsi. C'è anche un esperimento con Spot di Boston Dynamics, dove ER 2 orchestra le API del quadrupede per andare a prendere un pacchetto di popcorn su comando vocale.

Questo è il vero disegno industriale. Demis Hassabis ha già dichiarato di voler costruire un sistema operativo per robot, una specie di Android delle macchine fisiche. E l'architettura di ER 2 — che dichiara i controller di basso livello come "tool" richiamabili, esattamente come si fa con un agente software che chiama Google Search — è coerente con quell'ambizione. Google non vuole vendere robot: vuole essere lo strato di intelligenza che gira su tutti.

La scommessa ha senso anche competitivamente. Su chatbot e coding assistant OpenAI e Anthropic hanno un vantaggio percepito; sulla robotica Google ha una tradizione di ricerca più solida e nessun concorrente diretto con la stessa profondità di modelli multimodali. Puntare sull'"AGI fisica" — definizione usata da Carolina Parada, responsabile robotica di DeepMind, che la descrive come un robot capace di fare qualsiasi cosa faccia un umano — è un modo di spostare il campo di gioco.

Il capitolo sicurezza, stavolta con un benchmark

Un'allucinazione in un chatbot produce una frase sbagliata. La stessa allucinazione in un corpo da 70 chili che condivide lo spazio con delle persone produce qualcosa di diverso. DeepMind lo sa e presenta ASIMOV-Agentic, un nuovo benchmark pubblicato integralmente su Hugging Face, che valuta se un agente di ragionamento rifiuta chiamate non sicure provenienti dal modello d'azione, se un compito è eseguibile in sicurezza e se il sistema sa chiedere aiuto a un umano nel dubbio.

ER 2 viene descritto come il modello più sicuro del team: rileva meglio la presenza di persone vicine e porta il robot a un arresto controllato se qualcuno si avvicina troppo. Apprezzabile che il benchmark sia aperto — è l'unico modo per rendere verificabili affermazioni del genere. Resta il fatto che un benchmark lo scrive chi lo supera, e che la storia recente degli agenti AI capaci di comportamenti imprevisti non invita all'ottimismo automatico.

Due cose da tenere a mente, per chi valuta questa tecnologia con occhio professionale. La prima: i compiti mostrati richiedono ancora addestramento specifico, ottenuto mescolando teleoperazione umana, esempi video e simulazione. Il generalista puro non esiste. La seconda: Google stessa ammette che la velocità di movimento resta molto sotto quella umana. In un contesto industriale, dove il costo si misura in pezzi per ora, questo è il collo di bottiglia che conta.

Ma il dettaglio che terrei d'occhio è il modello on-device: adattarsi a un nuovo corpo robotico con qualche ora di dati di movimento, circa duecento esempi, significa che il costo di portare l'intelligenza su hardware nuovo sta crollando. È così che una piattaforma diventa uno standard.

Google DeepMindGemini Roboticsroboticaintelligenza artificialeumanoidiAI safety