
L'infrastruttura AI: le TPU di Google e le GPU NVIDIA per training e inferenza su scala — la potenza dietro Gemini, a noleggio.
Google addestra Gemini sulle proprie TPU — le stesse (Trillium, Ironwood) sono affittabili a ore, in pod da migliaia di chip interconnessi. Accanto, le GPU NVIDIA (H100, H200, B200) per l'ecosistema CUDA. Per un'azienda il tema non è il chip: è dimensionare, schedulare e pagare il giusto.


Fine-tuning ≠ pretraining: quasi sempre servono ore di GPU, non un pod TPU — il conto ringrazia.
DWS e spot per i job pazienti: la stessa GPU a frazione di prezzo.
Quantizzazione, batching e autoscaling: il costo per richiesta è la metrica che conta.
Il dataset vicino al calcolo (Cloud Storage regionale): la GPU non deve aspettare il disco.
Per l'AI su GCP si sceglie il silicio: le TPU (Trillium/v5) accelerano training e inferenza dei modelli grandi con il pod come unità di scala (interconnessione ICI dedicata), le GPU NVIDIA (H100/H200/B200 su A3/A4) coprono l'ecosistema CUDA; l'AI Hypercomputer combina silicio, storage (Hyperdisk ML, Parallelstore) e scheduling (DWS: calendar e flex start) per la capacità quando serve; il multislice scala il training oltre il singolo pod.
I modelli aperti specializzati sui tuoi dati.
Il servizio AI con SLA e costi per richiesta.
HPC e training quando il progetto lo chiede.