
La infraestructura de IA: las TPU de Google y las GPU NVIDIA para training e inferencia a escala — la potencia detrás de Gemini, en alquiler.
Google entrena Gemini sobre sus propias TPU — las mismas (Trillium, Ironwood) se alquilan por horas, en pods de miles de chips interconectados. Al lado, las GPU NVIDIA (H100, H200, B200) para el ecosistema CUDA. Para una empresa el tema no es el chip: es dimensionar, planificar y pagar lo justo.


Fine-tuning ≠ pretraining: casi siempre hacen falta horas de GPU, no un pod TPU — la cuenta lo agradece.
DWS y spot para los jobs pacientes: la misma GPU a una fracción del precio.
Cuantización, batching y autoscaling: el coste por petición es la métrica que cuenta.
El dataset cerca del cálculo (Cloud Storage regional): la GPU no debe esperar al disco.
Para la IA en GCP se elige el silicio: las TPU (Trillium/v5) aceleran training e inferencia de los modelos grandes con el pod como unidad de escala (interconexión ICI dedicada), las GPU NVIDIA (H100/H200/B200 sobre A3/A4) cubren el ecosistema CUDA; el AI Hypercomputer combina silicio, storage (Hyperdisk ML, Parallelstore) y scheduling (DWS: calendar y flex start) para la capacidad cuando hace falta; el multislice escala el training más allá del pod único.
Los modelos abiertos especializados sobre tus datos.
El servicio de IA con SLA y costes por petición.
HPC y training cuando el proyecto lo pide.