Google Cloud · Infraestructura · ficha YoctoIT

TPU & GPU

La infraestructura de IA: las TPU de Google y las GPU NVIDIA para training e inferencia a escala — la potencia detrás de Gemini, en alquiler.

FOCUS · LA POTENCIA DE LA IATPU para los transformers, GPU para todo: el cálculo de IA dimensionado y pagado justo
Material YoctoIT para clientes y partners · Google Cloud, BigQuery, Gemini y los demás productos citados son marcas de Google LLC.
01 · Qué es

Cloud TPU & GPU, en claro.

Google entrena Gemini sobre sus propias TPU — las mismas (Trillium, Ironwood) se alquilan por horas, en pods de miles de chips interconectados. Al lado, las GPU NVIDIA (H100, H200, B200) para el ecosistema CUDA. Para una empresa el tema no es el chip: es dimensionar, planificar y pagar lo justo.

TPU
los chips de Google para los transformers: la relación precio/rendimiento para la IA seria
Pod
miles de chips interconectados: el training distribuido sin construir nada
DWS
Dynamic Workload Scheduler: la GPU reservada cuando hace falta, no poseída
Cloud TPU & GPU
IMAGEN OFICIAL GOOGLE CLOUD · TPU & GPU
FOTO UFFICIALE GOOGLE · TPU IRONWOOD · FONTE: GOOGLE
FOTO OFICIAL GOOGLE · TPU IRONWOOD · FUENTE: GOOGLE
02 · Cómo usarlo bien

Las cosas que marcan la diferencia.

El stack de IA

Training & inferenciatus modelos y fine-tuning
TPU pods
GPU NVIDIA
Spot & DWS
escala · ecosistema · economía
GKE / Vertex AI encimala orquestación del cálculo
Los data centers de IA de Googlela fábrica detrás de Gemini
La supercomputación a consumo

El dimensionamiento honesto

Fine-tuning ≠ pretraining: casi siempre hacen falta horas de GPU, no un pod TPU — la cuenta lo agradece.

Scheduling inteligente

DWS y spot para los jobs pacientes: la misma GPU a una fracción del precio.

Inferencia optimizada

Cuantización, batching y autoscaling: el coste por petición es la métrica que cuenta.

Salida de los datos

El dataset cerca del cálculo (Cloud Storage regional): la GPU no debe esperar al disco.

03 · En profundidad

TPU, GPU y el AI Hypercomputer

Para la IA en GCP se elige el silicio: las TPU (Trillium/v5) aceleran training e inferencia de los modelos grandes con el pod como unidad de escala (interconexión ICI dedicada), las GPU NVIDIA (H100/H200/B200 sobre A3/A4) cubren el ecosistema CUDA; el AI Hypercomputer combina silicio, storage (Hyperdisk ML, Parallelstore) y scheduling (DWS: calendar y flex start) para la capacidad cuando hace falta; el multislice escala el training más allá del pod único.

  • TPU pod — miles de chips sobre interconnect dedicado: el training de los foundation models
  • GPU A3/A4 — H100→B200: el ecosistema CUDA a la escala de Google
  • DWS — Dynamic Workload Scheduler: la capacidad reservada cuando hace falta, no siempre
  • Hyperdisk ML — el storage que alimenta los aceleradores: nada de GPU hambrientas
  • Multislice — el training más allá del pod: la escala sin reescribir el código
  • Inferencia — TPU también para el serving: el coste por token que baja
04 · Números y ciclo de vida

Los números que cuentan.

~2x
perf/watt de Trillium sobre la generación anterior
k
chips por pod: la escala del training serio
flex
DWS: el descuento para quien puede esperar la capacidad
$/token
la métrica real de la inferencia: se diseña
El cálculo de IA se compra con proyecto: sizing, scheduling y costes por token — la potencia justa, cuando hace falta, con nosotros.
05 · Casos de uso

Dónde rinde de verdad.

Fine-tuning empresarial

Los modelos abiertos especializados sobre tus datos.

Inferencia de producción

El servicio de IA con SLA y costes por petición.

Investigación y simulación

HPC y training cuando el proyecto lo pide.

El cálculo de IA se alquila, la competencia no: dimensionamos y gobernamos la potencia que hace falta.