Google Cloud · Software · scheda YoctoIT

Dataflow & Pub/Sub

Streaming e messaggistica serverless: gli eventi raccolti, trasformati e consegnati in tempo reale — senza cluster da badare.

FOCUS · IL DATO IN TEMPO REALEDal batch notturno allo streaming continuo: le pipeline che non dormono
Materiale YoctoIT per clienti e partner · Google Cloud, BigQuery, Gemini e gli altri prodotti citati sono marchi di Google LLC.
01 · Cos'è

Dataflow & Pub/Sub, in chiaro.

Pub/Sub è il sistema nervoso: messaggistica globale serverless, milioni di eventi al secondo, senza broker da gestire. Dataflow li elabora in volo (Apache Beam): trasformazioni, finestre temporali, arricchimenti — stesso codice per streaming e batch, autoscaling incluso. Il tempo reale come servizio.

Serverless
né broker né cluster: si pubblica e si elabora, il resto è di Google
Beam
un solo codice per streaming e batch: la pipeline scritta una volta
Exactly-once
l'elaborazione senza doppi né buchi: i conti tornano
Dataflow & Pub/Sub
VESTE UFFICIALE GOOGLE CLOUD · DATAFLOW & PUB/SUB
CONSOLE REALE · DATAFLOW JOB GRAPH · FONTE: GOOGLE CLOUD DOCS
CONSOLE REALE · DATAFLOW JOB GRAPH · FONTE: GOOGLE CLOUD DOCS
02 · Come lo si usa bene

Le cose che fanno la differenza.

Il flusso

Sorgenti: app, IoT, database (CDC)gli eventi nascono ovunque
Pub/Sub
Dataflow
BigQuery & sink
trasporto · elaborazione · destinazione
Autoscaling & monitoringla pipeline che respira col carico
Datastream per il CDCil gestionale in streaming
Dall'evento alla decisione, in secondi

Architettura a eventi

Topic e schemi disegnati bene: il disaccoppiamento che rende i sistemi evolvibili.

CDC dal gestionale

Datastream da Oracle/MySQL/Postgres verso BigQuery: il warehouse aggiornato al minuto, senza batch.

Finestre e ritardi

Watermark e late data: lo streaming serio gestisce il tempo, non lo ignora.

Costi elastici

Autoscaling con limiti e streaming engine: il tempo reale a tariffa ragionevole.

03 · In profondità

Streaming: Beam, windowing e exactly-once

Pub/Sub disaccoppia i produttori dai consumatori (at-least-once di default, exactly-once ed ordering key quando servono, 31 giorni di retention); Dataflow esegue pipeline Apache Beam batch+streaming con autoscaling orizzontale e verticale, windowing (fixed/sliding/session) e watermark per il dato in ritardo, Streaming Engine che separa stato e calcolo. La coppia regge ingestion IoT, CDC (con Datastream) e le viste in tempo reale su BigQuery.

  • Exactly-once — la semantica forte quando i doppi non sono ammessi
  • Ordering key — l'ordine per chiave dove conta (per entità, non globale)
  • Windowing — finestre e watermark: il tempo dell'evento, non dell'arrivo
  • Autoscaling — i worker che seguono il flusso: il picco assorbito da solo
  • Streaming Engine — lo stato fuori dai worker: scala e aggiornamenti più fluidi
  • Template — pipeline pronte (Pub/Sub→BigQuery, CDC): lo streaming senza codice
04 · Numeri e ciclo di vita

I numeri che contano.

ms
le latenze Pub/Sub end-to-end
31 gg
la retention dei messaggi configurabile
1
modello (Beam) per batch e streaming
0
cluster da gestire: entrambi serverless
Lo streaming affidabile è progetto: semantiche, finestre e costi li disegniamo noi — il real-time che non perde pezzi.
05 · Use case

Dove rende davvero.

Dashboard operative

Vendite, logistica e produzione viste al minuto.

IoT e telemetria

Milioni di sensori raccolti e aggregati in volo.

Fraud & alerting

L'anomalia vista quando succede, non domattina.

Il batch notturno è un'abitudine, non un destino: lo streaming gestito, disegnato da noi.