AWS · Software · scheda YoctoIT

Redshift

Il data warehouse di AWS: analytics su petabyte, integrata col lake su S3 e ora anche serverless.

FOCUS · ANALYTICS SUL CLOUDIl warehouse che interroga anche il lake: SQL su S3 senza spostare il dato
Materiale YoctoIT per clienti e partner · AWS e i nomi dei servizi sono marchi di Amazon.com, Inc.
01 · Cos'è

Amazon Redshift, in chiaro.

Redshift porta il data warehouse nel cloud AWS: colonne compresse, esecuzione massively parallel e la possibilità di interrogare direttamente i dati su S3 (Spectrum). La versione Serverless elimina anche la gestione dei cluster.

Petabyte
la scala del warehouse, senza appliance
Serverless
paghi le query, non il cluster acceso
Zero-ETL
da Aurora e RDS al warehouse senza pipeline da mantenere
Icona ufficiale AWS — Amazon Redshift
ICONA UFFICIALE AWS · Redshift
Console AWS
CONSOLE AWS REALE · REDSHIFT QUERY EDITOR V2 · FONTE: AWS BLOG
02 · Come lo si usa bene

Le cose che fanno la differenza.

La piattaforma analitica

BI & data appLooker, Power BI, QuickSight
Redshift
Spectrum → S3
Data sharing
warehouse · lake · condivisione
Zero-ETL da RDS/Aurorail transazionale che arriva da solo
S3 data lakela base comune del dato
Dal dato grezzo alla dashboard

Architettura MPP colonnare

Le query analitiche su miliardi di righe: compressione e parallelismo fanno il lavoro.

Redshift Spectrum

Il SQL che scende nel lake: S3 interrogato senza caricare nulla.

Materialized view & autotuning

Le aggregazioni che si mantengono da sole: la BI veloce senza tuning infinito.

Data sharing

Il dato condiviso tra ambienti e società del gruppo senza copie: una sola verità.

03 · In profondità

MPP, RA3 e il warehouse che si ferma

Redshift è un MPP colonnare: le tabelle si distribuiscono (DISTKEY/EVEN/ALL) e ordinano (SORTKEY) per la co-locazione dei join; i nodi RA3 separano compute e managed storage, Serverless fattura in RPU solo quando interroga. Spectrum legge S3 esterno, la materialized view accelera i cruscotti, WLM/queue gestiscono la concorrenza, e zero-ETL da Aurora porta il transazionale dentro senza pipeline.

  • DISTKEY/SORTKEY — la fisica dei dati: i join co-locati valgono più di ogni tuning
  • RA3 — compute e storage separati: si scala il calcolo senza ridistribuire i dati
  • Serverless — RPU a consumo: il warehouse dei picchi e del non-24/7
  • Spectrum — query dirette su S3: il lake interrogato senza caricarlo
  • Zero-ETL — da Aurora a Redshift gestito da AWS: il near-real-time senza pipeline
  • Concurrency scaling — cluster extra automatici nei picchi di dashboard
04 · Numeri e ciclo di vita

I numeri che contano.

RPU
l'unità serverless: parte da 8, fattura al secondo
3x
l'accelerazione tipica di una sortkey giusta sui range scan
0 ETL
da Aurora con l'integrazione zero-ETL
PB
la scala del managed storage RA3
Il warehouse veloce è fisica dei dati: chiavi di distribuzione, viste materializzate e WLM — li tariamo sui tuoi carichi reali.
05 · Use case

Dove rende davvero.

Reporting direzionale

Il bilancio e le vendite su anni di storico: risposte in secondi, non in notti batch.

Analytics sul gestionale

Il dato IBM i e ERP portato a warehouse: lo storico che finalmente parla.

Consolidamento datamart

I dieci database di reporting riuniti: governance e costi sotto controllo.

Il warehouse rende col dato giusto dentro: pipeline solide dal gestionale — è lì che facciamo la differenza.