Merge, Pivot, Time Series e Tecniche Professionali
Livello up! Ora che padroneggi i DataFrame, esploriamo le tecniche avanzate usate dai data scientist professionisti per analisi complesse.
Nella realtà, i dati sono sporchi. Ecco come pulirli come un professionista.
| Problema | Soluzione | Codice |
|---|---|---|
| Valori mancanti | Imputazione con media/mediana | .fillna(), .interpolate() |
| Stringhe inconsistenti | Normalizzazione con .str |
.str.strip(), .str.title() |
| Tipi di dati errati | Conversioni mirate | pd.to_numeric(), pd.to_datetime() |
| Duplicati | Identificazione e rimozione | .duplicated(), .drop_duplicates() |
| Outliers | Rilevamento con z-score | stats.zscore() |
Unisci dati da diverse fonti come un database SQL.
| Tipo Join | SQL | Pandas | Descrizione |
|---|---|---|---|
| INNER JOIN | INNER JOIN |
how='inner' |
Solo righe con corrispondenza |
| LEFT JOIN | LEFT OUTER JOIN |
how='left' |
Tutte righe sinistra + corrispondenze destra |
| RIGHT JOIN | RIGHT OUTER JOIN |
how='right' |
Tutte righe destra + corrispondenze sinistra |
| FULL JOIN | FULL OUTER JOIN |
how='outer' |
Tutte le righe da entrambe |
| CROSS JOIN | CROSS JOIN |
.merge(how='cross') |
Prodotto cartesiano |
Trasforma i tuoi dati in insights potenti con le tabelle pivot.
Pivot Table: Per report tabellari, dashboard, visualizzazioni incrociate
GroupBy: Per calcoli complessi, aggregazioni multiple, pipeline di dati
Crosstab: Per tabelle di frequenza, analisi di conteggio
Analizza dati temporali con le potenti funzioni di Pandas.
pd.date_range(): Crea range di date.resample(): Cambia frequenza dati.rolling(): Statistiche mobili.shift(): Sposta dati temporali.diff(): Calcola differenze.pct_change(): Variazioni percentualidt accessor: Estrae giorno, mese, anno, etc.Hai 3 dataset di un e-commerce:
Analisi richieste:
Dataset prezzi azionari giornalieri (CSV con: Data, Azienda, Apertura, Chiusura, Volume).
Calcoli richiesti:
Crea una pipeline dati end-to-end:
Pulizia automatica, gestione missing values, outlier detection, normalizzazione dati
INNER, LEFT, RIGHT, FULL joins, concatenazione, merge su indici, gestione chiavi multiple
Tabelle pivot multi-livello, crosstab, aggregazioni complesse, analisi multidimensionale
Resampling, rolling statistics, decomposizione stagionale, forecasting base, lag analysis
Ora che sai pulire, trasformare e analizzare dati come un professionista, sei pronto per il Machine Learning.
Nel Modulo 3 inizieremo con:
Librerie Utili:
pandas-profiling: Analisi automatica datasetmissingno: Visualizzazione valori mancantiplotly: Visualizzazioni interattivestatsmodels: Analisi statistica avanzata