Metti insieme tutto il percorso: da un dataset grezzo a un modello predittivo, passo dopo passo.
In questa guida non impari un concetto nuovo: metti insieme Pandas, statistica, visualizzazione e Machine Learning in un unico flusso di lavoro reale, dall'importazione dei dati grezzi fino a un modello che fa previsioni.
Si parte sempre caricando i dati grezzi in un DataFrame, con Pandas (guida 10).
Si osserva la forma dei dati, si calcolano statistiche di base e si controllano valori mancanti (guida 14).
Si gestiscono eventuali valori mancanti o anomali prima di procedere (guida 10).
Un grafico rivela relazioni che i numeri da soli nascondono (guida 11).
Con i dati puliti ed esplorati, si passa a un modello di classificazione (guida 15).
Si misura l'accuratezza sul test set, mai sul training set (guida 15), per capire quanto il modello generalizza bene.
Spunta ogni passaggio man mano che lo completi: sbloccherai l'attestato di questa guida al termine.
Esempio per il punto 1
import pandas as pd df = pd.DataFrame({ "ore_studio": [2, 5, 1, 8, 3, 6, 7, 2, 4, 9], "presenze": [70, 95, 60, 98, 80, 90, 92, 65, 85, 99], "promosso": [0, 1, 0, 1, 0, 1, 1, 0, 1, 1] }) print(df.shape)
Esempio per il punto 2
print(df.describe()) print(df.corr())
Esempio per il punto 3
import matplotlib.pyplot as plt plt.scatter(df["ore_studio"], df["promosso"]) plt.xlabel("Ore di studio") plt.ylabel("Promosso") plt.show()
Esempio per il punto 4
from sklearn.model_selection import train_test_split from sklearn.linear_model import LogisticRegression X = df[["ore_studio", "presenze"]] y = df["promosso"] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3) modello = LogisticRegression() modello.fit(X_train, y_train)
Tocca ogni termine per vederne la definizione.
Crea un dataset di almeno 20 righe su un tema a tua scelta (es. vendite, salute, sport). Esegui l'intero flusso: importazione, EDA, pulizia, visualizzazione, modello, valutazione.
Scrivi un breve report (anche solo un file di testo) che riassuma: cosa hai scoperto nella EDA, quale grafico è stato più informativo, e quanto è accurato il tuo modello finale.
Un collega salta direttamente dall'importazione dei dati all'addestramento del modello, senza mai esplorarli. Il modello ottiene risultati scarsi. Spiega perché saltare la fase di EDA può portare a problemi non individuati (es. valori mancanti, outlier, variabili poco correlate).
Completa tutti i 5 passaggi della checklist per sbloccare il tuo attestato in PDF.