Guida Didattica · Percorso Python

Capstone: Data Science End-to-End

Metti insieme tutto il percorso: da un dataset grezzo a un modello predittivo, passo dopo passo.

0 di 5 passaggi completati

01Fondamenti

Il progetto: prevedere il successo di uno studente

In questa guida non impari un concetto nuovo: metti insieme Pandas, statistica, visualizzazione e Machine Learning in un unico flusso di lavoro reale, dall'importazione dei dati grezzi fino a un modello che fa previsioni.

1. Importa dati
→
2. Esplora (EDA)
→
3. Pulisci
→
4. Visualizza
→
5. Addestra un modello
→
6. Valuta

02Il Flusso di Lavoro Completo

📥 Fase 1: Importare i dati▶

Si parte sempre caricando i dati grezzi in un DataFrame, con Pandas (guida 10).

import pandas as pd df = pd.DataFrame({ "ore_studio": [2, 5, 1, 8, 3, 6, 7, 2, 4, 9], "presenze": [70, 95, 60, 98, 80, 90, 92, 65, 85, 99], "promosso": [0, 1, 0, 1, 0, 1, 1, 0, 1, 1] })
🔍 Fase 2: Esplorare (EDA)▶

Si osserva la forma dei dati, si calcolano statistiche di base e si controllano valori mancanti (guida 14).

print(df.describe()) print(df.isnull().sum()) print(df.corr())
🧹 Fase 3: Pulire i dati▶

Si gestiscono eventuali valori mancanti o anomali prima di procedere (guida 10).

df = df.dropna() # nel nostro caso non ci sono NaN, ma è buona pratica verificarlo sempre
📊 Fase 4: Visualizzare▶

Un grafico rivela relazioni che i numeri da soli nascondono (guida 11).

import matplotlib.pyplot as plt plt.scatter(df["ore_studio"], df["promosso"]) plt.xlabel("Ore di studio") plt.ylabel("Promosso (0/1)") plt.show()
🤖 Fase 5: Addestrare un modello▶

Con i dati puliti ed esplorati, si passa a un modello di classificazione (guida 15).

from sklearn.model_selection import train_test_split from sklearn.linear_model import LogisticRegression X = df[["ore_studio", "presenze"]] y = df["promosso"] X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3) modello = LogisticRegression() modello.fit(X_train, y_train)
✅ Fase 6: Valutare il modello▶

Si misura l'accuratezza sul test set, mai sul training set (guida 15), per capire quanto il modello generalizza bene.

from sklearn.metrics import accuracy_score previsioni = modello.predict(X_test) print(accuracy_score(y_test, previsioni))

03Checklist Pratica

Spunta ogni passaggio man mano che lo completi: sbloccherai l'attestato di questa guida al termine.

Esempio per il punto 1

import pandas as pd

df = pd.DataFrame({
    "ore_studio": [2, 5, 1, 8, 3, 6, 7, 2, 4, 9],
    "presenze": [70, 95, 60, 98, 80, 90, 92, 65, 85, 99],
    "promosso": [0, 1, 0, 1, 0, 1, 1, 0, 1, 1]
})
print(df.shape)
1. Crea il datasetCostruisci il DataFrame con ore di studio, presenze e risultato, come nell'esempio sopra (o con dati simili di tua scelta).

Esempio per il punto 2

print(df.describe())
print(df.corr())
2. Esplora il datasetUsa describe() e corr() per capire la forma e le relazioni tra variabili, come nell'esempio sopra.

Esempio per il punto 3

import matplotlib.pyplot as plt

plt.scatter(df["ore_studio"], df["promosso"])
plt.xlabel("Ore di studio")
plt.ylabel("Promosso")
plt.show()
3. Visualizza una relazione tra variabiliCrea uno scatter plot tra ore di studio e risultato, come nell'esempio sopra.

Esempio per il punto 4

from sklearn.model_selection import train_test_split
from sklearn.linear_model import LogisticRegression

X = df[["ore_studio", "presenze"]]
y = df["promosso"]
X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.3)

modello = LogisticRegression()
modello.fit(X_train, y_train)
4. Addestra e valuta un modelloDividi in train/test, addestra una LogisticRegression e calcola l'accuratezza sul test set, come nell'esempio sopra.
5. Completa il quiz di verificaScendi in fondo alla guida e rispondi correttamente ad almeno l'80% delle domande.

04Glossario Interattivo

Tocca ogni termine per vederne la definizione.

05Quiz di Verifica

06Esercitazioni Pratiche

Esercizio 1

Il progetto completo

Crea un dataset di almeno 20 righe su un tema a tua scelta (es. vendite, salute, sport). Esegui l'intero flusso: importazione, EDA, pulizia, visualizzazione, modello, valutazione.

⏱ 45 minuti📦 Script completo end-to-end🖥️ Individuale
Esercizio 2

Report dei risultati

Scrivi un breve report (anche solo un file di testo) che riassuma: cosa hai scoperto nella EDA, quale grafico è stato più informativo, e quanto è accurato il tuo modello finale.

⏱ 20 minuti📦 Report scritto🖥️ Individuale
Esercizio 3

Trova l'errore: saltare la EDA

Un collega salta direttamente dall'importazione dei dati all'addestramento del modello, senza mai esplorarli. Il modello ottiene risultati scarsi. Spiega perché saltare la fase di EDA può portare a problemi non individuati (es. valori mancanti, outlier, variabili poco correlate).

⏱ 10 minuti📦 Spiegazione scritta🖥️ Individuale o in coppia

🎓 Attestato di completamento

Completa tutti i 5 passaggi della checklist per sbloccare il tuo attestato in PDF.

0 / 5 passaggi completati