Tabelle di dati come fogli Excel, ma programmabili: DataFrame, pulizia e analisi dei dati.
Pandas è la libreria Python per lavorare con dati tabellari: righe e colonne, proprio come un foglio Excel. La struttura principale si chiama DataFrame, e ogni singola colonna è una Series.
import pandas as pd dati = { "nome": ["Anna", "Luca", "Sara"], "voto": [8, 6, 9] } df = pd.DataFrame(dati) print(df) # nome voto # 0 Anna 8 # 1 Luca 6 # 2 Sara 9
Pandas legge facilmente file CSV, Excel e JSON direttamente in un DataFrame.
.head() mostra le prime righe, .info() riassume tipi e valori mancanti, .describe() calcola statistiche di base per le colonne numeriche.
I dati reali spesso hanno valori mancanti (NaN) o duplicati. Pandas offre strumenti dedicati per gestirli.
Puoi selezionare colonne specifiche o righe che rispettano una condizione, proprio come una query.
groupby() permette di raggruppare i dati per categoria e calcolare statistiche per ogni gruppo, un'operazione centrale nell'analisi dati.
Spunta ogni passaggio man mano che lo completi: sbloccherai l'attestato di questa guida al termine.
Esempio per il punto 1
dati = {
"nome": ["Anna", "Luca", "Sara", "Marco"],
"materia": ["Python", "Python", "Excel", "Excel"],
"voto": [8, 6, 9, 7]
}
df = pd.DataFrame(dati)
Esempio per il punto 2
print(df.head()) # prime righe print(df.info()) # tipi e valori mancanti print(df.describe()) # statistiche colonne numeriche
Esempio per il punto 3
promossi = df[df["voto"] > 7] print(promossi)
Esempio per il punto 4
df.loc[1, "voto"] = None # introduciamo un valore mancante print(df.dropna()) # rimuove le righe con NaN print(df.fillna(0)) # sostituisce NaN con 0
Tocca ogni termine per vederne la definizione.
Crea un DataFrame con nome, materia e voto per 6 studenti. Filtra e stampa solo gli studenti con voto >= 7, poi ordina per voto decrescente.
Crea un DataFrame con almeno una cella mancante (usa None o np.nan). Mostra il DataFrame con .info(), poi applica sia dropna() che fillna() e confronta i risultati.
Questo codice genera un errore: df["Voto"] quando in realtà la colonna si chiama "voto" (minuscolo). Spiega perché Pandas è sensibile a maiuscole/minuscole e come evitare l'errore.
Completa tutti i 5 passaggi della checklist per sbloccare il tuo attestato in PDF.