🧭 Modelli Claude & Panorama LLM

Guida didattica 2026 · Come scegliere il modello giusto per ogni compito · Marco Consiglio
Famiglia Claude: Haiku · Sonnet · Opus · Fable Confronto con GPT, Gemini e gli altri LLM

La famiglia Claude 2026 — un modello per ogni compito

Anthropic non offre "un" modello, ma una famiglia calibrata su velocità, costo e intelligenza: si parte da Haiku (il più veloce ed economico) fino a Fable 5, il modello di livello Mythos più capace disponibile. La logica di fondo: usare il modello più potente per ogni compito è uno spreco, non una garanzia di qualità — spesso il modello bilanciato (Sonnet) raggiunge risultati quasi identici a un costo nettamente inferiore. Capire quando salire o scendere di livello è una competenza pratica, non un dettaglio tecnico.

4 livelli: Haiku · Sonnet · Opus · Fable/Mythos Nomi modello sempre con versione completa in API Scelta = velocità × costo × qualità
🔧 I quattro livelli, uno per uno
⚡ Claude Haiku 4.5 Il più veloce
Il modello più rapido ed economico della famiglia — ma più capace di quanto ci si aspetti: Anthropic lo definisce "intelligenza quasi di frontiera" nonostante la velocità. Perfetto per task ad alto volume dove la latenza e il costo contano più della qualità massima assoluta.
Ideale per: classificazione, estrazione dati, routing, moderazione, task ripetitivi
Quando sceglierlo: superi le 100 chiamate/giorno su un singolo workflow, oppure l'errore occasionale non ha conseguenze dirette (contenuti che passano comunque da revisione umana).
⚖️ Claude Sonnet 5 Il default consigliato
Lanciato il 30 giugno 2026, è oggi il modello predefinito e la scelta giusta per la maggior parte del lavoro professionale: eguaglia Opus 4.8 su gran parte dei task di conoscenza generale a un costo più contenuto. Il "cavallo di battaglia" per scrittura, analisi, programmazione quotidiana, assistenza allo studio.
Ideale per: scrittura, analisi documenti, programmazione quotidiana, assistenti conversazionali
Quando sceglierlo: è il punto di partenza predefinito per quasi tutto — passa a un livello superiore solo se un compito specifico lo richiede davvero.
🧠 Claude Opus 4.8 Il ragionamento massimo
Il modello per i problemi davvero difficili: reasoning multi-livello, catene agentiche lunghe, refactoring di codebase intere, debug complesso, analisi architetturali. Mantiene un vantaggio reale rispetto a Sonnet proprio sui compiti che richiedono di tenere in mente molte variabili contemporaneamente per periodi prolungati.
Ideale per: architettura software, sessioni agentiche lunghe, analisi normativa/legale profonda, ricerca scientifica
Quando sceglierlo: il compito richiede reasoning genuinamente complesso E solo per quello — usarlo di default su task semplici è come noleggiare un camion per la spesa settimanale.
👑 Claude Fable 5 / Mythos Il tier superiore
Lanciato il 9 giugno 2026, Fable 5 si colloca sopra il livello Opus in capacità — il modello generalmente disponibile più potente della famiglia, con fatturazione a crediti separata. Esiste anche Claude Mythos 5, riservato a un numero ristretto di organizzazioni nell'ambito del Progetto Glasswing di Anthropic.
Ideale per: la sessione rara dove la capacità massima giustifica il costo separato
Quando sceglierlo: quando il tuo piano include l'uso di Fable e il compito richiede davvero il massimo disponibile — non è la scelta quotidiana.
🧮 Il criterio pratico per scegliere
🔀 Le 3 domande da farsi prima di ogni task
1. Quante volte al giorno?→Sotto 100/giorno: Sonnet va bene. Sopra 100/giorno: testa Haiku sui task più semplici.
2. L'errore ha conseguenze dirette?→Draft con revisione umana: Haiku basta. Output verso clienti o altri sistemi senza supervisione: Sonnet/Opus.
3. Serve reasoning multi-variabile?→Compito con molte variabili da tenere a mente insieme, a lungo: Opus. Altrimenti Sonnet.
💡 Regola operativa: parti sempre da Sonnet 5. Sali a Opus 4.8 solo quando un task segnalato come "difficile" lo richiede davvero. Scendi a Haiku 4.5 quando volume e velocità contano più della qualità massima. La scelta sbagliata non blocca il lavoro — lo rende semplicemente fino a 10 volte più caro del necessario.

Il panorama dei modelli più diffusi — chi eccelle in cosa

A metà 2026 i grandi abbonamenti AI costano quasi la stessa cifra (circa 20€/mese), quindi la vera scelta non è più sul prezzo ma su quale modello risponde meglio al tuo flusso di lavoro specifico. Nessun modello domina ogni benchmark: ognuno dei laboratori ha spinto su un proprio punto di forza distintivo. Ecco una mappa onesta, senza tifoserie.

Nessun modello vince su tutto Differenze reali: coding, contesto, ecosistema, dati live Panorama in evoluzione continua
🔧 I modelli principali, uno per uno
Claude (Anthropic)
Famiglia Haiku/Sonnet/Opus/Fable
Riferimento per programmazione avanzata e scrittura di testi lunghi, con un'attenzione dichiarata alla sicurezza (bassi tassi di successo di prompt injection nei test comparativi). Punto di forza: qualità di ragionamento sostenuta anche su compiti tecnici complessi e sessioni agentiche prolungate.
💻 Coding avanzato📝 Scrittura lunga🔒 Sicurezza
GPT (OpenAI)
Famiglia GPT-5.x
Vince tipicamente per ampiezza dell'ecosistema: generazione immagini integrata, uso agentivo di strumenti (Work Mode, Codex, browsing), e capacità di ragionamento astratto ai vertici dei benchmark. La scelta più "generalista" per chi vuole un solo strumento che copre molti casi d'uso diversi.
🧩 Ecosistema ampio🎨 Immagini integrate🤖 Agenti/tool use
Gemini (Google)
Famiglia Gemini 3.x Pro
Domina per chi vive nell'ecosistema Google Workspace e ha bisogno di informazioni aggiornate dal web in tempo reale. Punto di forza distintivo: finestre di contesto enormi (fino a 1-2 milioni di token), utili per analizzare documenti molto lunghi in un colpo solo.
📎 Contesto lunghissimo🔍 Dati web in tempo reale📧 Google Workspace
Grok (xAI) & Perplexity
Focus dati real-time
Modelli orientati a chi ha bisogno di dati freschissimi e ricerca continua: Grok integrato nell'ecosistema X/social, Perplexity costruito specificamente come motore di risposta con citazioni verificabili. Non i più forti sul reasoning puro, ma preziosi quando serve "cosa sta succedendo adesso".
📡 Dati in tempo reale🔗 Citazioni verificabili
Llama (Meta) & Mistral
Modelli open-weight
La famiglia degli open-weight: scaricabili, eseguibili in locale o su infrastruttura propria, personalizzabili (fine-tuning). Non competono in cima ai benchmark generalisti, ma sono la scelta per chi ha vincoli di privacy, budget o vuole controllo completo sull'infrastruttura — nessun dato lascia i tuoi server.
🔓 Open-weight🖥️ Eseguibili in locale🔐 Privacy massima
💡 DeepSeek e altri modelli emergenti (soprattutto cinesi) competono spesso su prezzo aggressivo e buone prestazioni di coding/reasoning a costo ridotto — validi da tenere d'occhio per progetti sensibili al budget, con le dovute verifiche su policy dati e governance.
⚠️ Attenzione ai benchmark: una fotografia, non un verdetto
Il panorama dei modelli cambia più volte solo nell'arco di un semestre: un modello "in testa" a marzo può essere superato a giugno. I benchmark citati in questa guida (SWE-bench, GPQA, HumanEval…) sono indicatori tecnici specifici, non pagelle assolute — un punteggio alto su un benchmark di coding dice poco sulla qualità nella scrittura creativa. Insegna sempre a leggere QUALE benchmark misura COSA, prima di trarre conclusioni.
⚖️ Tabella riassuntiva — quale modello per quale esigenza
EsigenzaPrima sceltaAlternativa valida
Dentro la famiglia Claude
Uso quotidiano bilanciatoSonnet 5—
Task ad alto volume/velociHaiku 4.5Sonnet 5 se serve più qualità
Reasoning complesso, codice difficileOpus 4.8Sonnet 5 come prima verifica
Capacità massima disponibileFable 5Opus 4.8
Tra i grandi LLM
Programmazione avanzata, testi lunghiClaudeGPT per ampiezza di strumenti
Ecosistema esteso, immagini, agentiGPTClaude per qualità del codice
Documenti enormi, Google WorkspaceGeminiClaude su documenti medi
Dati aggiornati in tempo realePerplexity / GrokGemini con ricerca integrata
Privacy totale, esecuzione localeLlama / Mistral—
💡 La lezione di fondo per gli studenti: non esiste "il migliore in assoluto" — esiste il modello giusto per il compito, il budget e il contesto di lavoro davanti a te. Un professionista maturo sa passare da un modello all'altro (o dentro la stessa famiglia, da un livello all'altro) in base alla domanda reale, non per abitudine o moda.
✏️ Esercitazioni pratiche
ESERCIZIO 1Lo stesso compito, tre modelli Claude
Scegli un compito reale del corso (es. riassumere una dispensa, generare un'email professionale, scrivere una funzione di calcolo). Eseguilo con Haiku, Sonnet e Opus (se disponibili nel tuo piano) usando lo stesso identico prompt. Confronta: tempo di risposta percepito, qualità del risultato, dove la differenza si nota davvero e dove è impercettibile. Applica le 3 domande decisionali della guida per stabilire quale modello avresti dovuto scegliere fin dall'inizio.
⏱️ 60 min📦 Consegna: 3 output + tabella comparativa + scelta motivata finale👤 Individuale
ESERCIZIO 2Il router di modelli per un flusso di lavoro
Immagina un piccolo studio professionale che riceve 50 email al giorno da smistare, deve scrivere 3 contratti complessi a settimana, e vuole un chatbot per rispondere alle FAQ dei clienti. Per ciascuna delle 3 attività assegna il modello Claude più adatto (motivando con le 3 domande decisionali) e stima il risparmio se invece si usasse sempre il modello più potente per tutto.
⏱️ 45 min📦 Consegna: matrice attività→modello + stima di risparmio👥 Coppia
ESERCIZIO 3Caccia al benchmark: cosa misura davvero?
Cerca online 3 benchmark citati per i modelli AI (es. SWE-bench, GPQA Diamond, HumanEval) e per ciascuno scrivi in linguaggio semplice: cosa misura esattamente, su che tipo di compiti, e perché un punteggio alto in quel benchmark NON garantisce automaticamente un buon risultato su un compito diverso (es. scrittura creativa). L'obiettivo è imparare a leggere criticamente le classifiche dei modelli invece di fidarsi ciecamente dei numeri.
⏱️ 50 min📦 Consegna: schede di 3 benchmark spiegati in linguaggio semplice👤 Individuale
ESERCIZIO 4Il consulente multi-modello
Quattro clienti diversi: (a) uno studio legale che analizza contratti molto lunghi; (b) una software house con debug complesso su codice legacy; (c) un'agenzia che ha bisogno di notizie e prezzi aggiornati in tempo reale ogni giorno; (d) un'azienda con vincoli di privacy che non può mandare dati fuori dai propri server. Per ciascuno: quale modello/famiglia consigli tra tutti quelli visti in questa guida, e quale rischio segnali comunque al cliente? Presentazione di 5 minuti per coppia.
⏱️ 60 min + presentazioni📦 Consegna: 4 schede consulenza + pitch👥 Gruppo 3-4