Marco Consiglio · Volta Institute

DeepSeek AI
per Principianti

V3.2 · R2 · V4 Flash · Il modello più economico del mercato frontier · Guida 2026

Aggiornato 2026

Sviluppatore: DeepSeek AI (Hangzhou)
Prezzo API: da $0.14/M input
⚠️ Dati su server in Cina
01 · Introduzione

Cos'è DeepSeek

DeepSeek è un laboratorio AI fondato ad Hangzhou (Cina) come divisione di High-Flyer Capital Management. Ha scosso il mercato internazionale offrendo modelli con performance paragonabili a GPT e Claude a un costo API 20-50 volte inferiore, con i pesi open-source disponibili su Hugging Face.

⚠️ Avviso importante sulla privacy

I dati inviati all'API di DeepSeek vengono elaborati e conservati su server in Cina, soggetti alla legislazione cinese sulla sicurezza dei dati. Per uso professionale con dati sensibili (dati personali, informazioni aziendali riservate, dati dei clienti) valuta alternative con data residency europea, oppure usa i pesi open-source su infrastruttura propria. Per uso didattico su contenuti non sensibili, DeepSeek è una scelta legittima e molto economica.

Il primato economico nel 2026

DeepSeek V3.2 a $0.14/M input è il modello frontier più economico disponibile via API nel 2026 — battuto solo da Gemini Flash-Lite che però è un modello più piccolo e meno capace. Per team con carichi ad alto volume di token (automazioni, pipeline di analisi, agenti), la differenza di costo rispetto a Claude o GPT è sostanziale: un workload da $10.000/mese su GPT può costare poche centinaia su DeepSeek.

02 · La Famiglia di Modelli

V3.2, R2, V4 Flash:
tre profili distinti

Il catalogo DeepSeek nel 2026 ha tre modelli flagship principali — ognuno ottimizzato per un profilo di utilizzo diverso. Capire quale usare è il primo passo per sfruttare il vantaggio economico senza sacrificare qualità.

DeepSeek V3.2
$0.14/M input · $0.28/M output
Il cavallo da lavoro general-purpose. Chat, summarization, agenti, coding, analisi documenti. Il più economico della famiglia.
DeepSeek R2
$0.55/M input · $2.19/M output
Il ragionatore — successore di R1. Per matematica, debugging complesso, analisi multi-step, decisioni strutturate che richiedono chain-of-thought.
DeepSeek V4 Flash
$0.30/M input · $0.50/M output
Il nuovo flagship (marzo 2026). Bilancia qualità e prezzo: 81% su SWE-Bench vs 69% di V3.2. Il sostituto di deepseek-chat a partire da luglio 2026.
V3.2-Speciale
Prezzo variabile (alta compute)
Variante high-compute di V3.2 ottimizzata per massima qualità su ragionamento complesso — performance paragonabili a GPT-5 su alcuni benchmark.
💡 Quale usare per task quotidiani

Per la maggior parte dei task professionali (analisi testi, email, riepiloghi, coding base): V3.2. Per problemi che richiedono ragionamento profondo (matematica, debugging complesso, analisi dati strutturate): R2. Per chi vuole la qualità più alta al minor costo aggiuntivo: V4 Flash.

03 · DeepSeek V3.2

Il modello
general-purpose più economico

V3.2 è il modello di riferimento di DeepSeek per uso quotidiano — combina qualità frontier per task generici con il prezzo più basso del mercato tra i modelli seri.

  • 💰
    $0.14/M input, $0.28/M outputIl prezzo di riferimento per chi cerca il massimo volume al minimo costo. Con cache hit scende a $0.014/M input — quasi gratuito per prompt ripetuti.
  • 📄
    163K token di context windowAbbastanza per documenti lunghi, thread email estesi, analisi di report completi.
  • 🏆
    IMO 2025 Gold Medal (V3.2-Speciale)La variante Speciale ha ottenuto risultati da medaglia d'oro all'Olimpiade Internazionale di Matematica 2025 — un benchmark di intelligenza senza precedenti per un modello a questi prezzi.
  • 🔌
    API compatibile OpenAIMigrazione da GPT-4o a V3.2 richiede solo tre cambiamenti: base_url, API key, model name. Il resto del codice rimane invariato.
🎓 La DSA — DeepSeek Sparse Attention

V3.2 introduce un meccanismo di attenzione sparsa (DSA) che riduce il costo computazionale su contesti lunghi mantenendo la qualità. È la stessa idea alla base dell'MSA di MiniMax e dell'architettura MoE di Qwen — efficienza senza sacrificio di capacità.

04 · DeepSeek R2

Il ragionatore:
chain-of-thought a basso costo

R2 è il successore di R1 — il modello che nel 2025 aveva stupito il mondo con performance di reasoning paragonabili a o1 di OpenAI a una frazione del prezzo. R2 mantiene questa promessa e la migliora.

ConfrontoDeepSeek R2OpenAI o1
Prezzo input$0.55/M$15/M
Prezzo output$2.19/M$60/M
Risparmio~96% più economico per workload equivalenti
SpecializzazioneRagionamento, math, codingRagionamento avanzato

R2 usa chain-of-thought interno — genera un ragionamento passo per passo prima della risposta finale. Questo produce più token in output rispetto a un modello normale (da qui il costo output più alto), ma la qualità su problemi strutturati è nettamente superiore a V3.2.

⚠️ R2 non è sempre la scelta giusta

R2 genera molti più token di output per ogni risposta — per task semplici questo significa costi più alti senza beneficio reale. Usalo solo quando il task richiede davvero ragionamento step-by-step: matematica, debug di codice complesso, analisi strutturata, pianificazione multi-step. Per tutto il resto, V3.2 o V4 Flash offrono il rapporto qualità/prezzo migliore.

05 · DeepSeek V4 Flash

Il nuovo flagship
marzo 2026

V4 Flash è il modello più recente di DeepSeek, lanciato a marzo 2026. Sostituisce progressivamente deepseek-chat e deepseek-reasoner come modello di default — a partire dal 24 luglio 2026, i vecchi model name vengono deprecati e mappati su V4 Flash.

💡 Perché V4 Flash invece di V3.2

V4 Flash vale il 15% di sovrapprezzo rispetto a V3.2: 81% su SWE-Bench Verified vs 69% di V3.2 — un salto qualitativo rilevante per coding e task agentici. Per task di testo generico il gap è minore; per qualsiasi lavoro con codice, V4 Flash è la scelta migliore tra le due.

Deprecazione deepseek-chat e deepseek-reasoner

⚠️ Breaking change — 24 luglio 2026

I model name deepseek-chat e deepseek-reasoner vengono deprecati il 24 luglio 2026. Dopo quella data punteranno rispettivamente alla modalità non-thinking e thinking di deepseek-v4-flash. Se hai codice in produzione che usa i vecchi nomi, pianifica la migrazione prima di quella data per evitare comportamenti imprevisti.

Migrazione a V4 Flash (Python)
from openai import OpenAI

client = OpenAI(
    api_key="LA_TUA_API_KEY_DEEPSEEK",
    base_url="https://api.deepseek.com"
)

# Prima: model="deepseek-chat"   ← deprecato 24/07/2026
# Dopo:
response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Ciao!"}]
)
06 · Prezzi e Cache

Context caching:
90% di sconto

Il context caching è il meccanismo che rende DeepSeek ancora più economico di quanto già sembri: se invii lo stesso prefisso di prompt in richieste ripetute, paghi solo il 10% del prezzo normale per quei token.

ModelloInput standardCache hit (90% off)Output
V3.2$0.14/M$0.014/M$0.28/M
V4 Flash$0.30/M$0.03/M$0.50/M
R2$0.55/M$0.14/M (cache)$2.19/M
🎓 Come sfruttare il caching in pratica

Il caching funziona meglio quando il system prompt o una parte lunga del prompt utente si ripete tra richieste consecutive. In un agente AI che analizza centinaia di documenti con lo stesso system prompt, la maggior parte dei costi di input viene abbattuta del 90%. Struttura le tue pipeline mettendo la parte stabile del prompt all'inizio, dove il caching è più efficace.

Confronto di costo con altri frontier (indicativo)

ModelloInput $/MOutput $/MRapporto vs V3.2
DeepSeek V3.2$0.14$0.281× (riferimento)
DeepSeek V4 Flash$0.30$0.50~2×
Qwen3-235B API~$1.25~$3.75~9×
Claude Opus 4.6~$15~$75~107×
GPT-5.5~$10~$30~71×
07 · Accesso e API

Chat gratuita
e integrazione API

DeepSeek è accessibile tramite interfaccia web gratuita per uso personale, e tramite API compatibile OpenAI per integrazioni in applicazioni — con una struttura di accesso semplice e documentata.

  • 🌐
    chat.deepseek.comInterfaccia web gratuita per chat testuale. Include toggle per thinking mode. Non richiede credito API.
  • 🔌
    api.deepseek.comAPI OpenAI-compatible — cambia base_url, API key e model name. Il resto del codice OpenAI funziona senza modifiche.
  • ☁️
    Provider terzi (OpenRouter, Together, Fireworks)Per SLA migliori, minore latency globale e load balancing. OpenRouter offre V3.2 a ~$0.23/M input con alta affidabilità.
  • 💾
    Pesi open-source su Hugging FaceI pesi di V3.2 e R2 sono disponibili per self-hosting — la soluzione per chi non vuole dati su server cinesi.
Prima chiamata API DeepSeek (Python)
from openai import OpenAI

client = OpenAI(
    api_key="LA_TUA_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "Sei un assistente per analisi di marketing."},
        {"role": "user", "content": "Analizza i trend del digital marketing B2B nel 2026."}
    ],
    stream=False
)

print(response.choices[0].message.content)
08 · Esercizio 1

Prima chat con
DeepSeek

01
Confronto V4 Flash vs R2 sulla stessa domanda
Tempo: 15 minuti · chat.deepseek.com
Obiettivo: Sperimentare concretamente la differenza tra il modello general-purpose e il modello reasoning sulla stessa domanda complessa.
  1. Vai su chat.deepseek.com e accedi (account gratuito).
  2. In modalità standard (V4 Flash), invia: "Un'azienda B2B con 50 dipendenti deve scegliere tra implementare un CRM custom o adottare Salesforce. Analizza i pro e i contro e dai una raccomandazione."
  3. Salva la risposta. Ora attiva il toggle "DeepThink (R1/R2)" e riponi la stessa domanda.
  4. Osserva il processo di ragionamento visibile prima della risposta finale in R2.
  5. Confronta: quale risposta useresti per una consulenza reale? Qual è più rapida da leggere?
09 · Esercizio 2

Calcola il risparmio
per un use case reale

02
Simulazione costo API mensile
Tempo: 20 minuti
Obiettivo: Calcolare e confrontare il costo mensile di un'automazione AI tra DeepSeek V4 Flash e Claude Sonnet, per capire in quali scenari il risparmio è realmente significativo.
  1. Definisci un caso d'uso: es. "Classificazione automatica di 1.000 ticket di supporto al giorno in 5 categorie."
  2. Stima i token: system prompt (~500 token) + ticket (~300 token) + risposta (~100 token) = ~900 token per richiesta.
  3. Calcola il costo mensile su DeepSeek V4 Flash: 1.000 × 30 giorni × (700 input × $0.30/M + 100 output × $0.50/M) ÷ 1.000.000.
  4. Ripeti con Claude Sonnet 4.6 (prezzi su anthropic.com).
  5. Confronta: il risparmio mensile giustifica una migrazione? In quale volume di ticket il punto di pareggio cambia?
10 · Glossario

Tutti i termini spiegati

DeepSeek V3.2
base
Il modello general-purpose di DeepSeek — il più economico della categoria frontier ($0.14/M input). Per uso quotidiano su task di testo, coding base e analisi documenti.
DeepSeek R2
base
Il modello reasoning di DeepSeek — successore di R1. Chain-of-thought interno per matematica, debugging e analisi strutturata. 96% più economico di o1 di OpenAI.
DeepSeek V4 Flash
importante
Il nuovo flagship di DeepSeek (marzo 2026), $0.30/M input. A luglio 2026 sostituisce deepseek-chat come modello di default dell'API.
Context Caching
importante
Il meccanismo che riduce del 90% il costo dei token di input già inviati in richieste precedenti — cruciale per ottimizzare i costi in pipeline con prompt ripetuti.
DSA (DeepSeek Sparse Attention)
tecnico
L'architettura di attenzione sparsa introdotta in V3.2 che riduce il costo computazionale su contesti lunghi mantenendo la qualità della risposta.
deepseek-chat (deprecato)
tecnico
Il vecchio model name dell'API DeepSeek, deprecato il 24 luglio 2026. Dopo quella data punta alla modalità non-thinking di deepseek-v4-flash.
Data Residency
importante
Il luogo fisico dove i dati vengono elaborati e conservati. DeepSeek elabora su server in Cina — rilevante per compliance GDPR e policy aziendali sulla privacy dei dati.
Open-weight
base
Modello con pesi scaricabili per self-hosting — a differenza di open-source (codice incluso), i pesi permettono di eseguire il modello su propria infrastruttura senza API esterne.