Cos'è DeepSeek
DeepSeek è un laboratorio AI fondato ad Hangzhou (Cina) come divisione di High-Flyer Capital Management. Ha scosso il mercato internazionale offrendo modelli con performance paragonabili a GPT e Claude a un costo API 20-50 volte inferiore, con i pesi open-source disponibili su Hugging Face.
I dati inviati all'API di DeepSeek vengono elaborati e conservati su server in Cina, soggetti alla legislazione cinese sulla sicurezza dei dati. Per uso professionale con dati sensibili (dati personali, informazioni aziendali riservate, dati dei clienti) valuta alternative con data residency europea, oppure usa i pesi open-source su infrastruttura propria. Per uso didattico su contenuti non sensibili, DeepSeek è una scelta legittima e molto economica.
Il primato economico nel 2026
DeepSeek V3.2 a $0.14/M input è il modello frontier più economico disponibile via API nel 2026 — battuto solo da Gemini Flash-Lite che però è un modello più piccolo e meno capace. Per team con carichi ad alto volume di token (automazioni, pipeline di analisi, agenti), la differenza di costo rispetto a Claude o GPT è sostanziale: un workload da $10.000/mese su GPT può costare poche centinaia su DeepSeek.
V3.2, R2, V4 Flash:
tre profili distinti
Il catalogo DeepSeek nel 2026 ha tre modelli flagship principali — ognuno ottimizzato per un profilo di utilizzo diverso. Capire quale usare è il primo passo per sfruttare il vantaggio economico senza sacrificare qualità.
Per la maggior parte dei task professionali (analisi testi, email, riepiloghi, coding base): V3.2. Per problemi che richiedono ragionamento profondo (matematica, debugging complesso, analisi dati strutturate): R2. Per chi vuole la qualità più alta al minor costo aggiuntivo: V4 Flash.
Il modello
general-purpose più economico
V3.2 è il modello di riferimento di DeepSeek per uso quotidiano — combina qualità frontier per task generici con il prezzo più basso del mercato tra i modelli seri.
- 💰$0.14/M input, $0.28/M outputIl prezzo di riferimento per chi cerca il massimo volume al minimo costo. Con cache hit scende a $0.014/M input — quasi gratuito per prompt ripetuti.
- 📄163K token di context windowAbbastanza per documenti lunghi, thread email estesi, analisi di report completi.
- 🏆IMO 2025 Gold Medal (V3.2-Speciale)La variante Speciale ha ottenuto risultati da medaglia d'oro all'Olimpiade Internazionale di Matematica 2025 — un benchmark di intelligenza senza precedenti per un modello a questi prezzi.
- 🔌API compatibile OpenAIMigrazione da GPT-4o a V3.2 richiede solo tre cambiamenti: base_url, API key, model name. Il resto del codice rimane invariato.
V3.2 introduce un meccanismo di attenzione sparsa (DSA) che riduce il costo computazionale su contesti lunghi mantenendo la qualità. È la stessa idea alla base dell'MSA di MiniMax e dell'architettura MoE di Qwen — efficienza senza sacrificio di capacità.
Il ragionatore:
chain-of-thought a basso costo
R2 è il successore di R1 — il modello che nel 2025 aveva stupito il mondo con performance di reasoning paragonabili a o1 di OpenAI a una frazione del prezzo. R2 mantiene questa promessa e la migliora.
| Confronto | DeepSeek R2 | OpenAI o1 |
|---|---|---|
| Prezzo input | $0.55/M | $15/M |
| Prezzo output | $2.19/M | $60/M |
| Risparmio | ~96% più economico per workload equivalenti | |
| Specializzazione | Ragionamento, math, coding | Ragionamento avanzato |
R2 usa chain-of-thought interno — genera un ragionamento passo per passo prima della risposta finale. Questo produce più token in output rispetto a un modello normale (da qui il costo output più alto), ma la qualità su problemi strutturati è nettamente superiore a V3.2.
R2 genera molti più token di output per ogni risposta — per task semplici questo significa costi più alti senza beneficio reale. Usalo solo quando il task richiede davvero ragionamento step-by-step: matematica, debug di codice complesso, analisi strutturata, pianificazione multi-step. Per tutto il resto, V3.2 o V4 Flash offrono il rapporto qualità/prezzo migliore.
Il nuovo flagship
marzo 2026
V4 Flash è il modello più recente di DeepSeek, lanciato a marzo 2026. Sostituisce progressivamente deepseek-chat e deepseek-reasoner come modello di default — a partire dal 24 luglio 2026, i vecchi model name vengono deprecati e mappati su V4 Flash.
V4 Flash vale il 15% di sovrapprezzo rispetto a V3.2: 81% su SWE-Bench Verified vs 69% di V3.2 — un salto qualitativo rilevante per coding e task agentici. Per task di testo generico il gap è minore; per qualsiasi lavoro con codice, V4 Flash è la scelta migliore tra le due.
Deprecazione deepseek-chat e deepseek-reasoner
I model name deepseek-chat e deepseek-reasoner vengono deprecati il 24 luglio 2026. Dopo quella data punteranno rispettivamente alla modalità non-thinking e thinking di deepseek-v4-flash. Se hai codice in produzione che usa i vecchi nomi, pianifica la migrazione prima di quella data per evitare comportamenti imprevisti.
from openai import OpenAI
client = OpenAI(
api_key="LA_TUA_API_KEY_DEEPSEEK",
base_url="https://api.deepseek.com"
)
# Prima: model="deepseek-chat" ← deprecato 24/07/2026
# Dopo:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Ciao!"}]
)
Context caching:
90% di sconto
Il context caching è il meccanismo che rende DeepSeek ancora più economico di quanto già sembri: se invii lo stesso prefisso di prompt in richieste ripetute, paghi solo il 10% del prezzo normale per quei token.
| Modello | Input standard | Cache hit (90% off) | Output |
|---|---|---|---|
| V3.2 | $0.14/M | $0.014/M | $0.28/M |
| V4 Flash | $0.30/M | $0.03/M | $0.50/M |
| R2 | $0.55/M | $0.14/M (cache) | $2.19/M |
Il caching funziona meglio quando il system prompt o una parte lunga del prompt utente si ripete tra richieste consecutive. In un agente AI che analizza centinaia di documenti con lo stesso system prompt, la maggior parte dei costi di input viene abbattuta del 90%. Struttura le tue pipeline mettendo la parte stabile del prompt all'inizio, dove il caching è più efficace.
Confronto di costo con altri frontier (indicativo)
| Modello | Input $/M | Output $/M | Rapporto vs V3.2 |
|---|---|---|---|
| DeepSeek V3.2 | $0.14 | $0.28 | 1× (riferimento) |
| DeepSeek V4 Flash | $0.30 | $0.50 | ~2× |
| Qwen3-235B API | ~$1.25 | ~$3.75 | ~9× |
| Claude Opus 4.6 | ~$15 | ~$75 | ~107× |
| GPT-5.5 | ~$10 | ~$30 | ~71× |
Chat gratuita
e integrazione API
DeepSeek è accessibile tramite interfaccia web gratuita per uso personale, e tramite API compatibile OpenAI per integrazioni in applicazioni — con una struttura di accesso semplice e documentata.
- 🌐chat.deepseek.comInterfaccia web gratuita per chat testuale. Include toggle per thinking mode. Non richiede credito API.
- 🔌api.deepseek.comAPI OpenAI-compatible — cambia base_url, API key e model name. Il resto del codice OpenAI funziona senza modifiche.
- ☁️Provider terzi (OpenRouter, Together, Fireworks)Per SLA migliori, minore latency globale e load balancing. OpenRouter offre V3.2 a ~$0.23/M input con alta affidabilità.
- 💾Pesi open-source su Hugging FaceI pesi di V3.2 e R2 sono disponibili per self-hosting — la soluzione per chi non vuole dati su server cinesi.
from openai import OpenAI
client = OpenAI(
api_key="LA_TUA_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Sei un assistente per analisi di marketing."},
{"role": "user", "content": "Analizza i trend del digital marketing B2B nel 2026."}
],
stream=False
)
print(response.choices[0].message.content)
Prima chat con
DeepSeek
- Vai su chat.deepseek.com e accedi (account gratuito).
- In modalità standard (V4 Flash), invia: "Un'azienda B2B con 50 dipendenti deve scegliere tra implementare un CRM custom o adottare Salesforce. Analizza i pro e i contro e dai una raccomandazione."
- Salva la risposta. Ora attiva il toggle "DeepThink (R1/R2)" e riponi la stessa domanda.
- Osserva il processo di ragionamento visibile prima della risposta finale in R2.
- Confronta: quale risposta useresti per una consulenza reale? Qual è più rapida da leggere?
Calcola il risparmio
per un use case reale
- Definisci un caso d'uso: es. "Classificazione automatica di 1.000 ticket di supporto al giorno in 5 categorie."
- Stima i token: system prompt (~500 token) + ticket (~300 token) + risposta (~100 token) = ~900 token per richiesta.
- Calcola il costo mensile su DeepSeek V4 Flash: 1.000 × 30 giorni × (700 input × $0.30/M + 100 output × $0.50/M) ÷ 1.000.000.
- Ripeti con Claude Sonnet 4.6 (prezzi su anthropic.com).
- Confronta: il risparmio mensile giustifica una migrazione? In quale volume di ticket il punto di pareggio cambia?