Marco Consiglio · Volta Institute · 2026 Image Generation Pipeline
Corso Data Scientist
Guida alle variabili di generazione

Pipeline di
Image Generation
— Ottimizzazione Prompt

Manuale interattivo delle 10 macro-categorie di parametri che governano i modelli generativi di immagini (GPT-Image, Midjourney, Stable Diffusion, Firefly). Ogni variabile è descritta con funzione, valori accettati ed esempio di prompt ottimizzato.

10Pipeline
60Variabili
2026Edition
01

Generazione Base — Core Image Generation

Le fondamenta di ogni richiesta generativa. Queste variabili definiscono cosa generare e con quali parametri di base.

✍️
Prompt visivo
Visual Prompt
INPUT

La descrizione testuale dell'immagine desiderata. È il parametro più critico: determina soggetto, azione, ambiente, stile e umore. Va scritto in ordine decrescente di importanza (soggetto → contesto → stile → dettagli).

✦ Esempio ottimizzato GPT-Image 2026
"A senior data scientist, cinematic portrait, dark background, rim lighting, ultra-detailed, 8K, photorealistic, Fujifilm XT4"
💡Regola d'oro: soggetto + ambiente + stile + qualità. Evita negazioni — descrivi cosa VUOI vedere, non cosa vuoi evitare.
🖼️
Output renderizzato
Rendered Output
OUTPUT

Il risultato finale della generazione. La qualità dipende dall'interazione di tutti gli altri parametri. I modelli GPT-Image 2026 restituiscono immagini in formato base64 o URL, con varianti per formato e risoluzione.

base64_png url_jpeg url_webp
💡GPT-Image restituisce URL temporanei (1h). Scarica subito o salva in base64 per conservare il risultato.
🎲
Seed
Seme di generazione
PARAM

Valore intero che inizializza il generatore di numeri casuali. Lo stesso seed + stesso prompt = stesso output (determinismo). Fondamentale per iterazioni, comparazioni A/B e versioning.

✦ Uso API
seed: 42 → risultato riproducibile
seed: null → variazione casuale
0–4294967295 null (random)
📐
Aspect Ratio
Proporzioni immagine
FORMAT

Definisce il rapporto larghezza:altezza dell'immagine. Influenza la composizione (es. 16:9 → paesaggio; 9:16 → verticale social; 1:1 → Instagram). Va scelto in base alla destinazione d'uso finale.

1:1 16:9 9:16 4:3 3:2
💡Per social media: 9:16 (Reels/Stories), 1:1 (Feed), 16:9 (YouTube thumbnail). Specificalo sempre nel prompt: "vertical 9:16 portrait composition".
📏
Resolution Target
Dimensione target
PARAM

Dimensione in pixel dell'immagine finale. Risoluzioni più alte richiedono più token/crediti e tempo. GPT-Image 2026 supporta fino a 4096×4096. L'upscaling post-generazione è preferibile al downscaling.

256×256 512×512 1024×1024 1792×1024 4096×4096
⚙️
Sampling Strategy
Strategia di campionamento
TECH

L'algoritmo usato per risolvere il processo di diffusione. Influisce su velocità, qualità e carattere dell'output. Nei modelli aperti (SDXL) è configurabile; nei modelli chiusi (GPT-Image, Firefly) è gestito internamente.

DDIM DPM++ Euler a PLMS
💡DPM++ offre il miglior equilibrio qualità/velocità per Stable Diffusion. Euler A produce variazioni più creative. DDIM è più deterministico.
02

Controllo Stilistico — Style Control

Parametri che definiscono l'estetica visiva: tono, palette, illuminazione e livello di dettaglio superficiale.

🎨
Style Preset
Stile predefinito
STYLE

Keyword di stile incluse nel prompt che attivano un'intera costellazione di attributi visivi. È il modo più rapido per impostare l'estetica generale. I modelli 2026 riconoscono centinaia di stili combinabili.

✦ Esempi nel prompt
"...in the style of Bauhaus poster art"
"...cyberpunk neon aesthetic, concept art"
"...watercolor illustration, soft strokes"
photorealistic anime oil painting 3D render flat design
🎭
Art Direction
Direttiva artistica
STYLE

La direzione creativa macro: definisce l'intenzione comunicativa dell'immagine (editoriale, commerciale, narrativa). Guida il modello su mood e messaggio globale, non solo sull'aspetto tecnico.

✦ Nel prompt
"magazine editorial spread, luxury brand aesthetic, aspirational mood, high fashion photography"
💡Pensa a come descriverebbe l'immagine un art director: contesto comunicativo + emozione target + riferimento settore.
🎨
Color Grading
Gestione palette colori
COLOR

Controlla la palette cromatica e il tono colore dell'immagine. Include saturazione, temperatura (warm/cool), contrasto e stili di color-grading cinematografico.

warm tones cool blue desaturated golden hour neon accents
✦ Prompt
"...Kodak Portra film grain, warm amber tones, slight vignette, vintage color grading"
💡
Lighting Model
Schema di illuminazione
LIGHT

Definisce tipo, provenienza e intensità delle fonti di luce nell'immagine. L'illuminazione è uno dei fattori più potenti per definire qualità visiva e atmosfera.

soft box rim light volumetric golden hour neon glow backlit
💡"Cinematic lighting" è un booster universale di qualità. "Studio lighting, 3-point setup" per ritratti professionali.
🔬
Texture Fidelity
Fedeltà delle superfici
DETAIL

Controlla il livello di dettaglio delle texture materiali (pelle, tessuto, metallo, legno). Rilevante per fotorealismo e render di prodotto.

✦ Prompt
"...ultra-detailed leather texture, micro-surface detail, 8K material scan quality, subsurface scattering on skin"
🌡️
Visual Tone
Tono visivo
MOOD

Il registro emotivo dell'immagine. Agisce su contrasto, saturazione e composizione in modo olistico per trasmettere un'emozione specifica.

dramatic soft & airy moody commercial ethereal
03

Editing e Trasformazione — Image Editing

Operazioni che trasformano immagini esistenti: da modifiche locali (inpainting) a estensioni (outpainting) e sfondi.

🔄
Image-to-Image
Da immagine a immagine
EDIT

Tecnica che usa un'immagine input come base da cui il modello elabora un nuovo output. La "forza" di trasformazione è controllata dal parametro denoising_strength: 0 = identica, 1 = completamente rielaborata.

✦ API GPT-Image (image edit endpoint)
image: [base64_input]
prompt: "Transform into watercolor painting"
strength: 0.65
🖌️
Inpainting
Pittura interna
EDIT

Modifica selettiva di un'area dell'immagine delimitata da una maschera. Solo la zona mascherata viene rigenerata in coerenza con il resto. GPT-Image supporta inpainting via mask_image.

✦ Workflow tipico
1. Input image + mask (bianco=modifica)
2. Prompt: "replace background with forest"
3. Output: area rigenerata seamlessly
💡Per rimuovere oggetti: maschera l'area + prompt "empty background". Per sostituire: descrivi il nuovo elemento.
↔️
Outpainting
Pittura esterna / Estensione
EDIT

Estende l'immagine oltre i suoi bordi originali, generando nuovo contenuto coerente. Utile per cambiare aspect ratio o aggiungere spazio visivo per copy in campagne pubblicitarie.

💡Tecnica usata da Adobe Firefly per "Generative Fill". Il prompt descrive cosa deve contenere la nuova area.
⬜
Masking Area
Zona modificabile
CONTROL

Immagine binaria (grayscale) dove il bianco indica la zona da modificare e il nero quella da preservare. Può essere generata manualmente, via segmentazione automatica o prompt-based (SAM 2).

manual mask auto-segment SAM 2
🔃
Content Replacement
Sostituzione elementi
EDIT

Sostituzione di oggetti/elementi specifici nell'immagine mantenendo la scena inalterata. Combina object detection + inpainting. Utile per product mockup e localizzazione visiva.

✦ Use case
"Replace the red car with a blue electric SUV, same position and lighting"
🌄
Background Swap
Cambio sfondo
EDIT

Rimozione automatica dello sfondo e sostituzione con uno nuovo. Richiede una buona segmentazione soggetto/sfondo. GPT-Image lo gestisce via inpainting con mask auto-generata.

💡Per e-commerce: "white studio background, product photography". Per lifestyle: "outdoor café, bokeh background".
04

Controllo Strutturale — Composition & Layout

Come disporre gli elementi nella scena: prospettiva, inquadratura, angolo e posizionamento degli oggetti.

🖼️
Scene Composition
Composizione della scena
COMP

Disposizione degli elementi visivi nell'inquadratura. Include regola dei terzi, golden ratio, simmetria, leading lines. Uno dei fattori più impattanti sulla qualità compositiva.

rule of thirds centered leading lines symmetrical
🔭
Depth Mapping
Gestione profondità
DEPTH

Controllo della profondità di campo e della tridimensionalità della scena. Il depth of field (DOF) separa soggetto e sfondo creando focus narrativo.

✦ Prompt
"shallow depth of field, f/1.4 bokeh, sharp subject, blurred background, 3D depth"
📐
Perspective Control
Controllo prospettiva
COMP

Definisce il punto di fuga e la deformazione prospettica. La prospettiva isometrica è popolare nel design digitale; la prospettiva drammatica (worm eye / bird eye) crea impatto visivo.

isometric one-point fisheye worm eye
📌
Object Anchoring
Ancoraggio oggetti
LAYOUT

Istruzioni di posizionamento esplicito degli elementi nella scena. Nei prompt testuali si usano riferimenti spaziali relativi; nei modelli con spatial-conditioning è possibile specificare coordinate.

✦ Prompt
"product centered left, white space on the right for text overlay, foreground sharp"
🎞️
Framing
Inquadratura
COMP

Distanza focale equivalente e tipo di inquadratura fotografica. Deriva dalla cinematografia e fotografia e definisce quanto del soggetto/ambiente è visibile nel frame.

extreme close-up close-up medium shot full shot wide angle
📷
Camera Angle
Angolo visuale
COMP

Angolo di ripresa della camera virtuale. Influenza il punto di vista narrativo e la percezione delle proporzioni del soggetto. Combinato con focal length produce effetti molto diversi.

eye level bird's eye drone shot low angle dutch angle
05

Input Avanzati — Multimodal Inputs

Condizionamento della generazione tramite input visivi: immagini di riferimento, pose, bozze e guide semantiche.

📌
Reference Image
Immagine di riferimento
INPUT

Un'immagine usata come ancora visiva per mantenere coerenza di soggetto, stile o ambiente in una serie di generazioni. In GPT-Image si fornisce via multipart form-data insieme al prompt.

💡Fondamentale per brand consistency: mantiene colori, forme e stile del marchio attraverso generazioni multiple.
🎨
Style Reference
Riferimento stilistico
INPUT

Immagine fornita esclusivamente per il suo stile visivo, non per il contenuto. Il modello estrae palette, texture e tratti stilistici e li applica a un contenuto diverso. Feature nativa di Midjourney (--sref).

✦ Midjourney
/imagine a cityscape --sref [style_image_url] --sw 50
🧍
Pose Conditioning
Vincolo sulla postura
CONTROL

Tecnica ControlNet che vincola la postura del soggetto generato a uno scheletro OpenPose estratto da un'immagine di riferimento. Permette di replicare pose specifiche cambiando soggetto e stile.

OpenPose DWPose MediaPipe
✏️
Sketch Input
Bozza iniziale
INPUT

Un disegno grezzo (sketch o wireframe) usato come guide strutturale. Il modello lo interpreta come composizione di base e genera un'immagine rifinita che rispetta la struttura tracciata.

💡Adobe Firefly e SDXL ControlNet (Canny, Scribble) trasformano bozze in immagini professionali mantenendo la struttura originale.
🧠
Semantic Guidance
Guida semantica
CONTROL

Embedding semantici o mappe concettuali che guidano il modello sulla distribuzione di contenuto nella scena (es. "left=city, right=nature"). Tecnica avanzata di spatial conditioning dei modelli 2025-2026.

06

Parametri Tecnici — Generation Parameters

I knob numerici che controllano il comportamento del modello durante il processo di diffusione.

🎯
Guidance Scale
Scala di fedeltà al prompt
CFG

Il parametro CFG (Classifier-Free Guidance) bilancia aderenza al prompt vs libertà creativa. Valori bassi (3-5): immagini più creative. Valori alti (10-15): aderenza rigida ma rischio oversaturation.

1–3 creativo 5–8 bilanciato 10–15 rigido 20+ estremo
💡Sweet spot per la maggior parte degli usi: 7.0–8.5. Per fotorealismo: 9–12. Per arte generativa: 4–6.
🌀
Noise Level
Livello di rumore / variabilità
PARAM

Quantità di rumore iniziale (in text-to-image) o intensità di denoising (in img2img). Influenza quanto l'output si discosta da una baseline. In img2img: 0=identico, 1=completamente rigenerato.

✦ API Parameter
denoising_strength: 0.75
// 75% dell'immagine viene rigenerata
🔢
Iteration Steps
Passi di generazione
STEPS

Numero di passi del processo di denoising. Più passi = più qualità ma più tempo. Oltre una soglia il miglioramento è marginale. Con campionatori efficienti (DPM++) sono sufficienti 20-30 passi.

15–20 bozza 25–35 standard 50+ premium
⚡
Latency Profile
Profilo velocità/qualità
PERF

Preset che bilanciano latenza di risposta e qualità dell'output. Nei modelli SaaS (GPT-Image 2026) viene gestito come tier di servizio; nei modelli self-hosted è configurabile tramite batch size e steps.

low_latency balanced high_quality
💰
Compute Budget
Budget computazionale
COST

Risorse computazionali allocate per la generazione. In API cloud si traduce in costo per immagine (token/crediti). Aumenta con: risoluzione, steps, numero di varianti, uso di ControlNet/IP-Adapter.

💡Per prototipazione: usa 512×512, 20 steps. Per output finale: 1024×1024+, 30-50 steps. Risparmia budget sulle bozze.
07

Output e Post-processing

Operazioni sulla immagine generata: upscaling, nitidezza, format export e ottimizzazione per diversi canali.

🔍
Upscaling
Aumento risoluzione
POST

Tecnica AI per aumentare la risoluzione dell'immagine senza perdita di qualità. Real-ESRGAN e Stable Diffusion 4x Upscaler sono i modelli più usati nel 2026. Supportato nativamente in Automatic1111 e ComfyUI.

2x 4x Real-ESRGAN Tile Upscale
💎
Sharpening
Nitidezza
POST

Aumento del contrasto locale dei bordi per migliorare la nitidezza percepita. In prompt si attiva con "sharp details, crisp edges, high clarity". Nel post-processing: unsharp mask o enhance filter.

✦ Nel prompt
"...tack sharp, crisp details, high clarity, no motion blur, perfect focus"
🛠️
Artifact Reduction
Rimozione difetti
POST

Rimozione di anomalie visive tipiche dei modelli generativi: mani deformi, testi illeggibili, bordi innaturali, pixel corrotti. Si gestisce con inpainting mirato + prompt correttivo oppure modelli corrective specializzati.

💡Per il problema delle mani: usa prompt "perfect hands, anatomically correct" e aumenta i steps di generazione.
💾
Export Format
Formato di esportazione
FORMAT

Il formato file dell'output finale. Impatta qualità, dimensione e compatibilità.

PNG (lossless) JPG (web) WebP (moderno) AVIF (2026)
💡PNG per grafica con trasparenza, WebP per web ad alta qualità, JPG per social media (dimensione file ridotta).
📦
Compression Level
Livello di compressione
FORMAT

Bilanciamento tra dimensione file e qualità visiva. Valori tipici: quality 85-95 per JPG/WebP offrono il miglior rapporto qualità/peso per uso web.

quality: 60 web quality: 85 standard quality: 95 premium lossless
08

Controllo Semantico e Sicurezza

Sistemi che garantiscono conformità, filtro dei contenuti e gestione responsabile della generazione AI.

🛡️
Content Filtering
Filtro contenuti
SAFETY

Layer di moderazione automatica che analizza prompt e output per rilevare violazioni delle policy (violenza, contenuti espliciti, incitamento). Operativo su tutti i modelli SaaS 2026 (GPT-Image, Firefly, Gemini Imagen).

block warn log_only
📋
Policy Compliance
Conformità alle policy
SAFETY

Framework di regole che il sistema fa rispettare automaticamente: copyright su personaggi pubblici, minori, simboli di odio, marchi registrati. Fondamentale per uso commerciale e compliance GDPR 2026.

💡Per uso aziendale: verificare sempre i termini di licenza dell'output generato (commercial use rights variano per provider).
🧹
Prompt Sanitization
Pulizia e normalizzazione input
SAFETY

Pre-processing del prompt che rimuove o trasforma elementi potenzialmente problematici prima dell'inferenza. Include token filtering, keyword blocking e riformulazione automatica di richieste borderline.

⚖️
Bias Mitigation
Riduzione distorsioni
ETHICS

Tecniche per ridurre bias demografici, culturali e di genere nei modelli generativi. Include diversity sampling, prompt augmentation automatica e RLHF (Reinforcement Learning from Human Feedback) orientato all'equità.

💡Per campagne inclusive: specificare esplicitamente diversità nel prompt: "diverse group of people, multicultural team, various ethnicities".
09

Automazione e Workflow

Strumenti per produzione su scala: batch generation, pipeline concatenate, template riutilizzabili e versioning.

📦
Batch Generation
Generazione massiva
AUTO

Generazione di N immagini in un'unica chiamata API o workflow. Usato per: A/B testing visuale, varianti di prodotto, content pipeline per e-commerce. Il parametro n in GPT-Image API specifica il numero di varianti.

✦ API GPT-Image
n: 4, // genera 4 varianti
prompt: "product on white background"
🔗
Pipeline Chaining
Concatenazione di processi
AUTO

Sequenza automatizzata di operazioni: genera → upscale → rimuovi sfondo → aggiungi testo → esporta. Implementabile con Make.com, n8n, ComfyUI workflow o custom API chains.

💡Per Marcocreazioni.it: automatizza la pipeline "genera immagine prodotto → remove bg → crea banner social" con Make.com + GPT-Image API.
📝
Template Prompt
Prompt riutilizzabili
AUTO

Strutture di prompt predefinite con variabili dinamiche che permettono di generare varianti coerenti di uno stesso stile. Fondamentali per mantenere brand consistency in campagne scalabili.

✦ Template
"[PRODUCT], [COLOR], studio photography, white background, [SEASON] mood, 8K sharp"
🔖
Versioning
Versionamento output
AUTO

Sistema di tracciamento delle iterazioni: salva prompt, seed, parametri e output per ogni versione generata. Permette di riprodurre risultati, confrontare versioni e costruire un knowledge base visivo.

💡Salva sempre: prompt + seed + tutti i parametri. Con questi 3 elementi puoi ricreare identicamente qualsiasi immagine.
🔬
A/B Visual Testing
Test comparativo immagini
TEST

Confronto sistematico tra varianti dello stesso soggetto (diverso stile, illuminazione, colore) per selezionare la versione più efficace per un obiettivo specifico (CTR, engagement, conversioni).

💡In campagne Meta/Google Ads: genera 3-5 varianti stilistiche con batch generation, testa 48h, mantieni quella con CTR maggiore.
10

UX e Interazione — User Experience

Elementi dell'interfaccia utente per tool di generazione: preview, assistenza al prompt, cronologia e editing diretto.

🤖
Prompt Assistito
Suggerimenti automatici
UX

Sistema di autocomplete e suggerimento per i prompt, basato su LLM o embeddings. Propone keyword stilistiche, qualificatori tecnici e modificatori di qualità mentre l'utente scrive. Presente in Midjourney, Adobe Firefly e tool 2026.

💡Puoi usare Claude/GPT per migliorare automaticamente un prompt grezzo in uno ottimizzato: "expand this into a detailed image generation prompt".
👁️
Live Preview
Anteprima in tempo reale
UX

Visualizzazione progressiva dell'immagine durante il processo di generazione (step-by-step denoising). Offre feedback immediato e permette di annullare generazioni non soddisfacenti prima del completamento.

step preview thumbnail streaming
✋
Drag-and-Edit
Modifica diretta canvas
UX

Interfaccia di editing diretto dell'immagine con strumenti di selezione, spostamento e modifica visuale. Integra inpainting, outpainting e content replacement in un'esperienza fluida senza prompt.

💡Adobe Firefly e ChatGPT Canvas (2026) implementano drag-and-edit come interfaccia principale per non-tecnici.
📚
History Stack
Cronologia generazioni
UX

Registro di tutte le generazioni e modifiche di una sessione. Permette di navigare indietro nella cronologia, ripristinare versioni precedenti e ripartire da un punto specifico del processo creativo.

↩️
Undo/Redo Pipeline
Gestione iterazioni
UX

Sistema di annullamento e ripristino non-distruttivo delle operazioni di editing. In tool avanzati (ComfyUI, Automatic1111) è implementato come node-based workflow con branch multipli.

💡Nei workflow ComfyUI ogni nodo è un checkpoint: puoi modificare un singolo step senza rigenerare tutta la pipeline.