Marco Consiglio  ·  Volta Institute

Google Vertex AI
Guida Operativa

Architettura enterprise, Vertex AI Search, RAG Corpus API in Python, ScaNN Vector Search e Grounding con Gemini 1.5 — Edizione Specialistica 2026

Aggiornato 2026 · Edizione Ufficiale
Livello: Intermedio / Avanzato  |  Target: Cloud Architect & AI Engineer
1. Cos'è Google Vertex AI
Sezione 01 · Piattaforma e Architettura

Che Cos'è Google Vertex AI e Perché è lo Standard Enterprise

Google Vertex AI è la piattaforma cloud integrata e gestita di Google che unifica sotto un'unica architettura l'intero ciclo di vita del machine learning e dell'intelligenza artificiale generativa: dalla preparazione dei dati e l'addestramento dei modelli, fino al deployment scalabile, alla ricerca semantica vettoriale e all'orchestrazione avanzata di agenti autonomi.

💡 Il Salto di Livello: Da Strumenti Sperimentali ad Architettura Enterprise

Mentre piattaforme consumer o librerie open-source richiedono complessi interventi manuali per garantire scalabilità, ridondanza geografica e sicurezza dei dati, Vertex AI poggia direttamente sulla dorsale infrastrutturale proprietaria di Google (Google Cloud Platform - GCP). Offre SLA del 99.9%, isolamento di rete tramite Virtual Private Cloud (VPC) e piena conformità con le più stringenti normative internazionali (GDPR, HIPAA, ISO 27001, SOC 2).

I Tre Componenti Fondamentali per l'AI Generativa su Vertex AI

1 Model Garden & Fondational Models
Un catalogo curato di oltre 150 modelli fondazionali pronti all'uso: la famiglia proprietaria Gemini 1.5 Pro e Flash (con finestra di contesto fino a 2 milioni di token e multimodalità nativa per audio, video e testo), modelli di embedding come text-embedding-004, e modelli open source di primo piano (Llama 3, Mistral, Gemma, Claude 3.5 Sonnet su Google Cloud).
2 Vertex AI Search & Conversation (GenAI Agent Builder)
La soluzione gestita zero-code / low-code di Google per implementare motori di ricerca semantica interna e assistenti conversazionali su banche dati aziendali, documenti Google Drive, bucket Cloud Storage e database BigQuery con grounding automatico.
3 Vertex AI RAG Engine & Vector Search
Gli strumenti programmatici per sviluppatori: l'algoritmo vettoriale proprietario ScaNN (lo stesso che alimenta Google Search e YouTube), capace di cercare tra miliardi di vettori in meno di 5 millisecondi, e la suite RAG Corpus API per pilotare via Python chunking, indicizzazione e retrieval condizionato.

Confronto: Google Vertex AI vs OpenAI Platform vs AWS Bedrock

Caratteristica Google Vertex AI OpenAI Platform API Amazon Web Services Bedrock
Finestra di Contesto Max Fino a 2.000.000 token (Gemini 1.5) 128.000 token (GPT-4o) 200.000 token (Claude 3.5)
Motore di Ricerca Vettoriale ScaNN integrato (miliardi di item) Vector Stores Assistant API OpenSearch Serverless
Integrazione Dati Aziendali Nativa con BigQuery, Drive, GCS Caricamento file via API Nativa con S3, DynamoDB
Sovranità Dati & Perimetro VPC Massima (VPC-SC, Regioni UE certe) Enterprise Agreement separato Massima (AWS PrivateLink)
Multimodalità Nativa Totale (testo, audio, video nativo) Immagini, audio (video via frame) Dipende dal modello scelto
🎓 Lo Standard nei Corsi Avanzati Volta Institute

Nei percorsi avanzati di AI Engineering e Cloud Data Architecture, Google Vertex AI viene approfondito per fornire agli studenti le competenze necessarie a progettare soluzioni scalabili per grandi aziende, istituti bancari e software house operanti su scala continentale.

Sezione 03 · Sviluppo Low-Code Python

Vertex AI RAG Engine: La RAG Corpus API in Python

Per gli sviluppatori che desiderano incorporare un'infrastruttura RAG governata da codice all'interno di microservizi personalizzati, software SaaS proprietari o pipeline batch, Google mette a disposizione la RAG Corpus API nell'SDK Python ufficiale.

L'Architettura del RAG Corpus

Un RAG Corpus è uno spazio vettoriale gestito ospitato su infrastruttura Google Cloud che incapsula:

1 Chunking Parametrico Esplicito
Permette di specificare via codice la dimensione esatta dei frammenti (chunk_size) in caratteri o token e la sovrapposizione desiderata (chunk_overlap) per conservare la continuità semantica.
2 Modello di Embedding Assegnato
Utilizza nativamente i modelli di embedding più recenti di Google (come text-embedding-004 o multimodalembedding) senza necessità di invocare endpoint separati per calcolare le matrici numeriche.
3 Connettore Nativo con i Modelli Gemini (Tool Calling)
Il corpus può essere convertito istantaneamente in un Tool di retrieval conforme all'SDK di Gemini: il modello generativo sa quando e come interrogare il corpus per supportare le proprie argomentazioni.

Script Completo Python per la Gestione del Corpus

Pipeline RAG Completa in Python con Vertex AI
import vertexai
from vertexai.preview import rag
from vertexai.generative_models import GenerativeModel, Tool

# Inizializzazione del progetto su regione europea Francoforte
PROJECT_ID = "tuo-progetto-volta-2026"
LOCATION = "europe-west1"
vertexai.init(project=PROJECT_ID, location=LOCATION)

# 1. Definizione e Creazione del Corpus RAG
corpus = rag.create_corpus(
    display_name="Corpus_Manuali_Tecnici_2026",
    description="Knowledge base per assistenza ingegneristica"
)
print("Corpus creato con Resource Name:", corpus.name)

# 2. Ingestion con Chunking Personalizzato
import_op = rag.import_files(
    corpus_name=corpus.name,
    paths=["gs://bucket-manuali-volta/ingegneria/*.pdf"],
    chunk_size=512,      # 512 caratteri per blocco
    chunk_overlap=64     # 64 caratteri di overlap
)
print("File indicizzati con successo.")

# 3. Costruzione del Tool di Recupero Grounded
rag_tool = Tool.from_retrieval(
    retrieval=rag.Retrieval(
        source=rag.VertexRagStore(
            rag_resources=[rag.RagResource(rag_corpus=corpus.name)],
            similarity_top_k=3,
            vector_distance_threshold=0.60
        )
    )
)

# 4. Invocazione di Gemini 1.5 con Citazioni Automatiche
model = GenerativeModel(model_name="gemini-1.5-pro", tools=[rag_tool])
response = model.generate_content("Quali sono le tolleranze massime per i giunti ad alta pressione?")

print("Risposta Grounded:\n", response.text)
for candidate in response.candidates:
    print("Metadati Grounding:", candidate.grounding_metadata)
💡 Ispezione Diretta dei Frammenti (Vector Retrieval Debug)

Con il metodo rag.retrieval_query() puoi visualizzare direttamente a video i punteggi di affinità numerica (score da 0 a 1) e il testo grezzo dei chunk estratti prima di inviarli al modello generativo, rendendo il debug trasparente e controllabile.

Sezione 04 · Ricerca Vettoriale ad Alte Prestazioni

Vertex Vector Search: La Tecnologia ScaNN a Livello Planetario

Quando l'archivio vettoriale supera centinaia di migliaia di documenti e raggiunge decine o centinaia di milioni di record con requisiti di latenza inferiori ai 10 millisecondi, Vertex Vector Search (precedentemente denominato Matching Engine) costituisce il punto di riferimento assoluto nel settore dell'Information Retrieval.

La Tecnologia Sottostante: L'Algoritmo ScaNN di Google

ScaNN (Scalable Nearest Neighbors) è l'algoritmo di quantizzazione vettoriale proprietario sviluppato dai ricercatori di Google Research. È la stessa tecnologia che elabora istantaneamente le correlazioni semantiche per miliardi di utenti su Google Traduttore, YouTube e Google Immagini.

1 Quantizzazione Anisotropica (Anisotropic Vector Quantization)
A differenza degli algoritmi tradizionali che comprimono i vettori perdendo precisione geometrica uniforme, ScaNN preserva con rigore matematico la componente parallela del vettore originale, migliorando l'accuratezza del calcolo del prodotto scalare ad altissima velocità.
2 Latenza Ultra-Bassa (Sub-Millisecond Query Response)
Mentre i database relazionali con estensioni vettoriali faticano a gestire più di qualche decina di query al secondo su milioni di righe, Vector Search processa decine di migliaia di richieste al secondo (QPS) con una latenza p99 inferiore a 5 millisecondi.
3 Filtraggio Ibrido con Metadati (Crowding & Filtering)
Permette di applicare restrizioni logiche categoriche (es. categoria: 'farmaceutica' AND lingua: 'it') in combinazione con la ricerca geometrica, oltre alla funzionalità di crowding per evitare che i risultati siano dominati da record provenienti dalla medesima sorgente.

Le Metriche di Distanza Geometrica Supportate

Metrica di Distanza Descrizione Matematica Caso d'Uso Consigliato
DOT_PRODUCT_DISTANCE Prodotto scalare tra vettori normalizzati a norma unitaria La scelta consigliata per la maggior parte dei modelli di text-embedding
COSINE_DISTANCE Distanza angolare indipendente dalla magnitudo vettoriale Ottimale per testi di lunghezza molto eterogenea
SQUARED_L2_DISTANCE Distanza euclidea classica nello spazio euclideo Ideale per coordinate spaziali o feature visive di Computer Vision
💡 Architettura ad Indici Gestiti ed Endpoint Serverless

In Vertex Vector Search, l'indice vettoriale viene compilato in batch e distribuito su un Index Endpoint dedicato, scalabile orizzontalmente con bilanciamento del carico automatico per supportare picchi di traffico di milioni di utenti senza alcun degrado prestazionale.

Sezione 05 · Grounding e Citazioni

Grounding Nativo con Gemini 1.5: Trasparenza e Zero Allucinazioni

Il "Grounding" (ancoraggio) è la tecnica che vincola le capacità generative dei modelli linguistici a fonti verificabili di verità oggettiva. Su Vertex AI, i modelli della famiglia Gemini offrono un'integrazione architetturale nativa che restituisce con precisione matematica le coordinate delle fonti documentali utilizzate.

Le Due Modalità di Grounding su Vertex AI

1 Grounding con Google Search Pubblico
Consente a Gemini di verificare in tempo reale notizie di cronaca, quotazioni di borsa o normative appena pubblicate sul web, allegando alla risposta link web verificabili e riducendo a zero l'effetto del knowledge cutoff.
2 Grounding con Vertex AI Search & RAG Corpus Privati
Ancora il modello ai manuali, contratti e procedure riservate dell'azienda, impedendo rigorosamente al modello di attingere alla propria memoria pubblica quando deve descrivere una procedura interna protetta da NDA.

L'Oggetto `grounding_metadata`: Come Interpretare le Citazioni

Quando Gemini risponde con il grounding attivo, la risposta include un oggetto JSON strutturato denominato grounding_metadata:

Struttura JSON dei Metadati di Grounding
{
  "webSearchQueries": ["requisiti iscrizione master volta 2026"],
  "groundingChunks": [
    {
      "retrievedContext": {
        "uri": "gs://manuali-volta/bando_master_2026.pdf",
        "title": "Bando Ufficiale Master AI 2026",
        "text": "L'iscrizione richiede il possesso di laurea triennale o esperienza equivalente..."
      }
    }
  ],
  "groundingSupports": [
    {
      "segment": {
        "startIndex": 0,
        "endIndex": 84,
        "text": "Per accedere al Master Volta 2026 è necessario possedere una laurea triennale."
      },
      "groundingChunkIndices": [0],
      "confidenceScores": [0.965]
    }
  ]
}
🎓 Verificabilità Giuridica e Conformità Legale

La presenza del punteggio di confidenza numerico (confidenceScores: 0.965) e degli indici esatti di inizio/fine frase (startIndex e endIndex) permette di costruire interfacce utente trasparenti, dove ogni singola frase generata dall'AI presenta una nota a piè di pagina cliccabile che apre il documento originale evidenziando la riga di testo corrispondente.

Sezione 06 · Sicurezza e Conformità

Sicurezza dei Dati, Privacy e Conformità Europea (GDPR)

Per aziende che operano in settori regolamentati come banche, assicurazioni, sanità e pubblica amministrazione, la scelta della piattaforma di intelligenza artificiale non dipende solo dalle capacità del modello, ma soprattutto dalle garanzie legali di protezione del dato e non-proliferazione dei segreti industriali.

Gli Impegni Contrattuali di Google Cloud per Vertex AI

1 Nessun Addestramento sui Tuoi Dati (Zero Model Training)
Google garantisce per contratto formale (Data Processing Addendum - DPA) che i dati dei clienti, i prompt inviati e i documenti archiviati nei corpus RAG non vengono mai utilizzati per ri-addestrare o migliorare i modelli Gemini o di altri clienti.
2 Sovranità Geografica dei Dati (Data Residency in UE)
È possibile vincolare l'intero perimetro computazionale a regioni europee certificate (es. europe-west1 in Belgio, europe-west3 a Francoforte, europe-west8 a Milano o europe-west12 a Torino), garantendo che i dati non lascino mai fisicamente i confini dell'Unione Europea.
3 Perimetro di Rete Privato (VPC Service Controls)
I dati e i modelli possono essere isolati all'interno di un perimetro crittografico VPC-SC (Virtual Private Cloud Service Controls) che impedisce fisicamente qualsiasi esfiltrazione di dati verso internet o verso altri account non autorizzati, anche in caso di compromissione delle credenziali applicative.
4 Chiavi di Crittografia Gestite dal Cliente (CMEK)
I documenti e i vettori archiviati su Vertex AI sono crittografati a riposo con chiavi gestite direttamente dall'azienda tramite Google Cloud KMS (Customer-Managed Encryption Keys). L'azienda può revocare istantaneamente l'accesso ai dati in qualsiasi momento.

Matrice delle Certificazioni di Sicurezza

Normativa / Certificazione Copertura su Vertex AI Settore Industriale di Riferimento
Regolamento UE 2016/679 (GDPR) Piena conformità con DPA ufficiale e clausole contrattuali standard Tutti i settori operanti nell'Unione Europea
AI Act Europeo (2026) Fornisce audit log immutabili, tracciabilità e trasparenza delle decisioni Sistemi AI ad alto rischio in territorio UE
ISO/IEC 27001, 27017, 27018 Certificato e revisionato periodicamente da auditor terzi indipendenti Information Security e Cloud Privacy
SOC 1, SOC 2, SOC 3 Type II Report dettagliati disponibili su richiesta nel Compliance Reports Manager Banche, Finanza e Servizi Fiduciari
HIPAA / HITECH Sottoscrizione del Business Associate Agreement (BAA) Ospedali, Cliniche e Sanità Digitale
⚠️ Attenzione ai Parametri di Logging

Nelle impostazioni di Vertex AI, assicurati che la registrazione delle conversazioni nei log di Cloud Logging rispetti la politica di data retention aziendale e che non vengano registrati dati sensibili (PII) privi di mascheramento automatico con Cloud DLP (Data Loss Prevention).

Sezione 07 · Laboratorio 1

Laboratorio Guidato: Configurazione Data Store e Ricerca su Console

In questo primo laboratorio pratico, esplorerai l'ambiente di amministrazione di Google Cloud, creando un Data Store su Vertex AI Search, importando un set di manuali PDF da un bucket Cloud Storage e collaudando l'applicazione di ricerca semantica con sintesi automatica.

LAB 01
Motore di Ricerca Documentale con Vertex AI Search
Ambiente: Google Cloud Console · Livello: Principiante · Tempo: 25 min
Obiettivo: Creare una search app aziendale capace di estrarre risposte dirette da tre dispense PDF formative archiviate in Cloud Storage, verificando l'accuratezza dei sommari e la presenza delle citazioni numerate alle pagine di riferimento.
  1. Creazione del Bucket Cloud Storage: Accedi alla console di Google Cloud, apri Cloud Storage → Buckets e crea un nuovo bucket con nome univoco (es. manuali-didattici-volta-2026) impostando come regione europe-west1.
  2. Caricamento dei Documenti PDF: Carica all'interno del bucket tre documenti PDF formativi (es. Guida_Cybersecurity.pdf, Manuale_Contratti.pdf, Regolamento_Didattico.pdf).
  3. Creazione del Data Store: Nel menu di navigazione, entra in Agent Builder → Data Stores → Create Data Store. Seleziona l'opzione Cloud Storage, specifica il percorso gs://manuali-didattici-volta-2026/* e seleziona come formato Unstructured Documents con parsing Advanced.
  4. Configurazione della Search App: Fai click su Apps → Create App, scegli Search, assegna il nome Ricerca_Didattica_Volta e collega il Data Store appena creato.
  5. Attivazione del Modulo Sintesi Generativa (Summarization): Nella sezione Configurations dell'app, abilita la spunta su Enable Extractive Answers e imposta il modello su Gemini Pro per generare un sommario esaustivo in testa ai risultati.
  6. Impostazione Ponderazione Semantica: Tarare lo slider di ricerca impostando 80% su rilevanza semantica e 20% su corrispondenza lessicale per catturare sia acronimi tecnici che concetti descrittivi aperti.
  7. Sessione di Collaudo nella Console Preview: Apri la scheda Preview a destra e poni la domanda: "Quali sono le sanzioni per mancato rispetto della privacy?". Verifica che compaia un paragrafo riassuntivo in lingua italiana fluida corredato dal link cliccabile alla pagina esatta del PDF.
  8. Ispezione del Payload JSON: Fai click su View JSON Response per verificare le proprietà extractiveAnswers e snippets generate dall'infrastruttura Google in risposta alla query.
  9. Verifica del Log di Audit: Apri Cloud Logging e controlla che l'evento di ricerca sia stato registrato con latenza inferiore a 400ms e codice di stato HTTP 200.
💡 Suggerimento di Ottimizzazione per Documenti Tecnici

Se i tuoi PDF contengono tabelle con intestazioni a più livelli, attiva l'opzione Layout-Aware Chunking nelle impostazioni avanzate del Data Store per preservare l'associazione tra colonne e valori numerici.

🔑 Competenze Acquisite nel Laboratorio 1

Hai allestito un'infrastruttura di ricerca semantica enterprise pronta all'uso senza scrivere una sola riga di codice: l'intero processo di OCR, parsing avanzato, chunking e vettorizzazione è stato gestito in maniera autonoma da Google Cloud.

Sezione 08 · Laboratorio 2

Laboratorio Guidato: Pipeline Python con RAG Corpus API

Nel secondo laboratorio svilupperai uno script Python professionale che interagisce programmaticamente con le API di Vertex AI, creando un RAG Corpus, monitorando lo stato dell'indicizzazione e interrogando Gemini 1.5 con grounding documentale vincolato.

LAB 02
Automazione RAG con SDK Python Vertex AI
Stack: Python 3.11 + google-cloud-aiplatform · Livello: Intermedio · Tempo: 35 min
Obiettivo: Scrivere un'applicazione modulare in Python che inizializzi un corpus RAG, effettui l'ingestion asincrona di file contrattuali con chunking vincolato e formuli risposte verificando i metadati di grounding restituiti da Gemini.
  1. Predisposizione Ambiente e Autenticazione: Apri il terminale, attiva l'ambiente virtuale ed effettua il login a Google Cloud con il tuo account sviluppatore:
    gcloud auth application-default login
  2. Creazione dello Script `app_vertex_rag.py`: Crea il file di progetto ed importa i moduli dell'SDK:
    import vertexai
    from vertexai.preview import rag
    from vertexai.generative_models import GenerativeModel, Tool
    
    PROJECT_ID = "tuo-progetto-volta"
    REGION = "europe-west1"
    vertexai.init(project=PROJECT_ID, location=REGION)
  3. Funzione di Creazione Corpus ed Ingestion: Aggiungi la routine per inizializzare il corpus e caricare i documenti:
    def setup_rag():
        corpus = rag.create_corpus(
            display_name="Corpus_Contratti_Fornitori_2026",
            description="Banca dati contratti attivi e SLA fornitura"
        )
        print(f"Corpus creato: {corpus.name}")
        rag.import_files(
            corpus_name=corpus.name,
            paths=["gs://bucket-contratti-volta/*.pdf"],
            chunk_size=400,
            chunk_overlap=50
        )
        return corpus.name
  4. Funzione di Interrogazione con Grounding Tool: Scrivi la funzione di generazione e ispezione metadati:
    def query_rag(corpus_name, domanda):
        rag_tool = Tool.from_retrieval(
            retrieval=rag.Retrieval(
                source=rag.VertexRagStore(
                    rag_resources=[rag.RagResource(rag_corpus=corpus_name)],
                    similarity_top_k=2
                )
            )
        )
        model = GenerativeModel("gemini-1.5-pro", tools=[rag_tool])
        resp = model.generate_content(domanda)
        print("--- RISPOSTA GEMINI ---")
        print(resp.text)
        print("--- METADATI FONTI ---")
        print(resp.candidates[0].grounding_metadata)
  5. Esecuzione e Verifica Output: Esegui lo script con python app_vertex_rag.py e analizza i punteggi di confidenza stampati nei metadati di supporto.
💡 Integrazione in Pipeline di Produzione

Questo modulo Python può essere racchiuso all'interno di un'applicazione web FastAPI, distribuito come container Docker su Cloud Run o invocato da una Cloud Function a fronte del caricamento di ogni nuovo documento su Cloud Storage.

Sezione 09 · Prezzi e Dimensionamento

Modello dei Prezzi, Quote e Ottimizzazione su Vertex AI

Comprendere la struttura tariffaria di Google Vertex AI è indispensabile per redigere piani economico-finanziari accurati per progetti enterprise, evitando sorprese in fattura e massimizzando il rapporto qualità/prezzo su carichi di lavoro elevati.

Le Componenti Tariffarie Principali

1 Consumo Token dei Modelli Generativi (Gemini)
Fatturato a consumo per 1 milione di caratteri o 1 milione di token. Gemini 1.5 Flash offre costi irrisori (circa $0,075 per 1M token in input), ideale per pre-elaborazioni e FAQ; Gemini 1.5 Pro (circa $1,25 per 1M token in input) garantisce il massimo rigore logico per compiti analitici complessi.
2 Generazione di Embedding Vettoriali
Il modello text-embedding-004 ha un costo estremamente ridotto, pari a circa $0,025 per 1 milione di caratteri elaborati. L'indicizzazione di un corpus aziendale di 10.000 pagine PDF costa mediamente meno di 2 euro una tantum.
3 Vertex AI Search Query Pricing
Viene fatturato a pacchetti di query di ricerca: circa $1,50 - $2,00 ogni 1.000 query effettuate, comprendendo l'infrastruttura di indicizzazione, il caching dei vettori e la riscrittura automatica della domanda.
4 Vector Search Dedicated Node Hours
Se utilizzi Vertex Vector Search con nodi dedicati per bassissima latenza, paghi una tariffa oraria per il nodo di indicizzazione attivo (a partire da circa $0,20 - $0,40 per ora/nodo), ampiamente giustificata solo per volumi superiori a 500.000 record.

Le 3 Regole d'Oro per Minimizzare i Costi su Vertex AI

Strategia di Risparmio Descrizione Operativa Risparmio Stimato
Adozione Ibrida Flash / Pro Usa Gemini Flash per triage e FAQ, invia a Pro solo casi legali critici - 70% sui costi token
Context Caching (Memoria nella Cache) Attiva il context caching per documenti statici consultati migliaia di volte al giorno - 75% sul costo di input
Taratura di similarity_top_k Recupera solo 2 o 3 chunk anziché 10 se i testi sono ben suddivisi - 60% sui token di contesto
💡 Impostazione di Budget Alerts su Google Cloud

Configura sempre nella sezione Billing di Google Cloud un avviso di spesa mensile (Budget Alert) con soglie al 50%, 80% e 100% del budget prefissato: riceverai notifiche email preventive prima di sforare il tetto economico concordato.

Sezione 10 · Riferimento e Glossario

Glossario Tecnico Completo: Terminologia Google Vertex AI

Un repertorio terminologico rigoroso per consultare in qualsiasi momento definizioni, sigle tecnologiche e protocolli architetturali dell'ecosistema Google Cloud AI.

Vertex AI
piattaforma
La suite integrata di Google Cloud per la gestione dell'intero ciclo di vita di machine learning e AI generativa enterprise su infrastruttura hyperscale sicura e gestita.
Model Garden
catalogo
L'hub di Vertex AI che ospita oltre 150 modelli fondazionali proprietari di Google (Gemini, Imagen, Codey) e open-source (Llama, Mistral, Gemma) pronti al deployment.
Agent Builder
suite
L'ambiente no-code/low-code di Vertex AI che racchiude i servizi Vertex AI Search e Vertex AI Conversation per la rapida creazione di motori di ricerca semantica e chatbot.
RAG Corpus API
sviluppo
L'interfaccia di programmazione Python di Vertex AI che consente di creare contenitori vettoriali gestiti, importare file con chunking parametrico e collegare tool di retrieval a Gemini.
ScaNN (Scalable Nearest Neighbors)
algoritmo
L'algoritmo matematico di ricerca approssimata vettoriale sviluppato da Google Research che garantisce latenze inferiori a 5ms anche su database di miliardi di record.
Grounding
affidabilità
Il meccanismo che àncora la risposta generata da un modello a documenti certi (Data Store, RAG Corpus o Google Search), certificando la veridicità con coordinate di citazione.
Data Store
archivio
Il repository documentale all'interno di Vertex AI Search che acquisisce, indicizza e indicizza documenti non strutturati (PDF), tabelle BigQuery o siti web pubblici.
VPC Service Controls (VPC-SC)
sicurezza
Perimetro di sicurezza crittografico di rete privata in Google Cloud che impedisce fisicamente il transito o l'esfiltrazione di dati aziendali riservati verso internet.
CMEK (Customer-Managed Encryption Keys)
crittografia
Protocollo in cui l'azienda genera e controlla le proprie chiavi crittografiche per cifrare dati a riposo in Vertex AI, con possibilità di revoca autonoma incondizionata.
Context Caching
ottimizzazione
Tecnologia di Gemini che memorizza in cache ad alta velocità documenti o contesti massivi frequentemente consultati, abbattendo del 75% i costi computazionali di input.
Gemini 1.5 Flash
modello
Variante ultraleggera, velocissima ed economica della famiglia Gemini, ottimizzata per elaborazione dati ad alto volume, triage e retrieval su larga scala.
Gemini 1.5 Pro
modello
Modello di punta di Google Cloud dotato di finestra di contesto fino a 2 milioni di token e capacità di ragionamento multimodale avanzato su documenti complessi.