Passa al contenuto principale

Parametri avanzati del RAG

A chi si rivolge questa pagina

I parametri descritti in questa pagina si trovano nella configurazione della Knowledge Base e nella sezione RAG della configurazione di un agente. Sono pensati per chi amministra il tenant e desidera affinare la qualità delle risposte oltre ai valori proposti di default; per la spiegazione generale del funzionamento del RAG vedi Come funziona il RAG.

Suddivisione in blocchi (chunking)

Prima di essere indicizzato, ogni documento viene suddiviso in blocchi di testo più piccoli ("chunk"), perché è su questi blocchi che avviene la ricerca. La strategia si sceglie in fase di creazione della Knowledge Base:

StrategiaCome divide il testo
Fisso (Fixed size)Blocchi di lunghezza costante, indipendentemente dalla struttura del testo
Ricorsivo (Recursive)Rispetta per quanto possibile paragrafi e frasi, riducendo la dimensione solo dove necessario
Semantico (Semantic)Raggruppa le frasi per affinità di significato, con blocchi di lunghezza variabile
Parent-ChildIndicizza blocchi piccoli per la ricerca, ma recupera il blocco "genitore" più ampio come contesto

Due parametri regolano la suddivisione, indipendentemente dalla strategia scelta:

  • Dimensione del blocco — tipicamente tra 256 e 2.000 caratteri: blocchi più piccoli aumentano la precisione del recupero, blocchi più grandi mantengono più contesto insieme.
  • Sovrapposizione (overlap) — la percentuale di testo condivisa fra un blocco e il successivo (indicativamente 10-20%), per evitare che un concetto venga tagliato esattamente al confine tra due blocchi.
Contenuti da scraping web

Le pagine acquisite tramite scraping vengono indicizzate automaticamente con strategia Semantica, indipendentemente da quella scelta per il resto della Knowledge Base: è la strategia più efficace su testo destrutturato proveniente da pagine HTML.

Ogni blocco di continuazione riceve inoltre un'intestazione contestuale automatica (ad esempio [Sezione: Condizioni di reso]) che aiuta il recupero a comprendere da quale parte del documento proviene, anche quando il blocco viene estratto isolatamente.

Sezione strategia di chunking nel form di creazione della Knowledge Base

Quanti risultati recuperare (Top-K e soglia)

  • Top-K — quanti blocchi di testo vengono recuperati e forniti all'agente per ogni domanda. Un valore troppo basso rischia di escludere informazioni utili; un valore troppo alto aumenta il rumore e il costo di elaborazione.
  • Soglia di score minimo — i risultati con un punteggio di pertinenza sotto la soglia vengono scartati anche se rientrano nel Top-K, per evitare di fornire all'agente contenuti poco attinenti.

Un punto di partenza diffuso per una Knowledge Base di supporto clienti è un Top-K tra 3 e 6 risultati con una soglia di score minimo intorno a 0,3-0,4: una soglia più alta rende l'agente più selettivo (a costo di risposte "non ho trovato nulla" più frequenti), una soglia più bassa più permissivo (a costo di contesto meno pertinente).

Sezione di configurazione RAG nella scheda di un agente

Ricerca ibrida

La ricerca ibrida combina due tecniche di recupero: la ricerca vettoriale (per significato) e la ricerca testuale classica (per corrispondenza di parole, tipo BM25), fondendo i due elenchi di risultati con un algoritmo di fusione dei ranking (Reciprocal Rank Fusion).

Il parametro peso ibrido (alpha) regola l'equilibrio tra le due tecniche: un valore vicino a 1 privilegia la ricerca per significato, un valore vicino a 0 privilegia la corrispondenza testuale esatta (utile per codici prodotto, sigle o numeri di pratica che la sola ricerca semantica potrebbe non recuperare bene). Un valore intorno a 0,5 è un buon punto di partenza per contenuti generici in linguaggio naturale.

La componente testuale cerca i termini della domanda in modo indipendente l'uno dall'altro e applica le regole morfologiche della lingua dichiarata dalla Knowledge Base: dichiarare correttamente la lingua dei contenuti (vedi Lingue e traduzione) è quindi un prerequisito perché la ricerca ibrida produca risultati diversi dalla sola ricerca vettoriale.

Riordino dei risultati (reranking)

Disponibilità

Il riordino dei risultati richiede il feature flag RAG avanzato, incluso nei piani superiori.

Dopo il recupero iniziale, un modello di riordino (Cohere oppure un cross-encoder eseguito localmente) ricalcola la pertinenza dei risultati e li riordina, migliorando la qualità del Top-K finale a fronte di un piccolo costo aggiuntivo di elaborazione. È consigliato quando la Knowledge Base contiene molti contenuti simili tra loro (ad esempio varianti di prodotto) e la sola ricerca ibrida fatica a distinguerli.

Il riordino va attivato esplicitamente sull'agente: se l'opzione non viene abilitata, i risultati arrivano al modello nell'ordine prodotto dal recupero e in numero pari al Top-K configurato.

Quando il riordino è attivo entra in gioco un secondo valore, il numero di risultati riordinati: è l'ampiezza a cui il riordinatore restringe i risultati che riceve in ingresso. Va quindi letto insieme al Top-K — si recupera un insieme ampio con il Top-K e si lascia al riordinatore il compito di selezionare i migliori — e non come un limite da impostare a caso, perché è quello che determina quanti blocchi arrivano davvero al modello.

Correzione automatica della query

Se il primo recupero non produce risultati sufficientemente pertinenti, l'agente può riformulare automaticamente la domanda e ripetere la ricerca, entro un numero massimo di tentativi e una soglia minima di qualità configurabili (meccanismo noto come CRAG, Corrective RAG). La modalità di riscrittura si sceglie tramite i preset Veloce / Bilanciata / Approfondita / Personalizzata nella configurazione RAG dell'agente (vedi Collegare le Knowledge Base (RAG)): i preset più approfonditi consentono più cicli di correzione, a scapito di un tempo di risposta leggermente maggiore.

Preset "Comprensione della query" con le opzioni avanzate aperte

Lingue e traduzione

Una Knowledge Base può avere più lingue dichiarate; la prima indicata in fase di creazione è la lingua canonica. Quando la domanda dell'utente è scritta in una lingua diversa da tutte quelle dichiarate, la query viene tradotta automaticamente nella lingua canonica prima della ricerca, così da poter comunque recuperare contenuti pertinenti.

Valori consigliati per scenari tipici

ScenarioChunkingTop-K / sogliaRicerca ibridaReranking
FAQ e supporto clienti, risposte breviFisso, 300-500 caratteri, overlap 15%Top-K 3-4, soglia 0,4Alpha 0,6 (favorisce il significato)Non necessario
Documentazione tecnica o contrattuale, contenuti lunghiParent-Child o Ricorsivo, 800-1.200 caratteriTop-K 5-8, soglia 0,3Alpha 0,5Consigliato se i contenuti si assomigliano
Knowledge Base multilinguaSemanticoTop-K 4-6, soglia 0,35Alpha 0,5Facoltativo

I valori in tabella sono punti di partenza da verificare e affinare osservando le risposte reali e le fonti recuperate (vedi Provare un agente).

Pagine correlate