Passa al contenuto principale

Valutazioni e A/B Testing

Il servizio di Valutazioni consente di misurare la qualità delle risposte di un agente su un insieme di casi di test riproducibili. Gli Esperimenti A/B estendono lo stesso principio al confronto tra due varianti di configurazione di uno stesso agente.

Disponibilità

Il servizio richiede che le funzionalità Valutazioni e, per gli esperimenti A/B, A/B Testing siano abilitate sul piano del tenant.

Prerequisiti

  • Permesso di accesso alla sezione Servizi.
  • Un agente configurato e attivo, su cui eseguire la valutazione.

Concetti

ElementoDescrizione
DatasetUn insieme di casi di test raggruppati per scopo (ad esempio «Domande sulla policy di reso»)
Caso di testUna domanda con la risposta attesa e, opzionalmente, un contesto di riferimento
RunUn'esecuzione del dataset su un agente in un determinato momento
JudgeIl modello linguistico dedicato a valutare le risposte prodotte, distinto dal modello in esame

Creare un dataset

  1. Aprire Servizi → Valutazioni → Dataset e creare un nuovo dataset.
  2. Indicare nome, descrizione e, facoltativamente, l'agente di riferimento.
  3. Aggiungere i casi di test singolarmente oppure importarli da file.

Lanciare una valutazione e leggere le metriche

Una valutazione esegue l'intera pipeline dell'agente sotto test (ricerca nella Knowledge Base, prompt, eventuali strumenti collegati, regole di escalation) su ciascun caso del dataset, in modo asincrono. È possibile forzare un modello diverso da quello configurato sull'agente e limitare quante esecuzioni avvengono in parallelo.

Il risultato di una run riporta, per l'intero dataset e per singolo caso di test, le metriche:

  • Faithfulness: aderenza della risposta alle fonti recuperate.
  • Answer Relevancy: pertinenza della risposta rispetto alla domanda.
  • Context Precision e Context Recall: qualità del materiale recuperato dalla Knowledge Base.
  • Latenza e crediti AI consumati per l'esecuzione.

Risultati di una valutazione con le metriche per singolo caso di test

Esperimenti A/B

Un esperimento A/B mette a confronto due varianti di configurazione dello stesso agente (ad esempio system prompt, temperatura, modello o parametri RAG), con una ripartizione percentuale del traffico tra le due e un dataset di valutazione condiviso. Entrambe le varianti vengono valutate sullo stesso dataset con le stesse metriche descritte sopra; il dettaglio dell'esperimento mostra inoltre le metriche live, raccolte dal traffico reale di produzione instradato su ciascuna variante.

Dettaglio di un esperimento A/B con le due varianti a confronto

Promuovere la variante vincente

Quando una variante risulta superiore, è possibile promuoverla con un'azione dedicata.

warning

La promozione applica la configurazione della variante scelta all'agente sorgente, sovrascrivendo la configurazione attualmente attiva. L'operazione non è reversibile automaticamente: prima di procedere, verificare che la variante promossa sia realmente quella desiderata.

Problemi comuni

ProblemaCausa probabileSoluzione
La run resta a lungo in esecuzioneDataset molto ampio o concorrenza elevataRidurre la concorrenza impostata per la run, oppure attendere il completamento
Le metriche risultano basse in modo inattesoIl dataset non rispecchia bene i casi reali, oppure la Knowledge Base collegata è incompletaRivedere i casi di test e la copertura della Knowledge Base dell'agente
Le metriche live dell'esperimento non compaionoTraffico di produzione insufficiente sulla varianteAttendere un volume di conversazioni maggiore prima di trarre conclusioni

Pagine correlate