Valutazioni e A/B Testing
Il servizio di Valutazioni consente di misurare la qualità delle risposte di un agente su un insieme di casi di test riproducibili. Gli Esperimenti A/B estendono lo stesso principio al confronto tra due varianti di configurazione di uno stesso agente.
Il servizio richiede che le funzionalità Valutazioni e, per gli esperimenti A/B, A/B Testing siano abilitate sul piano del tenant.
Prerequisiti
- Permesso di accesso alla sezione Servizi.
- Un agente configurato e attivo, su cui eseguire la valutazione.
Concetti
| Elemento | Descrizione |
|---|---|
| Dataset | Un insieme di casi di test raggruppati per scopo (ad esempio «Domande sulla policy di reso») |
| Caso di test | Una domanda con la risposta attesa e, opzionalmente, un contesto di riferimento |
| Run | Un'esecuzione del dataset su un agente in un determinato momento |
| Judge | Il modello linguistico dedicato a valutare le risposte prodotte, distinto dal modello in esame |
Creare un dataset
- Aprire Servizi → Valutazioni → Dataset e creare un nuovo dataset.
- Indicare nome, descrizione e, facoltativamente, l'agente di riferimento.
- Aggiungere i casi di test singolarmente oppure importarli da file.
Lanciare una valutazione e leggere le metriche
Una valutazione esegue l'intera pipeline dell'agente sotto test (ricerca nella Knowledge Base, prompt, eventuali strumenti collegati, regole di escalation) su ciascun caso del dataset, in modo asincrono. È possibile forzare un modello diverso da quello configurato sull'agente e limitare quante esecuzioni avvengono in parallelo.
Il risultato di una run riporta, per l'intero dataset e per singolo caso di test, le metriche:
- Faithfulness: aderenza della risposta alle fonti recuperate.
- Answer Relevancy: pertinenza della risposta rispetto alla domanda.
- Context Precision e Context Recall: qualità del materiale recuperato dalla Knowledge Base.
- Latenza e crediti AI consumati per l'esecuzione.

Esperimenti A/B
Un esperimento A/B mette a confronto due varianti di configurazione dello stesso agente (ad esempio system prompt, temperatura, modello o parametri RAG), con una ripartizione percentuale del traffico tra le due e un dataset di valutazione condiviso. Entrambe le varianti vengono valutate sullo stesso dataset con le stesse metriche descritte sopra; il dettaglio dell'esperimento mostra inoltre le metriche live, raccolte dal traffico reale di produzione instradato su ciascuna variante.

Promuovere la variante vincente
Quando una variante risulta superiore, è possibile promuoverla con un'azione dedicata.
La promozione applica la configurazione della variante scelta all'agente sorgente, sovrascrivendo la configurazione attualmente attiva. L'operazione non è reversibile automaticamente: prima di procedere, verificare che la variante promossa sia realmente quella desiderata.
Problemi comuni
| Problema | Causa probabile | Soluzione |
|---|---|---|
| La run resta a lungo in esecuzione | Dataset molto ampio o concorrenza elevata | Ridurre la concorrenza impostata per la run, oppure attendere il completamento |
| Le metriche risultano basse in modo inatteso | Il dataset non rispecchia bene i casi reali, oppure la Knowledge Base collegata è incompleta | Rivedere i casi di test e la copertura della Knowledge Base dell'agente |
| Le metriche live dell'esperimento non compaiono | Traffico di produzione insufficiente sulla variante | Attendere un volume di conversazioni maggiore prima di trarre conclusioni |