Sorgenti web: scraping e discovery
Questa pagina descrive come acquisire nella Knowledge Base i contenuti di un sito web, tramite un processo in due fasi: prima si individuano le pagine candidate, poi si esegue l'acquisizione vera e propria.
Prerequisiti
- Una Knowledge Base già creata.
- L'indirizzo del sito da acquisire, con accesso pubblico (senza autenticazione).
Fase 1 — Rilevare le pagine del sito
Nella scheda Web Scraping della Knowledge Base, inserire l'indirizzo del sito e avviare il rilevamento. La piattaforma cerca automaticamente sitemap e feed del sito (robots.txt, sitemap.xml, indici di sitemap, feed RSS/Atom) e propone l'elenco delle pagine candidate.


Selezionare o deselezionare le pagine da acquisire, singolarmente o in blocco.
Esclusioni
È possibile escludere pagine per URL specifico, per percorso (ad esempio tutte le pagine sotto /blog/) o per pattern (espressione regolare), per evitare di acquisire sezioni non pertinenti del sito (aree di login, pagine legali ripetitive e simili).
Fase 2 — Avviare lo scraping
Confermata la selezione, avviare l'acquisizione. L'avanzamento viene mostrato in tempo reale.
Rendering avanzato per siti dinamici
Per i siti che costruiscono il contenuto tramite JavaScript (applicazioni a pagina singola, contenuti caricati dopo lo scorrimento), attivare l'opzione Rendering avanzato: la pagina viene caricata con un motore di rendering completo invece di leggere solo l'HTML statico, garantendo un'estrazione più fedele del testo effettivamente visibile.
Ottimizzazione dei contenuti
L'ottimizzazione dei contenuti richiede il feature flag Scraping avanzato.
Se attivata, il testo estratto da ogni pagina viene ripulito e riformattato prima dell'indicizzazione, per migliorarne la leggibilità e la struttura ai fini del recupero.
Pulizia automatica: menu, footer e pagine quasi identiche
Durante l'acquisizione, la piattaforma riconosce ed elimina automaticamente i blocchi di contenuto ripetuti su molte pagine dello stesso sito (menu di navigazione, intestazioni, piè di pagina), che altrimenti finirebbero indicizzati più volte senza portare informazione utile. Allo stesso modo, le pagine il cui contenuto risulta quasi interamente duplicato rispetto ad altre già acquisite vengono scartate automaticamente, per non appesantire la Knowledge Base con quasi-duplicati.
Seguire l'avanzamento
La barra di avanzamento indica il numero di pagine acquisite sul totale selezionato; è possibile lasciare la pagina e tornare in seguito senza interrompere il processo.
Risultato atteso
Al termine, le pagine acquisite compaiono come sorgenti di tipo "Web" nella scheda Panoramica della Knowledge Base, pronte per essere consultate dagli agenti collegati. Per mantenerle aggiornate nel tempo vedi Aggiornamento pianificato dei contenuti web.
Problemi comuni
| Problema | Causa | Soluzione |
|---|---|---|
| Alcune pagine attese non compaiono tra le candidate | Non sono presenti in nessuna sitemap/feed rilevato e non sono raggiungibili da un link interno | Verificare che la pagina sia effettivamente collegata dal sito o presente nella sitemap |
| Il testo acquisito da una pagina è incompleto o vuoto | Il sito richiede JavaScript per mostrare il contenuto | Attivare il Rendering avanzato per quella sorgente |
| Molte pagine vengono scartate come quasi-duplicate | Il sito ha una struttura fortemente ripetitiva (ad es. schede prodotto quasi identiche) | Restringere la selezione alle pagine realmente distintive, oppure valutare l'uso delle FAQ per i contenuti ripetitivi |