Passa al contenuto principale

Sorgenti web: scraping e discovery

Questa pagina descrive come acquisire nella Knowledge Base i contenuti di un sito web, tramite un processo in due fasi: prima si individuano le pagine candidate, poi si esegue l'acquisizione vera e propria.

Prerequisiti

  • Una Knowledge Base già creata.
  • L'indirizzo del sito da acquisire, con accesso pubblico (senza autenticazione).

Fase 1 — Rilevare le pagine del sito

Nella scheda Web Scraping della Knowledge Base, inserire l'indirizzo del sito e avviare il rilevamento. La piattaforma cerca automaticamente sitemap e feed del sito (robots.txt, sitemap.xml, indici di sitemap, feed RSS/Atom) e propone l'elenco delle pagine candidate.

Configurazione dell'acquisizione web

Elenco delle pagine candidate con selezione

Selezionare o deselezionare le pagine da acquisire, singolarmente o in blocco.

Esclusioni

È possibile escludere pagine per URL specifico, per percorso (ad esempio tutte le pagine sotto /blog/) o per pattern (espressione regolare), per evitare di acquisire sezioni non pertinenti del sito (aree di login, pagine legali ripetitive e simili).

Fase 2 — Avviare lo scraping

Confermata la selezione, avviare l'acquisizione. L'avanzamento viene mostrato in tempo reale.

Rendering avanzato per siti dinamici

Per i siti che costruiscono il contenuto tramite JavaScript (applicazioni a pagina singola, contenuti caricati dopo lo scorrimento), attivare l'opzione Rendering avanzato: la pagina viene caricata con un motore di rendering completo invece di leggere solo l'HTML statico, garantendo un'estrazione più fedele del testo effettivamente visibile.

Ottimizzazione dei contenuti

Disponibilità

L'ottimizzazione dei contenuti richiede il feature flag Scraping avanzato.

Se attivata, il testo estratto da ogni pagina viene ripulito e riformattato prima dell'indicizzazione, per migliorarne la leggibilità e la struttura ai fini del recupero.

Durante l'acquisizione, la piattaforma riconosce ed elimina automaticamente i blocchi di contenuto ripetuti su molte pagine dello stesso sito (menu di navigazione, intestazioni, piè di pagina), che altrimenti finirebbero indicizzati più volte senza portare informazione utile. Allo stesso modo, le pagine il cui contenuto risulta quasi interamente duplicato rispetto ad altre già acquisite vengono scartate automaticamente, per non appesantire la Knowledge Base con quasi-duplicati.

Seguire l'avanzamento

La barra di avanzamento indica il numero di pagine acquisite sul totale selezionato; è possibile lasciare la pagina e tornare in seguito senza interrompere il processo.

Risultato atteso

Al termine, le pagine acquisite compaiono come sorgenti di tipo "Web" nella scheda Panoramica della Knowledge Base, pronte per essere consultate dagli agenti collegati. Per mantenerle aggiornate nel tempo vedi Aggiornamento pianificato dei contenuti web.

Problemi comuni

ProblemaCausaSoluzione
Alcune pagine attese non compaiono tra le candidateNon sono presenti in nessuna sitemap/feed rilevato e non sono raggiungibili da un link internoVerificare che la pagina sia effettivamente collegata dal sito o presente nella sitemap
Il testo acquisito da una pagina è incompleto o vuotoIl sito richiede JavaScript per mostrare il contenutoAttivare il Rendering avanzato per quella sorgente
Molte pagine vengono scartate come quasi-duplicateIl sito ha una struttura fortemente ripetitiva (ad es. schede prodotto quasi identiche)Restringere la selezione alle pagine realmente distintive, oppure valutare l'uso delle FAQ per i contenuti ripetitivi

Pagine correlate