Aggiornamento pianificato dei contenuti web
Una sorgente web acquisita una sola volta resta ferma alla versione del sito rilevata in quel momento. Questa pagina descrive come pianificare acquisizioni ricorrenti per mantenere la Knowledge Base allineata al sito di origine.
Prerequisiti
- Una sorgente web già acquisita almeno una volta, vedi Sorgenti web: scraping e discovery.
Pianificare il re-scraping
Nella scheda Web Scraping della Knowledge Base è possibile impostare una pianificazione per le acquisizioni successive:

| Frequenza | Quando è indicata |
|---|---|
| Una tantum | Contenuti statici, che non richiedono un secondo passaggio |
| Giornaliera | Siti con contenuti che cambiano molto spesso (ad es. listini, disponibilità) |
| Settimanale | Portali aggiornati regolarmente ma non quotidianamente |
| Mensile | Documentazione e contenuti che cambiano raramente |
La ri-discovery automatica
Ogni esecuzione pianificata non si limita a ricaricare le pagine già selezionate: ripete anche la Fase 1 di rilevamento, per intercettare eventuali pagine nuove pubblicate sul sito dall'ultima esecuzione. Le nuove pagine rilevate seguono le stesse regole di esclusione già configurate.
Che cosa succede ai vecchi contenuti
Ogni esecuzione pianificata sostituisce integralmente i documenti web della sessione precedente: non si accumulano versioni multiple della stessa pagina nella Knowledge Base.
Se una pagina precedentemente acquisita non è più raggiungibile o non è più coperta dalla selezione, il documento corrispondente viene rimosso dalla Knowledge Base alla successiva esecuzione.
Verificare l'ultimo aggiornamento
La scheda Impostazioni della Knowledge Base riporta la data dell'ultima acquisizione completata e il relativo esito nella cronologia delle modifiche, vedi Esportazione, qualità e cronologia.
Problemi comuni
| Problema | Causa | Soluzione |
|---|---|---|
| L'acquisizione pianificata non è mai partita | La pianificazione non è stata salvata o l'esecuzione schedulata non è attiva | Verificare la configurazione nella scheda Web Scraping e ripianificare |
| Dopo un aggiornamento sono spariti dei contenuti attesi | Le pagine non risultano più raggiungibili o sono state escluse dalla selezione | Verificare se le pagine esistono ancora sul sito e controllare le regole di esclusione |
| Le nuove pagine del sito non vengono mai incluse | La ri-discovery non le rileva perché non sono in sitemap né raggiungibili da link interni | Verificare la presenza della pagina nella sitemap del sito |