Passa al contenuto principale

Caricare documenti (con OCR)

Questa pagina descrive il caricamento di file nella Knowledge Base e l'estrazione automatica del testo, incluso il caso dei documenti scansionati.

Prerequisiti

Formati supportati e limiti

  • Documenti: PDF, Office (DOCX, XLSX), TXT, CSV, HTML, Markdown.
  • Immagini: PNG, JPEG, TIFF, WebP.
  • Dimensione massima 50 MB per singolo file.
  • Caricamento multiplo tramite trascinamento (drag&drop) o selezione manuale.

Caricare i documenti

Menu di aggiunta di una nuova sorgente

Selezionare Nuova sorgente → Documenti, quindi trascinare i file nell'area dedicata o selezionarli dal proprio dispositivo.

Caricamento di documenti nella Knowledge Base

Priorità, categoria e lingua

Per ciascun documento è possibile indicare:

  • Priorità (Bassa/Media/Alta) — influenza il peso del documento nel recupero rispetto ad altre sorgenti.
  • Categoria — etichetta libera per organizzare i documenti all'interno della Knowledge Base.
  • Lingua — se non specificata, viene dedotta automaticamente dal contenuto.

Documenti scansionati e immagini: l'estrazione automatica del testo

Quando un documento è una scansione o un'immagine (ad esempio un PDF ottenuto da uno scanner, privo di testo selezionabile), la piattaforma tenta prima l'estrazione diretta del testo; se il risultato non è sufficiente, subentra automaticamente il riconoscimento ottico del testo (OCR), senza richiedere alcuna configurazione manuale. Il testo riconosciuto viene poi trattato come qualunque altro contenuto testuale della Knowledge Base.

Per amministratori di sistema

Il modello usato per l'OCR può essere personalizzato per singolo tenant o per singola Knowledge Base su richiesta al team di supporto Askme.

Verificare l'elaborazione

Ogni documento passa dallo stato In attesa a In elaborazione e infine a Pronto (o Errore). Nella scheda Documento della Knowledge Base è possibile aprire il dettaglio di ciascun file per vedere lo stato, le statistiche di suddivisione in blocchi e un'anteprima del testo effettivamente estratto — utile in particolare per verificare la qualità dell'estrazione OCR su un documento scansionato.

Dettaglio di un documento con anteprima del testo estratto

Problemi comuni

ProblemaCausaSoluzione
Il caricamento viene rifiutatoIl file supera i 50 MB oppure il formato non è tra quelli supportatiRidurre la dimensione del file o convertirlo in un formato supportato
Il testo estratto da un PDF scansionato è incompleto o erratoLa scansione è di scarsa qualità (bassa risoluzione, testo inclinato)Ricaricare una scansione a risoluzione più alta, se disponibile
Il documento resta a lungo in stato "In elaborazione"File di grandi dimensioni o numero elevato di pagine da elaborare in OCRAttendere il completamento; se la situazione persiste oltre un tempo ragionevole, verificare lo stato nella scheda Documento

Pagine correlate