Chiamata · 15 min
GlossarioMattia Esposito26 settembre 20266 minuti di lettura

OCR. Il passaggio che trasforma una scansione in testo per un programma.

OCR (optical character recognition, cioè riconoscimento ottico dei caratteri) è la tecnica che riconosce le lettere dentro l’immagine di una pagina, come una scansione o una foto, e le trasforma in testo che si può cercare, copiare e far leggere a un altro programma. È il primo passo perché un documento di carta diventi un dato.

In breve

L’OCR restituisce il testo della pagina. Quale numero sia il totale e quale il codice cliente lo decide un passaggio successivo, l’estrazione dei dati.

In Italia le fatture fra imprese non ne hanno bisogno: dal 1° gennaio 2019 sono solo elettroniche e arrivano con i dati già strutturati. Restano bolle, ordini, documenti di fornitori esteri, ricevute.

Fra le imprese italiane che usano l’intelligenza artificiale, il 70,8% la impiega per estrarre informazioni da documenti di testo, secondo Istat per il 2025. È l’uso più diffuso.

Questa voce fa parte del glossario dell’AI e dell’automazione, dove ogni termine ha una definizione breve. Qui la definizione si allarga: come funziona l’OCR, la differenza fra PDF nativo e scansionato, dove serve in un’azienda italiana, e come si passa dal testo ai dati.

Cos’è l’OCR

L’OCR è il riconoscimento ottico dei caratteri: un programma guarda l’immagine di una pagina, individua le forme delle lettere e le trascrive come testo. Il risultato è un file in cui si può cercare una parola, copiare una frase, o da cui un altro programma può leggere i dati. Senza OCR, una scansione resta una fotografia.

La tecnica esiste da decenni, e negli ultimi anni i modelli di intelligenza artificiale l’hanno resa molto più robusta su scansioni storte, foto fatte col telefono, timbri e stampatello scritto a mano. Restano difficili la scrittura corsiva, le copie sbiadite e le tabelle con molte colonne e celle unite.

PDF nativo o PDF scansionato

Un PDF può contenere due cose diverse, e solo una delle due ha bisogno dell’OCR. Un PDF nativo nasce da un programma, come un documento esportato dal gestionale: il testo c’è già dentro, e si seleziona e si copia. Un PDF scansionato è l’immagine della pagina: a occhio sembra uguale, ma per un programma contiene solo punti colorati.

DocumentoCosa contieneServe l’OCR?
Fattura elettronicafra imprese italiane

Dati strutturati, trasmessi dal Sistema di Interscambio.

No: i dati si leggono direttamente.

PDF nativoesportato da un programma

Testo vero, con l’impaginazione.

No: il testo si estrae così com’è.

PDF scansionatodallo scanner

L’immagine della pagina.

Sì.

Foto dal telefonobolle, scontrini

L’immagine, spesso storta o in ombra.

Sì, dopo aver raddrizzato e pulito l’immagine.

Scritto a manomoduli, note

L’immagine della grafia.

Sì, con risultati variabili: lo stampatello regge, il corsivo meno.

Un modo semplice di capire di che PDF si tratta: provate a selezionare una parola. Se si evidenzia solo quella parola, il testo c’è. Se si seleziona tutta la pagina come un blocco unico, avete un’immagine, e per leggerla serve l’OCR.

Dove serve ancora in un’azienda italiana

Dal 1° gennaio 2019 le fatture fra soggetti residenti o stabiliti in Italia «potranno essere solo fatture elettroniche», come riporta l’Agenzia delle Entrate. Nel 2025 ne sono transitate 2,4 miliardi dal Sistema di Interscambio, emesse da 5,5 milioni di soggetti. Per queste l’OCR non serve: i dati arrivano già strutturati.

Serve per tutto il resto. Le bolle e i documenti di trasporto stampati e firmati. Gli ordini che arrivano come scansione o come foto. Le fatture dei fornitori esteri, per cui l’elettronica è facoltativa. E poi ricevute, certificati, schede tecniche in PDF, contratti firmati a penna e riscansionati.

Dall’OCR al dato: l’estrazione

A un’azienda serve sapere quale numero è il totale, quale la data e quale il codice articolo: questo secondo passaggio si chiama estrazione dei dati. Oggi lo fanno spesso i modelli linguistici, gli LLM, che leggono il testo riconosciuto come lo leggerebbe una persona e compilano i campi per il gestionale.

Conta perché la ricopiatura a mano ha un errore piccolo e costante. Nello studio di Barchard e Pace circa l’1% dei dati trascritti a mano contiene un errore, e rileggere a occhio non lo riduce. Su mille valori ricopiati sono circa dieci numeri sbagliati, dentro un intervallo plausibile, e quindi invisibili.

Come si giudica un sistema di OCR

Un sistema di OCR ed estrazione si giudica con due numeri: quanti campi estrae giusti, e cosa fa quando non riesce a leggere. Il primo si misura su un lotto di documenti veri dell’azienda, contando i campi uno per uno. Il secondo pesa di più, perché un totale inventato con sicurezza finisce nel gestionale e da lì in fattura.

La prova da chiedere a chi vi propone un sistema è semplice: dategli un documento illeggibile e guardate cosa succede. Un sistema fatto bene lo mette da parte e lo segnala a una persona. Un sistema fatto male compila i campi lo stesso, ed è un’allucinazione con il formato di un dato.

Come lo usa Itria

L’inserimento automatico dei documenti di Itria legge ordini, bolle e fatture in PDF o in foto, con l’OCR dove serve, ed estrae i dati in un formato che il gestionale accetta. Su un banco di prova del 4 settembre 2026, con 30 documenti e 237 campi, il tipo di documento è stato riconosciuto in 30 casi su 30 e i campi giusti sono stati 234, il 98,7%.

Nel lotto c’era un PDF illeggibile, messo apposta, senza testo dentro. Il sistema lo ha classificato come «altro» e non ha inventato un solo campo. È una prova fatta su un sistema di test, non presso un cliente, e si rifà davanti a chi la chiede.

Termini correlati

ERP

Il gestionale che collega ordini, magazzino e fatture. È lì che finiscono i dati estratti dai documenti.

LLM

Il modello linguistico che legge il testo riconosciuto e decide quale numero va in quale campo.

Dato non strutturato

Il testo libero, l’immagine, la mail: informazione che un programma non sa usare finché qualcuno non la ordina.

Inserimento dati

Il data entry: la ricopiatura a mano che l’OCR e l’estrazione servono a togliere.

Domande e risposte

Cos’è l’OCR?

OCR, optical character recognition, cioè riconoscimento ottico dei caratteri, è la tecnica con cui un programma guarda l’immagine di una pagina, come una scansione o una foto, riconosce le lettere e le trascrive come testo.

Dopo l’OCR si può cercare una parola nel documento, copiarne una frase, o far leggere i dati a un altro programma. Senza OCR una scansione è solo una fotografia.

Cosa vuol dire PDF con OCR?

Vuol dire un PDF scansionato a cui è stato aggiunto, sotto l’immagine, il testo riconosciuto dall’OCR. A occhio la pagina resta uguale, ma le parole si possono selezionare e cercare.

Per capire se un PDF ha già il testo basta provare a selezionare una parola: se si evidenzia, il testo c’è; se si seleziona tutta la pagina come un blocco, è un’immagine.

Serve l’OCR per le fatture elettroniche?

No, per quelle italiane. Dal 1° gennaio 2019 le fatture fra soggetti residenti o stabiliti in Italia sono solo elettroniche, come riporta l’Agenzia delle Entrate, e arrivano con i dati già strutturati dal Sistema di Interscambio.

L’OCR serve per bolle, ordini in scansione o in foto, fatture di fornitori esteri, per cui l’elettronica è facoltativa, ricevute e certificati.

Quanto è preciso un OCR?

Dipende dal documento: su una stampa pulita è molto preciso, su scansioni sbiadite, foto storte e scrittura corsiva molto meno. Il numero che conta per un’azienda è quanti campi vengono estratti giusti su un lotto di documenti veri, contati uno per uno, e cosa fa il sistema davanti a un documento illeggibile.

Come termine di paragone, la trascrizione a mano sbaglia circa l’1% dei dati secondo Barchard e Pace.

Che differenza c’è fra OCR ed estrazione dei dati?

L’OCR trasforma l’immagine in testo. L’estrazione dei dati legge quel testo e decide quale numero è il totale, quale la data, quale il codice articolo, e li mette nei campi giusti.

Oggi l’estrazione la fanno spesso i modelli linguistici, che leggono il testo come lo leggerebbe una persona. A un’azienda servono tutti e due i passaggi.

Note sulle fonti

  1. La citazione sull’obbligo di fattura elettronica viene dall’Agenzia delle Entrate, letta il 26 settembre 2026, che precisa anche che per le fatture da e verso l’estero l’elettronica è facoltativa. I 2,4 miliardi di fatture e i 5,5 milioni di soggetti emittenti sono nel documento I risultati 2025 della stessa Agenzia, pagine 3 e 25.
  2. Il 70,8% viene da Istat, Imprese e ICT, anno 2025, ed è calcolato sulle imprese con almeno 10 addetti che usano l’intelligenza artificiale.
  3. L’errore intorno all’1% viene da Barchard e Pace, Preventing human error: The impact of data entry methods on data accuracy and statistical results, Computers in Human Behavior 27(5), 2011: un esperimento su persone che trascrivono dati di ricerca, citato per la forma dell’errore.
  4. Il 98,7% e il documento illeggibile vengono da una misura di Itria su un banco di prova del 4 settembre 2026: 30 documenti, 237 campi, i 3 sbagliati elencati uno per uno.
·Il passo successivo

Si parte dai documenti che oggi qualcuno ricopia. Un lotto vero basta a misurare quanto costano.

Il primo passo con Itria è una videochiamata di quindici minuti: si guarda quali documenti arrivano in azienda ogni settimana e quanti vengono ancora ricopiati a mano. Scriveteci una riga su cosa vi pesa. Il primo passo lo facciamo noi: quello che un cliente vede quando vi cerca, e cosa ci abbiamo trovato. Anche se poi non lavoreremo insieme.