Documenti PDF

Analisi PDF

Analisi PDF raccoglie in una sola pagina tutto ciò che un PDF dice di sé e tutto ciò che si può misurare: impronte, metadati Info e XMP, statistiche del testo con la lingua e la leggibilità, i dati pagina per pagina, la struttura e la sicurezza del file, le immagini, i font, gli allegati e le versioni salvate. Il testo non è quello di un copia-incolla: è ricostruito interpretando i contenuti di ogni pagina con le larghezze reali dei caratteri, così righe e parole sono quelle che si vedono. Tutto il PDF si legge nel processo isolato, come nel lettore.

Cosa fa

Cosa fa il modulo Analisi PDF

Impronte e metadati

MD5, SHA-1 e SHA-256, date del file system, dizionario Info e pacchetto XMP. I valori scritti come riferimento interno (1733 0 R) sono seguiti fino al testo vero.

Statistiche del testo

Caratteri per classe (lettere, accentate, cifre, punteggiatura, simboli, non leggibili), sistemi di scrittura, parole e parole distinte, numeri, frasi, righe, paragrafi, URL ed email, tempo di lettura, parole più frequenti.

Lingua e leggibilità

Lingua del testo (italiano, inglese, francese, tedesco, spagnolo) riconosciuta dalle parole funzionali, indice Gulpease per l'italiano e Flesch per l'inglese. Se la lingua dichiarata nel file è diversa da quella del testo, lo segnala.

Pagina per pagina

Formato, rotazione, caratteri, parole, righe, paragrafi, immagini disegnate davvero (non solo elencate fra le risorse), font, annotazioni e l'indicazione «probabile scansione».

Struttura e sicurezza

Oggetti e stream, linearizzazione, PDF taggato, conformità dichiarata (PDF/A, PDF/UA, PDF/X), etichette di pagina, cifratura e permessi negati, segnalibri, livelli, campi modulo, file incorporati, azioni JavaScript, annotazioni per tipo, link e domini.

Immagini, font, allegati, versioni

Le immagini con miniature ingrandibili, i font, gli allegati e le versioni salvate del documento, ciascuna confrontabile con l'attuale in Confronto PDF.

Rapporto PDF

Un rapporto con le tabelle di ogni sezione e la galleria delle immagini.

Passo per passo

Come funziona

  1. Trascina un PDF nel modulo, oppure aprilo col tasto destro da Explorer.
  2. Probatio lo legge nel processo isolato e compone il dossier, con gli avvisi in testa (scansioni, caratteri illeggibili, lingua dichiarata diversa).
  3. Genera il rapporto PDF, oppure passa a Confronto PDF per le versioni salvate.
FAQ

Domande frequenti

Perché il conteggio delle parole può differire da quello di un altro programma?
Probatio ricostruisce il testo dai contenuti della pagina usando le larghezze reali dei caratteri, compresi i Form XObject, invece di copiare il testo estratto. Righe e parole sono quelle disegnate; paragrafi e frasi sono stime, e il rapporto lo dichiara.
Che cosa vuol dire «lingua dichiarata diversa da quella del testo»?
Un PDF può dichiarare la propria lingua (/Lang). Probatio la confronta con la lingua riconosciuta nel testo: un manuale in italiano che dichiara zh-CN indica un modello o un programma d'origine diverso, un indizio sulla storia del documento.