Aritmetica, non impressioni
IBAN mod-97, carte Luhn, controllo CF e P.IVA. Un protocollo lungo non viene “scambiato” per un recapito.
Protocollo zero · solo loopback
Mr.Rao
offline by design
PDF, Word, scansioni, email → Markdown pulito, testo semplice o documento Word. Codici fiscali, IBAN, nomi e chiavi API: fuori, prima che tu li incolli in un’AI — o prima che tu pubblichi l’atto. Zero chiamate di rete. Validatori aritmetici, non promesse.
// 01 · minaccia
Per far ragionare un modello su un contratto, quasi tutti gli strumenti ti chiedono di caricare il file. In quel momento nomi, IBAN e codici fiscali finiscono “in giro”. Mr. Rao spezza la catena: converte e redige qui.
// 02 · motore
Pattern + validatore. Niente modello, niente sorprese tra due esecuzioni. Lo stesso documento dà sempre lo stesso esito — e ogni sostituzione ha una regola.
IBAN mod-97, carte Luhn, controllo CF e P.IVA. Un protocollo lungo non viene “scambiato” per un recapito.
«3 redazioni · 2 da controllare». Ciò che assomiglia a un dato e non è validabile viene segnalato, non nascosto.
Su CF e IBAN storpiati prova fino a due confusioni tipiche di lettura, e sostituisce solo se il candidato regge tre vincoli insieme: checksum, sigla del Paese, lunghezza prevista da quel Paese (registro ISO 13616). Il mod-97 da solo scarta 96 candidati su 97: quando in gioco ci sono migliaia di codici lunghi, il resto passa.
// 03 · banco di prova
Su un documento vero non sai se una sostituzione era dovuta: la giudichi a occhio, e l’occhio si stanca. Per questo il motore viene misurato prima di tutto su carte che dati personali non ne contengono affatto: lì ogni sostituzione è un errore, e non c’è niente da interpretare. Ogni modifica deve ripassare da qui.
Moduli fiscali italiani e statunitensi, numeri della Gazzetta Ufficiale fino al 1890, volumi statistici. Nessun dato personale per costruzione: il numero corretto di redazioni è zero, quindi ogni sostituzione si conta come errore.
6.000 messaggi di mailing list italiane e 1.500 inglesi: come si comporta sul testo che le persone scrivono davvero, non su frasi costruite per farlo riuscire.
Il recupero OCR produceva IBAN validi su documenti che non ne contenevano nessuno: il mod-97 da solo scarta 96 candidati su 97, e su un volume pieno di codici lunghi non basta. Con sigla del Paese e lunghezza attesa per Paese sono tornati a zero.
// 04 · capacità
| Formati | PDF, DOCX, XLSX, PPTX, HTML, CSV, immagini, EML — MarkItDown + OCR offline |
| Redazione | Email, telefoni, nomi, indirizzi, CF, P.IVA, IBAN, BBAN, carte, URL, segreti API |
| Oltre l’Italia | NHS number e National Insurance britannici, SSN e ITIN, ABA routing, SIN canadese, ABN e TFN australiani, CAP britannico, righe MRZ del passaporto |
| Esportazione | Markdown .md, testo semplice .txt e documento Word .docx, tutti già redatti — per gli atti che devono restare documenti · il .docx è rigenerato dal testo redatto, non è l’originale con sopra dei rettangoli neri |
| Lingua | Interfaccia in italiano e in inglese, scelta dal browser · il documento prodotto segue la stessa lingua |
| Shell Windows | Tasto destro → Apri con Mr. Rao · sospetti stampati in console quando servono |
| Cartella automatica | Da convertire → Convertiti, Markdown in uscita, default fuori da OneDrive/Dropbox |
| Sicurezza locale | Host allow-list, anti-CSRF Origin, GET read-only, bind 127.0.0.1 |
| Licenza | AGPL-3.0 · codice ispezionabile · nessun telefono a casa |
// 05 · perché Mr. Rao
Il problema. Quando un consulente, un avvocato o un analista vuole usare ChatGPT, Claude o Perplexity per analizzare un contratto, una fattura o un thread di email, non può incollare dati personali: GDPR, NDA, segreto d'ufficio.
La soluzione. Mr. Rao prende qualsiasi file — PDF scansionato, Word, Excel, EML — lo converte in puro Markdown, estrae e rimuove i dati sensibili, e restituisce un testo pronto da incollare nell'AI senza rischi. In un unico passaggio.
La maggior parte dei tool vede una mail come un semplice file di testo. Mr. Rao ricostruisce la catena delle risposte, separa i messaggi precedenti e applica la redazione automatica su email, telefoni e nomi. Una killer feature per il settore legale ed HR.
I tool americani falliscono sui formati italiani. Mr. Rao include validatori matematici specifici per codice fiscale, IBAN italiano (mod-97), partita IVA e carte di credito (algoritmo di Luhn), riducendo drasticamente i falsi positivi. E sì: funziona anche con i documenti in inglese.
Mr. Rao rileva se la cartella «Documenti» è sincronizzata con OneDrive, Dropbox o Google Drive e dirotta automaticamente lo spazio di lavoro su una cartella 100% locale non sincronizzata, garantendo che il file non esca mai dalla stanza.
// 06 · onestà operativa
Un CISO si fida di chi dichiara i limiti. Noi li scriviamo in README, PRIVACY e nel prodotto.
È redazione assistita. Il contesto del documento resta. Serve review umana.
Liste di nomi, contesto della frase, euristica che si può spegnere. È la parte più difficile: un cognome raro può restare, e serve sempre una rilettura.
Il recupero OCR li ha prodotti sui 127 documenti in bianco, che di IBAN non ne contengono nessuno. Il mod-97 da solo non bastava. Con sigla del Paese e lunghezza per Paese sono tornati a 0: misurato, non stimato.
Il recupero e i sospetti aiutano; tre errori di lettura bastano a far sfuggire un codice.
È un documento nuovo, ricostruito dal testo già redatto: il dato non c’è, ma l’impaginazione dell’originale nemmeno. Il PDF identico con sopra i rettangoli neri Mr. Rao non lo fa — sotto quei rettangoli il testo resta.
Nessuna auth. Esporre la porta in rete senza proxy è un errore consapevole.
Portable Windows, niente Python. Oppure clona il repo e fai girare i test. Se il motore sbaglia su un documento tuo (senza dati reali in issue), dillo: è l’unico modo per migliorarlo.
// 07 · canale diretto
Scritto e mantenuto da Antonio Andrea Rao. Scrivimi una mail o su LinkedIn: niente moduli di contatto, niente tracciamento — come il resto del progetto.