HjemBlogg › Sladde skannet PDF

Sladde skannet PDF eller bilde av et dokument

En skannet PDF eller et fotografert dokument har som regel ikke noe tekstlag – bare et bilde av siden. Det betyr at den vanlige kopier-og-lim-inn-testen ikke sier deg noe, og at du må dekke opplysningene visuelt, fullstendig og med en ugjennomsiktig boks. SladdPDF kan kjøre lokal teksgjenkjenning (OCR) i nettleseren for å foreslå hvor sensitive opplysninger står, men du eksporterer alltid i Sikker modus, akkurat som med et vanlig dokument.

Kort oppsummert

  • En skannet side er et bilde uten søkbar tekst – kopier-og-lim-inn-testen er derfor ikke relevant på samme måte som for tekst-PDF-er.
  • Smart-søk i SladdPDF kan kjøre OCR lokalt i nettleseren for å finne fødselsnummer, navn og lignende på skannede sider – helt uten opplasting.
  • Bruk alltid en heldekkende boks. Pikselering, uskarphet eller lav opasitet er ikke trygg sladding av bilder.
  • Fjern metadata ved eksport – skannere og mobilkameraer kan legge igjen modellnavn, brukernavn og til og med posisjonsdata.
  • Verifiser med zoom og kontrast i stedet for kopiering – se etter kanter der teksten skinner gjennom sladden.

Skannet PDF vs. vanlig PDF – hva er forskjellen?

En vanlig PDF som er laget digitalt – for eksempel eksportert fra Word – inneholder som regel et eget tekstlag ved siden av det visuelle. Det er dette laget som gjør at du kan søke, markere og kopiere tekst. Det er også dette laget som gjør en svart boks tegnet oppå teksten utrygg: teksten under ligger urørt og kan hentes ut, som vi går gjennom i guiden om hvordan du sladder en vanlig PDF.

En skannet PDF – eller et bilde av et dokument tatt med mobilkamera og lagt inn i en PDF – har normalt ikke noe slikt tekstlag. Hele siden er ett bilde. Det gjør trusselbildet annerledes: Du trenger ikke bekymre deg for et skjult tekstlag under sladden din, for det finnes ikke noe å hente ut med kopier-og-lim-inn. Til gjengjeld må hver eneste boks du tegner faktisk dekke opplysningen fullt ut i selve bildet, for det finnes ingen tekst å slette – bare piksler å skjule eller fjerne.

På en skannet PDF finnes det ikke noe skjult tekstlag å avsløre – men til gjengjeld holder det ikke å dekke til delvis. Sladden må dekke opplysningen fullstendig i selve bildet.

Noen skannede PDF-er inneholder faktisk begge deler: et OCR-generert, usynlig tekstlag lagt over bildet av skanneprogramvaren, for å gjøre dokumentet søkbart. Har filen din en slik «skjult» tekstlag, gjelder de samme reglene som for vanlige PDF-er – tekstlaget må fjernes, ikke bare bildet dekkes til.

Slik sladder du en skannet PDF med SladdPDF

  1. Åpne den skannede PDF-en på sladdpdf.com. Filen behandles lokalt i nettleseren med JavaScript og WebAssembly, uansett om det er en skanning, et fotografert dokument eller en vanlig PDF. Ingenting lastes opp.
  2. Kjør Smart-søk for å la lokal OCR lese siden. Har siden lite eller ingen søkbar tekst, faller Smart-søk automatisk tilbake på en lokal OCR-motor bygget på det åpne kildekode-prosjektet Tesseract, som kjenner igjen norsk tekst direkte i nettleseren. Modellene lastes ned én gang og kjøres deretter på enheten din – bildet forlater aldri maskinen.
  3. Gå gjennom forslagene manuelt. OCR er et hjelpemiddel, ikke en fasit. Skarphet, vinkel på fotografiet og eldre skannere påvirker treffsikkerheten. Se spesielt etter håndskrevne notater, stempler og tekst i topp- og bunntekst, som OCR lettere overser.
  4. Tegn bokser med god margin. Dekk opplysningen fullstendig, med litt ekstra margin i kantene – en piksel eller to med synlig tekst i overgangen er nok til at noen kan gjette seg frem til resten.
  5. Eksporter i Sikker modus og fjern metadata. Sikker modus bygger boksene inn i selve bildet ved eksport, slik at det ikke finnes noe lag å fjerne dem fra igjen. Huk samtidig av for fjerning av metadata – skannede filer kan bære med seg skannermodell, brukernavn eller til og med posisjonsdata fra et mobilkamera, akkurat som metadata i vanlige PDF-er.

Feilene som gjør bilde-sladding utrygg

Fordi en skannet side er et bilde, er det fristende å «sladde» den med verktøy som er laget for bilder generelt – uskarphetsfilter, pikselering eller en gjennomsiktig markering. Alle tre er utrygge:

Pikselering og uskarphet er ikke sladding. Bruk alltid en heldekkende, ugjennomsiktig boks – aldri et filter som kan reverseres.

Det samme prinsippet gjelder om du skriver ut et dokument, tegner over med tusj for hånd og skanner det inn på nytt: Er tusjen tynn eller lyset sterkt nok, kan teksten fortsatt skinne gjennom på skanningen. Flere kjente sladdetabber har akkurat denne årsaken.

Slik verifiserer du en sladdet skanning

Siden det ikke finnes tekst å kopiere ut av en skannet side, må du verifisere med øynene i stedet:

Denne fremgangsmåten utfyller kopieringstesten for vanlige PDF-er – bruk begge, avhengig av om dokumentet har et tekstlag eller ikke.

Denne artikkelen er generell veiledning, ikke juridisk rådgivning.

Klar til å sladde en skannet PDF?

SladdPDF kjører 100 % lokalt i nettleseren, med lokal OCR og Sikker modus. Gratis uten sidegrense – ingen konto, ingen opplasting.

Sladd en PDF nå

Ofte stilte spørsmål

Kan jeg sladde en skannet PDF som ikke har tekstlag?

Ja. En skannet side er allerede et bilde, så du tegner bokser direkte oppå det du ser, og eksporterer i Sikker modus. SladdPDF kan i tillegg kjøre lokal OCR for å foreslå hvor sensitive opplysninger står på siden, slik at du ikke overser noe.

Er det trygt å piksellere eller sladde tekst på et fotografert dokument?

Nei. Sikkerhetsforskere har vist at pikselert eller sterkt nedskalert tekst ofte kan gjenskapes ved å teste hvilken tekst som gir samme pikselmønster. Bruk alltid en heldekkende, ugjennomsiktig boks – aldri pikselering, uskarphet eller gjennomsiktig overlegg.

Hvordan vet jeg at OCR-en fant all sensitiv tekst i en skanning?

OCR er et hjelpemiddel, ikke en garanti – kvaliteten avhenger av skanningens oppløsning og skarphet. Gå alltid gjennom hver side manuelt i tillegg, spesielt topptekster, bunntekster, stempler og håndskrevne notater som OCR lettere bommer på.

Fjerner Sikker modus metadata fra en skannet fil?

Ja, hvis du huker av for det ved eksport. Skannede filer kan inneholde metadata fra skanneren eller kameraet – som modellnavn, brukernavn eller stedsdata fra et mobilbilde – i tillegg til det som står i selve bildet.

Kilder
  1. Tesseract OCR: Open Source OCR Engine (offisielt GitHub-repositorium)
  2. Bishop Fox: Never Use Text Pixelation to Redact Sensitive Information (2022)
  3. NSA: Redacting with Confidence – How to Safely Publish Sanitized Reports (Federation of American Scientists)