Datenmaskierung von PHI in Bildern minderer Qualität egal ob in eigenständigen Dateien oder eingebettet in Dokumente ❗
Vorverarbeitung von Bildern zur Verbesserung der OCR- und DarkShield-Ergebnisse: OCR-Software (Optical Character Recognition) ist eine Technologie zur Erkennung von Text in einem digitalen Bild. OCR wird von der IRI DarkShield-Software verwendet, um Text in eigenständigen oder eingebetteten Bildern während der PII-Suche und -Maskierungsvorgänge zu erkennen.
OCR hat jedoch ihre Grenzen: Um genaue Ergebnisse zu erzielen, muss das Bild vertikal ausgerichtet sein, die richtige Größe haben und so klar wie möglich sein. Nicht jedes Bild erfüllt diese Anforderungen! Wir müssen daher Methoden finden und anwenden, um diese Bilder durch Vorverarbeitung an unsere Bedürfnisse anzupassen. In diesem Artikel werden einige Vorverarbeitungsmethoden vorgestellt und erläutert, wie sie die Qualität der OCR-Ausgabe im Zusammenhang mit der DarkShield-Datenmaskierung verbessern können.
In dem Artikel werden 3 Vorverarbeitungsmethoden aufgezeigt: Bildskalierung, Binarisierung und Entzerrung. Diese auf GitHub verfügbare Demo demonstriert, wie die in diesem Artikel besprochenen Vorverarbeitungsmethoden mit der DarkShield-API für (Bild-)Dateien integriert werden können.
Das Demoprogramm erlaubt es, entweder ein einzelnes Bild oder einen Ordner mit Bildern für die Vorverarbeitung anzugeben. Jedes Bild wird zunächst vorverarbeitet, zur Suche und Maskierung an die DarkShield-Files-API gesendet und dann nachbearbeitet, um das Originalbild wiederherzustellen.
In solchen Fällen enthält das Bild immer noch alle Black Boxes, die von der DarkShield-Files-API platziert wurden, um sensible Daten zu maskieren. Beachten Sie, dass es bei Anwendung der adaptiven Binarisierung als eine der Vorverarbeitungsmethoden nicht möglich ist, die ursprüngliche Farbgebung des Bildes wiederherzustellen.
Die Bilder werden in einem Verzeichnis mit dem Namen masked gespeichert, das automatisch erstellt wird, wenn es beim Ausführen der Demo noch nicht existiert. Dem Programm können zusätzliche Argumente angegeben werden, die bestimmen, ob eine Pipeline verwendet werden soll.
Alle technischen Details finden Sie hier im ausführlichen Blog-Artikel unseres Partners IRI Inc.
Weltweite Referenzen: Seit über 40 Jahren nutzen unsere Kunden wie die NASA, American Airlines, Walt Disney, Comcast, Universal Music, Reuters, das Kraftfahrtbundesamt, das Bundeskriminalamt, die Bundesagentur für Arbeit, Rolex, Commerzbank, Lufthansa, Mercedes Benz, Osram,.. aktiv unsere Software für Big Data Wrangling und Schutz! Sie finden viele unserer weltweiten Referenzen hier und eine Auswahl deutscher Referenzen hier.
Partnerschaft mit IRI: Seit 1993 besteht unsere Kooperation mit IRI (Innovative Routines International Inc.) aus Florida, USA. Damit haben wir unser Portfolio um die Produkte CoSort, Voracity, DarkShield, FieldShield, RowGen, NextForm, FACT und CellShield erweitert. Nur die JET-Software GmbH besitzt die deutschen Vertriebsrechte für diese Produkte. Weitere Details zu unserem Partner IRI Inc. hier.
Firmenkontakt und Herausgeber der Meldung:
JET-Software GmbH
Edmund-Lang-Straße 16
64832 Babenhausen
Telefon: +49 (6073) 711-403
Telefax: +49 (6073) 711-405
https://www.jet-software.com
Ansprechpartner:
Amadeus Thomas
+49 (6073) 711403
Dateianlagen:
Weiterführende Links
- Originalmeldung von JET-Software GmbH
- Alle Meldungen von JET-Software GmbH
- PII, PHI, PAN und PCI in semi/un/strukturierten Quellen - lokal oder in der Cloud - finden und maskieren! Sensible Daten GDPR-konform schützen!
- DarkShield findet und maskiert sensible Informationen in mehreren unstrukturierten DB- und Dateiformaten in mehreren Silos gleichzeitig!