Lösung um schlechte Positionierung, Klarheit und Kontrast von PII in Bilddateien für optische Zeichenerkennung (OCR) zu verbessern❗
Vorverarbeitung von Bildern zur Verbesserung der OCR-Ergebnisse: OCR-Software (Optical Character Recognition) ist eine Technologie zur Erkennung von Text in einem digitalen Bild. OCR wird von der IRI DarkShield-Software verwendet, um Text in eigenständigen oder eingebetteten Bildern während der PII-Suche und -Maskierungsvorgänge zu erkennen.
OCR hat jedoch ihre Grenzen: Um genaue Ergebnisse zu erzielen, muss das Bild vertikal ausgerichtet sein, die richtige Größe haben und so klar wie möglich sein. Nicht jedes Bild erfüllt diese Anforderungen! Wir müssen daher Methoden finden und anwenden, um diese Bilder durch Vorverarbeitung an unsere Bedürfnisse anzupassen. In diesem Artikel werden einige Vorverarbeitungsmethoden vorgestellt und erläutert, wie sie die Qualität der OCR-Ausgabe im Zusammenhang mit der DarkShield-Datenmaskierung verbessern können.
In dem Artikel werden 3 Vorverarbeitungsmethoden aufgezeigt:
Bildskalierung
Binarisierung
Entzerrung
Diese auf GitHub verfügbare Demo demonstriert, wie die in diesem Artikel besprochenen Vorverarbeitungsmethoden mit der DarkShield-API für (Bild-)Dateien integriert werden können. Das Demoprogramm erlaubt es, entweder ein einzelnes Bild oder einen Ordner mit Bildern für die Vorverarbeitung anzugeben. Jedes Bild wird zunächst vorverarbeitet, zur Suche und Maskierung an die DarkShield-Files-API gesendet und dann nachbearbeitet, um das Originalbild wiederherzustellen.
In solchen Fällen enthält das Bild immer noch alle Black Boxes, die von der DarkShield-Files-API platziert wurden, um sensible Daten zu maskieren. Beachten Sie, dass es bei Anwendung der adaptiven Binarisierung als eine der Vorverarbeitungsmethoden nicht möglich ist, die ursprüngliche Farbgebung des Bildes wiederherzustellen.
Die Bilder werden in einem Verzeichnis mit dem Namen masked gespeichert, das automatisch erstellt wird, wenn es beim Ausführen der Demo noch nicht existiert. Dem Programm können zusätzliche Argumente angegeben werden, die bestimmen, ob eine Pipeline verwendet werden soll.
Alle Details finden Sie in diesem ausführlichen Blog-Artikel unseres Partners IRI Inc.
Weltweite Referenzen: Seit über 40 Jahren nutzen unsere Kunden wie die NASA, American Airlines, Walt Disney, Comcast, Universal Music, Reuters, das Kraftfahrtbundesamt, das Bundeskriminalamt, die Bundesagentur für Arbeit, Rolex, Commerzbank, Lufthansa, Mercedes Benz, Osram,.. aktiv unsere Software für Big Data Wrangling und Schutz! Sie finden viele unserer weltweiten Referenzen hier und eine Auswahl deutscher Referenzen hier.
Partnerschaft mit IRI: Seit 1993 besteht unsere Kooperation mit IRI (Innovative Routines International Inc.) aus Florida, USA. Damit haben wir unser Portfolio um die Produkte CoSort, Voracity, DarkShield, FieldShield, RowGen, NextForm, FACT und CellShield erweitert. Nur die JET-Software GmbH besitzt die deutschen Vertriebsrechte für diese Produkte. Weitere Details zu unserem Partner IRI Inc. hier.
Firmenkontakt und Herausgeber der Meldung:
JET-Software GmbH
Edmund-Lang-Straße 16
64832 Babenhausen
Telefon: +49 (6073) 711-403
Telefax: +49 (6073) 711-405
https://www.jet-software.com
Ansprechpartner:
Amadeus Thomas
+49 (6073) 711403
Dateianlagen:
Weiterführende Links
- Originalmeldung von JET-Software GmbH
- Alle Meldungen von JET-Software GmbH
- Die meisten Kunden von IRI Sicherheits-Produkten erstellen Profile und schützen PII in RDBs, Flat Files und Excel Sheets vor Ort oder in der Cloud. Jüngste Engagements umfassen auch NoSQL-DBs, Dokumente, Bilder sowie EDI- und Protokolldateien. Streaming und Hadoop-Datenquellen sowie Gesichter werden ebenfalls unterstützt.
- PII, PHI, PAN und PCI in semi/un/strukturierten Quellen - lokal oder in der Cloud - finden und maskieren! Sensible Daten GDPR-konform schützen!
- Finden Sie sensible Daten in unstrukturierten Quellen mit Hilfe mehrerer Suchtechniken. Verwenden Sie die Suchergebnisse, um die PII gleichzeitig oder getrennt bereitzustellen, zu entfernen oder zu korrigieren, um die Bestimmungen des GDPR zur Übertragbarkeit, Löschung oder Berichtigung von Daten einzuhalten. Egal, ob die PII auf Ihrem Desktop, in S3 oder an einem beliebigen Ort in Ihrem Netzwerk liegen, DarkShield findet und maskiert PII in mehreren unstrukturierten Dark Data Quellen