↓Zum Hauptinhalt springen
  1. Digitale Odyssee/

PrivDev: Von statischer Analyse zu Privacy-Wissen

··591 Wörter·3 min·
Digitale Odyssee Datenschutz KI Software-Engineering RAG Wissensgraphen DSGVO Forschung
Simon Bernbeck
Autor
Simon Bernbeck
Software-Ingenieur und Masterstudent in Informatik an der PUC Rio de Janeiro, ursprünglich aus Deutschland. Ich schreibe über das, was ich lerne, wo ich hinreise und was es wert ist, weitergegeben zu werden.
Inhaltsverzeichnis

Die erste PrivDev-Studie verbindet Datentyp-Bezeichnungen aus einem Code-Scanner mit einem Datenschutzvokabular. Das klingt einfach, bis eine Bezeichnung mehrdeutig ist, das Vokabular keinen passenden Begriff enthält oder der Graph mehr behauptet, als der Scanner wissen kann. Dieser Beitrag hält fest, was die erste Umsetzung leistete und was eine spätere Prüfung verändert hat. Das gesamte Forschungsvorhaben beschreibe ich in der PrivDev-Einführung.

Vom Scanner-Label zur Kategorie
#

Bearer CLI liefert die 122 Datentyp-Bezeichnungen dieser Studie. Die Pipeline ordnet ihnen Kategorien für personenbezogene Daten aus der PD-Erweiterung des Data Privacy Vocabulary zu. Das Ergebnis ist ein mit SPARQL abfragbarer RDF/Turtle-Graph. Er dokumentiert eine vorgeschlagene Deutung jedes Labels, nicht jede reale Verarbeitung, in der dieses Label vorkommen kann.

Das ist bei Begriffen wie „Emails“ wichtig. Ein Programm könnte Kontaktadressen oder den Inhalt von Nachrichten verarbeiten. „Employee Files“ ist noch breiter. Eine Zuordnung kann für das Label plausibel und für einen konkreten Codepfad falsch sein. Eine Suche im Vokabular kann Kontext, den der Scanner nie erfasst hat, nicht nachträglich herstellen.

Was geprüft wurde
#

In der ursprünglichen Layer-1-Studie stimmten 43 Labels genau mit einem bevorzugten Begriff des Vokabulars überein; 79 erforderten eine weniger direkte Zuordnung. Bei Letzteren halfen Retrieval und Vorschläge eines Sprachmodells. Darauf folgten Strukturprüfungen und eine Annotation durch Menschen. Der erste Graph deckte alle 122 Labels ab und enthielt 118 verschiedene Policy-Ressourcen, weil mehrere Labels in dieselbe Kategorie mündeten.

Zu den berichteten formativen Prüfungen gehörten SHACL-Validierung, ein Ontologie-Scan, fünf SPARQL-Fragen und eine Annotationsrunde mit neun Personen. Sie gaben 711 Bewertungen ab. Die rohe Übereinstimmung lag bei 0,721, Krippendorffs Alpha bei 0,251; Gwets AC1 betrug 0,682 und das gewichtete AC2 0,877. Diese Maße beantworten unterschiedliche Fragen. Ihre Spannweite warnt davor, eine einzelne Kennzahl als Beweis für korrekte Zuordnungen zu lesen. Zehn der 79 nicht trivialen Labels wurden zur Prüfung markiert.

Diese Zahlen beschreiben die ursprüngliche Studie. Sie belegen nicht, dass jede Zuordnung in einem realen System stimmt. Eine Strukturprüfung zeigt, dass der Graph eine vorgegebene Form einhält. Sie klärt weder die Bedeutung eines mehrdeutigen Labels noch die Rechtslage einer Organisation.

Was die nächste Fassung korrigierte
#

Eine spätere Prüfung zeigte, dass die ursprüngliche Methode aus einem Datentyp zu weitreichende Schlüsse ziehen konnte. Sie verwies auf bestimmte DSGVO-Artikel, obwohl der Verarbeitungskontext unbekannt war; einige Kennungen fehlten außerdem im verwendeten DPV-Vokabular. Die Methode wurde geändert: Sie wahrt die Grenze zwischen gewöhnlichen, besonderen und strafrechtlich relevanten Daten, erlaubt einen ausdrücklichen Verzicht auf eine Zuordnung und stellt Schemata für Rechtsgrundlagen als Kandidaten zur Prüfung dar, nicht als Ergebnis.

Der überarbeitete vollständige Durchlauf ist im Projekt als menschlich geprüft und strukturell validiert dokumentiert. Die Übernahme in ein veröffentlichtes Artefakt und eine weitergehende Evaluation sind eigene Schritte. Ein abgeschlossener Versuch ist noch kein einsatzbereites Compliance-System. Die breitere Brücke von Sicherheitsbefunden zu Datenschutzfragen, die auch Software-Schwachstellen und praktische Hinweise umfassen soll, wurde noch nicht durchgehend evaluiert.

Wobei die Arbeit helfen kann
#

Der Graph kann einen Teil der Datenschutzprüfung nachvollziehbarer machen. Entwickler können nachsehen, welcher Begriff für ein Scanner-Label gewählt wurde und wo eine zweite Prüfung nötig ist. Der Graph entscheidet weder über Verarbeitungszweck und Rechtsgrundlage noch über die Notwendigkeit einer Datenschutz-Folgenabschätzung oder die Eignung einer technischen Maßnahme. Kryptografie zeigt die Grenze gut: Ein Befund über unverschlüsselte Speicherung kann eine Sicherheitsprüfung auslösen. Er beweist für sich allein nicht, dass eine bestimmte Verschlüsselung vorgeschrieben oder ausreichend ist.

Meine wichtigste Erkenntnis aus Layer 1: Genauigkeit heißt auch zu wissen, wann eine Aussage enden muss. Ein formaler Graph und eine flüssige Erklärung können beide falsche Sicherheit erzeugen. Die Arbeit wird besser, wenn sie Belege, Unsicherheit und die Stelle zeigt, an der weiterhin ein Mensch entscheiden muss.

Verwandte Artikel

Project Planning Pipeline: In Obsidian planen, mit KI unterstützt
··1598 Wörter·8 min
Digitale Odyssee Obsidian KI Projektplanung CLI Produktivität Wissensmanagement Guide
LifeClock (Teil 1/2): Von Memento Mori zu Python
··1554 Wörter·8 min
Digitale Odyssee CS50 Python Philosophie Memento-Mori Stoizismus CLI Testing Persönliches-Projekt
LifeClock (Teil 2/2): Refactoring zu Clean Architecture
··5326 Wörter·26 min
Digitale Odyssee Clean-Architecture Python Refactoring Software-Design LifeClock Testing Architecture
Lokales WebDAV für Zotero unter Windows: Sync, Grenzen und Backup
··723 Wörter·4 min
Digitale Odyssee Zotero WebDAV Docker Windows-11 Forschungstools Self-Hosting Guide Wissensmanagement