---
title: "PII vor LLM-Prompts entfernen: Tools und Pipeline"
canonical: https://wavect.io/de/blog/pii-redaction-before-llm-prompts/
language: de
description: "Baue eine PII-Redaction-Pipeline vor LLM-Prompts. Vergleich von Presidio, Privacy Filter und Cloud-DLP mit Tests und DSGVO-Hinweisen."
image: "https://wavect.io/img/blog/headers/header_pii-redaction-before-llm-prompts.png"
---

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

14 min Lesezeit · 6. August 2026

[**Weiter**](/de/blog/local-multimodal-ai-coding-assistant/)

# Personenbezogene Daten vor LLM-Prompts schützen: Presidio, Privacy Filter und die Produktionspipeline

TL;DR

Setze ein deterministisches Privacy-Gateway vor jeden Modell-, Retrieval-, Tool- und Logging-Pfad, der sensible Texte erhalten könnte. Entferne Felder, die die Aufgabe nicht braucht, erkenne den Rest mit Regeln plus einem kontextsensitiven lokalen Detector und ersetze jeden Wert durch einen stabilen typisierten Platzhalter. Die verschlüsselte Zuordnung bleibt außerhalb des Modellpfads. Prüfe die Antwort, löse nur autorisierte Platzhalter an der finalen Auslieferungsgrenze zurück und protokolliere Entitätstypen sowie Policy-Versionen statt Rohinhalte. Presidio ist das flexibelste Open-Source-Framework. OpenAI Privacy Filter bietet stärkere kontextuelle Erkennung, braucht aber mehr Rechenleistung und nutzt eine primär englische feste Taxonomie. Managed DLP senkt den Betriebsaufwand, erhält jedoch die Originaldaten. Kein Tool garantiert Anonymisierung oder DSGVO-Konformität. Miss False Negatives, Aufgabenqualität, Latenz und Mehrsprachigkeit mit deinen eigenen Daten.

**Der sicherste Prompt fordert ein LLM nicht dazu auf, personenbezogene Daten zu ignorieren. Er enthält Daten, die das Modell nicht braucht, gar nicht erst.** Setze ein deterministisches Privacy-Gateway vor den Modellaufruf, entferne unnötige Felder, ersetze notwendige Identifikatoren durch stabile Platzhalter und behalte die Rückauflösung unter eigener Kontrolle.

Dieser Leitfaden schließt die praktische Lücke zwischen einem Presidio-Demo mit fünf Zeilen und einer allgemeinen DSGVO-Policy. Er zeigt den vollständigen Pfad für Support-Tickets, Dokumente, RAG, Agenten und interne Assistenten. Außerdem vergleicht er das ursprünglich von Microsoft entwickelte Presidio mit OpenAI Privacy Filter und Managed-DLP-Diensten. Die Tool-Angaben wurden am 6. August 2026 geprüft.

## Wie sollte eine PII-Redaction-Pipeline vor LLM-Prompts aussehen?

**Nutze sieben Grenzen: minimieren, erkennen, klassifizieren, transformieren, aufrufen, prüfen und selektiv zurückauflösen.** Die Erkennung läuft in deiner vertrauenswürdigen Umgebung, bevor Prompt, Anhang, gefundene Passage oder Tool-Ergebnis die Grenze zum Modellanbieter überschreitet.

1. **An der Quelle minimieren.** Wähle nur Felder, die die Aufgabe braucht. Serialisiere keinen vollständigen Kundendatensatz, um ihn später wieder zu schwärzen.
2. **Mehrschichtig erkennen.** Kombiniere schemaabhängige Feldregeln, Prüfsummen und Secret-Patterns mit einem kontextsensitiven PII-Detector. Eine Methode deckt nicht gleichzeitig IBANs und Namen im Fließtext zuverlässig ab.
3. **Policy je Entität und Zweck anwenden.** Blockiere verbotene Inhalte, entferne unnötige Inhalte und pseudonymisiere Werte, die die Aufgabe weiter benötigt.
4. **Eindeutige typisierte Platzhalter erzeugen.** Ersetze Werte durch Tokens wie `PERSON_001`, `EMAIL_001` und `CASE_ID_001`. Wiederholte Verweise bleiben im erlaubten Scope konsistent.
5. **Das Modell mit bereinigtem Kontext aufrufen.** Modell, Tracing und Prompt-Cache erhalten Platzhalter, niemals die Zuordnungstabelle.
6. **Die Ausgabe prüfen.** Erkenne neue sensible Werte, unerwartete Rohdaten und unautorisierte Platzhalter, bevor eine Antwort, ein Log oder ein Tool-Aufruf das Gateway verlässt.
7. **Nur an der finalen autorisierten Grenze zurückauflösen.** Löse erlaubte Platzhalter für den vorgesehenen Empfänger und Kanal auf. Re-identifiziere nie pauschal in Logs, Agent Memory oder Tool-Argumenten.

```
vertrauenswürdige Anwendung
  -> Feldminimierung
  -> Regeln + kontextsensitiver Detector
  -> Policy: blockieren | entfernen | tokenisieren
  -> verschlüsselter Token-Vault
  -> bereinigter Prompt -> LLM
  -> Output-Detector + Autorisierung
  -> selektive Rückauflösung -> Nutzer
```

Dieses Gateway ergänzt die Objekt- und Feldautorisierung aus unserem Leitfaden zu [Datenzugriffskontrollen für KI-Agenten](/de/blog/mcp-security-boundary-data-level-access-control/). Redaction begrenzt, was eine erlaubte Anfrage offenlegt. Autorisierung entscheidet, ob die Anfrage überhaupt auf den Datensatz zugreifen darf.

## Redaction, Masking, Tokenisierung und Anonymisierung sind nicht dasselbe

Das falsche Wort erzeugt eine gefährliche Kontrolllücke. Entscheidend ist, ob der Wert wiederhergestellt werden kann und ob der verbleibende Kontext eine Person weiterhin identifiziert.

| Technik | Beispiel | Reversibel? | Geeignet für |
| --- | --- | --- | --- |
| Redaction | `[ENTFERNT]` | Planmäßig ohne Zuordnung | Daten, die die Aufgabe nicht braucht |
| Masking | `j***@example.com` | Original bleibt an anderer Stelle | Benutzeroberflächen und Diagnose |
| Pseudonymisierung oder Tokenisierung | `PERSON_001` | Ja, mit Zusatzinformation oder Schlüssel | LLM-Aufgaben, die Entitätsbezüge brauchen |
| Anonymisierung | Niemand ist aus Ergebnis und verfügbarem Kontext vernünftigerweise identifizierbar | Nein | Nur nach belastbarer Prüfung des Re-Identifikationsrisikos |

Nach Art. 4 Z 5 DSGVO muss die Zusatzinformation bei einer Pseudonymisierung getrennt aufbewahrt und geschützt werden. Die [Leitlinien des Europäischen Datenschutzausschusses von 2025](https://www.edpb.europa.eu/news/edpb-adopts-pseudonymisation-guidelines-and-paves-the-way-to-improve-cooperation-with_de) stellen klar: Pseudonymisierte Daten bleiben personenbezogene Daten, wenn sie wieder einer Person zugeordnet werden können. Der Ersatz eines Namens durch `PERSON_001` senkt die Exposition. Er nimmt den Workflow nicht aus der DSGVO.

Selbst das irreversible Entfernen eines Strings anonymisiert einen Prompt nicht automatisch. Eine seltene Berufsbezeichnung, ein genaues Ereignisdatum und ein kleiner Ort können gemeinsam eine Person identifizieren. Bewerte immer den gesamten Kontext inklusive Metadaten, Anhängen und Modellausgabe.

## Welches Tool zur PII-Redaction passt 2026?

**Beginne mit Feldminimierung in der Anwendung und deterministischen Regeln. Ergänze Presidio für ein prüfbares, erweiterbares Framework. Nutze ein lokales Kontextmodell, wenn Namen und Freitext dominieren. Verwende Managed DLP nur, wenn die Übertragung der Rohdaten an diese Cloud bereits freigegeben ist.**

| Option | Stärkster Einsatz | Wichtigster Trade-off | Grenze für Rohdaten |
| --- | --- | --- | --- |
| Schemaregeln, Regex und Prüfsummen | Bekannte Felder, E-Mail, IBAN, Telefon und Credential-Formate | Schwach bei Namen, Kontext und unbekannten Formaten | Deine Anwendung |
| Presidio | Eigene Recognizer, Regeln plus NER, nachvollziehbare Operatoren, Python-Services | Braucht Sprachmodelle, Kalibrierung und Betrieb; Erkennung ist nicht garantiert | Lokal oder eigene Infrastruktur |
| OpenAI Privacy Filter | Kontextsensitive lokale Filterung langer Freitexte und Software-Secrets | Mehr Rechenleistung, acht feste Basiskategorien, ohne Anpassung primär Englisch | Lokal oder eigene Infrastruktur |
| Azure AI Language PII | Managed-Erkennung für Text, Gespräche und native Dokumente in einer freigegebenen Azure-Umgebung | Der Dienst erhält unbereinigte Eingaben; Kosten, Region und Operation unterscheiden sich | Azure |
| Google Sensitive Data Protection | Managed Inspection plus kryptografische Tokenisierung und referenzielle Integrität | Der Dienst erhält unbereinigte Eingaben und das Key-Design braucht Sorgfalt | Google Cloud |
| Amazon Comprehend PII | AWS-native Erkennung von Entitäten und Batch-Redaction | Sprach- und Echtzeitunterstützung unterscheiden sich je Operation | AWS |

### Ist Presidio noch ein Microsoft-Tool?

Presidio wurde bei Microsoft entwickelt und ältere Suchergebnisse nennen es weiterhin Microsoft Presidio. 2026 [wechselt das Projekt zur unabhängigen Organisation Data Privacy Stack](https://presidio.dataprivacystack.org/project_transition/). Laut Projekt bleibt es MIT-lizenziert, die APIs bestehen weiter und neue Container-Images ziehen von der Microsoft Registry zu `ghcr.io/data-privacy-stack`. „Ursprünglich von Microsoft entwickelt“ ist korrekt. Die heutige Community-Governance als Microsoft-Supportvertrag zu behandeln, wäre falsch.

Das Framework bleibt ein starker Ausgangspunkt. [Analyzer und Anonymizer](https://presidio.dataprivacystack.org/text_anonymization/) verbinden Regex, Deny Lists, Prüfsummen, Regeln, Named Entity Recognition und Kontextsignale mit Replace-, Redact-, Hash- und Encrypt-Operatoren. Eigene Recognizer können österreichische Sozialversicherungsnummern, deutsche Steuer-IDs, spanische DNI- oder NIE-Formate, chinesische Identitätsnummern und interne Kunden-IDs abdecken. Die Presidio-Dokumentation warnt zugleich, dass automatische Erkennung nicht alle sensiblen Werte findet. Diese Warnung gehört in die Architektur und nicht nur ins Kleingedruckte.

### Wann passt OpenAI Privacy Filter besser?

[OpenAI Privacy Filter](https://github.com/openai/privacy-filter) wurde im April 2026 unter Apache 2.0 veröffentlicht. Das lokale bidirektionale Token-Classification-Modell besitzt laut Veröffentlichung 1,5 Milliarden Parameter insgesamt, 50 Millionen aktive Parameter und ein Kontextfenster von 128.000 Tokens. Es erkennt acht Kategorien für private Personen, Adressen, E-Mails, Telefonnummern, URLs, Daten, Kontonummern und Secrets.

Dieses Sprachverständnis hilft, wenn Regex nicht zwischen einer Privatperson und einer öffentlichen Organisation unterscheiden kann. Es ist keine universelle Policy Engine. Laut Model Card ist die Basistaxonomie fest, die Leistung kann bei nicht englischen oder unbekannten Daten sinken und Policy-Anpassungen können Fine-Tuning brauchen. Das Modell ist ein Detector in der Pipeline, nicht Vault, Autorisierung oder Compliance-Entscheidung.

### Wann ist Managed DLP die bessere Kaufentscheidung?

Managed DLP ist attraktiv, wenn die Organisation die Cloud-Grenze bereits freigegeben hat, breite Detector-Kataloge braucht und keine NLP-Modelle betreiben will. [Azure AI Language PII](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/overview) deckt Texte, Gespräche und native Dokumente ab. [Google Sensitive Data Protection](https://docs.cloud.google.com/sensitive-data-protection/docs/pseudonymization) bietet kryptografische Einweg- und reversible Tokens mit referenzieller Integrität. [Amazon Comprehend PII](https://docs.aws.amazon.com/comprehend/latest/dg/pii.html) liefert Entitätspositionen und asynchrone Redaction.

Der architektonische Haken ist einfach: Ein Cloud-Detector muss den Rohwert sehen, um ihn zu entfernen. Er kann das nachgelagerte LLM schützen und wird dabei selbst zum Empfänger der Originaldaten. Prüfe Region, Retention, Subprozessoren, AVV und Transferbedingungen im Rahmen deiner [Entscheidung zur EU-Datenresidenz für KI](/de/blog/eu-data-residency-ai-apps-2026/).

## Warum typisierte Platzhalter besser sind als eine Wand aus ENTFERNT-Tokens

Ein Modell kann viele Aufgaben weiterhin lösen, wenn es erkennt, dass sich zwei Stellen auf denselben Kunden, dieselbe Ärztin oder denselben Vertrag beziehen. Wer jede Entität durch `[ENTFERNT]` ersetzt, zerstört diese Beziehung. Eindeutige typisierte Platzhalter erhalten sie, ohne den Wert offenzulegen.

```
Rohtext: Maria schrieb Dr. Chen zweimal wegen Konto AT00...
Prompt:  PERSON_001 schrieb PERSON_002 zweimal wegen ACCOUNT_001.
```

Begrenze die Konsistenz der Tokens eng. Derselbe Wert darf innerhalb einer Anfrage oder einer freigegebenen Unterhaltung denselben Platzhalter erhalten, aber nicht über alle Kunden und Jahre hinweg. Globale deterministische Tokens werden selbst zu Tracking-IDs. Speichere Zuordnungen mit Mandant, Zweck, Ablaufzeit und berechtigtem Empfänger. Verschlüssele sie getrennt von Prompt-Logs und lösche sie, sobald keine Rückauflösung mehr nötig ist.

Vom Modell erfundene Platzhalter dürfen sich nie automatisch auflösen. Der Restore-Schritt akzeptiert nur Tokens, die das Gateway für diese Anfrage erzeugt hat, und prüft Empfänger sowie Ausgabekanal. Ein Token in einem Tool-Argument, Memory Store oder Analytics Event bleibt pseudonymisiert, solange keine eigene Policy dort die Rückauflösung erlaubt.

## Wo sitzt das Gateway bei Chat, RAG und Agenten?

| Flow | Nötige Kontrollpunkte | Häufig übersehen |
| --- | --- | --- |
| Chat oder Support-Copilot | Nutzereingabe, geladene Kundenfelder, Modellausgabe und Traces | Der getippte Prompt wird bereinigt, der per Code ergänzte CRM-Datensatz nicht |
| RAG | Vor dem Indexieren, nach dem Retrieval und vor der Ausgabe | Der finale Prompt wird bereinigt, nachdem Rohdaten bereits in Embeddings und Logs gelandet sind |
| Agent Tools | Tool-Argumente, Tool-Ergebnisse, Modellkontext, Memory und finale Antwort | Identifikatoren werden vor einem autonomen Tool-Aufruf zurückaufgelöst |
| Dokumente und Bilder | Originaldatei, OCR-Text, Metadaten, Thumbnails und Exporte | Sichtbarer Text ist verdeckt, durchsuchbare Ebene oder Metadaten bleiben erhalten |
| Observability | Prompt-Traces, Fehler, Eval-Samples, Support-Bundles und Analytics | Die Inference ist bereinigt, das Exception-Payload landet vollständig im Log |

Bei RAG ersetzt Redaction keine Berechtigungen pro Nutzer. Auch eine bereinigte Passage kann vertrauliche Strategien offenlegen, und ein pseudonymisiertes Embedding kann personenbezogen bleiben. Nutze unsere [RAG-Berechtigungsarchitektur](/de/blog/rag-permissions-sharepoint-confluence-drive/) für den Zugriff und diese Pipeline für Datenminimierung.

## Wie testest du ein PII-Gateway vor Produktion?

**Gib es nicht aufgrund eines Vendor-Benchmarks oder zehn handgeschriebener Prompts frei.** Baue ein autorisiertes Eval-Set, das deine Sprachen, Formate, Fehlermuster und Geschäftsidentifikatoren abbildet. Nutze synthetische Beispiele für Breite und sauber geregelte gelabelte Samples für Realismus.

- **Entity Recall je Risikostufe:** Miss, wie oft verbotene Identifikatoren durchsickern. Ein übersehener Gesundheitsbezug darf nicht durch viele einfache E-Mail-Treffer verschwinden.
- **Precision und Nutzwert:** Miss entfernten Nutztext, Task Success vor und nach Bereinigung und den Erhalt von Entitätsbeziehungen.
- **End-to-End-Leakage:** Teste jeden Input-, Retrieval-, Tool-, Output- und Logging-Pfad, nicht nur die Detector-Funktion.
- **Sprache und Locale:** Berücksichtige deutsche Komposita, spanische Namen, chinesische Schrift, Transliteration, gemischte Prompts und lokale Identifikatoren.
- **Adversariale Formatierung:** Teste Leerzeichen, OCR-Fehler, Unicode-Lookalikes, über Felder geteilte Identifikatoren und Secrets in Code.
- **Sichere Rückauflösung:** Probiere fremde Mandanten-Tokens, abgelaufene Tokens, erfundene Platzhalter und verbotene Zielkanäle.
- **Betrieb:** Erfasse p50- und p95-Latenz, Timeouts, Versionsdrift, Vault-Ausfälle und Fail-Closed-Verhalten.

Setze Grenzwerte pro Workflow. Ein öffentlicher Marketing-Summarizer und ein klinischer Fallassistent haben nicht dieselbe akzeptable False-Negative-Rate. In Hochrisikopfaden führen unsichere Treffer zu Block oder Review. Bei geringerem Risiko kann ein False Positive zur Korrektur angezeigt werden. Ein langsamer oder ausgefallener Detector darf nie stillschweigend Fail Open auslösen.

![Kevin Riedl](/img/team/kevin.webp)

"Ein PII-Detector ist ein Sensor, keine Sicherheitsgrenze. Die Grenze ist das Gateway, das Daten minimiert, Policy erzwingt, Rückauflösung kontrolliert und bei Unsicherheit sicher fehlschlägt."

## Selbst bauen, kaufen oder kombinieren?

| Entscheidung | Wähle sie, wenn | Was bei dir bleibt |
| --- | --- | --- |
| Um Presidio bauen | Lokale Verarbeitung, eigene Entitäten, prüfbare Regeln und moderater Modellbetrieb zählen | Evaluation, Skalierung, Vault, Policies, Sprachmodelle und Incident Response |
| Privacy Filter lokal betreiben | Freitext und kontextabhängige Namen dominieren, lange Inputs zählen und lokale Kapazität vorhanden ist | Fine-Tuning, nicht englische Evals, Transformation, Vault und Policy |
| Managed DLP kaufen | Die Cloud ist freigegeben und schnelle Integration wichtiger als On-Device Detection ist | Zweckregeln, Verträge, Gateway-Logik, Output-Kontrolle und Verifikation |
| Hybrid einsetzen | Strukturierte Identifikatoren, mehrsprachiger Freitext und mehrere Risikostufen zusammenkommen | Routing, Konfliktlösung und ein gemeinsames End-to-End-Eval-Set |

Für die meisten Produktionssysteme ist der Hybrid die ehrliche Antwort: deterministische Extraktion für bekannte Felder, Presidio für konfigurierbare Entitätslogik, ein Kontextmodell für mehrdeutigen Freitext und ein anwendungseigener Token-Vault. Widersprechen sich zwei Detectors, ist das ein Policy-Signal und kein Grund, einfach das billigere Ergebnis zu wählen.

Wenn du eine KI-Plattform einkaufst, ergänze die Gateway-Nachweise im [Security-Fragebogen für KI-Anbieter in der EU](/de/blog/ai-vendor-security-questionnaire-eu/). Wenn du selbst baust, kann Wavects [AI-Enablement-Service](/de/services/ai-enablement/) den Datenfluss abbilden, einen begrenzten Workflow implementieren und deinem Team Tests sowie Betriebsdokumentation übergeben. [Twinsoft AI](/de/case-studies/twinsoft-ai/) zeigt die breitere Produktionsdisziplin rund um ein KI-System. Der Vergleich [AI Enablement versus allgemeine KI-Beratung](/de/compare/ai-enablement-vs-generic-ai-consultancy/) hilft bei der Entscheidung zwischen Umsetzung und Beratung.

## Checkliste für die Umsetzung

1. Inventarisiere Roh-Prompts, Uploads, Retrieval-Quellen, Tool-Ergebnisse, Outputs, Caches und Logs.
2. Definiere je Zweck, welche Datenklassen blockiert, entfernt, pseudonymisiert oder erlaubt werden.
3. Entferne unnötige strukturierte Felder vor dem Zusammenbau des Texts.
4. Betreibe deterministische und kontextsensitive Detectors innerhalb einer freigegebenen Grenze.
5. Erzeuge eindeutige typisierte Tokens und einen mandantenbezogenen verschlüsselten Mapping Store.
6. Halte Rohwerte und Zuordnung aus Modellkontext, Traces und Analytics fern.
7. Prüfe die Modellausgabe und autorisiere jede Rückauflösung nach Token, Empfänger, Zweck und Kanal.
8. Teste mehrsprachige False Negatives, Nutzwert, adversariale Formate, Latenz und Ausfälle.
9. Dokumentiere Detector-Versionen, Policy-Entscheidungen und aggregierte Entitätszahlen ohne Rohinhalt.
10. Prüfe Rechtsgrundlage, AVV, Retention, Betroffenenrechte und DPIA-Bedarf mit Datenschutzexpertise.

## Häufig gestellte Fragen

### Sollte ich PII vor einem LLM-Prompt entfernen?

Ja, wenn das Modell den Originalwert nicht braucht. Entferne unnötige Felder und nutze typisierte Pseudonyme, wenn Beziehungen zwischen Entitäten wichtig sind. Redaction senkt die Exposition, ersetzt aber weder Rechtsgrundlage noch Autorisierung, Retention oder AVV.

### Ist Microsoft Presidio gut genug für Produktion?

Presidio ist ein starkes Framework, keine Garantie. Produktion braucht eigene Recognizer, das passende Sprachmodell, ein In-Domain-Eval-Set, ein sicheres Gateway und Monitoring. Das Projekt selbst warnt, dass automatische Erkennung nicht alle sensiblen Informationen findet.

### Gehört Presidio noch Microsoft?

Nicht mehr in dem Sinn, den ältere Suchergebnisse nahelegen. Presidio entstand bei Microsoft und wechselt zu unabhängiger Community-Governance unter Data Privacy Stack. Es bleibt MIT-lizenziert und bestehende APIs sollen weiterlaufen.

### Macht die Pseudonymisierung einen Prompt nach DSGVO anonym?

Nein. Kann der Verantwortliche oder eine andere Stelle den Prompt mit Zusatzinformation einer Person zuordnen, bleibt er personenbezogen. Pseudonymisierung ist eine wertvolle Schutzmaßnahme, keine DSGVO-Ausnahme.

### Soll das Gateway Namen in der LLM-Antwort zurückauflösen?

Nur wenn Empfänger, Zweck und Ausgabekanal autorisiert sind. Löse ausschließlich Tokens auf, die für diese Anfrage erzeugt wurden. In Modell-Memory, Logs oder autonomen Tool-Aufrufen bleiben sie standardmäßig pseudonymisiert.

### Kann Cloud-DLP Daten vor einem Cloud-LLM schützen?

Es kann das nachgelagerte LLM schützen, muss aber die Originaldaten erhalten. Behandle den DLP-Dienst als Teil der Verarbeitungskette und prüfe Region, Retention, Subprozessoren, AVV und Transferbedingungen.

## Fazit

PII-Redaction vor einem LLM-Aufruf ist weder eine einzelne Regex noch eine Compliance-Checkbox. Baue ein unvermeidbares Gateway, das mit Datenminimierung beginnt, deterministische und kontextsensitive Erkennung kombiniert, nur nötige Beziehungen erhält und den Token-Vault außerhalb der Modellreichweite hält. Prüfe den Ausgang so sorgfältig wie den Eingang. Beweise das System danach mit deinen Sprachen und Fehlermustern. Presidio, Privacy Filter und Managed DLP können jeweils einen Detector liefern. Deine Architektur muss Policy, Autorisierung, Rückauflösung und Nachweise liefern.

## Primärquellen

- [Presidio-Dokumentation und Warnung zur automatischen Erkennung](https://presidio.dataprivacystack.org/)
- [Übergang von Presidio zu Data Privacy Stack](https://presidio.dataprivacystack.org/project_transition/)
- [Beispiel für Prompt-Masking mit Presidio und LiteLLM](https://presidio.dataprivacystack.org/samples/docker/litellm/)
- [Repository und Einschränkungen von OpenAI Privacy Filter](https://github.com/openai/privacy-filter)
- [Überblick zu Azure AI Language PII](https://learn.microsoft.com/en-us/azure/ai-services/language-service/personally-identifiable-information/overview)
- [Pseudonymisierung mit Google Sensitive Data Protection](https://docs.cloud.google.com/sensitive-data-protection/docs/pseudonymization)
- [PII-Erkennung und Redaction mit Amazon Comprehend](https://docs.aws.amazon.com/comprehend/latest/dg/pii.html)
- [EDSA-Leitlinien 01/2025 zur Pseudonymisierung](https://www.edpb.europa.eu/public-consultations/guidelines-012025-on-pseudonymisation_en)
- [OWASP LLM02:2025 Sensitive Information Disclosure](https://genai.owasp.org/llmrisk/llm022025-sensitive-information-disclosure/)

## Das könnte dich auch interessieren..

[**MCP ist keine Sicherheitsgrenze** Setze Objekt-, Zeilen- und Feldautorisierung hinter jeden Datenpfad eines Agenten.](/de/blog/mcp-security-boundary-data-level-access-control/) [**Security-Fragebogen für KI-Anbieter in der EU** Mache aus Aussagen zu Datenschutz, Retention, Vorfällen und Zugriff konkrete Nachweisanforderungen.](/de/blog/ai-vendor-security-questionnaire-eu/)

Agent Engineering

## In diesem Cluster weiterlesen

[Mit dem Grundlagenartikel starten**Graph Engineering für KI-Agenten: Wann lohnt sich ein Knowledge Graph?**](/de/blog/graph-engineering-ai-agents/)

- [Agent Reach im Test: Kosten, Sicherheit und Grenzen](/de/blog/agent-reach-open-source-review/)
- [Cloudflare Wallets für KI-Agenten: Was ist live?](/de/blog/cloudflare-wallets-ai-agents/)
- [QM AI Agent im Test: YCs Multiplayer Harness](/de/blog/qm-ai-agent-harness-review/)
- [jcode vs Claude Code: Lohnt sich der Wechsel zum Rust-Harness?](/de/blog/jcode-vs-claude-code-rust-agent-harness/)
- [Lightpanda Browser für KI-Agenten: Praxischeck 2026](/de/blog/lightpanda-headless-browser-ai-agents/)

Postfach, ohne Lärm

## Folge der Arbeit, die für dich zählt

Du bekommst eine kurze E-Mail, wenn wir etwas Neues veröffentlichen. Folge dem ganzen Blog oder nur den Themen, die dich interessieren.

[**Zurück**](/de/blog/overview/)

[![Kevin Riedl](/img/team/kevin.webp)](/de/team/kevin-riedl/)

[Kevin Riedl](/de/team/kevin-riedl/) https://linkedin.com/in/wsdt

14 min Lesezeit · 6. August 2026

[**Weiter**](/de/blog/local-multimodal-ai-coding-assistant/)

Neue Beiträge per E-Mail ×

×

Neue Beiträge per E-Mail

Eine kurze E-Mail, wenn wir etwas veröffentlichen. Kostenlos, ohne Tracking.

## Structured Data

```json
{
  "@context": "https://schema.org",
  "@graph": [
    {
      "@id": "https://wavect.io/#organization",
      "@type": [
        "Organization",
        "ProfessionalService",
        "LocalBusiness"
      ],
      "employee": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "founder": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "legalRepresentative": [
        {
          "@id": "https://wavect.io/team/kevin-riedl/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Kevin Riedl",
          "url": "https://wavect.io/team/kevin-riedl/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        },
        {
          "@id": "https://wavect.io/team/christof-jori/#person",
          "@type": "Person",
          "jobTitle": "Managing Director",
          "name": "Christof Jori",
          "url": "https://wavect.io/team/christof-jori/",
          "worksFor": {
            "@id": "https://wavect.io/#organization",
            "@type": [
              "Organization",
              "ProfessionalService",
              "LocalBusiness"
            ]
          }
        }
      ],
      "name": "Wavect GmbH",
      "subjectOf": {
        "@id": "https://wavect.io/verified-claims.json#dataset",
        "@type": "Dataset",
        "name": "Wavect verified publication claims",
        "url": "https://wavect.io/verified-claims.json"
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/team/kevin-riedl/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Kevin Riedl",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796365",
        "https://www.linkedin.com/in/wsdt",
        "https://github.com/wsdt"
      ],
      "url": "https://wavect.io/team/kevin-riedl/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/team/christof-jori/#person",
      "@type": "Person",
      "jobTitle": "Managing Director",
      "name": "Christof Jori",
      "sameAs": [
        "https://www.wikidata.org/wiki/Q139796367",
        "https://www.linkedin.com/in/jocr77/",
        "https://github.com/jo-chris"
      ],
      "url": "https://wavect.io/team/christof-jori/",
      "worksFor": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      }
    },
    {
      "@id": "https://wavect.io/#website",
      "@type": "WebSite",
      "inLanguage": [
        "en",
        "de",
        "es",
        "zh"
      ],
      "name": "Wavect",
      "potentialAction": {
        "@type": "SearchAction",
        "query-input": "required name=search_term_string",
        "target": {
          "@type": "EntryPoint",
          "urlTemplate": "https://wavect.io/search/?q={search_term_string}"
        }
      },
      "publisher": {
        "@id": "https://wavect.io/#organization",
        "@type": [
          "Organization",
          "ProfessionalService",
          "LocalBusiness"
        ]
      },
      "url": "https://wavect.io/"
    },
    {
      "@id": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/#webpage",
      "@type": "WebPage",
      "dateModified": "2026-08-06",
      "inLanguage": "de",
      "isPartOf": {
        "@id": "https://wavect.io/#website",
        "@type": "WebSite"
      },
      "lastReviewed": "2026-08-06",
      "url": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/"
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BlogPosting",
  "abstract": "Setze ein deterministisches Privacy-Gateway vor jeden Modell-, Retrieval-, Tool- und Logging-Pfad, der sensible Texte erhalten könnte. Entferne Felder, die die Aufgabe nicht braucht, erkenne den Rest mit Regeln plus einem kontextsensitiven lokalen Detector und ersetze jeden Wert durch einen stabilen typisierten Platzhalter. Die verschlüsselte Zuordnung bleibt außerhalb des Modellpfads. Prüfe die Antwort, löse nur autorisierte Platzhalter an der finalen Auslieferungsgrenze zurück und protokolliere Entitätstypen sowie Policy-Versionen statt Rohinhalte. Presidio ist das flexibelste Open-Source-Framework. OpenAI Privacy Filter bietet stärkere kontextuelle Erkennung, braucht aber mehr Rechenleistung und nutzt eine primär englische feste Taxonomie. Managed DLP senkt den Betriebsaufwand, erhält jedoch die Originaldaten. Kein Tool garantiert Anonymisierung oder DSGVO-Konformität. Miss False Negatives, Aufgabenqualität, Latenz und Mehrsprachigkeit mit deinen eigenen Daten.",
  "articleBody": " Blog-Übersicht/AI und Agents/Agent Engineering Personenbezogene Daten vor LLM-Prompts schützen: Presidio, Privacy Filter und die Produktionspipeline TL;DR Setze ein deterministisches Privacy-Gateway vor jeden Modell-, Retrieval-, Tool- und Logging-Pfad, der sensible Texte erhalten könnte. Entferne Felder, die die Aufgabe nicht braucht, erkenne den Rest mit Regeln plus einem kontextsensitiven lokalen Detector und ersetze jeden Wert durch einen stabilen typisierten Platzhalter. Die verschlüsselte Zuordnung bleibt außerhalb des Modellpfads. Prüfe die Antwort, löse nur autorisierte Platzhalter an der finalen Auslieferungsgrenze zurück und protokolliere Entitätstypen sowie Policy-Versionen statt Rohinhalte. Presidio ist das flexibelste Open-Source-Framework. OpenAI Privacy Filter bietet stärkere kontextuelle Erkennung, braucht aber mehr Rechenleistung und nutzt eine primär englische feste Taxonomie. Managed DLP senkt den Betriebsaufwand, erhält jedoch die Originaldaten. Kein Tool garantiert Anonymisierung oder DSGVO-Konformität. Miss False Negatives, Aufgabenqualität, Latenz und Mehrsprachigkeit mit deinen eigenen Daten. Der sicherste Prompt fordert ein LLM nicht dazu auf, personenbezogene Daten zu ignorieren. Er enthält Daten, die das Modell nicht braucht, gar nicht erst. Setze ein deterministisches Privacy-Gateway vor den Modellaufruf, entferne unnötige Felder, ersetze notwendige Identifikatoren durch stabile Platzhalter und behalte die Rückauflösung unter eigener Kontrolle. Dieser Leitfaden schließt die praktische Lücke zwischen einem Presidio-Demo mit fünf Zeilen und einer allgemeinen DSGVO-Policy. Er zeigt den vollständigen Pfad für Support-Tickets, Dokumente, RAG, Agenten und interne Assistenten. Außerdem vergleicht er das ursprünglich von Microsoft entwickelte Presidio mit OpenAI Privacy Filter und Managed-DLP-Diensten. Die Tool-Angaben wurden am 6. August 2026 geprüft. Wie sollte eine PII-Redaction-Pipeline vor LLM-Prompts aussehen? Nutze sieben Grenzen: minimieren, erkennen, klassifizieren, transformieren, aufrufen, prüfen und selektiv zurückauflösen. Die Erkennung läuft in deiner vertrauenswürdigen Umgebung, bevor Prompt, Anhang, gefundene Passage oder Tool-Ergebnis die Grenze zum Modellanbieter überschreitet. An der Quelle minimieren. Wähle nur Felder, die die Aufgabe braucht. Serialisiere keinen vollständigen Kundendatensatz, um ihn später wieder zu schwärzen. Mehrschichtig erkennen. Kombiniere schemaabhängige Feldregeln, Prüfsummen und Secret-Patterns mit einem kontextsensitiven PII-Detector. Eine Methode deckt nicht gleichzeitig IBANs und Namen im Fließtext zuverlässig ab. Policy je Entität und Zweck anwenden. Blockiere verbotene Inhalte, entferne unnötige Inhalte und pseudonymisiere Werte, die die Aufgabe weiter benötigt. Eindeutige typisierte Platzhalter erzeugen. Ersetze Werte durch Tokens wie PERSON_001, EMAIL_001 und CASE_ID_001. Wiederholte Verweise bleiben im erlaubten Scope konsistent. Das Modell mit bereinigtem Kontext aufrufen. Modell, Tracing und Prompt-Cache erhalten Platzhalter, niemals die Zuordnungstabelle. Die Ausgabe prüfen. Erkenne neue sensible Werte, unerwartete Rohdaten und unautorisierte Platzhalter, bevor eine Antwort, ein Log oder ein Tool-Aufruf das Gateway verlässt. Nur an der finalen autorisierten Grenze zurückauflösen. Löse erlaubte Platzhalter für den vorgesehenen Empfänger und Kanal auf. Re-identifiziere nie pauschal in Logs, Agent Memory oder Tool-Argumenten. vertrauenswürdige Anwendung -> Feldminimierung -> Regeln + kontextsensitiver Detector -> Policy: blockieren | entfernen | tokenisieren -> verschlüsselter Token-Vault -> bereinigter Prompt -> LLM -> Output-Detector + Autorisierung -> selektive Rückauflösung -> Nutzer Dieses Gateway ergänzt die Objekt- und Feldautorisierung aus unserem Leitfaden zu Datenzugriffskontrollen für KI-Agenten. Redaction begrenzt, was eine erlaubte Anfrage offenlegt. Autorisierung entscheidet, ob die Anfrage überhaupt auf den Datensatz zugreifen darf. Redaction, Masking, Tokenisierung und Anonymisierung sind nicht dasselbe Das falsche Wort erzeugt eine gefährliche Kontrolllücke. Entscheidend ist, ob der Wert wiederhergestellt werden kann und ob der verbleibende Kontext eine Person weiterhin identifiziert. TechnikBeispielReversibel?Geeignet für Redaction[ENTFERNT]Planmäßig ohne ZuordnungDaten, die die Aufgabe nicht braucht Maskingj***@example.comOriginal bleibt an anderer StelleBenutzeroberflächen und Diagnose Pseudonymisierung oder TokenisierungPERSON_001Ja, mit Zusatzinformation oder SchlüsselLLM-Aufgaben, die Entitätsbezüge brauchen AnonymisierungNiemand ist aus Ergebnis und verfügbarem Kontext vernünftigerweise identifizierbarNeinNur nach belastbarer Prüfung des Re-Identifikationsrisikos Nach Art. 4 Z 5 DSGVO muss die Zusatzinformation bei einer Pseudonymisierung getrennt aufbewahrt und geschützt werden. Die Leitlinien des Europäischen Datenschutzausschusses von 2025 stellen klar: Pseudonymisierte Daten bleiben personenbezogene Daten,",
  "articleSection": "Engineering",
  "author": {
    "@id": "https://wavect.io/team/kevin-riedl/#person",
    "@type": "Person",
    "name": "Kevin Riedl",
    "sameAs": [
      "https://www.wikidata.org/wiki/Q139796365",
      "https://www.linkedin.com/in/wsdt",
      "https://github.com/wsdt"
    ],
    "url": "https://wavect.io/team/kevin-riedl/"
  },
  "dateModified": "2026-08-06",
  "datePublished": "2026-08-06",
  "description": "Setze ein deterministisches Privacy-Gateway vor jeden Modell-, Retrieval-, Tool- und Logging-Pfad, der sensible Texte erhalten könnte. Entferne Felder, die die Aufgabe nicht braucht, erkenne den Rest mit Regeln plus einem kontextsensitiven lokalen Detector und ersetze jeden Wert durch einen stabilen typisierten Platzhalter. Die verschlüsselte Zuordnung bleibt außerhalb des Modellpfads. Prüfe die Antwort, löse nur autorisierte Platzhalter an der finalen Auslieferungsgrenze zurück und protokolliere Entitätstypen sowie Policy-Versionen statt Rohinhalte. Presidio ist das flexibelste Open-Source-Framework. OpenAI Privacy Filter bietet stärkere kontextuelle Erkennung, braucht aber mehr Rechenleistung und nutzt eine primär englische feste Taxonomie. Managed DLP senkt den Betriebsaufwand, erhält jedoch die Originaldaten. Kein Tool garantiert Anonymisierung oder DSGVO-Konformität. Miss False Negatives, Aufgabenqualität, Latenz und Mehrsprachigkeit mit deinen eigenen Daten.",
  "headline": "PII vor LLM-Prompts entfernen: Eine praktische Pipeline",
  "image": "https://wavect.io/img/blog/headers/header_pii-redaction-before-llm-prompts.svg",
  "inLanguage": "de",
  "keywords": "KI-Sicherheit, Datenschutz",
  "mainEntityOfPage": {
    "@id": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/",
    "@type": "WebPage"
  },
  "publisher": {
    "@id": "https://wavect.io/#organization",
    "@type": [
      "Organization",
      "ProfessionalService",
      "LocalBusiness"
    ]
  },
  "url": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/",
  "wordCount": 2541
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/",
      "name": "PII vor LLM-Prompts entfernen: Eine praktische Pipeline",
      "position": 3
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "BreadcrumbList",
  "itemListElement": [
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/",
      "name": "Startseite",
      "position": 1
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/overview/",
      "name": "Blog-Übersicht",
      "position": 2
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/topics/ai-agents/",
      "name": "AI und Agents",
      "position": 3
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/clusters/agent-engineering/",
      "name": "Agent Engineering",
      "position": 4
    },
    {
      "@type": "ListItem",
      "item": "https://wavect.io/de/blog/pii-redaction-before-llm-prompts/",
      "name": "PII vor LLM-Prompts entfernen: Tools und Pipeline | ",
      "position": 5
    }
  ]
}
```

```json
{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Ja, wenn das Modell den Originalwert nicht braucht. Entferne unnötige Felder und nutze typisierte Pseudonyme, wenn Beziehungen zwischen Entitäten wichtig sind. Redaction senkt die Exposition, ersetzt aber weder Rechtsgrundlage noch Autorisierung, Retention oder AVV."
      },
      "name": "Sollte ich PII vor einem LLM-Prompt entfernen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Presidio ist ein starkes Framework, keine Garantie. Produktion braucht eigene Recognizer, das passende Sprachmodell, ein In-Domain-Eval-Set, ein sicheres Gateway und Monitoring. Das Projekt selbst warnt, dass automatische Erkennung nicht alle sensiblen Informationen findet."
      },
      "name": "Ist Microsoft Presidio gut genug für Produktion?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nicht mehr in dem Sinn, den ältere Suchergebnisse nahelegen. Presidio entstand bei Microsoft und wechselt zu unabhängiger Community-Governance unter Data Privacy Stack. Es bleibt MIT-lizenziert und bestehende APIs sollen weiterlaufen."
      },
      "name": "Gehört Presidio noch Microsoft?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nein. Kann der Verantwortliche oder eine andere Stelle den Prompt mit Zusatzinformation einer Person zuordnen, bleibt er personenbezogen. Pseudonymisierung ist eine wertvolle Schutzmaßnahme, keine DSGVO-Ausnahme."
      },
      "name": "Macht die Pseudonymisierung einen Prompt nach DSGVO anonym?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Nur wenn Empfänger, Zweck und Ausgabekanal autorisiert sind. Löse ausschließlich Tokens auf, die für diese Anfrage erzeugt wurden. In Modell-Memory, Logs oder autonomen Tool-Aufrufen bleiben sie standardmäßig pseudonymisiert."
      },
      "name": "Soll das Gateway Namen in der LLM-Antwort zurückauflösen?"
    },
    {
      "@type": "Question",
      "acceptedAnswer": {
        "@type": "Answer",
        "text": "Es kann das nachgelagerte LLM schützen, muss aber die Originaldaten erhalten. Behandle den DLP-Dienst als Teil der Verarbeitungskette und prüfe Region, Retention, Subprozessoren, AVV und Transferbedingungen."
      },
      "name": "Kann Cloud-DLP Daten vor einem Cloud-LLM schützen?"
    }
  ]
}
```
