You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
Biblioteka do anonimizacji tekstów w języku polskim dla modelu PLLUM.
Zastępuje dane wrażliwe tokenami (np. [name], [city]) oraz wspiera generację danych syntetycznych.
Pipeline (hybrydowy)
RegEx – twarde dane o stałym formacie (PESEL, email, konta, telefony, daty).
AI NER (HerBERT) – kontekstowe encje (imiona, miasta, firmy) -> tagi.
LLM Refinement (PLLuM) – opcjonalna walidacja i dopełnienie tagowania.
LLM Synthesis (PLLuM) – opcjonalne podmiany tagów na realistyczne dane syntetyczne.
fromanonymizerimportAnonymizer# Inicjalizacja - model NER pobierze się automatycznie przy pierwszym użyciuanon=Anonymizer()
# Anonimizacja tekstutext="Nazywam się Jan Kowalski, mieszkam w Warszawie, PESEL 90010112345."result=anon.anonymize(text)
print(result)
# Output: "Nazywam się [name] [surname], mieszkam w [city], [pesel]."
fromanonymizerimportAnonymizer# Wymaga ustawienia PLLUM_API_KEY w .env lub zmiennej środowiskowejanon=Anonymizer(use_synthetic=True)
# Najpierw anonimizacjatext="Mieszkam w Warszawie przy ulicy Długiej 5."anonymized=anon.anonymize(text)
# "[city] przy ulicy [address]."# Potem synteza (PLLuM -> realistyczne dane)synthetic=anon.synthesize(anonymized)
# "Mieszkam w Poznaniu przy ulicy Krótkiej 10."