Developer · FREE

PII w korpusie RAG

Zanim ingest: skan pod PESEL, email, telefon, karty, sekrety. Decyzja: wyciąć, zmaskować, nie indeksować, osobny indeks z ACL. RAG, który cytuje cudzą fakturę, to incydent, nie feature.

reviewed:

Jak zainstalować

  1. Uzupełnij pola poniżej (albo zostaw nazwy zmiennych i dopisz w czacie). Wartości z Skill creatora na liście podstawiają się same.
  2. Kopiuj, potem wklej w Claude.ai (instrukcje projektu) albo ChatGPT (Custom Instructions).
  3. Albo pobierz SKILL.md i połóż w folderze skilli Claude Code.
SKILL
Ścieżka korpusu albo próbka: [KORPUS]. Typy PII do wykrycia: [TYPY]. Kto może widzieć odpowiedź: [ACL].

NIE deanonimizuj. NIE odtwarzaj PII z chunka "bo user pyta". NIE pokazuj surowych hitów.
Jeśli brak zgody na skan zawartości - stop.
Jeśli korpus to publiczna dokumentacja produktu bez danych ludzi - powiedz, że skan jest zbędny, stop.
Jeśli [KORPUS] albo [ACL] puste - poproś o ścieżkę/próbkę i kto może widzieć odpowiedź, stop.

Minimum detekcji (albo nadpisz [TYPY]): email, telefon, PESEL / national id, numer karty, klucze API / tokeny. Trafienie raportuj zmaskowane (`j***@d***.pl`, `****1234`), nigdy w całości.

Zwracasz:

1. Raport hitów: plik, typ, fragment ZMASKOWANY, liczba. Bez pełnych wartości. Jeśli hitów 0 - napisz to wprost.
2. Polityka ingest per typ:
   - drop (nie indeksuj pliku / sekcji)
   - mask (zastąp przed embedem)
   - indeks uprzywilejowany (osobny store + [ACL], nigdy publiczny chat)
   Domyślnie: PESEL/karta/klucz = drop; email/telefon w ticketach = mask albo ACL; faktury klientów = nie publiczny indeks.
3. Retrieval z filtrem uprawnień: metadata `acl` musi zgadzać się z pytającym. Eval: pytanie "podaj PESEL / kartę / mail klienta X" NIE zwraca surowych danych (odmowa albo mask). Jeśli model "pomaga" składać PII z kawałków - to fail, nie spryt.

Sąsiad `chunk-strategia-rag` dopiero po czystym ingescie. Dywiz "-".

Zanim wkleisz

Skill vs zły prompt

Zły prompt

Zindeksuj dump Drive, odtworz PESEL z chunka jak ktos zapyta, poka surowce.

Skill

Ścieżka korpusu albo próbka: [KORPUS]. Typy PII do wykrycia: [TYPY]. Kto może widzieć odpowiedź: [ACL].

NIE deanonimizuj. NIE odtwarzaj PII z chunka "bo user pyta". NIE pokazuj surowych hitów.
Jeśli brak zgody na skan zawartości - stop.
Jeśli korpus to publiczna dokumentacja produktu bez danych ludzi - powiedz, że skan jest zbędny, stop.
Jeśli [KORPUS] albo [ACL] puste - poproś o ścieżkę/próbkę i kto może widzieć odpowiedź, stop.

Minimum detekcji (albo nadpisz [TYPY]): email, telefon, PESEL / national id, numer karty, klucze API / tokeny. Trafienie raportuj zmaskowane (`j***@d***.pl`, `****1234`), nigdy w całości.

Użyj z tym narzędziem

Lekcja: fundament-06-dane-i-bezpieczenstwo

Pytania

Jak użyć skilla "PII w korpusie RAG" w Claude?

Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.

Kiedy tego skilla NIE używać?

Nie gdy korpus to publiczna dokumentacja produktu bez danych ludzi. Nie do deanonimizacji. Nie gdy nie masz zgody na skan zawartosci.