Developer · FREE

Strategia chunkowania

Z korpusu wybiera jak ciąć: po nagłówkach, po tokenach, overlap, co idzie do metadanych (tytuł, url, data). Żeby retrieval nie zwracał pół tabeli albo sklejki dwóch ustaw. Zanim ktoś wrzuci PDF do vector db.

reviewed:

Jak zainstalować

  1. Uzupełnij pola poniżej (albo zostaw nazwy zmiennych i dopisz w czacie). Wartości z Skill creatora na liście podstawiają się same.
  2. Kopiuj, potem wklej w Claude.ai (instrukcje projektu) albo ChatGPT (Custom Instructions).
  3. Albo pobierz SKILL.md i połóż w folderze skilli Claude Code.
SKILL
3-5 typowych pytań: [PYTANIA]. Próbka dokumentów: [DOKUMENTY]. Limit tokenów modelu (embedding + okno generatora): [LIMIT].

NIE ingestuj sekretów i PII "a zaindeksujemy" (najpierw `pii-w-korpusie`). NIE tnij w ciemno na N tokenów, gdy dokument ma nagłówki.
Jeśli [PYTANIA] ma mniej niż 3 pytania-kanony albo [DOKUMENTY] albo [LIMIT] puste - dopytaj pytania, próbkę i limit tokenów, stop. Bez pytania nie ma strategii.
Jeśli pytanie jest odpalane do SQL / filtra strukturalnego - powiedz "to nie RAG" i stop.

Zwracasz decyzję, nie kod ingestu:

1. Jednostka cięcia: nagłówek / sekcja / strona / ślepe N tokenów. Uzasadnienie pod [PYTANIA] (1-2 zdania). Domyślnie jednostka semantyczna (Markdown H2/H3, sekcja PDF). Ślepe N tylko gdy brak struktury - i wtedy i tak nie rozcinaj tego, co w pkt 2.
2. Rozmiar i overlap względem [LIMIT]: chunk mieści się w embedderze; overlap pokrywa zdanie na granicy. NIE wolno rozcinać: tabele, listy kroków, definicje (termin + znaczenie w jednym chunku), bloki kodu z sygnaturą.
3. Metadane osobno od tekstu embedding: `source`, `url`, `title`, `data`, `uprawnienie` (acl). Filtr metadata pre-query, nie "model zgadnie". Do embedu idzie treść sekcji, nie surowy dump frontmatteru z sekretami.

Artefakt: 3 przykładowe chunki z JEDNEGO dokumentu z [DOKUMENTY] (id, tytuł sekcji, pierwsze 40 słów, metadane). Jeśli próbka pokazuje PII albo klucz - stop, nie indeksuj.
Ewaluacja sąsiaduje z `eval-rag-metryki` - tu nie licz faithfulness. Dywiz "-".

Zanim wkleisz

Skill vs zły prompt

Zły prompt

Wrzuc caly PDF do vector db, tni co 512, jakos bedzie.

Skill

3-5 typowych pytań: [PYTANIA]. Próbka dokumentów: [DOKUMENTY]. Limit tokenów modelu (embedding + okno generatora): [LIMIT].

NIE ingestuj sekretów i PII "a zaindeksujemy" (najpierw `pii-w-korpusie`). NIE tnij w ciemno na N tokenów, gdy dokument ma nagłówki.
Jeśli [PYTANIA] ma mniej niż 3 pytania-kanony albo [DOKUMENTY] albo [LIMIT] puste - dopytaj pytania, próbkę i limit tokenów, stop. Bez pytania nie ma strategii.
Jeśli pytanie jest odpalane do SQL / filtra strukturalnego - powiedz "to nie RAG" i stop.

Zwracasz decyzję, nie kod ingestu:

Użyj z tym narzędziem

Lekcja: fundament-03-kontekst-i-zrodla

Pytania

Jak użyć skilla "Strategia chunkowania" w Claude?

Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.

Kiedy tego skilla NIE używać?

Nie gdy pytanie idzie do SQL albo struktury (to nie RAG). Nie do wrzucania sekretow i PII a zaindeksujemy. Nie gdy nie masz nawet jednego pytania-kanonu.