Developer · FREE

Metryki ewaluacji RAG

Zestaw pytań z oczekiwanym źródłem i faktem. Osobno: czy retrieval trafił dokument, czy odpowiedź jest wierna kontekstowi, czy odpowiada na pytanie. Bramka w CI, nie demo na jednym promptcie.

reviewed:

Jak zainstalować

  1. Uzupełnij pola poniżej (albo zostaw nazwy zmiennych i dopisz w czacie). Wartości z Skill creatora na liście podstawiają się same.
  2. Kopiuj, potem wklej w Claude.ai (instrukcje projektu) albo ChatGPT (Custom Instructions).
  3. Albo pobierz SKILL.md i połóż w folderze skilli Claude Code.
SKILL
Pary pytanie -> gold (fakt + id dokumentu), 20+: [GOLD]. Pipeline retrieve+generate: [PIPELINE].

NIE oceniaj stylu copy. NIE zlewaj retrievalu z generacją w jedną "jakość". NIE przyjmuj opinii jako gold.
Jeśli [GOLD] ma mniej niż 20 par albo gold nie ma id dokumentu - dopytaj brakujące i stop.
Jeśli [PIPELINE] puste - zapytaj retriever (top-k, embedder) + generator (model, prompt) i stop.

Zwracasz config eval do odpalenia, nie "wydaje się ok":

1. Retrieval osobno: context recall (czy gold dokument jest w top-k), context precision (czy top-k nie jest śmieciem). Zły chunk != wina generatora.
2. Generacja osobno: faithfulness (twierdzenie oparte o zwrócony kontekst, nie o parametry modelu), answer relevancy (czy odpowiada na pytanie).
3. Gold: każde pytanie ma `doc_id` (albo url+sekcja) i fakt sprawdzalny. Opinia / "brzmi mądrze" = wyrzuć z zestawu.

Próg bramki (liczba, nie nastrój), przykładowo i do potwierdzenia:
- context recall >= 0.8
- faithfulness >= 0.9
Regresja poniżej progu = fail CI, nie "jeszcze sprawdźmy ręcznie jeden prompt".

Narzędzie: promptfoo (example `eval-rag-full`, asercje na context) albo RAGAS na tych samych metrykach. Komenda odpalenia + gdzie leży plik gold (jsonl: `question`, `doc_id`, `fact`).
Sąsiad `chunk-strategia-rag` zmienia wejście; ten skill mierzy, czy zmiana pomogła. Dywiz "-".

Zanim wkleisz

Skill vs zły prompt

Zły prompt

RAG klamie, popraw prompt, wydaje sie ok, bez liczb.

Skill

Pary pytanie -> gold (fakt + id dokumentu), 20+: [GOLD]. Pipeline retrieve+generate: [PIPELINE].

NIE oceniaj stylu copy. NIE zlewaj retrievalu z generacją w jedną "jakość". NIE przyjmuj opinii jako gold.
Jeśli [GOLD] ma mniej niż 20 par albo gold nie ma id dokumentu - dopytaj brakujące i stop.
Jeśli [PIPELINE] puste - zapytaj retriever (top-k, embedder) + generator (model, prompt) i stop.

Zwracasz config eval do odpalenia, nie "wydaje się ok":

Użyj z tym narzędziem

Lekcja: fundament-03-kontekst-i-zrodla

Pytania

Jak użyć skilla "Metryki ewaluacji RAG" w Claude?

Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.

Kiedy tego skilla NIE używać?

Nie gdy nie ma korpusu ani pytan. Nie do oceny stylu copy. Nie gdy gold answer jest opinia.