Developer · FREE

Golden eval offline

Lokalny zestaw evali: prompt, oczekiwanie, asercje z dowodem. Baseline bez skilla, potem ze skillem. Bez promptfoo i bez płatnego API. Pokazuje, czy skill w ogóle zmienia wynik.

reviewed:

Jak zainstalować

  1. Uzupełnij pola poniżej (albo zostaw nazwy zmiennych i dopisz w czacie). Wartości z Skill creatora na liście podstawiają się same.
  2. Kopiuj, potem wklej w Claude.ai (instrukcje projektu) albo ChatGPT (Custom Instructions).
  3. Albo pobierz SKILL.md i połóż w folderze skilli Claude Code.
SKILL
Ścieżka skilla: [SKILL]. 5-15 tasków (albo hasła do rozpisania): [TASKI]. Katalog roboczy na wyniki: [KATALOG].

NIE wołaj promptfoo. NIE wołaj płatnego API. Jeśli [SKILL] nie istnieje - stop. Jeśli [TASKI] < 3 - dopytaj brakujące i stop.

## Po co

Skill bez failing baseline to dokument, nie narzędzie. Najpierw zobacz, jak agent pada BEZ skilla. Potem ten sam task ZE skillem. Inny tylko skill.

## Artefakt `evals/evals.json`

Dla każdego taska:

- `id` - liczba
- `prompt` - wypowiedź, jaką człowiek naprawdę wpisze (ścieżka, literówka, kontekst), nie "Format this data"
- `expected_output` - opis sukcesu po ludzku
- `files` - wejścia względne albo `[]`
- `expectations` - 3-8 zdań sprawdzalnych ("plik X zawiera sekcję Y", "nie woła sieci"). Nie "wygląda profesjonalnie".

Dwa rodzaje tasków w zestawie:

- trafienie: skill MA się przydać
- sąsiad: skill NIE ma się włączyć (inny job)

## Przebieg (offline)

1. RED: ten sam prompt, zero skilla (albo stara wersja w `skill-snapshot/`). Zapisz output do `[KATALOG]/iteration-1/eval-<id>/without_skill/`.
2. GREEN: ten sam prompt, skill wczytany. Output do `.../with_skill/`.
3. Grade: dla każdej asercji `{ text, passed, evidence }`. Evidence = cytat z outputu albo "brak w pliku Z". Skrypt tam, gdzie da się zgrepować; człowiek / grader tam, gdzie smak.
4. Tabela: task, without pass_rate, with pass_rate, delta. Asercja, która przechodzi w obu konfiguracjach, nie mierzy skilla - oznacz jako martwą.
5. Jeśli delta ~ 0: skill nie broni tokenów. Albo zaostrz asercje, albo nie publikuj.

Nie startuj najpierw tylko przebiegów with_skill. Baseline i with_skill w tej samej fali, ten sam model.

## Czego nie robić

- oceniać "na oko" bez tabeli
- zmieniać promptu między without i with
- wrzucać asercji, które model spełni halucynacją ("wspomina nazwę X")
- odpalać serwera recenzji na stałe; HTML statyczny albo tabela w md

## Format wyjścia

1. `evals/evals.json` (pełna treść albo ścieżka).
2. Tabela task x without/with x pass (liczby zmierzone, nie z pamięci).
3. 3 wnioski: co skill naprawił, czego nie, która asercja jest martwa.
4. Werdykt: PUBLIKUJ / ITERUJ (co zmienić w ciele) / NIE PUBLIKUJ.

Dywiz "-". Komendy lokalne (Read, Grep, skrypt), nie SaaS.

Zanim wkleisz

Skill vs zły prompt

Zły prompt

Odpal promptfoo na chmurze i powiedz że nowy skill jest lepszy, bez baseline.

Skill

Ścieżka skilla: [SKILL]. 5-15 tasków (albo hasła do rozpisania): [TASKI]. Katalog roboczy na wyniki: [KATALOG].

NIE wołaj promptfoo. NIE wołaj płatnego API. Jeśli [SKILL] nie istnieje - stop. Jeśli [TASKI] < 3 - dopytaj brakujące i stop.

## Po co

Skill bez failing baseline to dokument, nie narzędzie. Najpierw zobacz, jak agent pada BEZ skilla. Potem ten sam task ZE skillem. Inny tylko skill.

Użyj z tym narzędziem

Lekcja: claude-start-06-claude-dla-programisty

Pytania

Jak użyć skilla "Golden eval offline" w Claude?

Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.

Kiedy tego skilla NIE używać?

Nie do ewaluacji routingu w CI promptfoo (to eval-agenta-promptfoo). Nie do red-teamu adversarial (to redteam-llm-promptfoo). Nie gdy nie ma jeszcze ciała skilla - najpierw skill-creator-pl.