Developer · FREE

Ewaluacja agenta (promptfoo)

Sprawdza, czy agent w ogóle ładuje skill gdy zadanie tego wymaga, i czy ta wersja SKILL.md daje lepszy artefakt niż poprzednia. Ten sam task, ten sam model, inny skill. Nie 'wydaje mi się, że lepiej'.

reviewed:

Jak zainstalować

  1. Uzupełnij pola poniżej (albo zostaw nazwy zmiennych i dopisz w czacie). Wartości z Skill creatora na liście podstawiają się same.
  2. Kopiuj, potem wklej w Claude.ai (instrukcje projektu) albo ChatGPT (Custom Instructions).
  3. Albo pobierz SKILL.md i połóż w folderze skilli Claude Code.
SKILL
Wersja A `SKILL.md` (ścieżka albo wklejka): [SKILL_A]. Wersja B: [SKILL_B]. Zestaw 5-15 tasków z oczekiwanym artefaktem: [TASKI]. Model: [MODEL].

To NIE jest red-team (injection, jailbreak). Tu: routing skilla + jakość artefaktu. Jeśli brakuje [SKILL_A]/[SKILL_B] albo [TASKI] - poproś i stop.
Jeśli [MODEL] puste - zapytaj który model (identyczny dla A i B) i stop.
Jeśli tasków < 5 - dopytaj albo odmów "za mało, by odróżnić szum".

Kontrola (twarda): ten sam [MODEL], te same taski, te same uprawnienia tooli. Różni się TYLKO `SKILL.md` (dwa `working_dir` / dwie fixtures).

Zwracasz:

## 1. Drzewo fixtures
`fixtures/v1/` i `fixtures/v2/` z `.claude/skills/<slug>/SKILL.md` (Claude) albo `.agents/skills/<slug>/SKILL.md` (Codex). Reszta plików identyczna.

## 2. `promptfooconfig.yaml`
- dwa providery, identyczny model, inny `working_dir`
- `prompts: ['{{request}}']`
- testy z [TASKI]

Asercje, OSOBNO (nie mieszaj w jedną "jakość"):

1. Czy agent wczytał właściwy skill: `skill-used` (wartość = slug). To nie jest ocena outputu.
2. Czy artefakt jest dobry: rubryka na SEKCJE i ZAKAZY (np. `contains` nagłówka, javascript na wymagane pola), nie "ogólne wrażenie", nie samo `llm-rubric` bez kryteriów.
3. Sąsiad: minimum 1 task, który MA NIE odpalać tego skilla (`not-skill-used` na slugu; `skill-used` na sąsiedzie, jeśli bundle).

## 3. Komenda
`npx promptfoo@latest eval -c promptfooconfig.yaml`

Komendę PODAJESZ. Nie odpalasz płatnego eval bez zgody na koszt tokenów [MODEL]. `--no-cache` tylko gdy iterujesz treść skilla; `--repeat 3` gdy wynik jest losowy.

## 4. Tabela pass/fail
Kolumny: task | skill-used A | skill-used B | rubryka A | rubryka B | werdykt.

Werdykt jednej linii: która wersja wygrywa i na którym sygnale (routing vs artefakt). Bliski wynik = nie koronuj po jednym szczęśliwym runie.

Zakaz: spłaszczanie requestu do jednego generic `prompt:` gdy agent ma tool; porównywanie różnych modeli "bo tak"; red-team pluginy w tym confie. Dywiz "-". YAML po angielsku.

Zanim wkleisz

Skill vs zły prompt

Zły prompt

Odpal promptfoo, porównaj skille na czuja, red team przy okazji, na produkcji.

Skill

Wersja A `SKILL.md` (ścieżka albo wklejka): [SKILL_A]. Wersja B: [SKILL_B]. Zestaw 5-15 tasków z oczekiwanym artefaktem: [TASKI]. Model: [MODEL].

To NIE jest red-team (injection, jailbreak). Tu: routing skilla + jakość artefaktu. Jeśli brakuje [SKILL_A]/[SKILL_B] albo [TASKI] - poproś i stop.
Jeśli [MODEL] puste - zapytaj który model (identyczny dla A i B) i stop.
Jeśli tasków < 5 - dopytaj albo odmów "za mało, by odróżnić szum".

Kontrola (twarda): ten sam [MODEL], te same taski, te same uprawnienia tooli. Różni się TYLKO `SKILL.md` (dwa `working_dir` / dwie fixtures).

Użyj z tym narzędziem

Lekcja: claude-start-06-claude-dla-programisty

Pytania

Jak użyć skilla "Ewaluacja agenta (promptfoo)" w Claude?

Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.

Kiedy tego skilla NIE używać?

Nie gdy skill nie istnieje (najpierw napisz kartę). Nie do red-teamu (to redteam-llm-promptfoo). Nie gdy nie masz zestawu tasków z oczekiwanym artefaktem.