Zły prompt
Odpal promptfoo, porównaj skille na czuja, red team przy okazji, na produkcji.
Developer · FREE
Sprawdza, czy agent w ogóle ładuje skill gdy zadanie tego wymaga, i czy ta wersja SKILL.md daje lepszy artefakt niż poprzednia. Ten sam task, ten sam model, inny skill. Nie 'wydaje mi się, że lepiej'.
reviewed:
Wersja A `SKILL.md` (ścieżka albo wklejka): [SKILL_A]. Wersja B: [SKILL_B]. Zestaw 5-15 tasków z oczekiwanym artefaktem: [TASKI]. Model: [MODEL].
To NIE jest red-team (injection, jailbreak). Tu: routing skilla + jakość artefaktu. Jeśli brakuje [SKILL_A]/[SKILL_B] albo [TASKI] - poproś i stop.
Jeśli [MODEL] puste - zapytaj który model (identyczny dla A i B) i stop.
Jeśli tasków < 5 - dopytaj albo odmów "za mało, by odróżnić szum".
Kontrola (twarda): ten sam [MODEL], te same taski, te same uprawnienia tooli. Różni się TYLKO `SKILL.md` (dwa `working_dir` / dwie fixtures).
Zwracasz:
## 1. Drzewo fixtures
`fixtures/v1/` i `fixtures/v2/` z `.claude/skills/<slug>/SKILL.md` (Claude) albo `.agents/skills/<slug>/SKILL.md` (Codex). Reszta plików identyczna.
## 2. `promptfooconfig.yaml`
- dwa providery, identyczny model, inny `working_dir`
- `prompts: ['{{request}}']`
- testy z [TASKI]
Asercje, OSOBNO (nie mieszaj w jedną "jakość"):
1. Czy agent wczytał właściwy skill: `skill-used` (wartość = slug). To nie jest ocena outputu.
2. Czy artefakt jest dobry: rubryka na SEKCJE i ZAKAZY (np. `contains` nagłówka, javascript na wymagane pola), nie "ogólne wrażenie", nie samo `llm-rubric` bez kryteriów.
3. Sąsiad: minimum 1 task, który MA NIE odpalać tego skilla (`not-skill-used` na slugu; `skill-used` na sąsiedzie, jeśli bundle).
## 3. Komenda
`npx promptfoo@latest eval -c promptfooconfig.yaml`
Komendę PODAJESZ. Nie odpalasz płatnego eval bez zgody na koszt tokenów [MODEL]. `--no-cache` tylko gdy iterujesz treść skilla; `--repeat 3` gdy wynik jest losowy.
## 4. Tabela pass/fail
Kolumny: task | skill-used A | skill-used B | rubryka A | rubryka B | werdykt.
Werdykt jednej linii: która wersja wygrywa i na którym sygnale (routing vs artefakt). Bliski wynik = nie koronuj po jednym szczęśliwym runie.
Zakaz: spłaszczanie requestu do jednego generic `prompt:` gdy agent ma tool; porównywanie różnych modeli "bo tak"; red-team pluginy w tym confie. Dywiz "-". YAML po angielsku. Odpal promptfoo, porównaj skille na czuja, red team przy okazji, na produkcji.
Wersja A `SKILL.md` (ścieżka albo wklejka): [SKILL_A]. Wersja B: [SKILL_B]. Zestaw 5-15 tasków z oczekiwanym artefaktem: [TASKI]. Model: [MODEL]. To NIE jest red-team (injection, jailbreak). Tu: routing skilla + jakość artefaktu. Jeśli brakuje [SKILL_A]/[SKILL_B] albo [TASKI] - poproś i stop. Jeśli [MODEL] puste - zapytaj który model (identyczny dla A i B) i stop. Jeśli tasków < 5 - dopytaj albo odmów "za mało, by odróżnić szum". Kontrola (twarda): ten sam [MODEL], te same taski, te same uprawnienia tooli. Różni się TYLKO `SKILL.md` (dwa `working_dir` / dwie fixtures).
Agentowy asystent kodowania Anthropic uruchamiany w terminalu.
Alternatywy
Edytor kodu z wbudowanym agentem AI, fork Visual Studio Code.
Alternatywy
Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.
Nie gdy skill nie istnieje (najpierw napisz kartę). Nie do red-teamu (to redteam-llm-promptfoo). Nie gdy nie masz zestawu tasków z oczekiwanym artefaktem.