Zły prompt
Odpal promptfoo na chmurze i powiedz że nowy skill jest lepszy, bez baseline.
Developer · FREE
Lokalny zestaw evali: prompt, oczekiwanie, asercje z dowodem. Baseline bez skilla, potem ze skillem. Bez promptfoo i bez płatnego API. Pokazuje, czy skill w ogóle zmienia wynik.
reviewed:
Ścieżka skilla: [SKILL]. 5-15 tasków (albo hasła do rozpisania): [TASKI]. Katalog roboczy na wyniki: [KATALOG].
NIE wołaj promptfoo. NIE wołaj płatnego API. Jeśli [SKILL] nie istnieje - stop. Jeśli [TASKI] < 3 - dopytaj brakujące i stop.
## Po co
Skill bez failing baseline to dokument, nie narzędzie. Najpierw zobacz, jak agent pada BEZ skilla. Potem ten sam task ZE skillem. Inny tylko skill.
## Artefakt `evals/evals.json`
Dla każdego taska:
- `id` - liczba
- `prompt` - wypowiedź, jaką człowiek naprawdę wpisze (ścieżka, literówka, kontekst), nie "Format this data"
- `expected_output` - opis sukcesu po ludzku
- `files` - wejścia względne albo `[]`
- `expectations` - 3-8 zdań sprawdzalnych ("plik X zawiera sekcję Y", "nie woła sieci"). Nie "wygląda profesjonalnie".
Dwa rodzaje tasków w zestawie:
- trafienie: skill MA się przydać
- sąsiad: skill NIE ma się włączyć (inny job)
## Przebieg (offline)
1. RED: ten sam prompt, zero skilla (albo stara wersja w `skill-snapshot/`). Zapisz output do `[KATALOG]/iteration-1/eval-<id>/without_skill/`.
2. GREEN: ten sam prompt, skill wczytany. Output do `.../with_skill/`.
3. Grade: dla każdej asercji `{ text, passed, evidence }`. Evidence = cytat z outputu albo "brak w pliku Z". Skrypt tam, gdzie da się zgrepować; człowiek / grader tam, gdzie smak.
4. Tabela: task, without pass_rate, with pass_rate, delta. Asercja, która przechodzi w obu konfiguracjach, nie mierzy skilla - oznacz jako martwą.
5. Jeśli delta ~ 0: skill nie broni tokenów. Albo zaostrz asercje, albo nie publikuj.
Nie startuj najpierw tylko przebiegów with_skill. Baseline i with_skill w tej samej fali, ten sam model.
## Czego nie robić
- oceniać "na oko" bez tabeli
- zmieniać promptu między without i with
- wrzucać asercji, które model spełni halucynacją ("wspomina nazwę X")
- odpalać serwera recenzji na stałe; HTML statyczny albo tabela w md
## Format wyjścia
1. `evals/evals.json` (pełna treść albo ścieżka).
2. Tabela task x without/with x pass (liczby zmierzone, nie z pamięci).
3. 3 wnioski: co skill naprawił, czego nie, która asercja jest martwa.
4. Werdykt: PUBLIKUJ / ITERUJ (co zmienić w ciele) / NIE PUBLIKUJ.
Dywiz "-". Komendy lokalne (Read, Grep, skrypt), nie SaaS. Odpal promptfoo na chmurze i powiedz że nowy skill jest lepszy, bez baseline.
Ścieżka skilla: [SKILL]. 5-15 tasków (albo hasła do rozpisania): [TASKI]. Katalog roboczy na wyniki: [KATALOG]. NIE wołaj promptfoo. NIE wołaj płatnego API. Jeśli [SKILL] nie istnieje - stop. Jeśli [TASKI] < 3 - dopytaj brakujące i stop. ## Po co Skill bez failing baseline to dokument, nie narzędzie. Najpierw zobacz, jak agent pada BEZ skilla. Potem ten sam task ZE skillem. Inny tylko skill.
Agentowy asystent kodowania Anthropic uruchamiany w terminalu.
Alternatywy
Edytor kodu z wbudowanym agentem AI, fork Visual Studio Code.
Alternatywy
Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.
Nie do ewaluacji routingu w CI promptfoo (to eval-agenta-promptfoo). Nie do red-teamu adversarial (to redteam-llm-promptfoo). Nie gdy nie ma jeszcze ciała skilla - najpierw skill-creator-pl.