Zły prompt
RAG klamie, popraw prompt, wydaje sie ok, bez liczb.
Developer · FREE
Zestaw pytań z oczekiwanym źródłem i faktem. Osobno: czy retrieval trafił dokument, czy odpowiedź jest wierna kontekstowi, czy odpowiada na pytanie. Bramka w CI, nie demo na jednym promptcie.
reviewed:
Pary pytanie -> gold (fakt + id dokumentu), 20+: [GOLD]. Pipeline retrieve+generate: [PIPELINE]. NIE oceniaj stylu copy. NIE zlewaj retrievalu z generacją w jedną "jakość". NIE przyjmuj opinii jako gold. Jeśli [GOLD] ma mniej niż 20 par albo gold nie ma id dokumentu - dopytaj brakujące i stop. Jeśli [PIPELINE] puste - zapytaj retriever (top-k, embedder) + generator (model, prompt) i stop. Zwracasz config eval do odpalenia, nie "wydaje się ok": 1. Retrieval osobno: context recall (czy gold dokument jest w top-k), context precision (czy top-k nie jest śmieciem). Zły chunk != wina generatora. 2. Generacja osobno: faithfulness (twierdzenie oparte o zwrócony kontekst, nie o parametry modelu), answer relevancy (czy odpowiada na pytanie). 3. Gold: każde pytanie ma `doc_id` (albo url+sekcja) i fakt sprawdzalny. Opinia / "brzmi mądrze" = wyrzuć z zestawu. Próg bramki (liczba, nie nastrój), przykładowo i do potwierdzenia: - context recall >= 0.8 - faithfulness >= 0.9 Regresja poniżej progu = fail CI, nie "jeszcze sprawdźmy ręcznie jeden prompt". Narzędzie: promptfoo (example `eval-rag-full`, asercje na context) albo RAGAS na tych samych metrykach. Komenda odpalenia + gdzie leży plik gold (jsonl: `question`, `doc_id`, `fact`). Sąsiad `chunk-strategia-rag` zmienia wejście; ten skill mierzy, czy zmiana pomogła. Dywiz "-".
RAG klamie, popraw prompt, wydaje sie ok, bez liczb.
Pary pytanie -> gold (fakt + id dokumentu), 20+: [GOLD]. Pipeline retrieve+generate: [PIPELINE]. NIE oceniaj stylu copy. NIE zlewaj retrievalu z generacją w jedną "jakość". NIE przyjmuj opinii jako gold. Jeśli [GOLD] ma mniej niż 20 par albo gold nie ma id dokumentu - dopytaj brakujące i stop. Jeśli [PIPELINE] puste - zapytaj retriever (top-k, embedder) + generator (model, prompt) i stop. Zwracasz config eval do odpalenia, nie "wydaje się ok":
Agentowy asystent kodowania Anthropic uruchamiany w terminalu.
Alternatywy
Lekcja: fundament-03-kontekst-i-zrodla
Uzupełnij pola w nawiasach (albo weź je z profilu Skill creator na /skille), kliknij Kopiuj i wklej treść do instrukcji projektu w Claude.ai. W Claude Code kliknij Pobierz SKILL.md i połóż plik w folderze skilli. Skill działa też w ChatGPT (Custom Instructions). Nie chowa się za paywallem: kopia jest darmowa.
Nie gdy nie ma korpusu ani pytan. Nie do oceny stylu copy. Nie gdy gold answer jest opinia.