← wszystkie wpisy
2026.06.30 2 min

Datasety: ewaluacja i trening

Polski rdzeń evalowy, kontrola regresji, dane prawne i MCQ. Jak budujemy czyste zbiory bez kontaminacji.

W poprzednich wpisach opisaliśmy zadania i jak dołączyć. Teraz pokażemy, na czym konkretnie pracujemy — jakie dane zbieramy, jak je oczyszczamy i jak używamy do treningu i ewaluacji.

Ewaluacja — polski rdzeń
To są nasze główne benchmarki polskie:

LLMzSzŁ — egzaminy zawodowe i państwowe
PES — polski egzamin standardowy
PoQuAD — pytania i odpowiedzi po polsku
Belebele (PL) — rozumienie tekstu
INCLUDE-44 (PL) — rozumowanie instrukcji
FLORES-200 (PL) — tłumaczenia
Ewaluacja — kontrola regresji (EN)
Żeby upewnić się, że nie psujemy angielskiego, mierzymy też na benchmarkach EN:

Belebele (EN)
ARC-Challenge
MMLU
GSM8K
Ewaluacja — zamknięte
Niektóre benchmarki trzymamy zamknięte, żeby nikt nie mógł ich przeuczyć. Szczegóły na /closed-benchmarks.

Braki danych dla V4
Zasada V4: benchmarki są termometrem, nie paliwem. Trenujemy na niezależnych, zweryfikowanych danych jakościowych, które uczą tej samej umiejętności: wierności źródłu, neutralności, polszczyzny, rozumowania MCQ i wiedzy domenowej.

Z treningu wykluczone są nie tylko zbiory eval/test — oficjalne train splity benchmarków też są poza treningiem. Każdy większy korpus przechodzi dekontaminację oraz filtr wierności.

Dane pod LLMzSzŁ
LLMzSzŁ mierzy dużo egzaminów zawodowych, przepisów branżowych, BHP i prawa. Sensowny trening to niezależne korpusy z tych domen oraz własne zadania MCQ generowane ze źródeł, nie kopiowanie publicznych pozycji benchmarkowych.

Kategoria A: Najwyższa dźwignia
ISAP — Internetowy System Aktów Prawnych. To nasz najważniejszy korpus prawny. Daje dostęp do aktualnych przepisów, orzeczeń i interpretacji.

Kategoria B: Wiedza ogólna i program szkolny
Wikipedia / Wikibooks / Wikisource PL
Korpusy SpeakLeash
Format MCQ + rozumowanie
Polskie MCQ z korpusów
Generowane z Wikipedia/ISAP (Evol/Magpie) z weryfikacją; uczy „odpowiedz literą" i szerokości.

Distylacja rozumowania PL
Łańcuchy myślenia z mocnego nauczyciela na trudniejsze pozycje.

GRPO na polskich MCQ
Nagroda = poprawna litera → optymalizuje dokładnie to, co mierzy LLMzSzŁ, czysto.

Przepis treningowy
CPT/RAG na wiernych źródłach (Wikipedia + ISAP/BHP/SAOS/KIS) → SFT na niezależnych zadaniach użytkowych i MCQ → preference/RLVR na formacie odpowiedzi.

Pomiar zostaje na publicznych benchmarkach i prywatnym held-oucie, nigdy na danych użytych w treningu.

Masz dobre dane?
Jeśli masz arkusze, przepisy lub dane prawne — zgłoś się. Szukamy szczególnie:

Aktów prawnych i orzeczeń
Materiałów egzaminacyjnych
Dokumentacji branżowej
Instrukcji i procedur
Nawigacja
Poprzedni: Zadania: od początkującego do zaawansowanego

Więcej: Pełna lista datasetów · Zgłoś dane · GitHub