W poprzednich wpisach opisaliśmy zadania i jak dołączyć. Teraz pokażemy, na czym konkretnie pracujemy — jakie dane zbieramy, jak je oczyszczamy i jak używamy do treningu i ewaluacji.
Ewaluacja — polski rdzeń
To są nasze główne benchmarki polskie:
LLMzSzŁ — egzaminy zawodowe i państwowe
PES — polski egzamin standardowy
PoQuAD — pytania i odpowiedzi po polsku
Belebele (PL) — rozumienie tekstu
INCLUDE-44 (PL) — rozumowanie instrukcji
FLORES-200 (PL) — tłumaczenia
Ewaluacja — kontrola regresji (EN)
Żeby upewnić się, że nie psujemy angielskiego, mierzymy też na benchmarkach EN:
Belebele (EN)
ARC-Challenge
MMLU
GSM8K
Ewaluacja — zamknięte
Niektóre benchmarki trzymamy zamknięte, żeby nikt nie mógł ich przeuczyć. Szczegóły na /closed-benchmarks.
Braki danych dla V4
Zasada V4: benchmarki są termometrem, nie paliwem. Trenujemy na niezależnych, zweryfikowanych danych jakościowych, które uczą tej samej umiejętności: wierności źródłu, neutralności, polszczyzny, rozumowania MCQ i wiedzy domenowej.
Z treningu wykluczone są nie tylko zbiory eval/test — oficjalne train splity benchmarków też są poza treningiem. Każdy większy korpus przechodzi dekontaminację oraz filtr wierności.
Dane pod LLMzSzŁ
LLMzSzŁ mierzy dużo egzaminów zawodowych, przepisów branżowych, BHP i prawa. Sensowny trening to niezależne korpusy z tych domen oraz własne zadania MCQ generowane ze źródeł, nie kopiowanie publicznych pozycji benchmarkowych.
Kategoria A: Najwyższa dźwignia
ISAP — Internetowy System Aktów Prawnych. To nasz najważniejszy korpus prawny. Daje dostęp do aktualnych przepisów, orzeczeń i interpretacji.
Kategoria B: Wiedza ogólna i program szkolny
Wikipedia / Wikibooks / Wikisource PL
Korpusy SpeakLeash
Format MCQ + rozumowanie
Polskie MCQ z korpusów
Generowane z Wikipedia/ISAP (Evol/Magpie) z weryfikacją; uczy „odpowiedz literą" i szerokości.
Distylacja rozumowania PL
Łańcuchy myślenia z mocnego nauczyciela na trudniejsze pozycje.
GRPO na polskich MCQ
Nagroda = poprawna litera → optymalizuje dokładnie to, co mierzy LLMzSzŁ, czysto.
Przepis treningowy
CPT/RAG na wiernych źródłach (Wikipedia + ISAP/BHP/SAOS/KIS) → SFT na niezależnych zadaniach użytkowych i MCQ → preference/RLVR na formacie odpowiedzi.
Pomiar zostaje na publicznych benchmarkach i prywatnym held-oucie, nigdy na danych użytych w treningu.
Masz dobre dane?
Jeśli masz arkusze, przepisy lub dane prawne — zgłoś się. Szukamy szczególnie:
Aktów prawnych i orzeczeń
Materiałów egzaminacyjnych
Dokumentacji branżowej
Instrukcji i procedur
Nawigacja
Poprzedni: Zadania: od początkującego do zaawansowanego
Więcej: Pełna lista datasetów · Zgłoś dane · GitHub